11月28日消息,,今天,阿里云通義團隊宣布推出并同步開源了全新的AI推理模型——QwQ-32B-Preview,。
評測顯示,,預(yù)覽版本的QwQ(Qwen with Questions)在科學(xué)推理能力上展現(xiàn)出研究生水平,尤其在數(shù)學(xué)和編程領(lǐng)域表現(xiàn)卓越,,其整體推理能力可與OpenAI的o1相媲美,。
據(jù)介紹,QwQ是通義千問Qwen大模型最新推出的實驗性研究模型,,也是阿里云首個開源的AI推理模型,。
阿里云通義千問團隊研究發(fā)現(xiàn),當模型有足夠的時間思考,、質(zhì)疑和反思時,,其對數(shù)學(xué)和編程的理解就會深化,基于此QwQ取得了解決復(fù)雜問題的突破性進展,。
在衡量科學(xué)問題解決能力的GPQA評測集中,QwQ達到了65.2%的準確率,,顯示出其研究生水平的科學(xué)推理能力,;在AIME評測中,QwQ以50%的勝率證明了其解決數(shù)學(xué)問題的能力,。
在MATH-500評測中,,QwQ以90.6%的高分超越了o1-preview和o1-mini。在評估高難度代碼生成的LiveCodeBench評測中,,QwQ答對了一半的題目,,在編程競賽題場景中也有出色表現(xiàn)。
不僅如此,,QwQ在面對復(fù)雜問題時,,能夠進行深度自省,質(zhì)疑自身假設(shè),,并通過深思熟慮的自我對話,,仔細審視其推理過程的每一步。
例如,,在解決經(jīng)典智力題“猜牌問題”時,,QwQ通過梳理對話和推演,像個擅長思考的人一樣,,并最終得出正確答案,。
目前,QwQ-32B-Preview已在魔搭社區(qū)和HuggingFace等平臺上開源,,發(fā)布短短幾小時,,引起全球開發(fā)者熱情體驗。
有開發(fā)者認為該模型“是完全沒有預(yù)料到的瘋狂的躍進”、“今年開源領(lǐng)域最重大的突破”,、“讓中國在開源大模型和AI推理上占據(jù)先機”,。
不過通義團隊也表示,雖然QwQ展現(xiàn)了強大的分析能力,,但其仍是個供研究的實驗型模型,,存在不同語言的混合使用、偶有不恰當偏見,、對專業(yè)領(lǐng)域問題不了解等局限,,未來隨著研究深入模型迭代,這些問題將逐步得到解決,。