《電子技術(shù)應(yīng)用》
您所在的位置:首頁(yè) > 人工智能 > 業(yè)界動(dòng)態(tài) > 阿里云開源首個(gè)AI推理模型QwQ

阿里云開源首個(gè)AI推理模型QwQ

推理水平對(duì)標(biāo)OpenAI o1 數(shù)學(xué)、編程尤為出色
2024-11-29
來源:IT之家
關(guān)鍵詞: 阿里云 QwQ AI推理模型

11月28日消息,,今天,,阿里云通義團(tuán)隊(duì)宣布推出并同步開源了全新的AI推理模型——QwQ-32B-Preview。

評(píng)測(cè)顯示,,預(yù)覽版本的QwQ(Qwen with Questions)在科學(xué)推理能力上展現(xiàn)出研究生水平,,尤其在數(shù)學(xué)和編程領(lǐng)域表現(xiàn)卓越,其整體推理能力可與OpenAI的o1相媲美,。

據(jù)介紹,,QwQ是通義千問Qwen大模型最新推出的實(shí)驗(yàn)性研究模型,也是阿里云首個(gè)開源的AI推理模型,。

阿里云通義千問團(tuán)隊(duì)研究發(fā)現(xiàn),,當(dāng)模型有足夠的時(shí)間思考、質(zhì)疑和反思時(shí),,其對(duì)數(shù)學(xué)和編程的理解就會(huì)深化,,基于此QwQ取得了解決復(fù)雜問題的突破性進(jìn)展。

0.png

在衡量科學(xué)問題解決能力的GPQA評(píng)測(cè)集中,,QwQ達(dá)到了65.2%的準(zhǔn)確率,,顯示出其研究生水平的科學(xué)推理能力,;在AIME評(píng)測(cè)中,QwQ以50%的勝率證明了其解決數(shù)學(xué)問題的能力,。

在MATH-500評(píng)測(cè)中,,QwQ以90.6%的高分超越了o1-preview和o1-mini。在評(píng)估高難度代碼生成的LiveCodeBench評(píng)測(cè)中,,QwQ答對(duì)了一半的題目,,在編程競(jìng)賽題場(chǎng)景中也有出色表現(xiàn)。

不僅如此,,QwQ在面對(duì)復(fù)雜問題時(shí),,能夠進(jìn)行深度自省,質(zhì)疑自身假設(shè),,并通過深思熟慮的自我對(duì)話,,仔細(xì)審視其推理過程的每一步。

例如,,在解決經(jīng)典智力題“猜牌問題”時(shí),,QwQ通過梳理對(duì)話和推演,像個(gè)擅長(zhǎng)思考的人一樣,,并最終得出正確答案,。

目前,QwQ-32B-Preview已在魔搭社區(qū)和HuggingFace等平臺(tái)上開源,,發(fā)布短短幾小時(shí),,引起全球開發(fā)者熱情體驗(yàn)。

有開發(fā)者認(rèn)為該模型“是完全沒有預(yù)料到的瘋狂的躍進(jìn)”,、“今年開源領(lǐng)域最重大的突破”,、“讓中國(guó)在開源大模型和AI推理上占據(jù)先機(jī)”。

不過通義團(tuán)隊(duì)也表示,,雖然QwQ展現(xiàn)了強(qiáng)大的分析能力,,但其仍是個(gè)供研究的實(shí)驗(yàn)型模型,存在不同語(yǔ)言的混合使用,、偶有不恰當(dāng)偏見,、對(duì)專業(yè)領(lǐng)域問題不了解等局限,未來隨著研究深入模型迭代,,這些問題將逐步得到解決,。


官方訂閱.jpg

本站內(nèi)容除特別聲明的原創(chuàng)文章之外,轉(zhuǎn)載內(nèi)容只為傳遞更多信息,,并不代表本網(wǎng)站贊同其觀點(diǎn),。轉(zhuǎn)載的所有的文章、圖片、音/視頻文件等資料的版權(quán)歸版權(quán)所有權(quán)人所有,。本站采用的非本站原創(chuàng)文章及圖片等內(nèi)容無(wú)法一一聯(lián)系確認(rèn)版權(quán)者,。如涉及作品內(nèi)容、版權(quán)和其它問題,,請(qǐng)及時(shí)通過電子郵件或電話通知我們,,以便迅速采取適當(dāng)措施,避免給雙方造成不必要的經(jīng)濟(jì)損失,。聯(lián)系電話:010-82306118;郵箱:[email protected],。