廣告
xx
xx
回到網頁上方

超越99%人!GPT-5.6智商衝破136 創紀錄跨過「天才門檻」

編輯 謝景沛 報導
發佈時間:2026/07/21 12:17
最後更新時間:2026/07/21 17:34
OpenAI旗下的GPT-5.6完整套件一舉拿下136高分。(示意圖/達志影像美聯社)
OpenAI旗下的GPT-5.6完整套件一舉拿下136高分。(示意圖/達志影像美聯社)

人工智慧(AI)發展迎來新里程碑!在AI測驗平台Tracking AI最新公布的防作弊「離線智商測驗」中,OpenAI旗下的GPT-5.6完整套件一舉拿下136高分。這不僅是有史以來首次有大型語言模型(LLM)突破130分的大關,也在標準化智商分布中,GPT-5.6的邏輯推理能力已正式超越全球99%的人類,跨入「天才」級別領域。

 

踢開130分天花板! 防作弊「離線題庫」實力曝光

過去一年,包含OpenAI o3以及各大科技巨頭的旗艦模型,雖然智商測驗成績一路攀升,但始終卡在130分的門檻前。這次GPT-5.6成為首個打破此一天花板的模型。

 

 


 

Tracking AI的測試包含兩套題庫。公開版本為任何人皆可線上測試,GPT-5.6在此版本早已得分超過140分。另一種為離線版本,旨在防止模型透過記憶訓練資料複製答案。GPT-5.6家族(包含SOL、TERRA及視覺版本)在最困難的離線測試中全數獲得136分,遙遙領先其他競爭對手。

 

GPT-5.6測驗成績一路攀升。(圖/翻攝自Tracking AI)


 
 
在此榜單中,緊隨其後的是Claude-5 Fable(130 分),而像GPT-5.6 LUNA Max和Claude-4.8 Opus等模型,得分則落在117至123分之間。
 

從理論到實戰! 開發者驚呼:務實解決問題的強者

除了標準化測驗的亮眼數據,實際開發者的使用體驗也印證了GPT-5.6的進化。開發者 Amir Bohlooli 測試發現,GPT-5.6 Sol 僅憑單一提示詞,就完成了即時粒子流體物理運算,並將CSS、介面與渲染濃縮在單一 HTML檔案中,甚至自動託管為可分享的網頁。

 

另一位開發者Ramanpal Singh運用同個提示,成功讓GPT-5.6一次打造出包含四種角色、管理儀表板、自動投訴分類與情緒偵測的RAG客戶支援系統,成本遠低於競爭對手。此外,開發者克萊爾·沃(Claire W.)指出,在面對極其棘手的Code Error時,Fable往往因過度執著於絕對技術精確而受限,而GPT-5.6 Sol則憑藉極高的務實性,精準且一次性地解決了問題。
 

這就是AGI嗎? 專家:是智力的閃光,但非全貌

面對這項突破,不少網友驚呼:「對99%的人來說,這已經是通用人工智慧(AGI)了!」然而,136分的成績主要來自抽象模式識別與邏輯推理能力。專家提醒,傳統智商測驗並非為大型語言模型設計,無法完全衡量模型在現實世界中的事實可靠性、工具調用能力,以及在專業情境下的持續穩定度。

 

參考資料
KUCOIN



全球必讀

#人工智慧#AI#新里程碑#測驗平台#防作弊#智商測驗#語言模型#邏輯推理能力#全球99%#天才級別

你可能會喜歡

人氣點閱榜

延伸閱讀

其他人都在看

notification icon
感謝您訂閱TVBS,跟上最HOT話題,掌握新聞脈動!

0.1286

0.0662

0.1948