人工智慧(AI)發展迎來新里程碑!在AI測驗平台Tracking AI最新公布的防作弊「離線智商測驗」中,OpenAI旗下的GPT-5.6完整套件一舉拿下136高分。這不僅是有史以來首次有大型語言模型(LLM)突破130分的大關,也在標準化智商分布中,GPT-5.6的邏輯推理能力已正式超越全球99%的人類,跨入「天才」級別領域。
踢開130分天花板! 防作弊「離線題庫」實力曝光
過去一年,包含OpenAI o3以及各大科技巨頭的旗艦模型,雖然智商測驗成績一路攀升,但始終卡在130分的門檻前。這次GPT-5.6成為首個打破此一天花板的模型。
Tracking AI的測試包含兩套題庫。公開版本為任何人皆可線上測試,GPT-5.6在此版本早已得分超過140分。另一種為離線版本,旨在防止模型透過記憶訓練資料複製答案。GPT-5.6家族(包含SOL、TERRA及視覺版本)在最困難的離線測試中全數獲得136分,遙遙領先其他競爭對手。

在此榜單中,緊隨其後的是Claude-5 Fable(130 分),而像GPT-5.6 LUNA Max和Claude-4.8 Opus等模型,得分則落在117至123分之間。
從理論到實戰! 開發者驚呼:務實解決問題的強者
除了標準化測驗的亮眼數據,實際開發者的使用體驗也印證了GPT-5.6的進化。開發者 Amir Bohlooli 測試發現,GPT-5.6 Sol 僅憑單一提示詞,就完成了即時粒子流體物理運算,並將CSS、介面與渲染濃縮在單一 HTML檔案中,甚至自動託管為可分享的網頁。
另一位開發者Ramanpal Singh運用同個提示,成功讓GPT-5.6一次打造出包含四種角色、管理儀表板、自動投訴分類與情緒偵測的RAG客戶支援系統,成本遠低於競爭對手。此外,開發者克萊爾·沃(Claire W.)指出,在面對極其棘手的Code Error時,Fable往往因過度執著於絕對技術精確而受限,而GPT-5.6 Sol則憑藉極高的務實性,精準且一次性地解決了問題。
這就是AGI嗎? 專家:是智力的閃光,但非全貌
面對這項突破,不少網友驚呼:「對99%的人來說,這已經是通用人工智慧(AGI)了!」然而,136分的成績主要來自抽象模式識別與邏輯推理能力。專家提醒,傳統智商測驗並非為大型語言模型設計,無法完全衡量模型在現實世界中的事實可靠性、工具調用能力,以及在專業情境下的持續穩定度。
參考資料
KUCOIN
◤音樂劇魔女宅急便◢
◤你的早餐吃對了嗎?◢



