‌
‌
‌
‌
‌
快訊

AI Agent科學任務實測:最強也只完成了20.6%

BlockBeats 律動財經

動察 Beating AI 快訊,陳天橋旗下全新 AI 專案 Apodex 發布科學 Agent 評測 FrontierChallenge,用 97 個真實科學工作流測試 AI 能不能從頭到尾把任務完成。12 個前沿模型參與測試,最佳成績也只有 20.6%。GPT-5.6 Sol + Codex 和 Grok 4.6 + Claude Code 並列第一,各完整通過 20 項。


測試還發現,Agent 經常沒做完卻說自己做完了。在使用 Claude Code 作為 Agent 框架的 10 組模型測試中,849 次失敗任務裡有 75.5% 最終仍聲稱已經完成。另一方面,所有參評系統在電化學和環境科學任務上的平均得分達到 94.9,但沒有一個完整通過。

‌


這套評測專門把「大部分做對」和「真正交付完成」分開。榜單比較的也是模型 + Agent 運行框架,不是單獨比較裸模型。


‌

官方同時提醒,每個系統每題只有一次運行,小幅分差不能直接理解成穩定的模型排名。

原文連結

發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。

暢行幣圈交易全攻略,專家駐群實戰交流

▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!

▶ 前往鉅亨買幣找交易所優惠

‌
section icon

鉅亨講座

看更多
  • 講座
  • 公告
    ‌
    Empty
    Empty
    ‌