BlockBeats 律動財經
動察 Beating AI 快訊,YC 孵化的 AI 數據公司 Specific Labs 推出編程評測 Real-SWE,專門拿真實公司的私有代碼測試 Coding Agent。任務直接來自企業生產環境,包括算稅、賬單遷移、API 計費和客戶數據遷移。代碼和答案都沒公開在網上,Agent 得自己摸清公司的業務規則和代碼結構。
結果 Fable 5.1 排第一,通過率也只有 38.8%;GPT-6 Astra 為 33.8%,Gemini 3.8 Flash 為 31.2%。GLM 5.3 以 28.8% 排第四,高於 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。當前公開的 10 個任務裡,有 6 個整體通過率低於 15%,還有一個任務所有模型全部失敗。
最讓人意外的是 GLM 5.3。Real-SWE 更考驗 Agent 在陌生項目裡持續讀代碼、找規則和完成多步改動的能力。智譜研究員 Xiaopu Peng 回應稱,他們從 GLM-5.1 起就在訓練長程任務,Real-SWE 比公開 SWE 榜更接近這類能力,這也能部分解釋 GLM 5.3 為什麼在這套榜上表現突出。
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
上一篇
下一篇