#1Agent 說它完成了,資料庫不同意
主軸 ① 能力 · ③ 協作
發生什麼
Microsoft 與 Hugging Face 10/3 發布聯名文章介紹 ThinkingBox 評測,並宣布可以透過 Hugging Face 使用;相關論文 8 月已發表,資料集 8 月也已公開。這個評測有 507 個合成重建、會改動資料的商業工作流程,18 個模型各跑 20 次;評分主要看後端資料庫的最終狀態與副作用,而不是模型呼叫了哪些工具(507 題中有 30 題另外評分回覆內容)。
在 12 個模型的共同題組裡,121,680 次有效試驗中有 79,853 次沒通過檢查。這些失敗裡,有 67.24% 是「正常結束、呼叫過改資料的工具、也沒有回報最終工具錯誤」。從外表看,這些失敗很像成功。〔推論〕作者把執行過程比作一份「宣稱」,並寫道:“Database state is the evidence.”
為什麼重要
以 Kimi-K3 為例,93.89% 的題目至少成功過一次,但 20 次全對的只有 13.41%。Claude Opus 5.5 的 pass@1(只跑一次就成功的比例)是 67.16%,20 次全對的有 241 題。
作者也把成本換算成「每可靠完成一題」:單次成功成本最低的 GPT-5.6 Sol,每次成功約 0.127 美元,換算後卻要 9.76 美元,比 GPT-5.4(6.80)、GPT-6 Astra(7.45)和 Claude Opus 5.5(7.80)都高。
挑模型如果只看單次成功率和單價,可能同時高估了可靠度、低估了成本。〔推論〕
可以怎麼用
驗收 AI 做的事,可以去查實際結果(資料、檔案、系統狀態)而不是只看它說「完成」,評估模型時同一題多跑幾次、看「每次都對」的比例,會改資料又無法復原的步驟則加一個人工核准。〔推論〕
展開:證據與限制
- 來源是 Microsoft 與 Hugging Face 的聯名文章(10/3),屬發布機構自己的評測。
- 任務是合成重建的商業流程,客戶不是真實的。
- 成本是用 OpenRouter(模型轉售平台)的牌價估算,不是實際帳單。
- 作者的建議:送出前檢查最終狀態、先把錯誤分類再重試、縮小給 agent 的工具範圍、無法復原的變更要人工核准。作者明說沒有量測這些建議的實際效果。
- 文章在本期截止後約 10 分鐘有過修改,我們拿不到修改前的版本;本則所有數字都以修改後版本為準,無法確認截止前是否相同。
來源:Hugging Face 部落格:The Agent Said It Was Done. The Database Disagreed.(一手·發布機構)