今天最值得知道的事:一篇 arXiv 論文發現,換用不同的 coding agent 外層框架,準確度差距不大,但每題成本最多差 3 倍。
#1論文:換 agent 框架,準確度差不多,成本最多差 3 倍
主軸 ③ 協作
發生什麼
arXiv 上一篇論文(作者 Yangze Liu、Zhongyi Han)比較了多種 coding agent 的 harness,也就是包在模型外面、負責呼叫工具與管理對話內容的程式框架。
論文指出,在 447 個任務上,最重的 Claude Code 與最輕的 mini-SWE-agent 成績相差在 5 分以內。
論文指出,在同模型、同任務下,每題成本在不同 harness 之間最多差 3 倍,主因是 system prompt 的長度與每一步送出的工具定義(tool schema)大小。
論文指出,OpenCode 最多落後 9 分,其中約一半來自輸出被截斷。
作者估計,只有 45 題的評測,約只有一半機率偵測到 13 分的差距;要穩定偵測 5 分的差距需要 447 題。
為什麼重要
挑 harness 時,成本差距可能比準確度差距更實在,而題數少的評測多半分不出 harness 的好壞。〔推論〕
可以怎麼用
比較 agent 框架時,先在同一模型、同一批任務下量每題的 token 成本,並用足夠的題數再談準確度。〔推論〕
展開:證據與限制
- 這是 arXiv 預印本,尚未經同儕審查;結論限於作者選用的模型、任務與 harness。
- arXiv 頁面標示的提交日是 10/3;本刊以它在 arXiv 新論文清單公開的時間收錄。
- 仍不知道的:換成其他類型的任務(例如非程式任務)是否得到同樣結論。
來源:What Does a Harness Buy? Tokens, Mostly(一手·論文)
#2SWE-CC:功能正確的 agent 修補,仍違反約 43% 的專案規範
主軸 ① 能力
發生什麼
一篇 arXiv 論文提出 SWE-CC 基準,作者把 12 個開源專案的文件轉成 823 條可由機器檢查的專案規範。
作者用 500 個貢獻任務測試四個 LLM agent。
論文指出,功能正確的修補仍違反 43.1% 適用的專案規範。
論文指出,近半數的違規發生在中間執行步驟,而不是最終成品。
為什麼重要
測試通過不等於可以合併,agent 寫對程式之後,還有「守不守專案規矩」這一關。〔推論〕
可以怎麼用
把專案的貢獻規範寫成可自動檢查的規則,並把 agent 的中間步驟也納入審查,而不只看最後的 diff。〔推論〕
展開:證據與限制
- 這是 arXiv 預印本,尚未經同儕審查;結果限於 12 個開源專案與四個受測 agent。
- arXiv 頁面標示的提交日是 10/5;本刊以它在 arXiv 新論文清單公開的時間收錄。
- 仍不知道的:在公司內部、規範較少成文的專案裡,違規比例會是多少。
來源:Correct Code, Broken Contributions? SWE-CC(一手·論文)
#3UndoBench:agent 做得完事,出錯後卻常收拾不好
主軸 ① 能力
發生什麼
一篇 arXiv 論文提出 UndoBench,把使用工具的 AI agent「完成任務」與「出錯後復原」的能力分開測量。
論文指出,受測情境中任務完成率為 83.54%,但復原成功率只有 46.72%。
論文指出,單純重試在 53.33% 的情況下造成外部副作用重複發生。
為什麼重要
會做事和出錯後收得了尾是兩種不同的能力,後者目前明顯較弱。〔推論〕
可以怎麼用
對寄信、付款、寫資料庫這類有外部副作用的動作,不要把自動重試當預設,先設計可確認、可撤銷的步驟。〔推論〕
展開:證據與限制
- 這是 arXiv 預印本,尚未經同儕審查;數字來自作者設計的故障情境,不代表一般使用時的比例。
- arXiv 頁面標示的提交日是 10/4;本刊以它在 arXiv 新論文清單公開的時間收錄。
- 仍不知道的:不同模型之間復原能力的差距有多大。
來源:UndoBench(一手·論文)
#4Anthropic 擴大資安驗證計畫,三個等級開放 Opus 5.5、Sonnet 5.5、Mythos 5.1
主軸 ① 能力
發生什麼
Anthropic 宣布把 Project Glasswing 與原有的 Cyber Verification Program(Anthropic 針對資安用途的模型存取計畫)合併,分成 Defense、Red Team、Specialized 三個等級。
可用的模型包括 Claude Opus 5.5、Sonnet 5.5、Mythos 5.1 及後續模型。
Specialized 等級需經美國政府協作核准,Glasswing 成員會自動轉入。
Anthropic 稱,Glasswing 夥伴在 4~7 月找出超過 129,000 個已驗證的漏洞,其中超過 33,000 個屬 critical 或 high 等級。〔廠商宣稱〕
Anthropic 同日發布的客戶案例中,文中描述 Comcast 用 Mythos Preview 在 258 個關鍵系統、約 1.7 億行程式碼中找出一個關鍵的認證漏洞。〔廠商宣稱〕
同一篇案例中,Comcast 方面表示,驗證大量的發現已成為新的瓶頸。〔廠商宣稱〕
為什麼重要
前沿模型找漏洞的能力已經需要分級管理存取,而瓶頸正從「找得到」移到「人驗證得完」。〔推論〕
可以怎麼用
資安團隊若考慮申請這類存取,先評估自己驗證與修補大量發現的人力是否跟得上。〔推論〕
展開:證據與限制
- 漏洞數量與客戶成果都出自 Anthropic 自己的文章,沒有第三方驗證。
- 兩篇文章只標日期、沒有精確時間,日期為美國時間 10/6。
- 仍不知道的:各等級的審核標準與申請所需時間。
來源:Expanding the Cyber Verification Program(一手·官方);How Comcast and Booz Allen use Claude Mythos(一手·廠商客戶案例)
今天的工程思維
今天幾則研究指向同一件事:agent 的難處正從「做不做得到」轉向成本、守規矩、出錯後的復原,以及人能不能驗證得完。〔推論〕
今天最值得知道的事:據 TechCrunch,Mistral 推出 1 兆參數的 Mistral Large 4,並計畫在三週內開放權重。〔媒體報導〕
#5據 TechCrunch,Mistral 推出 1 兆參數的 Large 4,計畫三週內開放權重〔媒體報導〕
產業 b 產品與市場競爭
發生什麼
據 TechCrunch 報導,AI 公司 Mistral 推出 1 兆參數的多模態模型 Mistral Large 4。〔媒體報導〕
據 TechCrunch 報導,Mistral 科學副總裁 Pierre Stock 表示,這個模型用 4,000 張 Nvidia GPU 訓練,比中國競爭者少 2~3 倍。〔媒體報導〕〔廠商宣稱〕
據 TechCrunch 報導,模型目前只能透過設有防護機制(guardrail)的公開端點使用,Mistral 計畫在安全測試後三週內開放權重。〔媒體報導〕
開放權重是指公開模型參數,讓外界可以下載後自行部署。
為什麼重要
若如期開放,企業在美國閉源模型與中國開放模型之外,多了一個可自行部署的大型模型選項。〔推論〕
接下來值得留意
三週後權重是否如期釋出,以及獨立評測的成績如何。〔推論〕
展開:證據與限制
- 來源是 TechCrunch 的原創報導,含對 Pierre Stock 的訪談。
- GPU 數量與「比中國競爭者少 2~3 倍」是 Mistral 的說法,沒有獨立驗證。
- 仍不知道的:獨立評測成績,以及開放權重採用的授權條款。
來源:Mistral's new 1T model aims to leapfrog closed and open rivals(TechCrunch·媒體報導)
#6據 Crunchbase News,今年 AI 新創併購已達 195 件,超過去年全年〔媒體報導〕
產業 a 公司與資金
發生什麼
據 Crunchbase News 依自家資料統計,截至 9/29,今年已完成 195 件 AI 新創併購,比 2025 全年多 14%。〔媒體報導〕
據 Crunchbase News 報導,67 個重複出手的買家占近三年交易約 42%。〔媒體報導〕
據 Crunchbase News 報導,OpenAI 以 20 件收購居首,其中 10 件在 2026 年。〔媒體報導〕
據 Crunchbase News 報導,今年最大的案子之一是 Nscale 以 16.5 億美元收購 Anyscale。〔媒體報導〕
為什麼重要
資金充足的 AI 公司正用連續收購補人才與產品,產業整併的速度在加快。〔推論〕
接下來值得留意
監管機關是否開始審視這類金額不大、但頻繁發生的連續收購。〔推論〕
展開:證據與限制
- 數字出自 Crunchbase 自家資料庫,統計範圍與分類方式由 Crunchbase 決定。
- 未公開金額的交易可能沒有完整收錄。
- 仍不知道的:這些收購中有多少是以人才為主的收購。
來源:AI's Most Active Startups Are Becoming Serial Acquirers(Crunchbase News·媒體報導)
#7據中央社,台電稱台積電「包電廠」仍屬概念討論,未進入政策研議〔媒體報導〕
產業 d 算力與供應鏈
發生什麼
據中央社報導,針對外界傳出擬請台積電「包電廠」的說法,台電表示相關議題仍屬概念討論,尚未形成具體方案,也未進入政策研議或協商程序。〔媒體報導〕
據中央社報導,台電董事長曾文生先前已澄清未提出差別電價。〔媒體報導〕
據中央社報導,台電表示將與主管機關及高科技業交換意見後再共同決定。〔媒體報導〕
為什麼重要
AI 與先進製程帶動用電成長,電力成本怎麼分攤是台灣半導體供應鏈的關鍵變數。〔推論〕
接下來值得留意
主管機關與高科技業後續是否提出具體的電力分攤方案。〔推論〕
展開:證據與限制
- 來源是中央社報導,內容為台電的官方回應。
- 報導未說明「包電廠」的具體設計。
- 仍不知道的:傳聞的最初出處,以及台積電方面的回應。
來源:傳擬請台積電包電廠 台電:未進入政策研議程序(中央社·媒體報導)
今天的產業觀察
今天的產業消息分別落在模型、資金與電力三層:開放模型的競爭、資本的整併,以及支撐算力的電力,都在同時推進。〔推論〕