三個 AI 勁過一個?Nature 研究:Multi-Agent 有時反而仲差 | 學識 Hok6 | 廣東話網上教育平台
三個 AI 勁過一個?Nature 研究:Multi-Agent 有時反而仲差

三個 AI 勁過一個?Nature 研究:Multi-Agent 有時反而仲差

2026-09-10

江啟明博士

4.80/5.00(15個評分)

※ 本文由 AI 根據影片內容整理,如有錯漏敬請指正。
📺 觀看完整影片:[三個 AI 勁過一個?Nature 研究:Multi-Agent 有時反而仲差]

---

如果你試過設計 AI agent 的工作流程,大概遇過這種情況:頭一兩步做得相當好,一做久就開始亂。網上不少教學會叫你不要只用一個 agent,而是建立一個 multi-agent workflow——一個負責搜尋資料、一個負責分析、一個負責 fact check,最後再由一個 agent 整合。聽起來像一支各司其職的團隊。

但真的建好之後,你可能發現沒想像中理想。第一個 agent 做完的東西,第二個好像完全不明白;一個改了計劃,另一個還在用舊版本;幾個 agent 討論了很多輪,燒了大量 token,最後原地踏步。

本集《學識AI》,拆解 2026 年《Nature》一篇研究論文《Capable Language Models Can Outgrow the Benefits of Collaboration》,回答一個工程上很實際的問題:究竟什麼時候該用多個 AI 分工,什麼時候一個 AI 自己做反而更好。

研究怎樣做到公平比較
研究要先解決一個問題:如果多 agent 只是因為用多幾倍 token 和運算資源而贏,那證明不到「合作」本身有用。所以這次研究盡量控制其他因素,讓單一 agent 與 multi-agent 處理相同任務、使用相同工具,可用的資源亦盡量相若。真正要問的是:同一筆資源,集中給一個 AI,還是分給一隊 AI,哪樣更有效?

研究比較五種架構:單一 agent;independent multi-agent(各自做、基本上不交流);centralized(由一個 orchestrator 分工再整合);decentralized(沒有中央主管,互相直接協調);以及 hybrid(有中央 orchestrator,下面 agent 又可互相溝通)。

這五種架構放在六類 agentic benchmark 上測試,包括上網搜尋資料、金融分析、類似 Minecraft 的遊戲規劃任務、模擬真實職場工作、修復軟件問題,以及操作電腦 terminal 命令。模型涵蓋 OpenAI、Google 和 Anthropic 三個主流家族,總共 260 個受控配置。

一邊升八成,另一邊跌七成
最搶眼的結果來自兩個 benchmark 的對比。

在金融分析的測試中,AI 要研究公司新聞、監管資料、SEC filing 和財務數字,再分析營運和市場影響。單一 agent 的平均準確度是 34.9%,centralized multi-agent 大幅提升到 63.1%,改善超過八成;另外兩種會互相協調的架構也提升超過七成。

但 PlanCraft 的結果完全倒轉。那是一個讓 AI 自行規劃的遊戲測試,形式有點像 Minecraft,AI 要根據目前資源、recipe 和環境狀態一步步完成目標。在這裡,四種 multi-agent 架構全部不如單一 agent:原本準確度 56.8%,最好的 multi-agent 跌至 34.6%,最差的 independent multi-agent 更跌至 17%,下降七成。

把六個 benchmark 平均起來,multi-agent 相對單一 agent 的平均改善率剛好是 0%,即是打和。這個 0% 不是說 multi-agent 沒用,而是說結果極度依賴你在做什麼工作。

真正的關鍵:工作拆不拆得開
第一個答案是:工作本身能否自然拆成幾個相對獨立的部分。

金融分析很適合分工,因為新聞、監管、財務、營運幾條資料線可以同時探索,不需要等一條做完才開始另一條。這正是 multi-agent 帶來、單一 agent 難以做到的好處——parallel exploration,平行探索。

PlanCraft 剛好相反。第二步要知道第一步完成後的最新狀態,第三步又依賴第二步,前後高度互相依賴。這類工作叫做 sequential interdependence。硬要拆給幾個 agent,大家反而要不停互相交代進度。

研究還發現,金融分析和 PlanCraft 兩者的整體難度其實差不多。所以真正影響結果的不是「有多難」,而是「難的部分能不能分開做」。

拆開之後要付的三個代價

資訊碎片化。 單一 agent 由頭做到尾,所有歷史、工具結果、失敗嘗試都留在同一條 context stream 裡。一個 agent 要把工作交給另一個,就要將自己知道的濃縮成一段 message,而一濃縮就可能遺失資訊。

溝通成本。 研究計算過每種架構要經歷多少推理和溝通步驟:單一 agent 平均約七步,最複雜的 hybrid multi-agent 約 44 步,多了六倍左右。但多做六倍步驟,成績並沒有相應提升——開多了會,事情卻沒有好多少。

錯誤傳染。 若 agent A 一開始理解錯,而 agent B 沒有重新看原始資料,只接住 A 的答案繼續做,錯誤就會一路傳下去。研究發現有中央主管的架構較能控制這個問題,因為下面 agent 做完後不是直接當成真,而是先回到中央 agent 整合和檢查。換句話說,所有重要結果都應該經過一個看得緊的驗證關口。

45% 這條參考線
研究還發現一個更有預測力的指標:同一件工作,multi-agent 有沒有幫助,最相關的是「單一 agent 本身已經做得多好」。

從今次數據估算,大約有一條 45% 的經驗性分界。在他們測試的任務中,如果單一 agent 的成功率已高過這個水平,改用 multi-agent 就比較可能沒有改善甚至變差;低過這個水平,改善機會則會提高。

不過作者自己說得很清楚:45% 千萬不要當成定律,那只是今次研究得出的一條實用參考線。真正值得記住的是背後的方向——一個 AI 本身越勝任這件工作,多 agent 能提供的新增價值通常就越少。這正是論文標題的意思。

不要為了 Multi-Agent 而 Multi-Agent
回到開場那個經驗。如果你的 multi-agent workflow 怎樣調整都做不好,這篇研究可能是在告訴你:未必是你設計得不好,而是這件工作根本不適合這樣分工。

工作能真正分成幾條獨立路線,多個 agent 同時處理更多資訊,效果可以非常好。但如果前後步驟緊密相連,而一個 agent 本身已經做得不錯,再加角色可能只是增加交接、溝通和混亂。

所以在拆成幾個 AI 之前,或許可以先問三個問題:這件工作真的拆得開嗎?每個 agent 真的會帶來不同資訊嗎?最後有沒有真正的驗證關口?如果答案不夠肯定,先試試用一個更有能力的 AI、給原本那個 agent 更完整的資料、更好的工具和更充足的 context,可能才是更直接的路。

三個 AI 勁過一個?Nature 研究:Multi-Agent 有時反而仲差

其他同類文章

畀 AI 多啲資料,答案反而變差?Context Window 的陷阱點樣避免 AI 拍馬屁?Claude 真係最客觀?AI識寫文言投訴信,但點解人手寫得更精簡、更有霸氣?|學識開咪 EP69AI開始自己做科研?從 AlphaFold 走向 AI 科學家

關注我們

Copyright © 2026 hok6.com

版權所有,不得轉載