The "Battle of the Four Powers" in the Aggregation Strategy for Office Agents Officially Begins

華爾街見聞
2026.08.17 03:19

國內頭部廠商如阿里、百度、騰訊、字節正推動辦公 Agent 走向模型聚合模式。千問辦公上線智譜 GLM-5.3 和 DeepSeek V4 Pro,百度庫庫 AI 及騰訊 WorkBuddy 等亦內置多家第三方大模型。競爭邏輯從單一模型強弱轉向構建包含多模型的工作台,以積累真實工作流數據並打磨系統,同時需解決任務路由問題。

辦公 Agent 正式進入模型聚合大戰。

8 月 14 日晚間,千問辦公宣佈上線智譜 GLM-5.3 和 DeepSeek V4 Pro 兩款模型,用户可以在產品首頁的 “前沿模型” 檔位直接選擇使用。

就在同一天,百度文庫網盤通用智能體 GenFlow 正式啓用中文名 “庫庫 AI”,並推出獨立桌面端,其模型池同樣包含 DeepSeek、智譜 GLM 等外部模型。

無獨有偶,騰訊 WorkBuddy、字節 TRAE Work 都已經內置多家第三方大模型。

從騰訊、字節到阿里、百度,國內頭部廠商的辦公 Agent 正在不約而同走向模型聚合模式。

過去大模型產品爭的是 “誰家的模型更強”,到了辦公 Agent 階段,競爭邏輯開始出現變化:先把不同模型放進同一個工作台,讓更多用户願意把真實工作交進來。 

只有用户真正用起來,寫作、表格分析、PPT 製作等真實工作流持續進入 Agent,平台才有機會積累任務拆解、工具調用、失敗恢復和用户糾正等反饋,並反過來打磨 Harness,形成數據飛輪。

但下一道題也會隨之出現:同一項任務究竟該調用哪個模型。路由由此成為聚合路線需要繼續解決的問題。

踏入同一條河流

目前千問辦公對外展示的 “前沿模型” 數量並不算多,除了自家的千問模型,外部模型主要是 GLM-5.3 和 DeepSeek V4 Pro。

但千問辦公明確表示三款前沿模型發佈後都快速完成了接入,“這個節奏,我們會一直保持下去”。

這意味着,千問辦公的內置模型池後續還會繼續擴張。

相比之下,騰訊 WorkBuddy 已經形成了更大的內置模型池,不僅包括混元 Hy3,還有智譜 GLM、MiniMax、Kimi 和 DeepSeek 等多個系列。

字節旗下 TRAE Work 也走在類似方向上。目前產品端可見的模型已經包括字節 Seed 系列、智譜 GLM、DeepSeek 以及千問等模型;

百度剛剛推出獨立端的庫庫 AI,同樣引入了 DeepSeek、智譜 GLM 等外部模型。

四家產品的共同點已經相當明顯:辦公 Agent 不再把自己的能力完全綁定在一家模型上。

原因在於,對辦公 Agent 來説,現階段比把每一次模型調用都留給自家模型更重要的是先讓用户真正用起來。

當 Agent 開始搜索網頁、打開文檔、分析 Excel、製作 PPT、調用軟件,並與用户來回修改一項工作時,都會留下更完整的執行過程:模型如何拆解任務、調用了哪些工具、哪一步失敗、用户在哪一步進行了糾正,以及最終什麼結果被接受。

真實工作流正是 Agent 時代稀缺的數據資源。

百度集團副總裁、個人超級智能事業羣總裁王穎認為,隨着公共數據逐漸被模型充分學習,AI 繼續提升的過程中人產生的新知識、新經驗和新想法會越來越重要。未來真正需要共同建立的是通用智能體能力、記憶與存儲,以及個人知識和經驗三部分能力。

模型池越豐富,越有機會提升不同任務的完成率,降低用户嘗試一款 Agent 的門檻;只有更多用户真正把工作交給 Agent,平台才能獲得持續反饋,再去優化任務拆解、Context 管理、工具選擇、失敗恢復等 Harness 能力。

模型聚合由此不只是模型能力的拼盤,也是在為數據飛輪爭取更多真實任務。

但聚合並不意味着大廠之間的邊界已經消失。

從目前產品端可見的默認模型池來看,WorkBuddy 雖然接入了多家外部模型,但其中沒有阿里的千問和字節 Seed;TRAE Work 已經內置千問模型,但沒有騰訊混元;庫庫 AI 目前也未見混元、千問和 Seed。

各家雖然都在擴大模型選擇,但仍然保留着自己的生態邊界。

不可能三角

把更多模型裝進同一個 Agent,只解決了 “有沒有得選” 的問題,真正決定聚合路線能不能跑通的是下一步怎麼選。

大模型落地一直存在一組近似 “不可能三角” 的權衡:效果、速度和成本很難同時拉滿。 

能力更強的模型通常意味着更高的推理價格,複雜任務為了得到更好的結果也往往需要更長的思考和執行時間;反過來,一味追求便宜和低延遲,又可能犧牲任務完成質量。

路由要解決的本質上就是這道三角題:為了把一項工作做完,應該在什麼環節花更多錢換能力,又應該在什麼環節用速度和成本換效率。

這也讓聚合型辦公 Agent 的競爭開始出現另一層差異。

理想的狀態是用户只需要提出任務,後台根據任務難度、時效要求和模型成本完成選擇。 

到了這一步,用户看到的可能只是一次 “幫我做完這份報告” 的請求,後台卻可能已經在不同步驟之間調用不同模型。

對於個人用户,這種差別最終體現在結果好不好、需要等多久、消耗多少積分;對於企業客户,則會進一步落到一項工作的單位算力成本。

辦公 Agent 一旦進入大規模使用,幾分錢、幾毛錢的單次調用差異,都會隨着任務量被不斷放大。 

路由由此也成為成為一筆規模化的經濟賬。但從 Agent 的完整執行鏈條看,路由也是 Harness 中的一環。

一項任務從用户提出,到最終交付,中間還涉及任務拆解、Context 管理、工具調用、模型選擇和失敗恢復。路由決定 “這一環該調用誰”,但真正決定任務能不能穩定完成的是整套 Harness 能否把這些環節協同起來。

這也是聚合路線真正可能形成壁壘的地方。模型本身可以接入,價格也可能隨市場競爭不斷下降,但如何在效果、速度和成本之間找到更好的平衡需要的是足夠多的真實任務,以及平台長期積累下來的調度經驗。 

當 WorkBuddy、TRAE Work、千問辦公、庫庫 AI 手裏的模型越來越多,真正拉開差距的可能是同一道題誰算得更精:什麼時候該用最強模型,什麼時候又根本沒必要。

風險提示及免責條款
市場有風險,投資需謹慎。本文不構成個人投資建議,也未考慮到個別用户特殊的投資目標、財務狀況或需要。用户應考慮本文中的任何意見、觀點或結論是否符合其特定狀況。據此投資,責任自負。