2026年8月3日,阿里巴巴旗下企业级Agent产品"千问办公"(QwenWork)正式开启公测,整合QoderWork、MuleRun、悟空三款产品,搭载2.4万亿参数的Qwen3.8-Max模型。就在同一周,易观发布《2026年Q2中国AI办公智能体市场报告》显示,腾讯WorkBuddy月访问量从Q1的885万飙升至2097万,超过第二第三名之和,登顶国内AI办公智能体榜首。字节跳动则将飞书团队一分为二,分别与豆包和火山引擎整合。三家大厂同时动手,信号已经非常明确:AI Agent的竞争,正从"谁的模型参数大"全面转向"谁的系统更可靠、更安全、更便宜"。
模型竞赛降温,工程化成为新战场。过去两年行业主线是卷模型,GPT-4、Claude、Gemini、Qwen轮番刷新榜单,参数从千亿飙升到万亿。但到了2026年,一个尴尬的现实浮出水面:Gartner预测到2026年底40%的企业应用将内置AI Agent,但同时也预测超过40%的Agentic AI项目将在2027年前被取消——原因是价值不清晰、成本失控、治理缺失。Agent最容易被忽视的问题是"复合错误率":一个10步任务,即使每步成功率高达90%,端到端成功率也只有0.9的10次方约等于35%。这不是模型不够好,是数学规律——多步骤自主任务的错误会指数级累积。
大模型进入"月抛"节奏也加剧了工程化挑战。7月一个月内有9款旗舰模型扎堆发布,阿里Qwen3.8-Max、MiniMax H3、DeepSeek V4 Flash、Grok 4.6预告……模型迭代速度远超应用适配速度。AirLLM让4GB显存跑2.8万亿参数模型成为可能,降低了硬件门槛,但模型选择、Prompt工程、错误处理、安全审计等工程问题变得更加复杂。欧盟AI法案透明度条款8月2日生效、白宫8月4日召集四大巨头讨论安全框架、中国智能体安全强制性国标立项——全球监管同步进入执法阶段,合规成本将成为AI Agent项目的必要支出。对于企业而言,选择AI办公智能体时,不应只看背后跑的是哪个模型,更要看产品的工程可靠性、安全合规能力和实际场景适配度。