2026年8月28日,五条重磅消息共同指向AI产业两个核心趋势的加速——MoE(混合专家)架构全面爆发和具身智能突破性进展。第一条是智谱GLM-5.3-Flash身份揭晓。8月26日晚智谱正式确认,此前以匿名模型Ox Alpha身份在OpenRouter刷屏的"牛来"大模型正是GLM-5.3-Flash(320B-A18B)——GLM-5系列首个原生多模态模型,总参数320B、每Token仅激活18B,采用稀疏注意力与线性注意力混合架构,MIT协议开源。最引人注目的是全部线上流量由10万张国产芯片承载,摩尔线程MTT S5000在发布当日完成Day-0适配。在OpenRouter使用量是DeepSeek两倍多。
第二条是阿里Qwen3.8-Flash发布。125B总参数仅激活6B的MoE架构,搭配51B N-gram Embedding记忆库。在CoWorkBench办公工作流基准上获73.9分远超Claude Opus 4.6的45.1分。训练成本仅为Qwen3.7-Plus的1/9,API定价每百万Tokens输入1元输出3元。Apache 2.0协议开源。6B激活参数意味着推理成本接近6B小模型但能力远超——"小成本大能力"组合定义了开源大模型性价比天花板。
第三条是千寻智能Spirit v1.6登顶RoboArena。在英伟达联合硅谷顶级机构主导的世界级具身智能榜单上综合得分全球第一,力压英伟达Cosmos 3和Physical Intelligence Pi0.5——首个中国具身模型登顶。就在两天前黄仁勋刚发布Cosmos 3登上多个榜首,荣耀只持续一天就被千寻反超。三个月融资近50亿,雷军顺为资本和马云云锋基金入局,与博世、京东达成合作。
第四条是小鹏VLA从3D到4D的跃迁。第二代VLA大模型升级让AI第一次建立时间维度理解——从静态3D空间理解进化到动态4D时空理解(记住过去、理解当下、预判未来)。三项核心技术:时序记忆模块、动态场景推理引擎、未来轨迹预测网络。XOS 6.3.0将在G9L全球首发。这是自动驾驶AI架构的范式升级——从"帧级感知"到"时空理解"。
第五条是Google加速迭代。Gemini 3.8 Flash Preview已在内部编程平台Jetski上向员工开放测试,体验明显好于3.7 Flash。Google以数周间隔快速迭代追赶OpenAI和Anthropic。同日发布Gemini Omni 1.1 Flash多模态视频生成模型——场景延展至40秒、关键帧控制、4K输出,从演示级升级到生产级。
这五条线索合在一起勾勒出AI产业的新格局:MoE稀疏激活架构已成为性价比共识——智谱320B激活18B、阿里125B激活6B,两种参数规模都通过稀疏激活实现了"大模型能力+小模型成本"的组合。这种架构正在成为开源大模型的主流选择。具身智能正在成为继大语言模型之后的下一个AI竞争焦点——千寻击败英伟达登顶RoboArena,小鹏将4D时空理解引入自动驾驶,AI正从"屏幕里"走向"物理世界"。对AI工具用户而言,MoE架构的普及意味着更便宜更强大的开源模型将持续涌现,具身智能的突破意味着AI将在物理世界中扮演越来越重要的角色。