新模型发布

阿里开源Qwen3.8-Flash:125B参数仅激活6B,办公性能超Claude Opus 4.6,训练成本降90%

2026年8月28日,阿里Qwen团队发布并开源Qwen3.8-Flash(内部代号Flash-Next),这是全球大模型性价比的新标杆。该模型采用125B总参数的MoE架构,但每Token仅激活6B参数,搭配51B N-gram Embedding记忆库——这种设计使得模型在保持大参数模型能力的同时,推理成本接近6B小模型。在CoWorkBench办公工作流基准上,Qwen3.8-Flash斩获73.9分,远超Claude Opus 4.6的45.1分——在办公场景中性能超越参数量大数十倍的前沿模型。

成本方面的数据更为惊人。训练成本仅为前代Qwen3.7-Plus的1/9——训练一个125B参数的MoE模型只需要不到Qwen3.7-Plus九分之一的算力。API定价低至每百万Tokens输入1元、输出3元人民币——这在全球前沿模型中属于最低梯队。模型原生支持256K上下文窗口,权重在Hugging Face和魔搭社区同步开源,采用Apache 2.0协议——这是最宽松的开源协议之一,允许商业使用。

Qwen3.8-Flash的发布进一步印证了"小激活参数+大总参数"MoE架构的优势——通过稀疏激活,模型可以在保持大模型能力的同时大幅降低推理成本。6B激活参数意味着Qwen3.8-Flash的推理成本接近一个6B小模型,但能力远超6B模型——这种"小成本大能力"的组合是当前AI模型设计的主流方向。与此前Inherent Faraday(270亿参数小模型打赢千亿大模型)和英伟达AVO(框架比参数更重要)的发现一致,AI能力的释放越来越依赖架构设计而非单纯参数堆叠。对AI工具用户而言,Qwen3.8-Flash的开源意味着又一款极致性价比的开源模型可供选择——每百万Token输出3元的定价使其成为目前最便宜的前沿级模型之一,特别适合需要大量推理的Agent场景。阿里用"1/9训练成本+6B激活参数+73.9分办公基准"的组合,再次定义了开源大模型的性价比天花板。

← 返回AI热点列表