重大影响 2026-08-13

AI推理专用芯片崛起:从GPU垄断到"模型即芯片",AMD收购Taalas打开新赛道

AMD宣布收购AI推理芯片公司Taalas,其将模型"刻进"芯片实现17000 TPS推理速度,超GPU一个数量级,成本仅GPU几十分之一。从Groq、SambaNova到Etched再到Taalas,AI推理专用芯片专用化程度不断加深。NVIDIA也在Vera Rubin系统中引入Groq专用推理芯片,GPU不再是AI推理的唯一选择。AI推理正从"训练主导"走向"推理专用化"。

AI芯片AI算力GPUAI推理半导体

2026年8月12日,AMD宣布收购AI推理专用芯片公司Taalas,标志着AI推理专用芯片赛道进入新阶段。Taalas采用"模型即计算机"理念,将AI模型和权重直接硬编码到基于掩膜ROM的芯片结构中,首款验证芯片HC1将Llama 3.1 8B"刻进"芯片,实现接近17000 TPS/user的推理速度——对比NVIDIA H200、B200及Groq、SambaNova、Cerebras断层领先。成本方面,Llama 3.1 8B每百万Token仅0.75美分,而GPU成本在20至49美分之间;功耗方面,Taalas单机架仅12-15kW,GPU机架高达120-600kW。

Taalas的收购标志着AI推理专用芯片从"概念验证"走向"产业落地"。回顾这条赛道:Groq和SambaNova代表了"通用推理专用化"——针对推理场景优化但不绑定特定模型;Etched代表了"架构专用化"——专注Transformer架构推理;Taalas则走到了"模型专用化"极致——一款芯片只推理一款模型。专用化程度越深,性能和成本优势越明显,但灵活性越低。值得注意的是,NVIDIA也在下一代Vera Rubin系统中引入Groq 3 LPX专用推理芯片,将解码阶段交给专用芯片处理——GPU龙头自己也承认GPU在推理场景的效率瓶颈。

AI推理专用芯片崛起的深层驱动力是AI推理成本的持续攀升。Uber CTO今年4月透露公司已在年初数月内耗尽2026全年AI预算,不得不对每名员工设每月1500美元上限。AI推理的高成本已成为AI应用普及的核心瓶颈——当推理成本占总拥有成本(TCO)的主要部分时,专用化推理芯片的商业价值就凸显出来。对AI产业格局而言,专用推理芯片的崛起可能打破NVIDIA在AI算力领域的垄断地位——GPU在训练场景的通用性优势在推理场景不再适用,专用芯片可以做到更快的速度、更低的成本和更小的功耗。对中国创业公司而言,AI推理专用芯片尤其是端侧推理芯片是难得的机会:不需要最先进制程,不需要HBM等受限高价存储,基于开放指令集的ASIC路线在端侧场景有天然优势。中国拥有全球最好的AI原生硬件成长土壤,一旦AI原生硬件进一步进入主流,端侧AI推理专用芯片需求将爆发。

核心要点

  • AMD收购Taalas,其将模型"刻进"芯片实现17000 TPS推理速度,超GPU一个数量级
  • Taalas推理成本仅GPU的几十分之一,功耗12-15kW vs GPU机架120-600kW
  • AI推理专用芯片从Groq→SambaNova→Etched→Taalas,专用化程度不断加深
  • NVIDIA在Vera Rubin系统中引入Groq 3 LPX专用推理芯片,承认GPU推理效率瓶颈
  • Uber已在年初数月耗尽2026全年AI预算,推理成本成AI应用普及核心瓶颈
  • 端侧AI推理专用芯片是中国创业公司的机会,不需要最先进制程和HBM

前瞻展望

AI推理专用芯片的崛起将深刻改变AI算力产业格局。预计2026-2027年,随着AMD、NVIDIA等巨头加速布局专用推理芯片,以及Groq、Etched等创业公司持续获得融资,AI推理将形成"GPU训练+专用芯片推理"的混合架构成为主流。对AI服务用户而言,推理成本的下降将直接降低AI使用门槛——当前每月20美元的AI订阅费用,在专用推理芯片普及后可能降至个位数,这将推动AI应用从"尝鲜"走向"日常必需"。对NVIDIA而言,虽然GPU在训练场景仍不可替代,但在推理市场的份额可能被专用芯片逐步蚕食,NVIDIA的毛利率可能面临下行压力。对中国而言,AI推理专用芯片尤其是端侧芯片是缩小与NVIDIA差距的窗口期——绕过CUDA生态壁垒,直接在推理专用芯片上建立新的软硬件生态。端侧AI推理芯片市场可能在中国率先爆发——中国有全球最多的智能终端用户和最完整的硬件产业链,AI手机、AI眼镜、AI耳机等原生硬件的普及将催生海量端侧推理需求。

更多时势报告