2026年8月12日,AMD宣布收购AI推理专用芯片公司Taalas,标志着AI推理专用芯片赛道进入新阶段。Taalas采用"模型即计算机"理念,将AI模型和权重直接硬编码到基于掩膜ROM的芯片结构中,首款验证芯片HC1将Llama 3.1 8B"刻进"芯片,实现接近17000 TPS/user的推理速度——对比NVIDIA H200、B200及Groq、SambaNova、Cerebras断层领先。成本方面,Llama 3.1 8B每百万Token仅0.75美分,而GPU成本在20至49美分之间;功耗方面,Taalas单机架仅12-15kW,GPU机架高达120-600kW。
Taalas的收购标志着AI推理专用芯片从"概念验证"走向"产业落地"。回顾这条赛道:Groq和SambaNova代表了"通用推理专用化"——针对推理场景优化但不绑定特定模型;Etched代表了"架构专用化"——专注Transformer架构推理;Taalas则走到了"模型专用化"极致——一款芯片只推理一款模型。专用化程度越深,性能和成本优势越明显,但灵活性越低。值得注意的是,NVIDIA也在下一代Vera Rubin系统中引入Groq 3 LPX专用推理芯片,将解码阶段交给专用芯片处理——GPU龙头自己也承认GPU在推理场景的效率瓶颈。
AI推理专用芯片崛起的深层驱动力是AI推理成本的持续攀升。Uber CTO今年4月透露公司已在年初数月内耗尽2026全年AI预算,不得不对每名员工设每月1500美元上限。AI推理的高成本已成为AI应用普及的核心瓶颈——当推理成本占总拥有成本(TCO)的主要部分时,专用化推理芯片的商业价值就凸显出来。对AI产业格局而言,专用推理芯片的崛起可能打破NVIDIA在AI算力领域的垄断地位——GPU在训练场景的通用性优势在推理场景不再适用,专用芯片可以做到更快的速度、更低的成本和更小的功耗。对中国创业公司而言,AI推理专用芯片尤其是端侧推理芯片是难得的机会:不需要最先进制程,不需要HBM等受限高价存储,基于开放指令集的ASIC路线在端侧场景有天然优势。中国拥有全球最好的AI原生硬件成长土壤,一旦AI原生硬件进一步进入主流,端侧AI推理专用芯片需求将爆发。