AMD收购AI芯片公司Taalas:把大模型直接
2026年8月6日,AMD宣布收购AI芯片初创公司Taalas,一家致力于将AI模型直接”蚀刻”到硅片中的创新企业。这笔交易的金额尚未披露,但技术路线图已足够让行业震动。Taalas此前已累计融资超过2亿美元,其首款产品HC1芯片在Llama 3.1 8B模型上实现了惊人的17,000 tokens/秒推理速度——是NVIDIA H200的10倍以上。
Taalas是谁?一家24人的”芯片界特种部队”
Taalas于2023年9月由Ljubisa Bajic在加拿大多伦多创立。Bajic的背景堪称AI芯片界的”全明星”:他曾在AMD和NVIDIA担任芯片架构师,2016年创办了AI芯片公司Tenstorrent并担任首任CEO,后于2022年将CEO职位交接给传奇芯片设计师Jim Keller。2023年3月,Bajic离开Tenstorrent,半年后联合Lejla Bajic(COO)和Drago Ignjatovic(CTO)创办了Taalas,三人均来自Tenstorrent,团队背景覆盖AMD、NVIDIA、苹果和谷歌。
这家仅24人的公司已申请14项专利。2024年3月,Taalas以5000万美元融资走出隐身模式;到2026年2月,公司累计融资达1.69亿美元,投资者包括Quiet Capital和Pierre Lamond等知名半导体投资人。其首款产品HC1芯片专为Meta Llama 3.1 8B模型优化,已在实际硅片上验证运行——用Bajic的话说,”仅24人和3000万美元就做出了第一款产品”。
模型蚀刻:当神经网络变成物理电路
Taalas做的事情与传统GPU/TPU完全不同。传统AI芯片是通用计算单元——同样的硬件跑GPT-5、Claude、Llama都没问题,但效率并非最优。Taalas的思路是:为特定模型定制硅片。
“模型蚀刻”(Model Etching)的技术原理可以这样理解:传统芯片中,模型权重存储在DRAM或HBM中,推理时数据需要反复在内存和计算单元之间搬运——这被称为”内存墙”(Memory Wall)瓶颈。Taalas的突破在于,将训练好的神经网络权重直接固化到芯片的掩膜ROM(Mask ROM)中——”1″是物理连线,”0″是断开路径,权重不再是需要刷新的磁电荷,而是永久的金属连接。
Transformer模型的两大核心运算——前馈层(Feed-Forward)和注意力层(Multi-Head Attention)——在Taalas芯片中被差异化处理。前馈层的权重在训练后固定不变,直接存入ROM,访问速度极快;注意力层的KV缓存(Key-Value Cache)随输入序列动态变化,则存储在片上SRAM中。这种”ROM+SRAM”混合架构兼顾了极致效率与必要灵活性,且支持通过LoRA(低秩适配)进行微调。
实际效果令人瞠目:HC1芯片在800mm²的面积上以3比特/参数存储了Llama 3.1 8B全部权重,推理成本仅0.75美分/百万token——相比GPU方案降低了5-10倍。更重要的是,Taalas声称从新模型发布到定制芯片流片只需两个月。对于已经稳定的大模型,一旦部署到这种”固化芯片”上,推理成本可能降到当前的十分之一。
竞争格局:Groq、Cerebras与AI推理的”诸神之战”
AI推理芯片市场正在上演一场激烈的架构竞赛,Taalas并非唯一的挑战者。
Groq选择了一条不同的技术路线——采用全SRAM架构的LPU(语言处理单元),同样绕过HBM带宽瓶颈。2025年12月,NVIDIA以200亿美元收购了Groq的知识产权,此举被解读为NVIDIA对专用推理架构的”防御性收割”。Groq目前以推理云服务商的角色运营着横跨北美、欧洲、中东和亚太的13个数据中心,服务超过500万开发者。
Cerebras则以”晶圆级引擎”(Wafer-Scale Engine)闻名——将整片晶圆做成一个巨型芯片,拥有超大规模片上SRAM。2026年5月,Cerebras在纳斯达克上市(代码CBRS),IPO估值约564亿美元,成为美国自2020年Snowflake以来最大的科技IPO。2026年1月,Cerebras与OpenAI签署了价值超过200亿美元的推理合作协议。
此外还有Etched——专为Transformer架构设计的Sohu芯片。但与这些对手不同,Taalas将”专业化”推向了极致:Groq加速所有模型、Cerebras加速所有模型、Etched加速所有Transformer,而Taalas只加速一个特定模型。这种极端策略的赌注是:当模型推理需求足够大时,为每个主流模型定制芯片的经济性反而更优。
为什么AMD需要Taalas?直指NVIDIA的软肋
AMD在AI芯片领域正奋力追赶NVIDIA。虽然MI300X系列在训练场景逐渐获得认可,但在推理市场份额仍远落后于NVIDIA的H100/B200系列。根据2026年估算,NVIDIA仍占据数据中心AI加速器市场80-85%的份额,而AMD仅占5-7%。
收购Taalas给了AMD一个差异化武器:不从通用计算正面追赶NVIDIA,而是押注”模型固化”这条NVIDIA尚未全力投入的赛道。NVIDIA的护城河在通用GPU编程生态(CUDA)和训练市场,但在推理效率这个维度上,专用芯片(ASIC)天然优于通用GPU。
这标志着AMD从”追赶者”向”规则改变者”转型的野心。NVIDIA以200亿美元收购Groq IP已表明其感受到了专用推理架构的威胁——但收购IP和拥有完整团队、产品与路线图是两回事。通过Taalas,AMD直接获得了一支已在硅片上验证过”模型蚀刻”技术的顶尖团队,可以为云厂商提供”特定模型专用推理卡”。The Register报道指出,收购时机也很巧妙——正值全球AI推理需求爆发、数据中心电力紧张之际,能效比成为新的竞争维度。
但挑战同样存在。模型固化意味着”锁定”——芯片上的模型无法更新,每1-2年大模型迭代就需要更换硬件。数据中心是否愿意接受这种”一次性推理卡”的运营模式,是AMD-Taalas需要回答的核心问题。此外,将更大模型(如DeepSeek R1)蚀刻到芯片上,预计需要30种不同的定制芯片——制造成本和复杂度都将急剧上升。
对开发者的影响
短期内,这项技术主要面向超大规模部署(如ChatGPT的后端推理)。但对普通开发者来说,信号是明确的:未来2-3年内,运行一个开源大模型的推理成本可能趋近于零。当Llama、Qwen等开源模型也能被”刻进”专用芯片,本地运行顶级AI将不再是天方夜谭。
一场AI芯片的”范式转移”正在发生——从”一个架构统治一切”走向”每个模型都有专属芯片”。这场收购或许是AMD改写游戏规则的开始。
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn