CUDA 20年护城河一个周末崩塌:Claude独自跑通AMD新GPU

· 科技资讯

一个周末改写了GPU竞争格局

上周末,Anthropic的一名工程师做了一个实验:他给Claude接上了一台全新的AMD MI355X机架,丢下一句话——”去,把这台机器跑起来。”

CUDA 20年护城河一个周末崩塌:Claude独自跑通AMD新GPU封面

等周末结束回到工位,屏幕上已经多出一条持续上涨的性能曲线。Claude不仅跑通了AMD的新GPU,还在不断地自动优化性能

人类工程师全程没有改过一行代码。

AMD CEO苏姿丰在现场讲述这个故事时透露,她第一反应是让AMD团队赶紧去帮忙。结果团队回来告诉她:对方说不用,已经全部搞定了。

这件事为什么是”地震级”的?

要理解这个事件的冲击力,你得知道CUDA是什么。

CUDA是NVIDIA的GPU编程平台,从2006年推出至今已积累了20年。它包括:

编译器(nvcc):把代码翻译成GPU能执行的指令

数学库(cuBLAS、cuDNN):深度学习的核心运算都依赖这些库

调试工具(Nsight):帮开发者找Bug

性能分析器:告诉你瓶颈在哪里

海量的开发文档和社区经验:无数工程师20年攒下来的”手感”

过去,任何挑战者(AMD的ROCm、Intel的oneAPI)都面临同一个死结:芯片性能可以追,软件生态没法追。开发者习惯了CUDA,换平台意味着所有工具链重来,没人愿意干。

但Claude不一样。它不挑工具链——它会读文档、调参数、改代码、跑测试,然后自己判断优化方向。它不需要20年的经验积累,它只需要一份说明书。

AMD给AI开的”后门”:ROCm.AI

在这次AMD Advancing AI大会上,AMD发布了一套专门给AI准备的工具箱——ROCm.AI。

核心理念简单到令人不安:把GPU的指令集和编程文档直接写成AI能读懂的格式。AI不需要人工写驱动、调兼容性、踩坑——它读完说明书就能直接上手调性能。

入口叫AMD Skills,里面装的全是经过验证的ROCm知识。Agent拿到这些知识后,可以自己装环境、部署模型、读日志、查故障。

AMD还在用一个叫Hyperloom的工具,让AI自动做性能优化:拉推理服务→跑出基线→找瓶颈→改配置→生成定制内核→重新跑一遍。现场演示中,Hyperloom把MiniMax M3的输出速度提升了38%

CUDA生态优势的”核弹级”降维打击

CUDA的护城河建立在人力积累上:培养一名顶级GPU工程师要按年算。而AI调GPU,多启动一个Agent只需要再开一个任务。

一名工程师放出一群Agent,就能并行排查报错、定位性能瓶颈。一次跑通的配置、写好的内核和踩过的坑,也能马上成为下一批Agent的起点。

把按年计算的追赶压缩成按任务计算——这就是AI对CUDA生态的降维打击。

已经落地的合作:Anthropic要在AMD上跑2GW

这不是一个实验室里的Demo。Anthropic已经宣布,将在AMD Helios系统中部署最高2GW的Instinct GPU,首批1GW计划于2027年上半年启动。

2GW是什么概念?大约相当于一个中等城市的全部电力供应。全用来跑AI。

对中国AI产业的启示

AMD和Anthropic的这场合作,给中国AI产业一个清晰的信号:CUDA的壁垒正在被AI瓦解

过去我们总说”国产GPU最大短板是软件生态”。现在,如果AI能帮我们搞定软件栈,那么芯片本身的性能就成了唯一变量。国内GPU厂商如果能在硬件上追平,再配合AI自动化适配ROCm生态,追赶NVIDIA的窗口期可能比预想的短得多。

20年的生态差距,第一次可以交给一群Agent昼夜不停地往回追。

🔥 关注LC智趣厅,不错过每一次产业变局。

👇 你认为CUDA会在几年内失去主导地位?评论区聊聊你的判断。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅