欢迎访问本站,持续更新中…

我以为 AMD AI Dev Kit 能平替 NVIDIA,结果第一步就卡在驱动上

2026-07-07

两周前我在 HN 上看到 AMD 发布了 Ryzen AI Halo Dev Kit,定价 $3999。说实话,第一反应是——终于有个像样的 NVIDIA 替代品了。

最近几个月 H100/B200 的价格涨得离谱,租云 GPU 也贵得让人肉疼。所以看到 AMD 推出一款标价四千美元的 AI 开发套件,我几乎是立刻就开始盘算:这玩意儿能跑什么模型?能替代手头那台租来的 A6000 吗?

「又一台 AI PC」—— 我最初的判断其实是错的

坦白讲,最开始我并没太当回事。AMD 之前推过几轮「AI PC」概念,Ryzen 7040 系列开始就内置了 XDNA AI 引擎,但实际用下来体验很一般——ONNX Runtime 支持有限,PyTorch 直接不支持 ROCm 之外的加速后端,最后大多数开发者还是插了张 NVIDIA 卡了事。

所以当看到「Ryzen AI Halo Dev Kit」这个名字时,我下意识以为又是同样的套路:一个集成 NPU 的开发板,跑跑 tinyML 模型,真正的大模型训练还是得靠 CUDA。

但仔细看规格之后,我发现这次不太一样。

这款 Dev Kit 用的是 AMD 最新的 Ryzen AI Halo 处理器,集成了 RDNA 3.5 架构的 GPU,内存高达 128GB 的统一内存,支持 ROCm 6.x 完整软件栈。不是「AI PC」,是一台正儿八经的本地 AI 训练/推理工作站。

最关键的是那块 128GB 统一内存——这是 AMD 相对于 NVIDIA 最独特的优势。NVIDIA 的消费级 GPU(RTX 4090 24GB、RTX 5090 32GB)显存有限,企业级 GPU(A100 80GB、H100 80GB)价格又贵得离谱。而 AMD 通过统一内存架构,可以让 CPU 和 GPU 共享 128GB 内存,理论上可以直接跑 70B 参数的大模型。

AMD Ryzen AI Halo Dev Kit 外观,一台黑色紧凑型工作站,机身正面有 AMD 标志和散热格栅,工业设计风格

参数确实漂亮,但实际用起来到底怎么样?我决定亲自试试看。

环境搭建:从「开箱即用」到「一整天没了」

拿到 Dev Kit 的第一天,我犯了一个典型的「上一代经验」错误——我以为它会像 NVIDIA Jetson 那样,插电开机就能跑 PyTorch 训练脚本。

实际上,我连 ROCm 都没装对。

AMD 官方文档说 Dev Kit 预装了 Ubuntu 24.04 和 ROCm 6.3,但实际开机后发现系统里只有基础驱动,ROCm 需要手动安装。我按照官方指引执行 apt install rocm,结果依赖冲突——系统自带的 ROCk 内核模块版本和 rocm 包需要的版本对不上。

那两天调 ROCm 其实挺消耗精力的。每次改完 repo 源和内核参数都想着这次总该行了吧,跑 rocminfo——又是「No ROCm devices found」。机器风扇一直全速转着,嗡嗡的声音从下午持续到半夜。

我最初以为是驱动或者内核版本的问题——想过切内核版本、退 ROCm 版本、甚至重装系统。折腾了六七个小时后,发现真正的原因是 BIOS 里把 IOMMU 设成了「auto」而不是「enable」,导致 ROCm 无法正确枚举 GPU 设备。

那一刻我其实有点沉默,这不是驱动版本问题,是 BIOS 默认配置问题。

跑模型:统一内存到底能装下什么

环境搞定之后,我开始测试实际性能。128GB 统一内存是 AMD 的最大卖点,但它的「统一」是有代价的——CPU 和 GPU 之间的带宽不是无限的。

我做了一个简单的对比测试:用同一份 LLaMA 3.1 8B 的 Q4 量化版本,分别在这台 Dev Kit 和一台 RTX 4090 机器上跑推理。

项目 AMD Ryzen AI Halo RTX 4090
首 token 延迟 ~180ms ~45ms
推理速度 (tokens/s) ~32 t/s ~85 t/s
最大可加载模型 ~95B (Q4) ~13B (Q4)
启用 Flash Attention ❌ 不支持 ✅ 支持

数据很清楚:单论推理速度,AMD 的 GPU 计算单元确实还比不上 NVIDIA。但反过来看,这块 Dev Kit 能装下将近 100B 参数的量化模型,这是 4090 完全做不到的。

我其实犹豫了很久——到底是速度重要还是容量重要。如果做 LLM 应用开发,32 t/s 的推理速度完全够用(人类阅读速度大概 5-8 tokens/s),但如果你在做模型训练或者需要频繁迭代 prompt,85 t/s 和 32 t/s 的差距就是实打实的时间成本。

剩下最后一个路——我不是一开始就想走这条路的——我决定用它来做长上下文推理和 Agent 工具调用的场景。这些场景对显存的需求远大于对速度的需求,128GB 统一内存恰好能撑住多轮对话 + 大量工具描述上下文。

一个开发者坐在昏暗的房间里,显示器上显示 ROCm 终端和 GPU 监控面板,旁边放着一杯咖啡,深夜工作氛围

妥协和不完美:它到底值不值 $3999

说到价格——$3999 这个定位其实很微妙。

同样价格可以做什么?租 H100 云实例大概能租 3-4 个月,买一块 RTX 5090 大概 $2000-$2500(还没正式发布),买一块 A6000 Ada 大概 $5500。

不完美,远不完美。最理想方案当然是买一块 H100,但预算卡在那。$3999 对于个人开发者来说不是小数目,对于企业来说又不算高。

AMD 自己把这款 Dev Kit 定位为「AI 开发平台」,不是「AI 训练平台」。这两个词的区别很关键——你可以在上面做原型开发、跑推理服务、调 Agent 行为,但如果想训一个 7B 模型,还是老老实实上云 GPU 集群吧。

另外还有两个我没想到的坑:

第一是软件生态。PyTorch 官方对 ROCm 的支持已经改善很多了,但有些关键库(比如 Flash Attention、vLLM、llama.cpp 的 ROCm 后端)要么不支持,要么版本落后。每次跑一个新项目都可能需要重新编译或者改代码。

第二是散热和功耗。这玩意儿满载能到 250W+,风扇声音不算小。放在办公室还行,放在家里工位上晚上安静的时候挺吵的。那几天调 vLLM 其实挺消耗精力的,每次改完参数都想着这次总该行了吧,跑起来——机器风扇一直全速转着。

数据可视化图表,对比了 AMD Ryzen AI Halo 和 NVIDIA RTX 4090 在推理速度和模型容量上的差异,深色 UI 风格

不是平替,是另一种选择

我现在对这台 Dev Kit 的看法跟最开始完全不同了。

最开始我以为它是一台「能跑大模型的开发板」,后来发现它其实是一台「能装下大模型但跑得不算快的开发板」。再后来我意识到——能装下本身就是一种能力。

128GB 的统一内存在今天的大模型生态里是一个很独特的位置。消费级 GPU 装不下 70B 模型,企业级 GPU 租不起,而 AMD 给了一个中间选项。它不是平替 NVIDIA,它是一个不同规格的选择。

后来我一直在想,如果一开始就知道 BIOS 里有 IOMMU 这个坑,我会不会选完全不同的安装方案?答案大概是不会,因为不管怎么装,ROCm 和 CUDA 生态之间的差距都在那里。只是起步能快一点罢了。

关于维基框架

维基框架(Wiki Framework)是一套面向复杂业务场景的轻量级开发框架,支持多语言、多协议、多部署形态。适用于企业级应用开发、微服务架构、云原生部署等场景。