欢迎访问本站,持续更新中…

OpenAI Jalapeño 芯片:杀鸡真的需要牛刀吗

2026-06-25

昨晚折腾到两点半。

不是什么大事——就是在跑一个 Codex agent 做代码审查。批了大概二十个 PR,结果跑到一半,Token 烧得飞快,GPU 显存直接拉满。我盯着 nvidia-smi 愣了三秒,然后默默关掉了 Chrome 里剩下的八个 Tab。

开发者深夜盯着 nvidia-smi 监控画面,GPU 满载

不是。

就是那种感觉——明明就是让 AI 帮我 review 一下 if 语句有没有少个括号,结果背后调用的是一整块 H100。简单问答用它属于杀鸡用牛刀,后来甚至不敢拿它问天气,等它思考完天气都变了。

所以今天看到 OpenAI 官宣他们第一颗自研推理芯片的时候——嗯,有那味儿了。

名为 Jalapeño。

Jalapeño 芯片近照,硅晶圆与 Broadcom 合作标识

这颗芯片是跟 Broadcom 合作搞的,专门为推理场景设计。用 OpenAI 自己的话说,他们自己的 AI 模型也参与了芯片设计——好家伙,AI 给自己设计跑自己的硬件,这闭环我服。实测数据还没完全公开,但官方说性能功耗比已经显著超过了现有方案。

说实话。这事儿我从去年十月 Broadcom 合作公布就在等了。

你看,Google 有 TPU,Amazon 有 Trainium 和 Inferentia,NVIDIA 有 H100 和 Blackwell——但说实话,这几家的芯片侧重点都不一样。Google TPU 强在训练,Amazon Inferentia 主打廉价推理,NVIDIA 是通吃但贵。OpenAI 以前是纯软件公司,全靠租别人的算力跑。ChatGPT 火爆那阵子,Sam Altman 愁的不是模型能力不够——他愁的是没卡。

真的是没卡。

所以 OpenAI 要自己做芯片这事,已经传了两年了。从之前挖 Google TPU 的核心工程师,到后来跟 Broadcom 联手,再到今天 Jalaperño 正式亮相,这条路走得算是比较务实了。

关键是——这颗芯片只做推理,不做训练。

什么意思呢?就是 GPT-5 这种大家伙的训练,还是得靠 NVIDIA 的 H100 或者 Blackwell。但日常跑聊天、写代码、做 agent 任务的推理负载,全部交给 Jalaperño。

冲了一杯咖啡——周五下午就是这样——然后开始琢磨这个策略。

推理才是真正烧钱的地方。

训练 GPT-5 可能花了几亿美金,但那是一次性的。推理是每天每秒钟都在花钱。OpenAI 的 Codex、ChatGPT、API 服务,每天处理几十亿次请求,每次请求背后都是推理计算。哪怕一次推理省 0.1 美分,乘以几十亿,那也是巨款。

我原本以为 OpenAI 会一步到位做个训练芯片,跟 NVIDIA 正面刚。后来发现不是这样——他们选了最痛的地方下手。就像修路不先修高速公路,而是先修家门口那段每天都在堵的窄巷子。

Greg Brockman 在内部播客里说了一句话,我觉得挺实在的:"我们对工作负载有深刻理解。我们一直在找那些未被充分服务的特定负载,想想怎么做出能加速可能性的东西。"

翻译一下:我们知道哪疼,就治哪。

当然,不是所有人都买账。HN 上有工程师吐槽说这名字也太随意了——Jalaperño,辣椒名,听着像墨西哥菜名而不是芯片。但说实话,比起 Intel 那些 "Xeon Platinum 8490H" 之类的命名,我觉得 Jalaperño 挺好记的。虽然我不太确定以后听到"辣椒芯片"还能不能保持严肃。

技术层面,我更好奇的是具体架构。

OpenAI 说他们在自研芯片架构、内核、内存系统、网络、调度、部署系统——整条链路全部自控。这意味着 Jalaperño 不只是个芯片,而是一整套基础设施。从芯片到操作系统层面的调度器,从网络拓扑到数据中心的散热方案,全栈自研。

全栈芯片基础设施架构图,从芯片到产品体验的分层设计

举个例子:如果用 Jalaperño 跑 Codex agent,芯片可以针对 Codex 的特定算子做硬件级优化。一般 GPU 上跑要加载完整 CUDA kernel,Jalaperño 可能只要一个专用指令就搞定了。省掉的功耗和延迟不是一点半点。

当然目前一切都还是纸上谈兵。芯片还在测试阶段,大规模部署估计要等到明年。

但我已经有点期待了——等 Jalaperño 真正落地之后,我那个因为跑 code review 而卡死的终端窗口,应该终于不用再强制重启了吧。

怎么说呢。芯片这东西,以前是 Intel 的天下,后来 NVIDIA 一骑绝尘,再后来 Google 和 Amazon 各自为战。现在 OpenAI 也杀进来了。

算力的战场上,玩家越来越多了。

谁最后能赢不好说。但有一点我很确定:等这颗辣椒芯片真能用上的时候,我第一个关掉 nvidia-smi 的监控页面。

关于维基框架

维基框架(Wiki Framework)是一套面向复杂业务场景的轻量级开发框架,支持多语言、多协议、多部署形态。适用于企业级应用开发、微服务架构、云原生部署等场景。