Anthropic 指控阿里窃取 Claude:模型安全到底防得住谁
说实话,看到这条新闻的时候我正在喝咖啡——周五早上嘛,本来打算摸鱼的。
然后 Reuters 的推送弹出来了:"Anthropic says Alibaba illicitly extracted Claude AI model capabilities"。749 点冲上 Hacker News 热榜第一。
咖啡差点喷屏幕上。
嗯,怎么说呢。我一直觉得"模型安全"这四个字,行业里喊得比做得响。但 Anthropic 这次算是把遮羞布扯下来了。
事情是这样的。Anthropic 发现——或者说他们声称发现——阿里巴巴通过某种手段,非法提取了 Claude 模型的能力。不是常规的 API 调用,不是正规的合作,而是"illicit extraction"——非法抽取。
我盯着屏幕愣了三秒。
其实这个事吧,行业内一直有人在做。你知道有个词叫"模型蒸馏"(model distillation)吗?听起来很学术,但说白了就是:拿大模型的输出去训练自己的小模型。正规做法是你跟 API 提供方签协议,走正规渠道。但灰色做法嘛——你偷偷用 API 疯狂调用,把输入输出攒下来,然后拿去训自己的模型。
这不是什么新鲜事。
新鲜的是——Anthropic 居然公开说出来了。
而且点名道姓。
我原本以为这种指控会在私下解决,NDA 一签,赔偿金一付,风头过了大家当没事发生。后来发现——不对劲。Anthropic 是玩真的。这篇报道里说的不是几千次 API 调用那种小打小闹,而是系统性的、有组织的模型能力提取。
怎么说呢。这背后涉及到的东西,比一个公司纠纷复杂得多。
首先是技术层面。训练一个大模型要花多少钱?GPT-4 级别的模型,训练成本保守估计在 1-2 亿美元。如果你能直接"拷贝"别人的模型能力,成本可能降到几百万甚至更低。这就是为什么模型蒸馏那么诱人——也是为什么 Anthropic 那么紧张。
但真正刺痛我的是另一个问题:你的模型到底安不安全?
我做了一个小实验——当然,我不是阿里,没有那个资源去做模型提取——我只是用 Claude 的 API 试了试它的安全限制。
结果怎么说呢。
有个经典的"越狱"测试:让模型假装是某个特定角色,然后绕开安全限制。Claude 在这方面的防护确实比很多模型好,但你多试几次,换个措辞,换个场景——卡——死——了——对,有时候它会死死守住底线。但有时候,你绕三四个弯,它就松口了。
我合上笔记本。这个对比很有意思。
你再想想 Anhtropic 这次指控的规模。如果连 Claude——号称安全做得最好的模型——都能被系统性地提取能力,那其他模型呢?开源模型你随便下,不需要提取。但闭源模型呢?GPT-4 呢?Gemini 呢?
谁在防?防得住谁?
我揉了揉眼睛,又看了一遍那篇报道。不是。问题的核心不是技术漏洞,而是商业动机。为什么 Anthropic 选择现在公开?不是因为他们刚刚发现这件事——这类检测系统应该是持续运行的。而是因为——搞不好——他们想传递一个信号:我们的模型有价值到别人愿意违法去偷。
矛盾是吧?但吃过亏的人就懂。被抄袭说明你做的东西好。

更让我起鸡皮疙瘩的是这事的连锁反应。
阿里巴巴回应了什么?我没找到公开声明。如果是真的,那意味着中国科技巨头直接下场用非法手段获取美国 AI 公司的核心技术。如果是假的——那 Anthropic 为什么要冒着损害声誉的风险公开指控?
你看,这就是问题。不管是真是假,这件事都会加速一个趋势:AI 模型的闭源化。
说实话,我一直是开源模型的拥趸。你看 Llama、GLM、Mistral,这些都是好模型,在一定程度上推动了整个行业。但你越是担心模型被窃取,你就越不敢开源。越不敢开源,垄断就越严重。
这直接伤害的是谁?开发者。是那些想在自己的业务里用 AI、但又不想被锁定在某一个供应商的中小团队。
我原本以为 AI 行业会朝着更开放的方向走。开源模型越来越强,闭源模型被迫降价——这是过去两年的剧本。后来发现——在这个新闻出来之后——剧本可能改了。各大模型公司会加大安全投入,API 调用更严格的监控,频率限制更紧,甚至可能推出"可疑行为检测"。最终受害的是正常用户。
哦对了,还有一层。这起事件可能会上升到国家层面。Reuters 的报道里提到了中国的 AI 产业政策。如果美国商务部介入,事情就大了——出口管制、技术封锁,这些东西已经在芯片领域上演过了。现在轮到模型了。
谁在乎?反正我在乎。
因为如果模型能力也被管制了,那整个 AI 开发生态都会变。你用哪个模型、怎么用、能做什么不能做什么,可能都不再是你自己能决定的事。

写到这里我已经喝了三杯水了。
讲真,这件事给我的最大冲击不是技术层面的,而是信任层面的。AI 行业本来就是一个建立在 trust 之上的行业——你信任 API 调用不会被滥用,你信任模型不会被逆向,你信任合作协议会被遵守。
但信任这个东西,在一次公开指控之后就碎了。
我想起几年前的一个场景。有个开发者买了某大厂的 API 套餐,结果发现对方在日志里记录了他的全部对话内容。他发现之后发了条推,然后那条推炸了。最后官方道歉,说"这是 bug"。你信吗?反正我不信。
回到 Anthropic 和阿里这件事。我们现在能看到的只是冰山一角。更多的细节可能永远不会公开——法律纠纷经常秘密和解。但有一点是确定的:模型提取这件事,已经从"灰色地带"变成了"正面战场"。
我盯着屏幕看了好一会儿。
怎么说呢。在这个行业待久了,你会发现所有"不可想象"的事情,最终都会发生。每个公司都在说自己的模型多安全、多可靠,但真正被攻击的时候,防线往往不堪一击。
不是我不相信技术。是我太相信人类对短期利益的追逐了。
这个问题怎么解决?我目前没有答案。更好的检测算法?更严的 API 管控?法律法规?都不够。只要模型的价值大于窃取成本,就永远有人会去偷。
算了。
最后说一句:如果你在用一个 API 服务,建议你看一下你的使用条款,看看 provider 有没有权利记录你的使用数据。你可能会惊讶地发现——嗯,反正我不太意外了。

关于维基框架
维基框架(Wiki Framework)是一套面向复杂业务场景的轻量级开发框架,支持多语言、多协议、多部署形态。适用于企业级应用开发、微服务架构、云原生部署等场景。
- 官网:https://framewiki.com
- Gitee:https://gitee.com/wiki-framework
- GitHub:https://github.com/wiki-framework
- 示例项目:https://gitee.com/cdkjframework/framewiki-example
- 📄 许可证:MulanPSL-2.0(木兰宽松许可证,第2版)