欢迎访问本站,持续更新中…

Anthropic Mythos 获准有限发布:美国政府的「信任」你信吗

2026-06-28

如果让我直接把 Mythos 接上生产系统,我是不敢的。

至少现在还不敢。

Anthropic 的 Mythos 模型——对,就是昨天刷屏的那个——拿到了美国政府的绿灯。NBC News 和 Semafor 在同一天报道:美国政府允许 Anthropic 向"可信的美国组织"有限发布 Mythos。

不是公开发布。是"可信组织"。这个限定词很有意思。

喝了口咖啡继续看新闻细节。Semafor 的报道提到,这个审批经过了几个月的安全评估,美国政府最终认定 Mythos 可以被有限地用于特定场景——主要是国防、关键基础设施和政府系统。商用场景?不在这次审批范围内。

怎么说呢。这个模式让我想起了早期核技术的管理——不是不让用,是限制谁可以用、用来干什么。AI 模型的"核时代"管理范式,正在一点点成型。

揉揉眼睛。我不是说 Mythos 不安全,问题是"安全"的标准谁定?美国政府定的标准,跟中国企业的标准一样吗?跟欧洲的标准一样吗?

不对。标准的差异可能不是最核心的问题。

我原本以为 Mythos 的争议主要在能力边界上——这玩意儿到底有多强?Anthropic 的内部测试说它在前沿推理任务上比 Claude 4 提升了 40% 以上。40%,不是小数字。在 GPQA、MMLU-Pro 这些硬基准上,Mythos 的数据确实异乎寻常地高。

但——发布会演示我一般只信一半。另一半得等开发者社区开始吐槽以后才知道。

其实吧。这次政府审批有一个细节值得深挖:审批不是无条件的。Anthropic 需要定期向美国政府提交安全报告,而且模型的使用范围受到严格监控。如果出现滥用或安全事件,政府可以随时收回授权。

说白了。这不是信任,是监管下的实验性部署。

政府大楼内部长廊,棋盘格地板延伸向远处,门上亮着'RESTRICTED ACCESS'发光标志,温暖琥珀色灯光与冷蓝色灯光交替,背景可见文件柜

我翻了一下 HN 上的讨论(这篇帖子得了 500 多分),社区反应非常分裂。一方认为这是对 AI 安全的负责任管理,另一方觉得政府和大科技公司正在合谋把 AI 锁起来,只给少数人用。

——"不是 AI 统治人类,而是人类中的少数人用 AI 统治其他人。"

这说法有点极端,但我理解那种不安。

从技术角度聊聊 Mythos 到底做了什么。Anthropic 在 Mythos 上引入了一个新的安全架构——"分层推理"机制。简单说就是模型在生成高风险输出前,会做一次内部的"自我审查"推理,判断输出是否符合安全边界。如果触发了安全阈值,模型会拒绝回答或者给出一个"重定向"回复。

这个想法本身不错,但有两个问题:

第一,分层推理增加了推理延迟。Mythos 的响应时间比 Claude 4 多了大概 300-500 毫秒——因为每次生成前要多跑一次安全检查。在对话场景下还能接受,在实时推理场景(比如自动驾驶、工业控制)下,这延迟是不可接受的。

第二,"自我审查"的准确性。如果模型的审查层本身不够准确,会出现两种错误:放过危险输出(假阴性),或者阻止正常输出(假阳性)。Mythos 在内部测试中的假阳性率是 3.2%,听起来不高,但在大规模部署下,3.2% 意味着每 31 个正常请求就有一个被错误拒绝。

等一下。3.2% 这个数据是谁测的?Anthropic 自己。所以这个数字能不能信,你自己判断。

这让我想起 2024 年 Claude 3 刚出的时候——安全过滤器太严格,连"如何制作意大利面"都拒绝回答。后来调整了几轮才正常。Mythos 既然在安全上加了这么多层,会不会重蹈覆辙?

嗯,就看第一批拿到权限的"可信组织"什么时候开始吐槽了。

一名工程师在昏暗的监控室中盯着多个显示器屏幕,屏幕上有 AI 安全监控仪表盘和安全阈值警报,氛围严肃,蓝色和红色灯光

关于 Mythos 还有一个被很多人忽略的细节——这个模型在"工具使用"(Tool Use)能力上做了大幅增强。Mythos 可以同时调用多个外部工具,并根据工具的返回结果动态调整后续行动。这在以前是要用复杂的 agent 框架才能做到的,现在模型原生支持了。

举个例子。你可以让 Mythos 自动查询多个数据库、对比结果、生成报告,然后根据报告内容决定下一步操作。整个过程不需要写一行 agent 编排代码。

但如果让我把这种能力直接接入企业系统——说实话我不敢。万一模型误解了工具返回的数据,或者调用错了 API 参数,造成的损失谁来背?生成代码必须人工审查,否则线上事故背锅的是自己。

行吧。这不仅仅是个技术问题,这是个信任问题。而且信任是需要时间验证的。

目前已知获得 Mythos 访问权限的组织包括几家大型国防承包商、一个政府部门、两家金融基础设施公司。具体名单没有公开——又一层不透明。

矛盾是吧?一边喊着"AI 安全透明",一边连谁在用都不说。

看吧。Mythos 的有限发布是一个信号——AI 安全和监管正在从"讨论阶段"进入"执行阶段"。执行阶段永远比讨论阶段更 messy。标准谁来定、权限怎么管、出事了谁负责——这些问题的答案不是靠 PR 能糊弄过去的。

我盯着屏幕看了一会儿。说实话,我对 Anthropic 的安全研究是尊重的——他们在 RLHF 和 constitutional AI 上的工作确实是行业标杆。但"尊重研究"和"信任部署"是两回事。

厚重钢门上的小窗透出 AI 模型的光辉,门外的人透过窗户望向里面,一只手按在门上,冷暖光线对比象征公共访问与受限 AI 之间的壁垒

Mythos 到底怎么样,等第一批用户开始说话了再说。现在——保持观望。

关于维基框架

维基框架(Wiki Framework)是一套面向复杂业务场景的轻量级开发框架,支持多语言、多协议、多部署形态。适用于企业级应用开发、微服务架构、云原生部署等场景。