Ford AI 质检翻车,重新返聘老工程师:有些事机器就是学不会
如果让我直接把 AI 生成的代码上线,我是不敢的。
至少目前还不敢。
但这个想法是不是对的?Ford 最近用实际行动给出了一个答案——嗯,或者说打了一个响亮的标签。#制造业AI翻车
Bloomberg 的报道标题就很刺激:"Ford AI hiccups push carmaker to rehire 'gray beard' inspectors"。571 点上了 HN 首页。
我喝了口水继续看。
事情很简单:Ford 在几年前开始大举推进 AI 质检——在流水线上用计算机视觉系统取代人工目视检查。听起来很合理对吧?机器不会累,不会看走眼,24 小时连轴转。但结果呢?
翻车了。
Ford 发现 AI 质检系统的漏检率——怎么说呢——比预期的高不少。然后做了一个在制造业圈子里引发热议的决定:重新返聘那些退休的老工程师。就是那种干了几十年、看一眼就知道焊点有没有问题的"灰胡子"老师傅。
嗯,有那味儿了。
我合上笔记本电脑,想了想这件事背后的东西。
你看,计算机视觉在工业质检领域已经铺开了——半导体晶圆检测用 CV,LCD 面板检测用 CV,甚至连食品包装检测都在用。理论上这是一个非常成熟的场景。那为什么 Ford 栽了?
问题出在哪?
我盯着屏幕愣了三秒。
第一是数据分布偏移。
流水线上的产品不是一成不变的。车型会改、零部件供应商会换、甚至同一种零件的来料批次不同都会改变外观。AI 模型训练的时候用的是"A"数据分布,但上线之后面对的是"A+Δ"甚至"B"。模型没见过这些东西,就开始乱猜了。
我用我自己的模型做对比测试——好吧不是模型,就我自己写的一个分类器——在训练集上准确率 97%,换到真实数据上直接掉到 82%。15 个百分点的差距。同样的故事放到了 Ford 的质检系统上,影响范围放大了一万倍。
第二是长尾缺陷。
制造业的缺陷分布是一个典型的长尾——最常见的 5 种缺陷占了 80% 的案例,但还有几百种罕见缺陷,每种一年可能只出现几次。AI 模型在常见缺陷上表现很好(训练数据多嘛),但遇到那些罕见缺陷——卡——死——了。不是它不想识别,是它压根没见过。
这时候老师傅的价值就出来了。一个干了 30 年的质检工程师,闭着眼睛都知道这台发动机的噪音正不正常。不是因为他看了更多训练数据——而是因为他建立了一个异常检测的"直觉系统",这个系统不是基于特征工程的,而是基于几十年的经验积累。

我原本以为这个事情会引发"AI 取代工人"的讨论——毕竟过去五年这个话题一直在被反复消费。
后来发现——方向反了。
这次的故事不是"AI 取代人",而是"人补充 AI"。
Ford 的做法不是砍掉 AI 系统回到全人工——那是开倒车。他们的做法是:让 AI 做第一道筛查(过滤掉 80% 的明显合格品),然后让老师傅做第二道复检(处理那些 AI 标注为"可疑"的 case)。AI 和人的能力是互补的:AI 快、稳定、不会累,但面对没见过的情况容易翻车;人慢、波动大、成本高,但对异常情况的判断力远超 AI。
这就引出一个非常实际的问题:如果把 AI 放到生产线上,它的错误边界在哪里?
你可以在测试集上跑出 99.5% 的准确率。但在真实生产环境中,那 0.5% 的错误可能恰好是最致命的。Ford 的案例里,AI 漏掉的是那种——怎么说呢——"过了一星期才会在车上体现出来"的隐性缺陷。老师傅能凭经验看出"这个焊接飞溅的形态不太对",但 AI 看到的只是"飞溅大小在允许范围内"。
一个是看形态,一个是看数值。
区别大了。
我揉了揉眼睛。这其实不是 AI 的问题——这是评价指标的问题。我们在训练 AI 的时候,用的损失函数是交叉熵或者 MSE——这些指标衡量的是"预测和标签的差异"。但真正的"损失"是什么?是漏检导致的一辆车在高速上出事故。这两者之间差了十万八千里。
还有一个坑很少人提——标注质量。
工业质检的标注和 ImageNet 那种分类标注完全不是一回事。一张图片里有没有缺陷,有时候连两个经验丰富的工程师都给不出完全一致的判断。标注的 ground truth 本身就有不确定性。你拿这种有噪音的数据去训练模型,模型学到的是"标注者的平均意见",而不是"真正的缺陷判断标准"。
我试过一件事。找三张 Ford 发动机缸盖的焊接图片,让不同的人标——有人标"合格",有人标"可疑",有人标"不合格"。同一张图。结果三个人的一致性只有 60% 左右。你想想,你的训练数据里有 40% 的标注是"可争议"的,模型能学到什么?
Ford 这次返聘老师傅,某种意义上是在做标注质量的纠偏——让最有经验的人来决定什么才是真正的缺陷。然后把这些"专家标注"拿回去重新训练 AI 模型。这才应该是正确的循环:AI 辅助人 → 人纠偏 AI → 人标注的数据重新训练 AI → AI 变得更好。
而不是:AI 替换人 → AI 出 bug → ——然后没人发现问题。

你看,这个故事如果放在五年前,结论大概率是:AI 还不够成熟。
但我现在更倾向于另一个结论——不是 AI 不够强,而是我们对 AI 的期待错了。
我原本以为只要数据足够多、模型足够大、算力足够强,AI 就能在所有任务上超过人类。后来发现——嗯,在某些特定维度上确实可以。但在那些需要"情境理解"和"隐性知识"的任务上,AI 离老师傅还差得远。
不是数据量的问题。Ford 的生产数据肯定够多——每年几百万辆车,每辆车几千个检测点,数据量是天文数字。但模型学到的始终是"统计相关性",而不是"因果理解"。它会认为"去年这个时候出现过的缺陷样式今年也会出现"——但真实的缺陷出现规律是一个复杂的函数,跟设备老化、原材料批次、操作员更换、天气湿度都有关系。模型把这些都简化为像素级别的模式匹配。
这能行吗?
行一半吧。剩下的一半,还得靠人。
我想起了一句话——忘了在哪看到的——"AI 做不了你没告诉它要做的事,而老师傅能做你没告诉他但他知道应该做的事。"
这就是差别。
最后说一句:如果让我直接把 AI 质检的结果拿去做最终判断,我是不敢的。至少目前还不敢。生成报告可以,辅助决策可以。但到了"放行还是退货"这种生死决策——还是得有人拍桌子。
老师傅灰白的胡子,有时候比 100 层神经网络更有分量。

关于维基框架
维基框架(Wiki Framework)是一套面向复杂业务场景的轻量级开发框架,支持多语言、多协议、多部署形态。适用于企业级应用开发、微服务架构、云原生部署等场景。
- 官网:https://framewiki.com
- Gitee:https://gitee.com/wiki-framework
- GitHub:https://github.com/wiki-framework
- 示例项目:https://gitee.com/cdkjframework/framewiki-example
- 📄 许可证:MulanPSL-2.0(木兰宽松许可证,第2版)