欢迎访问本站,持续更新中…

Ford AI 质检翻车,重新返聘老工程师:有些事机器就是学不会

如果让我直接把 AI 生成的代码上线,我是不敢的。

至少目前还不敢。

但这个想法是不是对的?Ford 最近用实际行动给出了一个答案——嗯,或者说打了一个响亮的标签。#制造业AI翻车

Bloomberg 的报道标题就很刺激:"Ford AI hiccups push carmaker to rehire 'gray beard' inspectors"。571 点上了 HN 首页。

我喝了口水继续看。

事情很简单:Ford 在几年前开始大举推进 AI 质检——在流水线上用计算机视觉系统取代人工目视检查。听起来很合理对吧?机器不会累,不会看走眼,24 小时连轴转。但结果呢?

翻车了。

Ford 发现 AI 质检系统的漏检率——怎么说呢——比预期的高不少。然后做了一个在制造业圈子里引发热议的决定:重新返聘那些退休的老工程师。就是那种干了几十年、看一眼就知道焊点有没有问题的"灰胡子"老师傅。

嗯,有那味儿了。


我合上笔记本电脑,想了想这件事背后的东西。

你看,计算机视觉在工业质检领域已经铺开了——半导体晶圆检测用 CV,LCD 面板检测用 CV,甚至连食品包装检测都在用。理论上这是一个非常成熟的场景。那为什么 Ford 栽了?

问题出在哪?

我盯着屏幕愣了三秒。

第一是数据分布偏移。

流水线上的产品不是一成不变的。车型会改、零部件供应商会换、甚至同一种零件的来料批次不同都会改变外观。AI 模型训练的时候用的是"A"数据分布,但上线之后面对的是"A+Δ"甚至"B"。模型没见过这些东西,就开始乱猜了。

我用我自己的模型做对比测试——好吧不是模型,就我自己写的一个分类器——在训练集上准确率 97%,换到真实数据上直接掉到 82%。15 个百分点的差距。同样的故事放到了 Ford 的质检系统上,影响范围放大了一万倍。

第二是长尾缺陷。

制造业的缺陷分布是一个典型的长尾——最常见的 5 种缺陷占了 80% 的案例,但还有几百种罕见缺陷,每种一年可能只出现几次。AI 模型在常见缺陷上表现很好(训练数据多嘛),但遇到那些罕见缺陷——卡——死——了。不是它不想识别,是它压根没见过。

这时候老师傅的价值就出来了。一个干了 30 年的质检工程师,闭着眼睛都知道这台发动机的噪音正不正常。不是因为他看了更多训练数据——而是因为他建立了一个异常检测的"直觉系统",这个系统不是基于特征工程的,而是基于几十年的经验积累。

Automotive factory assembly line with robotic arms and AI vision cameras inspecting car body parts, a human inspector in the background examining a component, industrial setting with dramatic lighting


我原本以为这个事情会引发"AI 取代工人"的讨论——毕竟过去五年这个话题一直在被反复消费。

后来发现——方向反了。

这次的故事不是"AI 取代人",而是"人补充 AI"。

Ford 的做法不是砍掉 AI 系统回到全人工——那是开倒车。他们的做法是:让 AI 做第一道筛查(过滤掉 80% 的明显合格品),然后让老师傅做第二道复检(处理那些 AI 标注为"可疑"的 case)。AI 和人的能力是互补的:AI 快、稳定、不会累,但面对没见过的情况容易翻车;人慢、波动大、成本高,但对异常情况的判断力远超 AI。

这就引出一个非常实际的问题:如果把 AI 放到生产线上,它的错误边界在哪里?

你可以在测试集上跑出 99.5% 的准确率。但在真实生产环境中,那 0.5% 的错误可能恰好是最致命的。Ford 的案例里,AI 漏掉的是那种——怎么说呢——"过了一星期才会在车上体现出来"的隐性缺陷。老师傅能凭经验看出"这个焊接飞溅的形态不太对",但 AI 看到的只是"飞溅大小在允许范围内"。

一个是看形态,一个是看数值。

区别大了。

我揉了揉眼睛。这其实不是 AI 的问题——这是评价指标的问题。我们在训练 AI 的时候,用的损失函数是交叉熵或者 MSE——这些指标衡量的是"预测和标签的差异"。但真正的"损失"是什么?是漏检导致的一辆车在高速上出事故。这两者之间差了十万八千里。


还有一个坑很少人提——标注质量。

工业质检的标注和 ImageNet 那种分类标注完全不是一回事。一张图片里有没有缺陷,有时候连两个经验丰富的工程师都给不出完全一致的判断。标注的 ground truth 本身就有不确定性。你拿这种有噪音的数据去训练模型,模型学到的是"标注者的平均意见",而不是"真正的缺陷判断标准"。

我试过一件事。找三张 Ford 发动机缸盖的焊接图片,让不同的人标——有人标"合格",有人标"可疑",有人标"不合格"。同一张图。结果三个人的一致性只有 60% 左右。你想想,你的训练数据里有 40% 的标注是"可争议"的,模型能学到什么?

Ford 这次返聘老师傅,某种意义上是在做标注质量的纠偏——让最有经验的人来决定什么才是真正的缺陷。然后把这些"专家标注"拿回去重新训练 AI 模型。这才应该是正确的循环:AI 辅助人 → 人纠偏 AI → 人标注的数据重新训练 AI → AI 变得更好。

而不是:AI 替换人 → AI 出 bug → ——然后没人发现问题。

Quality control flowchart showing AI detection results being reviewed by experienced human inspectors, with feedback loop arrows connecting human judgments back to model retraining, infographic style


你看,这个故事如果放在五年前,结论大概率是:AI 还不够成熟。

但我现在更倾向于另一个结论——不是 AI 不够强,而是我们对 AI 的期待错了。

我原本以为只要数据足够多、模型足够大、算力足够强,AI 就能在所有任务上超过人类。后来发现——嗯,在某些特定维度上确实可以。但在那些需要"情境理解"和"隐性知识"的任务上,AI 离老师傅还差得远。

不是数据量的问题。Ford 的生产数据肯定够多——每年几百万辆车,每辆车几千个检测点,数据量是天文数字。但模型学到的始终是"统计相关性",而不是"因果理解"。它会认为"去年这个时候出现过的缺陷样式今年也会出现"——但真实的缺陷出现规律是一个复杂的函数,跟设备老化、原材料批次、操作员更换、天气湿度都有关系。模型把这些都简化为像素级别的模式匹配。

这能行吗?

行一半吧。剩下的一半,还得靠人。

我想起了一句话——忘了在哪看到的——"AI 做不了你没告诉它要做的事,而老师傅能做你没告诉他但他知道应该做的事。"

这就是差别。

最后说一句:如果让我直接把 AI 质检的结果拿去做最终判断,我是不敢的。至少目前还不敢。生成报告可以,辅助决策可以。但到了"放行还是退货"这种生死决策——还是得有人拍桌子。

老师傅灰白的胡子,有时候比 100 层神经网络更有分量。

An elderly automotive quality inspector with gray beard examining a car part closely, wearing safety glasses, experienced hands holding the component, workshop environment with tools and machinery in background, warm lighting

关于维基框架

维基框架(Wiki Framework)是一套面向复杂业务场景的轻量级开发框架,支持多语言、多协议、多部署形态。适用于企业级应用开发、微服务架构、云原生部署等场景。