人和 AI 组队,先翻翻错题本
人和 AI 组队,先翻翻错题本
AI 这么强,再加上一个你,不是应该更强吗?—— 第一反应是”是”,但翻完数据你会发现,”不是”的那部分,才更有意思。
我最近在搭一个”两个 AI 互相审查”的系统,顺手去查了查:人和 AI 组队,到底灵不灵。
结果被一个数字震住了。
一百多项研究、三百多个对照实验,结论出奇地一致——人和 AI 组队,平均下来,还不如让最强的那个单干。 十次组队,七次打不赢团队里最厉害的那一个。
一、1+1,常常小于 2
这个结论很反直觉。你多半会想:AI 会犯错,人会纠错,两个人加一块儿,不是应该更对了吗?
但实验说的是另一回事:在”做决定”这类任务上,人 + AI 的组合,平均表现比”人或 AI 单独最好的那个”还差。
注意,这不是说 AI 没用。而是说——“组队”这个动作本身,不保证变强。 有时候,多一个”人”(或一个 AI),反而把水搅浑了。
那什么时候组队才真能变强?答案藏在一个特别朴素的地方。
二、秘密在错题本
想象你和 AI 一起做同一套题。做完,翻翻你们俩的错题本。
- 如果你错的那批题,AI 也恰好错——组队没用。 你们错到一块儿去了,谁也没法给谁兜底。
- 如果你错的题 AI 刚好会、AI 错的题你刚好会——组队就赚大了。 你们错得不一样,正好互补。
数学家给这个”错得不一样”起了个名字,叫错误相关性,记作希腊字母 ρ(读 rho)。
翻译成人话,就一句话:你错的时候,AI 是不是也恰好错?
- 是 → ρ 高 → 组队白搭。
- 不是 → ρ 低、甚至负 → 组队才 1+1 > 2。
这背后是一条冷冰冰的数学定理:只有当你们俩的错误相关性低到某个阈值以下,组队才可能超越任何一个人单干。 迈不过这个门槛,任何”把两个判断揉在一起”的技巧,都救不回来。
三、”谁对听谁”,是个陷阱
好,那怎么把两个判断”揉在一起”?
多数人的第一反应是:谁厉害听谁的。 医生和 AI 意见不一致?听 AI 的,或者听医生的。
听起来天经地义,但数学上,这是个死胡同——
“谁对听谁”这种二选一的玩法,永远无法超越那个被选中的人自己。 你只是从两个人里挑一个,挑得再准,上限也就是”最强那一个”的水平,永远到不了”比最强还强”。
真正能超越的,是把两个判断乘起来,而不是挑一个。
打个比方:不是让 AI 和医生投票”谁票多听谁”,而是让医生先给出判断,再让 AI 拿着医生的”历史准确率”——这个医生在哪些病上容易看走眼——去修正 AI 自己的判断。两个信号相乘,谁弱谁靠边、谁强谁主导,但拼出来的结果,能比任何单独一方都准。
我用这套东西,真搭了一个审查系统。实测:两个 AI 单独都是 82% 左右的准确率,融合之后,到了 91%。
前提只有一个——它们的错题本,错得不一样。
四、互补,是设计出来的,不是等来的
写到这,其实还有一个更扎心、也更有意思的东西。
我们总爱聊”AI 会不会取代人””AI 怎么辅助人”。但数据讲的是另一件事:互补不是天上掉下来的。你不会因为旁边坐了个 AI,就自动变强。
你得主动干一件事:看清自己错在哪,看清 AI 错在哪,然后设计出一个”谁也替代不了谁”的位置。
这事跟”会不会用 AI”无关。会用的、不会用的,都可能跟 AI 错到一块儿去。
我们这代人最大的焦虑,是”AI 一来,人就自动贬值”。但数据给出的答案,恰恰相反:值钱的那部分,从来不在 AI 手里,也不在你手里——在”你们怎么错开”这件事里。
真正稀缺的能力,是拿着两本错题本,当那个决定”怎么组队”的人。
你不是 AI 的观众,不是 AI 的下属,也不是坐在旁边给它鼓掌的人。你是那个看清了边界、然后把两块拼图拼起来的人。
这,可能才是 AI 时代”人”真正的位置。
五、所以
下次你想让 AI 当搭档,先别急着问它”你会不会”。
先翻翻错题本,问一句:我们俩,会不会错到一块儿去?
错开了,1+1 才大于 2。