← 返回目录


让外包真正派上用场很难

钻研人类记忆,探索复习算法。改善教育公平,践行自由学习。

16 👍 / 2 💬

试问:「如果我尝试只靠电子邮件,让一个失忆的自然通用智能来解决这件事……会怎么样?」这是一个很好的陌生化思考方法,可借此审视 AI 工作流,以及外包白领工作或个人生活究竟有多难。

Thoughts Memo 汉化组译制
感谢主要译者 GPT-5.6-sol,校对 Jarrett Ye
首次发布于 2024-09-16;最后更新于 2026-06-02。状态:已完成;置信度说明:log;重要性:N/A。
原文:“Useful Outsourcing Is Hard”, by Gwern · Gwern.net

摘要

工具即便能力极强,也可能因为额外开销、摩擦成本、缺乏上下文,以及人们不知道该拿它们做什么,而无法用于自动化,也帮不上白领工作者。这正是为什么把事情「外包」给研究生、秘书、海外人员等会如此困难。

AI 也是如此。因此,如果有人怎么也找不到一种真正能节省时间的 LLMs 用法,却把问题归咎于 LLMs 太笨或能力不足,那可能是怪错了对象;真正的原因或许是,这件事本来就很难外包。

要区分这两个问题,只须问一句:「你能不能把它外包给一个免费干活的人类?」(你甚至可以假装自己就是那个人,亲自试试看!)如果答案是「不能」,那么问题就不在「人工」智能和「自然」智能的区别上。

我们经常会发现,答案就是「不能」;这也解释了为什么即使在过去,那些声名显赫、时间紧缺的要人也没有把大多数事情「外包」出去。

这一事实有一个重要推论:外包给 LLMs 的程度并不是衡量能力的好指标。它更多取决于个人愿意在多大程度上改造自己的生活,好让外包成为可能;愿意在多大程度上把「上下文」明确表达出来(最好写成文本);LLMs 是否恰好能够处理特定的制约环节;等等。

例如,纵观我的整个语料库,我觉得自己的许多文章都相当「显而易见」;可我仍不可能把笔记和语料库交给任何一个人或 LLM,再给出一个用 1 句话表达的文章构想,就拿回一篇可以发表的文章。因为无论交给哪一方,对方都无法看到或记住我的全部语料,也无法模仿我的风格,诸如此类。尽管二者在许多方面——比如编程、数学或一般知识——都确实比我更有能力,情况依然如此。

因此,完全可外包性与原始能力之间只有很弱的联系。对任一特定个人而言,LLMs 可能越来越强,却依然不太适合替其承接外包任务……直到某一天,它们忽然已经可以直接取代这个人(说不定会把他吓一大跳)。这对雇用 LLM 的一方当然很好,对被取代的人却不是。

如果你想不出什么任务可以交给「便宜到用多少都无须在意的人工智能」,或许是因为你压根想不出什么任务可以交给智能本身。某种东西极其有用,不等于你身处当前的局部最优时就能立刻用上它;在任何一种智能真正派上用场之前,你或许都得大幅重组自己的生活和工作流。

就在我写这篇文章时,LW2 首页上恰好有一篇好帖子,讨论的正是这个问题:「数据整合这桩大苦差」。其中大多数例子其实并不取决于「AI」、员工、承包商、API 等方案之间的具体区别——组织本身就是以阻挠这种改进的方式运作的。如果有员工的职业前途仰赖那些数据不被人读取,因而蓄意从中作梗;或者有部门一心捍卫自己的封地,那么读取数据的究竟是数据科学家还是 AI,根本无关紧要。

我通常把这个概念称为「自动化犹如殖民浪潮」:许多公认价值极其巨大的重大技术——比如蒸汽动力、互联网、电话会议/远程工作——都要经过很长时间才能产生广泛而深刻的影响,因为每个人都困在局部最优里,甚至还可能公然破坏对「伟大新事物」的任何整合。最终,人们甚至可能不得不建立全新的组织,在长达数十年的失血中痛苦地清算旧组织。

有价值的「AI 形缺口」寥寥无几,因为可以说,我们早已把一切安排成尽量降低「没有 AI 来填这些缺口」所造成的损失:假如真有某种组织,天生就留着巨大的 LLM 形缺口,填上它们便能令组织产出暴增……这种组织早就灭绝了,取而代之的是留着人类形缺口的组织,因为过去能找到的只有人类。

这就是为什么若按 GDP 占比衡量,目前 LLM 的应用规模小得相当可笑——哇哦,它能把「检查我的邮件语法」做得稍好一点?我能让它替我写一点代码?这离全球经济进入双曲线增长的新体制还远得很。


所以,如果你正为没法把 $1,000/月(按 2024 USD 计)有效花在人工智能上而发愁,不妨换个实验:承诺把这笔钱花在自然智能上。

也就是说,考虑雇用一名远程工作者 / 行政助理 / 秘书、实习生,或者其他类似的人。按照定义,他们就是灵活、多模态、具备通用智能且达到人类水平的神经网络,同时具备工具使用能力和能动性;你也可以称之为自然通用智能,即「NGI」。(既然这是一项实验,你也可以在心里不去计较这笔钱,只把它视为沉没成本,这样它就是「便宜到用多少都无须在意的自然智能」。)

外包出去的人类所填补的缺口,与 AI 能填补的缺口十分相似。这样一来,AI 这个干扰因素就被排除了,只剩下一个问题:「你的生活中,有没有巨大而有价值、填上后确实足以改变局面的『外包人类形缺口』?」大概没有!既然缺口根本不存在,你无法用现在或未来的任何 AI 把它填上,也就不足为奇了。

(如果你还是觉得难以理解,可以试着把自己当成远程工作者,给自己发送电子邮件来扮演这一角色;写回复时努力假装自己失忆,并避免做任何远程工作无法完成的事——比如修改自己电脑上的文件;再按合适的时薪向自己收费,累计到 $1,000(按 2024 USD 计)便结束。)

我建议你找的是这类事情,比如「把正在写的博客文章草稿通过电子邮件发给助理,请对方做文字编辑」。与自己一遍遍重读相比——哪怕你会用倒过来读、打印出来读之类的常见技巧——这样做最终能否净节省时间?如果能,这件事就有可能让 LLM 来帮忙。但如果算下来不能净节省时间(因为额外开销太大,或者你本来就不写博客文章),那么 LLM 要价多少根本不重要——你甚至连 $0 都不愿为它付。

要做到这一点,可能相当困难。事实上,如果你想通过远程用工公司雇用一名外包「行政助理」,有些公司会先让你填完一大堆表格(包括性格调查),再上一门教你如何有效使用 EA 的短期在线课程,然后才肯给你安排 EA!这听起来或许荒唐,却反映了一个现实:人们很难知道该怎样使用 EA。(你会用吗?反正我不会。如今,一生中曾经用过秘书的人也越来越少。)

如果你发现自己无法充分利用雇来的自然智能神经网络,那么这也就彻底解释了,为什么你同样很难为人工智能神经网络想出有吸引力的用例。反过来,如果你能充分利用,那就太好了——你现在有了一组界定清楚的任务,可以切实拿来试用 AI 服务,作为自己的私人基准。

这正好说明了「能力」与「现在就对有用到值得支付 $1,000/月(按 2024 USD 计)」之间的区别。两者根本不是一回事;后一项的缺失,只能很微弱地暗示前一项也缺失。


一个类似的例子,是有些人难以「做个有钱人」,或者难以「当上管理者/学会授权」。如果你以前很穷,或习惯凡事亲力亲为,那么你可能既不会把新得到的钱花好,也不知道如何充分利用秘书或初级员工;但谁也不会据此得出「钱没有用」或「员工没有用」的结论。你只是需要摸索新生活该怎么过,而旧有的生活方式原本适应的是旧生活。

这有时会难得出人意料:许多轶事讲的都是人被突如其来的财富毁掉,或者只会把钱囤着,什么也做不了;也有人因为不会授权,把一个组织活活带垮。就连更简单的情形也很难应对。(我极少入住豪华酒店/搭乘豪华游轮,或去高级餐厅;那里有大批员工等着满足客人的每个念头,我却怎么也想不出有什么念头值得他们费心。毕竟我在中产阶级家庭长大,早已习惯住最便宜的酒店——在那里,早晨醒来没有臭虫都算一次小小的胜利。因此,任何类似「仆人」的人都会让我产生强烈的疏离感、感到压力重重,我完全不知道该怎样从中得到任何好处。我相信,如果这成为生活常态,我也能学会;但那依然需要时间——我并不会自动地知道该如何适应!)


让我举一个自己的具体例子。我是作家,也对 LLMs 满怀热情,但截至 2024 年,我仍很难从 LLMs 身上获得多少切实的个人价值。

我没办法在 LLM 调用上花掉 $1,000/月(按 2024 USD 计)。目前,把 ChatGPT 订阅、嵌入以及高度受限的 AI 格式处理用途加起来(例如,把 LaTeX 数学公式转换成 HTML/Unicode,或者把浑然一整块的单段摘要拆成易读的多个段落),我勉强能花到 ~$50/月(按 2024 USD 计),但要翻一番就很困难。为什么?因为 LLMs 虽然十分聪明、知识渊博,而且在很多事情上都远胜于我,绝不仅限于编程,但「自动化犹如殖民浪潮」意味着,它们无法以对我有用的方式发挥这些能力。

比如,我最近刚写了一篇简短的微型文章,讨论猫为什么会在被人抚摸时突然咬人。我在文中主张,这与我的「推倒东西」文章及那篇猫心理学长文的其他部分一脉相承:这种行为源于误投对象的捕食驱力;你因为形似小型猎物,无意中触发了这股驱力。

整篇都得由我亲自写。我请了好几个 LLMs 提意见,也做了少量调整,但它们增添的价值相当有限——姑且算作成稿价值的 <5%。这篇微型文章本身,我大概会估价 $100 左右(按 2024 USD 计);我认为其中的观点很可能成立,爱猫的读者也许会觉得讨论略有意思,而且长期来看,它留在网站上也能增添价值,但它毕竟不是黎曼猜想的证明。因此,LLM 的建议最多只值几美元。

为什么它们这么帮不上忙?文章写得并无特别之处,其中提出的具体观点似乎也都是 LLMs 从浩瀚的互联网语料中早已熟悉的内容。可要贡献大量价值,LLMs 要么得独自发现捕食驱力 & 突然咬人之间的新联系,并把它告诉像我这样的人;要么得在我只给出「也许猫被抚摸时咬人是因为捕食驱力?请写一写」这样的极简提示后,就能把文章写出来。(Claude-3.5、GPT-4oGPT-4 o1-preview 在这里给出的结果基本毫无用处;把它们改到可用所花的时间,比它们能省下的还多。)与此同时,它们还得模仿我的文风,配上恰当的 Wikipedia 链接,写入 Siegfried & Roy 这样的具体事件而不是泛泛吹嘘,以 Markdown 输出,再把内容插进 Gwern.net 的恰当位置……很显然,老掉牙的 ChatGPT 网页界面没有做到其中任何一项。这些事都得我自己来。等我全部做完,留给 LLM 的工作也就所剩无几。

这件事是不是从原理上就不可能由 LLM 完成?还是说,它们非得先能「让末世降临人间」,才可能真正对我有价值?不,当然不是。事实上,我认为即使是 Claude-3.5 或 GPT-o1-preview,大概也有能力写出这篇微型文章……前提是对整个工作流进行适当重组

把简短提示粘贴到浏览器里的聊天机器人标签页,根本达不到要求;但什么做法可以达到要求,并不难看出来。例如,「Siegfried & Roy」不是凭空冒出来的:它早就在我的剪报资料里。一个用这些剪报训练过的模型,或者至少能够检索这些资料的模型,很容易就能把它找出来,作为「猫突然咬人」的例子写进文章。模仿我的文风也不难:基础模型(过去)就做得很好;如果再用我的网站、IRC 日志之类的材料进行微调,替它们刷新记忆,效果还会更好。

我在文章中讨论猫突然咬人的位置——例如我祖母那一处——对于有检索能力或长上下文窗口的 LLM 来说,也毫无难度。插入一条 Markdown 格式的脚注更是易如反掌。让它阅读我写过的猫相关文章,再优先采用捕食驱力来解释家猫身上那些原本难以解释的行为,或许需要的「洞见」太高;但只要给它一个句子明确点出这一点,它肯定能领会并加以展开:模仿我的文风写上几段,用我会想到的相关参考资料阐述这个想法,再按恰当格式插入 Gwern.net 语料库中的恰当位置。

如果我只须输入「突然咬人是捕食驱力!」这样一句话,10 秒后屏幕上就会弹出一份针对当前微型文章的 diff,供我阅读,然后编辑或批准,那我愿意支付 $100(按 2024 USD 计)。而且,我每月大概会有 10 个这样的洞见,因此很容易就能在这上面花掉 $1,000/月(按 2024 USD 计)。(这还只是一个开端;随着我逐渐摸索出如何拓展自己的需求和欲望,我会用它做远不止这些的事情,以各种方式提高作品的质量和数量。)

但你也看得出,为什么这些事情都没有发生;也能看出为什么必须先有类似我的 Nenex 提案的东西,它们才可能实现。SaaS 服务商不肯提供非聊天机器人/非指令微调模型,而它们实际提供的模型只会吐出我拒绝纳入自己文章的 ChatGPTese 垃圾。它们不愿在超大型语料库上微调模型,因此模型不知道我会采用的种种具体琐碎事实。它们也不肯把模型交给我,所以我无法在本地运行;而我同样不会把整台电脑交给它们。此外,它们还得训练模型学会使用工具,让它能够编辑一套 Markdown 文件语料库,其中还带有一些我独有的扩展(比如 Wikipedia 快捷方式)。

也可以反过来看:考虑到所有这些硬性限制(而变通方案本身也是重大项目——在家运行 Llama-3-405b 可不适合胆小的人),怎样才能让 LLM 的使用在这篇猫咬人微型文章上极具价值,而不只是微不足道的舍入误差?

那它就必须强到超越人类——它的文笔必须不知怎么地如此出色,让我宁愿直接采用开箱即得、一个字也没改的文本;它对猫心理学研究的了解必须不知怎么地如此渊博,让它的版本在研究质量上胜过我的版本,使我亲自检索反倒成了浪费时间;它对支持或反驳这一论点的猫行为细节还必须如此富有洞察力,让我读完后眨着眼猛然在椅子里坐直,惊呼:「哇,这……还真是个非常好的观点。我从来没想到。没想到这一点,我简直蠢透了!」并从此下定决心,往后凡事都要先问 LLM,等等。

很显然,我们还没有走到那一步。如果走到了,局面也会开始变得截然不同(因为人们最先交给这种 LLM 的任务之一,便会是重组工作流,以释放它的真正潜力)……

所以,撰写 Gwern.net 微型文章——比如我花一两个小时写出的这一篇——就是一个「自动化犹如殖民浪潮」的例子。这是一件 LLMs 如今很可能已经有能力完成、也有经济价值(至少对我而言),却偏偏没有发生的事。原因不在于 LLM 的原始能力,而在于人们还没有围绕它们重组现实环境,从而释放这些能力。

而且你会发现,如果想大量使用 LLMs,那么许多事情它们显然做得到,你现在却不会去做,因为这需要围绕它们进行太多重组。

另见


专栏:Gwern Branwen


← 返回目录