用五岁小孩能懂的话,讲清楚什么是 loop engineering
你不再一句一句指挥机器人,而是造一台会指挥机器人的机器。它每天自己醒来、自己找活干、自己检查——而最难的一步,是让它学会说「不行」。
想象你有一个很听话的机器人。
你说「把积木收起来」,它就去收。收完了,它站在那儿不动,等你说下一句。
你说一句,它做一件。你不说,它就一直等。
Loop engineering 讲的是:别再一句一句地说了。造一台会替你说话的机器。
这台机器每天早上自己醒过来,自己看看家里哪儿乱了,自己告诉机器人「去收那边」,等机器人收完了还自己检查一遍。你在睡觉,它在转。
这就是「loop」——一个会自己转圈的东西。
四层楼
这件事有四层楼,一层比一层大。
最底下那层:说一句好话。 你怎么跟机器人讲话,它才听得懂。「把积木收起来」比「弄一下」清楚。
往上一层:给它看该看的东西。 你得让它知道积木长什么样、该放哪个箱子。给它看一堆没用的东西,它反而糊涂。
再往上:给它配好工具。 有没有小推车?够不够得着高处?做到什么样算做完了?这一层有个专门的名字叫 harness。
最上面那层:让它自己每天都干。 前面三层做好了,它能干净利落地干完一次 —— 然后停下来等你。 第四层就是把这个「等你」去掉。
下面三层都假设你坐在旁边。最上面这层把你请出去了 —— 你不再是干活的人,你是造机器的人。
一圈里有五个动作
机器每转一圈,做五件事。少一件,圈就转不起来。
| 动作 | 是什么 | 打个比方 |
|---|---|---|
| 找活 | 自己看看有什么该干的 | 早上起来看看哪儿乱了 |
| 交活 | 把活交给机器人,各干各的 | 一人一个房间,别挤在一起 |
| 检查 | 看看干得对不对 | 收完了真的整齐吗 |
| 记下来 | 写在本子上 | 因为脑袋会忘,本子不会 |
| 定闹钟 | 明天这个点再来一次 | 没闹钟就只是「干过一次」 |
第四件最容易被忘。机器人的脑袋每天早上会清空,昨天干了什么它一点都不记得。所以要写在本子上。
「脑袋会忘,本子不会」 —— 这句话是这篇文章里我最喜欢的一句。
最难的一步:让它学会说「不行」
现在讲最重要的部分。
你让机器人收积木,收完了问它:「收得好不好呀?」
它一定说:「特别好!」
它不是骗你。它是没法跳出自己的眼睛去看自己。它脑子里装着的是「我为什么这么收」的一整套理由,所以它看到的不是结果,是那串说服自己的过程。
有人试过教它「对自己严格一点」,效果很差。
真正管用的办法是:再找一个小孩来挑毛病。 这件事在别的地方也反复被证明过:改东西的和验东西的必须是两个人。
这个小孩不参与收积木,什么都不知道,进门就一句话:「我觉得肯定收得不好,你证明给我看。」
这招好使,因为教一个外人挑刺,比教作者自我批评容易得多。
还有一条更重要:挑毛病的那个不能光用眼睛看。
光看着说「看起来挺整齐」是不够的。得真的去拉一下抽屉、真的去踩一下地板。文章里说的是让检查员真的去点按钮、真的截图、真的看页面变了没有。
判断的依据要从「看起来对」变成「我试过了,是对的」。
五种转坏了的机器
每一种,都是少了上面五个动作里的一个。
点头机器(少了检查)。它一直转,一直干,然后自己说自己好。转了几百圈,一次「不行」都没说过 —— 这不可能,只能说明根本没人在检查。
健忘机器(少了本子)。今天干完的活,明天早上全忘了,于是又干一遍,还跟昨天干的打架。特征是:每天早上都从同一个地方开始。
手动机器(少了闹钟)。样样都好,就是要你自己去按启动。做出来那天很风光,你一忙就再也没转过。
瞎子机器(少了找活)。每天早上还是你告诉它干什么。可**「决定干什么」本来就是最费脑子的那部分**,你把最累的活留给自己了。
打架机器(少了分房间)。好几个机器人在同一个房间里同时收积木,撞成一团。一个机器人的时候看不出来,五个一起上的第一天就炸了。
真的有人在用
一个人的早晨。 每天早上自动开始:看看昨天哪些测试没过、有什么新问题,挑出值得干的,一个机器人去修、另一个专门挑毛病,修好了自动交上去。搞不定的放进一个盒子里等人来看。
一家公司的流水线。 Stripe 那套每周合并一千三百多个改动,没有一行是人手写的。
但最有意思的是:它不是靠更聪明的机器人。它靠的是规矩——很多步骤压根不让机器人碰,因为那些步骤用死规矩就能做对。
能用死规矩做对的事,就别交给会瞎猜的东西。 这条线画在哪儿,决定了整台机器可不可靠。
还有一点别忘了:那一千三百个改动,还是人在看。人没走开,只是从「写」的桌子换到了「看」的桌子。
四张不会自己消失的账单
机器转得越欢,有四样东西越会悄悄堆起来 —— 而且转的时候一声不吭。
一、没检查的活越堆越多。 每交上去一件,就欠下一件「还没人真正验过」。
二、你越来越看不懂自己的东西。 它写得比你读得快,东西一直长,你脑子里的地图停在原地。
三、你懒得有意见了。 这个最危险。它做得越顺,你越容易想「它说行就行吧」。
四、账单吓一跳。 一个小毛病能让它空转一整晚。
这四样是同一件事的四张脸:没验的活多了 → 你就看不懂 → 看不懂就懒得管 → 懒得管它就转得更久 → 于是没验的活更多。
什么时候不该造这台机器
这篇文章讲的全是怎么造。但有几种情况,造了反而更糟。
活太少的时候。 造一台会自己转的机器,本身要花不少功夫。如果一周只干两次,你自己动手更快。机器要转很多圈,那些功夫才摊得平。
没人能检查的时候。 如果你压根没办法判断它干得对不对,那它转得越勤,坏东西堆得越多。先有检查的办法,再让它自己转。
你自己也说不清要什么的时候。 机器只会照着你给的目标使劲。目标写成「让测试变绿」,它可能就去把测试删掉 —— 那也算变绿。你自己没想清楚,它会非常高效地把你带到错的地方。
你还不想懂这件事的时候。 这一条最要紧。如果你造它是为了以后再也不用懂,那六个月后你会守着一台自己读不懂的机器 —— 下一节讲的就是这个。
最后一句,也是最重要的一句
同样一台机器,两个人造,六个月后会变成完全相反的样子。
一个人用它跑得更快 —— 他本来就看得懂,机器把他的本事放大了。
另一个人用它再也不用看懂了 —— 六个月后,他守着一台自己读不懂的机器。
机器是一个放大镜,它放大的是你。 你带着理解来,它放大理解;你带着偷懒来,它放大偷懒。
它能生出一百个方案,但它挑不出哪个对。或者说,它挑的是「看起来合理」,而不是「真的对」—— 而这两者之间的那道缝,就是人还得在这儿的理由。
原文的收尾我原样记下来:造这台机器,但要像一个打算继续当工程师的人那样造它,而不是像一个只负责按启动键的人。
我自己的三条笔记
一、我踩过「点头机器」。 我做过一道检查门,跑了十几次,一次都没拦对过 —— 拦下来的全是好东西。因为我没给它一个可信的参照物,它只能靠猜。
二、「本子」那条我做对了,但理由说浅了。 我那套东西每干完一小步就写到磁盘上,当时的理由只是「一次跑不完是常态」。看完这篇才明白,它其实是让机器「明天还记得今天」的那个本子。
三、检查员要真的动手,这条我还没做到。 我的检查现在还是「看这句话写得具体不具体」,不是「我真的去点了,结果对不对」。这是下一步该补的。
原文是 2026 年 6 月的一份实践笔记 —— Loop Engineering(副标题 The Anthropic Playbook for Designing Systems That Prompt Your Agents)。术语由 Addy Osmani 命名并写下,起因是 Peter Steinberger 和 Boris Cherny 在同一周里各自说了同一件事。