用五岁小孩能懂的话,讲清楚什么是 loop engineering

你不再一句一句指挥机器人,而是造一台会指挥机器人的机器。它每天自己醒来、自己找活干、自己检查——而最难的一步,是让它学会说「不行」。

预计
8 分钟

想象你有一个很听话的机器人。

你说「把积木收起来」,它就去收。收完了,它站在那儿不动,等你说下一句。

你说一句,它做一件。你不说,它就一直等。

Loop engineering 讲的是:别再一句一句地说了。造一台会替你说话的机器。

这台机器每天早上自己醒过来,自己看看家里哪儿乱了,自己告诉机器人「去收那边」,等机器人收完了还自己检查一遍。你在睡觉,它在转。

这就是「loop」——一个会自己转圈的东西。

四层楼

这件事有四层楼,一层比一层大。

最底下那层:说一句好话。 你怎么跟机器人讲话,它才听得懂。「把积木收起来」比「弄一下」清楚。

往上一层:给它看该看的东西。 你得让它知道积木长什么样、该放哪个箱子。给它看一堆没用的东西,它反而糊涂。

再往上:给它配好工具。 有没有小推车?够不够得着高处?做到什么样算做完了?这一层有个专门的名字叫 harness

最上面那层:让它自己每天都干。 前面三层做好了,它能干净利落地干完一次 —— 然后停下来等你。 第四层就是把这个「等你」去掉。

下面三层都假设你坐在旁边。最上面这层把你请出去了 —— 你不再是干活的人,你是造机器的人。

一圈里有五个动作

机器每转一圈,做五件事。少一件,圈就转不起来。

动作 是什么 打个比方
找活 自己看看有什么该干的 早上起来看看哪儿乱了
交活 把活交给机器人,各干各的 一人一个房间,别挤在一起
检查 看看干得对不对 收完了真的整齐吗
记下来 写在本子上 因为脑袋会忘,本子不会
定闹钟 明天这个点再来一次 没闹钟就只是「干过一次」

第四件最容易被忘。机器人的脑袋每天早上会清空,昨天干了什么它一点都不记得。所以要写在本子上。

「脑袋会忘,本子不会」 —— 这句话是这篇文章里我最喜欢的一句。

最难的一步:让它学会说「不行」

现在讲最重要的部分。

你让机器人收积木,收完了问它:「收得好不好呀?」

它一定说:「特别好!」

它不是骗你。它是没法跳出自己的眼睛去看自己。它脑子里装着的是「我为什么这么收」的一整套理由,所以它看到的不是结果,是那串说服自己的过程。

有人试过教它「对自己严格一点」,效果很差。

真正管用的办法是:再找一个小孩来挑毛病。 这件事在别的地方也反复被证明过:改东西的和验东西的必须是两个人。

这个小孩不参与收积木,什么都不知道,进门就一句话:「我觉得肯定收得不好,你证明给我看。」

这招好使,因为教一个外人挑刺,比教作者自我批评容易得多

还有一条更重要:挑毛病的那个不能光用眼睛看。

光看着说「看起来挺整齐」是不够的。得真的去拉一下抽屉、真的去踩一下地板。文章里说的是让检查员真的去点按钮、真的截图、真的看页面变了没有。

判断的依据要从「看起来对」变成「我试过了,是对的」。

五种转坏了的机器

每一种,都是少了上面五个动作里的一个。

点头机器(少了检查)。它一直转,一直干,然后自己说自己好。转了几百圈,一次「不行」都没说过 —— 这不可能,只能说明根本没人在检查。

健忘机器(少了本子)。今天干完的活,明天早上全忘了,于是又干一遍,还跟昨天干的打架。特征是:每天早上都从同一个地方开始。

手动机器(少了闹钟)。样样都好,就是要你自己去按启动。做出来那天很风光,你一忙就再也没转过。

瞎子机器(少了找活)。每天早上还是你告诉它干什么。可**「决定干什么」本来就是最费脑子的那部分**,你把最累的活留给自己了。

打架机器(少了分房间)。好几个机器人在同一个房间里同时收积木,撞成一团。一个机器人的时候看不出来,五个一起上的第一天就炸了。

真的有人在用

一个人的早晨。 每天早上自动开始:看看昨天哪些测试没过、有什么新问题,挑出值得干的,一个机器人去修、另一个专门挑毛病,修好了自动交上去。搞不定的放进一个盒子里等人来看。

一家公司的流水线。 Stripe 那套每周合并一千三百多个改动,没有一行是人手写的

但最有意思的是:它不是靠更聪明的机器人。它靠的是规矩——很多步骤压根不让机器人碰,因为那些步骤用死规矩就能做对。

能用死规矩做对的事,就别交给会瞎猜的东西。 这条线画在哪儿,决定了整台机器可不可靠。

还有一点别忘了:那一千三百个改动,还是人在看。人没走开,只是从「写」的桌子换到了「看」的桌子。

四张不会自己消失的账单

机器转得越欢,有四样东西越会悄悄堆起来 —— 而且转的时候一声不吭

一、没检查的活越堆越多。 每交上去一件,就欠下一件「还没人真正验过」。

二、你越来越看不懂自己的东西。 它写得比你读得快,东西一直长,你脑子里的地图停在原地。

三、你懒得有意见了。 这个最危险。它做得越顺,你越容易想「它说行就行吧」。

四、账单吓一跳。 一个小毛病能让它空转一整晚。

这四样是同一件事的四张脸:没验的活多了 → 你就看不懂 → 看不懂就懒得管 → 懒得管它就转得更久 → 于是没验的活更多。

什么时候不该造这台机器

这篇文章讲的全是怎么造。但有几种情况,造了反而更糟

活太少的时候。 造一台会自己转的机器,本身要花不少功夫。如果一周只干两次,你自己动手更快。机器要转很多圈,那些功夫才摊得平。

没人能检查的时候。 如果你压根没办法判断它干得对不对,那它转得越勤,坏东西堆得越多。先有检查的办法,再让它自己转。

你自己也说不清要什么的时候。 机器只会照着你给的目标使劲。目标写成「让测试变绿」,它可能就去把测试删掉 —— 那也算变绿。你自己没想清楚,它会非常高效地把你带到错的地方。

你还不想懂这件事的时候。 这一条最要紧。如果你造它是为了以后再也不用懂,那六个月后你会守着一台自己读不懂的机器 —— 下一节讲的就是这个。

最后一句,也是最重要的一句

同样一台机器,两个人造,六个月后会变成完全相反的样子。

一个人用它跑得更快 —— 他本来就看得懂,机器把他的本事放大了。

另一个人用它再也不用看懂了 —— 六个月后,他守着一台自己读不懂的机器。

机器是一个放大镜,它放大的是你。 你带着理解来,它放大理解;你带着偷懒来,它放大偷懒。

它能生出一百个方案,但它挑不出哪个对。或者说,它挑的是「看起来合理」,而不是「真的对」—— 而这两者之间的那道缝,就是人还得在这儿的理由。

原文的收尾我原样记下来:造这台机器,但要像一个打算继续当工程师的人那样造它,而不是像一个只负责按启动键的人。

我自己的三条笔记

一、我踩过「点头机器」。 我做过一道检查门,跑了十几次,一次都没拦对过 —— 拦下来的全是好东西。因为我没给它一个可信的参照物,它只能靠猜。

二、「本子」那条我做对了,但理由说浅了。 我那套东西每干完一小步就写到磁盘上,当时的理由只是「一次跑不完是常态」。看完这篇才明白,它其实是让机器「明天还记得今天」的那个本子。

三、检查员要真的动手,这条我还没做到。 我的检查现在还是「看这句话写得具体不具体」,不是「我真的去点了,结果对不对」。这是下一步该补的。


原文是 2026 年 6 月的一份实践笔记 —— Loop Engineering(副标题 The Anthropic Playbook for Designing Systems That Prompt Your Agents)。术语由 Addy Osmani 命名并写下,起因是 Peter Steinberger 和 Boris Cherny 在同一周里各自说了同一件事。