最会用 AI 的人,在给它建一家公司
你有没有过这种经历:让 AI 干一件长一点的活,开头惊艳你就放手不盯了,结果它干到后面把你反复强调的要求忘得一干二净,还把改好的又改坏,一脸自信。这不是某个 AI 不行,是这一代 AI、尤其是能自己干活的 Agent 一个改不掉的毛病——它其实没有记忆,每次都在重读一份不断被压缩、越读越糊的笔记。这篇把它讲透:它为什么会「断片」,业界这两年用 context / harness / loop engineering 怎么拼命治它,到底治得了吗(有 16 分的硬证据,也有独立评测的冷水),以及我最后咂摸出的一件事——那些最会用 AI 的人,干的压根不是调教一个更聪明的大脑,而是在给 AI 建一家「公司」:分工、交接、复盘、验收,全是人类组织对付「人也健忘」的老办法。
你有没有过这种经历——
让 AI 帮你干一件稍微长一点的活。一开始它表现得特别好,思路清楚、响应到位,你心里一松,觉得这玩意儿靠谱,就放手让它接着干,不怎么盯了。
然后回头一看,傻眼了。它干到后面,把你前面反复强调的要求忘得一干二净,甚至把你早就确认过、改好的东西,又给改回错的。它还一脸自信,仿佛一切尽在掌握。
我自己被坑过不止一次。最气的不是它做错,是它在你最信任它的时候掉链子——开头越惊艳,你越放心,它后面断片,你越措手不及。
这事不怪你不会用,也不是某个 AI 不行。不管你平时用的是 ChatGPT、Claude,还是豆包、DeepSeek、各种国产 Agent,这个毛病都一样。它是这一代 AI——尤其是能自己连续干活的 Agent——一个改不掉的硬伤。
今天我想把它讲透:它为什么会「断片」,业界这两年怎么拼命想治它,治得了吗,以及最后我咂摸出的一件挺有意思的事——那些最会用 AI 的人,干的压根不是「调教一个更聪明的大脑」,而是在给 AI 建一家「公司」。
它压根没在「记」,是每次重读一份被压缩的笔记
先得搞明白一件反直觉的事:AI 其实没有「记忆」。
你跟它聊天、或者让一个 Agent 连续干活,看起来像是它一直「记得」你们之前说过啥。但底层不是这么回事。
每一次它要接话、要做下一步,系统都会把「到目前为止的所有内容」——你的指令、它的回复、它读过的文件、工具返回的结果——重新打包,整个塞进去给模型看一遍。模型本身什么都不记,它只是每次重读一遍这份卷宗,然后接着干。
问题来了:这份卷宗能塞的量是有上限的(这个上限叫上下文窗口)。活干得越久,卷宗越厚,迟早超出上限。超了怎么办?
主流做法叫 compaction(上下文压缩):系统把前面那一大坨打包成一份摘要,把原件扔了,留下摘要加最近几轮,凑成一份更薄的新卷宗,接着干。

你品品这个过程。你以为你和 AI 是一段连续的对话、它一直陪着你;其实在底层,它读的那份卷宗被压缩、被替换了一轮又一轮。你看到的「连续」和「记得」,是工程拼出来的错觉。 而且每压一次,都是一次有损压缩——把厚的压成薄的,必然丢东西。摘要保留的是它「觉得重要」的,丢掉的恰恰可能是你最在乎的那个细节:某个具体约束、一个文件路径、一句「这里千万别动」。
这就是它「断片」的根。不是它笨,是它每次重读的那份笔记,越读越糊。
像 Claude Code 这类编程 Agent,干脆把这事摆到台面上——它有个 /compact 命令,窗口快满了会自动触发压缩,你能亲眼看到它「重新整理记忆」那一下。方便是方便,但压缩该留什么、扔什么,是它说了算,不总跟你想的一样。
窗口越大,越像个安慰剂
那有人说了:把窗口做大不就行了?卷宗能塞越多,不就不用老压缩了?
这两年厂商也是这么卷的,上下文窗口从几万一路卷到上百万。听起来很美。但这里有个挺扎心的事实:标称的窗口大小,和真正能用好的部分,差得远。
行业里测下来,模型能可靠用上的,大概只有标称窗口的一半多点。更麻烦的是一个叫「lost in the middle」的现象——信息放在卷宗的开头和结尾,它看得清;放在中间,它经常视而不见。
有多明显?拿「在一堆内容里找一个指定信息」的测试看,最新的前沿模型在百万级长度上能做到 96%、99%,看着完美。但把它换成「同时找 8 个信息」——这才接近真实使用——分数立刻掉到 74%、89%。东西越多、越复杂,它漏得越狠。

往更让人后背发凉的方向说:有研究发现,前沿模型在读了几十万 token 的内容之后,对那些本该警觉的危险操作,漏判的概率会成倍上升。不是它没看,是内容一多,它是真的「看不见」了。
所以「窗口够大就能记住一切」这个前两年很流行的想法,现在基本破产了。窗口大是有用,但它不是解药,更像个安慰剂——让你以为问题解决了,其实只是把它往后推了推。何况窗口越大、越慢越贵:内容翻一倍,响应时间也差不多翻一倍。
AI 会「慌」,也会「逞能」
光说机制有点干。我讲两个特别有画面感的翻车现场,你立刻就懂这个「断片」长啥样。
第一种,叫「慌了」。
当卷宗快塞满、空间快没了的时候,模型会进入一种类似「上下文焦虑」的状态——它好像意识到自己快没地方了,于是赶着收尾:本来该一步步做完的活,草草了事,能省则省,糊弄个结果给你。就像考试时间快到了,后面的大题直接乱写几笔交卷。
第二种,正好相反,叫「逞能」。
你给它一个挺大的活,它不懂得拆,非要一口吃成胖子,想在一轮里把整件事全干完。结果它在有限的卷宗里东改一笔西改一笔,搞出一团互相打架、没有任何记录的乱改。你想回头看它到底干了啥,根本理不清。

一个怂、一个莽。但你发现没有,这两种翻车,根子是同一个——它能稳稳握住的「工作记忆」就那么点。空间紧张了就慌,活儿太大了又超出它能一次握住的范围。健忘,是这两种翻车共同的母题。
于是高手不再「使唤」AI,而是给它建制度
讲到这,你可能觉得:那这 AI 还能用吗?
能。而且这两年业界没坐着等模型变强,而是发明了一整套工程,专门对付这个健忘症。这套工程的演进,本身就挺说明问题:
最早大家拼的是 prompt engineering(怎么把话说好);后来是 context engineering(怎么把喂给它的料组织好);现在最热的,叫 harness engineering。
harness,可以理解成套在模型外面的那层「骨架」——循环、工具、上下文管理、记忆、护栏,全在里头。圈子里有个特别简洁的公式:Agent = Model + Harness。模型是那个会断片的大脑,harness 是包在外面、让它能稳定干活的那套系统。

这套系统具体怎么对付健忘?举几个我觉得很聪明的招:
- 该用才喂:不一次把所有工具说明、文档、规则全塞进卷宗,而是用到哪一步、才把那一步要的信息喂进去,省出宝贵空间。
- 好钢用在刀刃上:规划和最后验收这种重活,用贵的强模型;中间打杂跑腿,用便宜快的模型。一份卷宗里,钱和注意力都花在关键处。
- 拦住它草草收尾:它一想偷懒提前交卷,系统就把你最初的要求重新喂一遍,逼它回到正轨。
- 分活:脏活累活分给「子 Agent」,每个用自己干净的卷宗去干,干完把结果交回来,互不污染。
- 只追加,不改写:绝不回头去改前面的记录(一改就毁掉缓存、还容易乱),只往后追加。
最能说明风向的,是 Claude Code 负责人 Boris Cherny 公开讲过的一句话——他说他现在已经不亲手去 prompt AI 了,而是写一堆「循环」,让循环自己去驱动 AI、自己琢磨下一步该干啥,「我的工作是写循环」。
这就是现在很火的 loop engineering(循环工程):你不再一句句使唤 AI,而是设计一套能自己转的流程——发现任务、分派、验收、记录、决定下一步,让这套流程去推动 AI。这里有句话我特别认同:一个没有任何东西能给它「挑刺」的循环,等于让 AI 自己跟自己点头。所以好的循环里,一定塞着测试、检查、验收这些「挑刺」的环节。
但这套工程,真治好病了吗
这是我最想跟你聊的一问,因为吹这套工程的声音太多了,得泼点冷水。
先说有用的证据,确实硬:
同一个模型——比如同一个 Claude——放进不同的骨架里,跑同一套编程测试,分数能差出 16 分(一个 93,一个 77)。模型一模一样,差距全来自外面那套系统。还有团队,模型一个字没改,光优化骨架,就把自己的 Agent 从某榜单第 30 名干到了第 5 名。甚至有个反直觉的发现:给模型开到最大「思考预算」,效果反而不如适中——适当的约束,比放任它使劲想更管用。
这些都说明:模型越来越像个标准件,拉开差距的,是外面那套工程。
但是——它治本了吗?我的判断是:没有。

几个不能忽略的反面声音:有独立评测机构发现,这些精心设计的 Agent 工具,在不少任务上的优势其实「在误差范围内」,没那么神。更关键的一点是——长上下文不等于长任务。当前最强的一批 Agent,在标准编程测试上能拿七成多,换到考验长任务的测试上(要连续改几十个文件那种),能掉到两成五。这说明工程能帮它「把料找齐、组织好」,但它在长链条上连续推理的底子,还是不够硬。料喂对了,它照样可能想岔。
还有人——包括 OpenAI 内部的研究者——认为这套外挂工程可能是临时的:等模型自己变强了,外面这层骨架会被慢慢吸收进模型里,不再需要。
所以我的结论是:这套工程是真有用,但它是对冲,不是治愈。它把 AI 健忘、会慌、会逞能这些毛病兜住了一大半,让 Agent 能干越来越长的活。但天花板还在那——在模型本身的长任务推理能力上。工程能托到哪儿,是有边界的。
说到底,是在给 AI 复刻一家公司
把这套东西摊开看,我后来咂摸出一个味道——
这些招数,分活给子 Agent、用外部文件做交接记录、让 AI 复盘过往总结经验、每一步都要过测试验收、别让一个上下文扛太多……这不就是一家公司管人的那套吗?
人也健忘。人也会在快下班时赶工出错,也会高估自己一口接太多活。人类组织是怎么解决的?从没指望谁记住一切——而是靠分工、靠写文档交接、靠复盘、靠流程和检查清单、靠别让一个人累垮。

你看,harness 也好、loop engineering 也好,本质上就是在给 AI 搭一套「工作制度」,让一群记性有限、偶尔犯浑的「员工」(一个个 Agent),靠制度协作出靠谱的结果。
想通这层,有件事就清楚了:「让 AI 记住一切」,从一开始就是个误会。 我们不该追求一个能记住一切的超级大脑,就像一家好公司不靠一个记得住所有事的超人,靠的是好的制度。AI 协作的进化方向,不是更大的脑子,是更好的制度。
那你该怎么用它
落到你自己身上,分两种人说。
如果你是普通用户,把 AI 当一个「会断片的天才同事」来相处,就对了:
- 关键要求别只说一次。重要的约束、偏好,该重复就重复,别指望它一直记得。
- 自己留底。真正要紧的信息(一段确定的需求、一个不能错的数字),自己存一份,需要时重新贴给它,别赌它没丢。
- 长活拆开干。别一次甩给它一个巨大的任务,拆成几段,每段做完你验收一下再往下。
- 它开始飘了就重开。发现它前言不搭后语、开始忘事,别在那个对话里硬聊,新开一个,把关键背景重新喂一遍。
如果你是开发者、在搭 Agent:
- 把记忆外置。关键信息在压缩发生之前,就写到外部文件或数据库,别全压在模型那点上下文里。
- 写循环,塞验收。别手把手喂,设计能自转的流程,每个环节都挂上测试、检查这种「挑刺」机制。
- 拆活、隔离。脏活用子 Agent 隔离上下文去干,主流程保持干净。
- 换个指标。别用「能连续干多久」衡量一个 Agent,用「每花一块钱产出多少有用的活」。
最后
这一轮 AI Agent 的较量,我越来越觉得,拉开差距的不是谁的模型更强、谁的窗口更大,是谁更懂怎么管它的健忘——谁给它搭的那套「工作制度」更结实。
所以下次别再问「这个 AI 能连续干多久」了。该问的是:它这套工作制度,兜不兜得住?
模型会一代代变强,这是肯定的。但「长任务里的健忘」是这一代 AI 真实的边界,短期内绕不过去。看懂这条边界的人——知道工程能托到哪、哪里还得靠人盯着、哪里只能等模型进步——才能把 AI 用稳、用出活来。
说到底,今天 AI 的可靠,还不长在模型里。它长在你给它搭的那套制度里。