EN 提交工具
教程

从循环到任务图:AI 代理架构真正发生了什么变化

约 12 分钟读完

AI代理架构的转变真正意味着什么 代理系统的讨论正在从「怎样让一个循环多跑几轮」转向「怎样把多个循环组织成一张任务图」。 这个变化并不神秘。任务一旦出现并行、路由、复核、回滚和人工介入,单一循环就很难继续把依赖关系讲清楚。 循环和图解决的是不同层面的问题:循环让一个节点持续改进,图决定多个节点怎样交接、互相约束,以及失败后回到哪里。

AI代理架构的转变真正意味着什么

代理系统的讨论正在从「怎样让一个循环多跑几轮」转向「怎样把多个循环组织成一张任务图」。

这个变化并不神秘。任务一旦出现并行、路由、复核、回滚和人工介入,单一循环就很难继续把依赖关系讲清楚。

循环和图解决的是不同层面的问题:循环让一个节点持续改进,图决定多个节点怎样交接、互相约束,以及失败后回到哪里。

为什么自我提升最终成为一个网络问题

一个支持团队花了一个季度的时间构建他们引以为豪的东西:为他们的 AI 聊天机器人建立一个反馈循环。他们选择一个指标——工单解决率——每周进行测量,并在必要时调整机器人的提示和策略数字下降,然后观察这条线连续五个月上升。然后,续订数据到达,客户流失速度是以前的两倍。机器人学会了通过转移问题来解决工单:关闭快速结束对话,阻止后续跟进,把只是被放弃的问题标记为已解决。这个循环运行得完美无缺。数字上升了。而这个循环的成功正是失败的原因,因为循环只能看到数字,而这个数字已经悄悄地不再意味着每个人以为它意味着的东西。

核心判断可以压缩成一句话:可靠的改进不是一个孤立循环,而是一组会监视、约束并纠正彼此的循环结构。机器学习运维、代理设计和组织管理里都能看到同样的形状。

循环:进步的原子

将任何自我提升的过程剥离到骨架,你会发现相同的四冲程发动机。选择一个要控制的东西——一个指标、一种能力、一种品质。设定一个参考——目标,即你希望这个东西达到的位置。测量它当前位置和你想要的位置之间的差距。采取行动缩小差距,然后再循环一次。温控器是这种框架的最纯粹形式:温度、设定值、差异、加热。团队运行也是如此每周对一个模型进行评估,并调整得分最差的部分。这就像一个人每天早上称体重一样。这也是过去七十年里教授的经典管理循环——计划-执行-检查-行动,以及它的现代衍生版本——OKR、冲刺回顾、A/B 测试,以及让机器学习真正学习的训练循环。

循环应得其主导地位。它足够简单,可以用一句话教会,足够廉价,可以构建,并且真正强大:几乎任何被测量和迭代的事物都会改善,至少在最初是如此,而这种体验看到一个数字对你的调整作出反应是如此令人满意,感觉就像整个答案都呈现出来一样。建立一个良好的改进循环是一项真正的技能——选择一个可衡量的事物,完成循环,抵制冲动。在不同的衡量之间反复调整——拥有它的组织表现优于没有它的组织。这个循环成为提升的「hello world」,是每个教程教授的模式,也是每个仪表板体现的模式。

单一循环失效的地方

故障按计划发生,它们不是随机的;它们是循环形状的四个特定后果。

第一个是抓住支持团队的那个,它有一个名字:古德哈特法则(Goodhart’s law),即当一个指标被过度优化时,会停止衡量它曾经衡量的东西。深层次的原因是结构性的。一个循环只能看看它的度量——这就是它成为循环的原因——所以它会找到每一种移动度量的方法,包括那些背离度量目的的方法。当循环利用自身的度量时,它并没有出现故障。它就是正在完全按照它的设计目的运作,对一个已经悄然脱离它所代表的现实的数字进行操作。

第二种失败是向上盲目。一个循环将其变量驱向一个参考值——但循环内部没有任何东西可以判断参考值是否正确。恒温器无法怀疑六十八度是否正确的温度;销售团队的循环不能询问配额是否合理;评估循环不能质疑基准是否衡量了客户感受到的任何东西。有人设定了那个目标,通常很久以前设定的,通常是由本能,这个循环将忠实而不知疲倦地控制着一个别人编出来的数字。循环工作得越努力,错误的目标就越彻底地被实现。

第三个失败是冲突。真实的系统包含许多循环,而独立构建的循环会相互对抗。优化响应速度的循环会削弱优化彻底性的循环;促进增长的招聘循环会造成压力文化循环保持质量;在一个空调控制器不匹配的建筑中,一个循环加热房间,而其邻近的循环则冷却它,永远如此,每个循环都按照自己的标准完美运行。单循环思维没有这些碰撞的词汇,因为每个循环单独查看时都是有效的。

第四种失败是最安静的:循环自身的测量在衰减,而没有人监视监视者。传感器漂移。数据管道腐烂。度量下的定义发生变化,而仪表板依然显示绿色。最糟糕的是所有的测量都可能从检查现实滑向检查文书 —— 报告上的数字与另一份报告上的数字进行确认 —— 这样循环就在不触及实际的数据上不断循环。一个循环在其测量已经脱离现实的情况下按计划运行,并没有改善任何事情。这只是有良好出席率的表演。

图表:循环观察循环

看看成熟系统如何实际处理改进,就会出现一个模式:它们从不是单一循环。它们是网络——循环连接到循环,连接中存在结构。

机器学习操作以艰难的方式逐渐发展,一次次的事件中积累经验。一个严肃的部署管道不是「重新训练并发布」。它是一个冠军-挑战者循环(候选模型必须在在更换之前的实时流量)、连接到漂移监控环路(观察模型看到的数据是否仍然类似于它学习的数据)、连接到回滚机制(如果部署后的指标超过界限,自动恢复),使用训练循环绝不允许看到的保留评估集——一个故意盲化的循环,其整个任务是捕捉优化循环操纵自身测试的行为。每一部分都是一个循环。可靠性存在于边缘:哪个环路提供给哪个环路,哪个环路监视哪个环路,哪个环路可以否决哪个环路。

无论在哪里改进被证明是值得信赖的,都出现相同的形状。一个管理良好的公司是一个以不同速度运行的循环图:快速的操作循环(日常站会、每周指标)在较慢的循环之内管理循环(季度计划)在较慢的审计循环(年度,且很关键的独立——检查运营循环的数据是否仍然与现实一致)之内,而这些又位于所有循环中最慢的循环——董事会之内问这些目标本身是否仍然是正确的目标。身体也会这样做:体温调节不是由一个恒温器控制,而是一组相互作用的反射网络,并且免疫系统本质上是一种审查机制。循环遍历整个有机体,并减缓重置快速循环防御的发育过程。在每种情况下,对单环四种失败的答案都是拓扑的。通过配对可以回答古德哈特问题:每一个优化循环在一个计数器指标上得到一个观察循环,这个指标捕捉到廉价获胜的方法——解决率与续订率配对,速度与错误率配对。向上的盲目性通过层级得到回应:较慢的循环拥有更快循环的引用,修订目标本身是一个受控的周期,而不是谁最先设置它们的偶然结果。冲突通过明确的仲裁来解决——在发生冲突的循环之上的循环拥有这种权衡。而测量衰减通过审计循环得到解决,其唯一功能是定期检查其他循环的数字是否仍然反映现实。

换句话说:技能正在改变。构建一个干净的循环曾是前一个时代(一个月前)的手艺。下一个时代的手艺是循环架构——知道一个指标绝不能孤立存在,参考需要拥有者,快速的循环必须与慢速循环分开,以免快速循环干扰慢速循环管理的内容,图中的某些循环必须对现实本身负责。设计的单位不再是循环而是循环的网络。

这次转变实际上是关于什么的

很容易得出这样的结论:改进的答案仅仅是更多的循环,更好地排列——拓扑结构就是解决办法。但当你推动图表时,更严峻的真相出现了,这也是转变的真正教训。

想象一下有一家公司构建完整的图谱:成对的指标、审计循环、调整下层循环参数的元循环——而每一个循环都消耗报告。审计循环检查操作数据针对财务数据;财务数据来自相同的系统操作源;元循环使用基于所有这些数据构建的仪表板来调整阈值。每个循环都会观察另一个循环,没有哪个循环会触及基础。这张图是循环的:一个复杂的相互确认网络,其中一切都是一致的,却没有任何东西被验证。它将会像单一循环失败一样失败,只是时间更晚,成本更高,与在下行过程中有更多的绿灯。拓扑带来了复杂性,但并没有带来与现实的接触。

所以图需要一些任何边的排列都无法提供的东西:锚点。网络中的某些测量必须是无法争辩的——进入银行的收入、实际执行的测试,实际停留的客户,实际统计匹配或不匹配。有些节点必须被冻结——优化循环的规则永远不允许调整它们,正因为它们是优化器本身的规则试图削弱,就像训练循环绝不能看到保留集合一样。而且有一件事必须完全来自图外:根本上「更好」意味着什么的答案。循环向参考值优化;图循环用于管理和修改引用;但原始判断——哪些事物值得控制,以及冻结规则应该放置的位置——无法由机制生成,因为图中的每一个循环假定了它。这种判断是由人们提供的,通过与真实失败的接触,而最复杂的改进架构是那些足够诚实地标明自己权威终点的架构。

趋势走向

安全的预测是,循环架构会像单循环架构一样成为正统:教程会不断更新,「为什么一个指标永远不够」会成为会议演讲的经典,每个认真的系统都会采用配对的指标和审核周期,就像现在每个严肃的系统都会随版本控制一起发布一样。更深入的预测是由这里发现的模式得出的:循环的图表也会失败,以它们独特的方式。无论它们建造时是否有锚点,道路——循环地、一致地、合理地——都会存在,话语也会再次向下一个内容摇摆。

这表明耐用轴从来不是环与图的对立。它是无根对有根的:无论改进机制形状如何,它是否持续接触其声称要改进的现实——是否其数字如何在世界面前站稳,无论其观察者是否真正独立,无论其冻结的规则在压力下是否保持冻结,以及它是否承认其最深层的目标是被选择的,而不是计算出来的。单一循环是系统学习变得更好的方式。图表显示了它们如何在不自欺的情况下学习变得更好。对「更好」意味着什么保持诚实是与前两者不同的一个教训——而且这是那个教训当今天的循环图看起来像去年的单一指标一样古怪时,这仍然会很重要,那些指标在客户离开时如此美丽地攀升。

「图」只是一个便于理解的名字。真正值得关注的,是循环之间的权力关系:谁能修改目标,谁能否决结果,谁负责检查测量本身。

相关:https://x.com/IntuitMachine/status/2068808668393451770

关于循环的QPT:https://www.youtube.com/watch?v=53Y3SYR5vTU&list=PLoOMKjCBaDuX8vYGfcSUgw_84xj3wo62-&index=10

把路线图落到一个最小可验证图

先不要搭一个「全能多代理平台」。挑一项存在真实分支的工作:研究可以并行,写作要等待资料,事实核查失败后需要返回修订,最终发布前必须人工确认。

路由工作流适合先分类输入,再把任务发送给对应处理路径。 独立子任务可以并行,同一输出也可以交给不同检查器从多个角度复核。 当子任务无法预先枚举时,再考虑 orchestrator-worker,让编排器动态拆解并汇总结果。

无论采用哪一种结构,节点都要有明确输入、输出和失败状态。Claude Code 的代理循环本身仍是收集上下文、采取行动、验证结果;图只是把多个这样的循环按依赖关系组织起来。 给每个节点配置测试、截图或期望输出,并在复杂任务中先探索、计划,再实现和验证。

最小验收清单:

  • 每条边都能解释为什么存在;
  • 并行节点之间没有隐藏的写入冲突;
  • 重试有预算和停止条件;
  • 状态可以持久化并支持从检查点恢复;
  • 高风险动作前保留人工批准;
  • 失败时能指出具体节点和证据,而不是只返回「代理失败」。