MultiAgent 的 Loop 总结下来其实有 3 种判别分类,共计 6 种模式。针对 6 种不同的模式,有 6 种处理方案。以下逐一阐释。

一、【处理类】手上已经有一堆东西
这一类的共同前提:材料已经有了,AI 不需要创造任何东西,只需要过一遍。 共同风险:AI过完之后你以为覆盖了全部内容,但可能并没有。
解决方案有两种:
- ① 分类再处理 —— 异构处理
- ② 拆开再汇总 —— 同构处理
① 分类再处理 —— 异构处理
结构:一个分诊 agent 把全部材料读一遍打标签,然后每个标签配一个专属处理 agent。分诊只做一件事,就是决定归属;然后专属Agent挨个处理,以此降低幻觉。
它解决的瓶颈是判断归属。活儿本身不难,写四种回复模板你自己十分钟就能写完;难的是四百封信里哪封该用哪套。这种任务的典型特征是高数量、低判断力:单看每一件都不值得你花时间,但是每次都得判断做出不同处理,也很浪费注意力。
在 GTM 场景里常见的是:
- 入站线索分诊(真需求 / 竞品来摸底 / 求职 / 垃圾访客)
- 邮件回信分诊(感兴趣 / 合作 / 客服支持 / 退订)
- 支持工单路由
- CRM 存量数据清洗
Prompt 示例:
读完每一封邮件,把每封归入「感兴趣 / 合作 / 客服支持 / 退订」四类之一,然后按类别各写对应的跟进话术。任何把握低于 80% 的,单独放进第五类「没把握」,附上你犹豫的理由,不要硬归类进前四类里。
AI 一般不会跳出你的框架,如果你不给它第五个分类,它就把不确定的硬塞进某个分类,导致出现幻觉。所以必须显式给出"没把握"这一类,并设置置信阈值。当然,如果你有计算标准或者给定一些 few shot 效果会更好。
那份不确定清单是人类真正该重点关注的东西,它暴露的不是 AI 的能力上限,是 AI 无法理解的分类标准。
② 拆开再汇总 —— 同构处理
结构:经典的 map-reduce。N 个 agent 一人拿一项同时跑,最后一个 agent 把所有结果合成一份答案。
它解决的瓶颈是上下文窗口。一个 agent 读四十份通话纪要,读到第二十份的时候第一份的细节已经开始模糊了;换成四十个 agent 各读一份,每一份都是独立的。相当于通过 Token 代偿来降低上下文过载的幻觉。
要不要采用这个结构,只需要关注一件事:各项任务之间是否互相独立。第 7 份的结论如果依赖第 3 份的产出,这个模式就不成立了。
在 GTM 场景里常见的是:
- 批量通话纪要提异议
- 多个目标账户各自做调研
- 全站页面对照定位声明做一致性审计
- 四十篇历史内容提取钩子模式
- 多份流程文档找互相冲突的地方
这是六种里用得最多的一种。
Prompt 示例:
读这个文件夹里全部 40 份通话纪要,一份纪要一个 agent,提取客户提出的每一条异议。然后合并成一份按出现频次排序的清单,每一条异议后面必须挂上它来自哪次通话。只出现过一次但你认为重要的,单独列一节,不要因为频次低就丢掉。
合并环节是整条流水线上唯一的单点,也是最爱偷工减料的地方。它有三个惯性幻觉:
- 丢掉低频但重要的信息
- 把相似的强行合并成一条
- 丢掉了出处
所以三个对策一起上:
- 强制每条结论标记来源
- 要求单列低频项
- 先出全量再排序,而不是边读边筛选
二、【生成类】要造出还不存在的东西
这一类的共同前提:产出物是新的,没有标准答案可以对照。
共同风险:AI 会自信地交出看起来完美的东西。两个分支的区别在于你首先要什么,是优先要结果正确,还是优先要结果优秀。
解决方案也有两种:
- ③ 先做再拆台 —— 求正确
- ④ 多产再择优 —— 求品味
③ 先做再拆台 —— 求正确
结构:串联对抗。A agent 产出,B agent 拿着原始材料逐条校对。B 必须看得到源材料,且不能看到 A 的推理过程,只看 A 给的结论。
采用这个模式就一个判断:你会不看原始材料就直接用这个输出吗?如果不会,那就必须上这个模式做初步筛查。后面加上人工回路。
在 GTM 场景里常见的是:
- 客户提案里的每个数字
- 竞品对比表的每条声明
- 带 ROI 测算的报告
- 对外发布的品牌内容
凡是带数字和带"他们家不支持 X"这类断言的,都需要人工核查,那么就先走一遍 AI 核查吧。
同样的,输出必须是三态:通过 / 不通过(附源材料里出错的那一行)/ 无法核实。
Prompt 示例:
把这份报告里的每一条事实性主张单独抽出来,然后由另一个 agent 拿源文档逐条核对。给我三份清单:核实通过的、核实失败的(附源文档里对应的那一行)、无法核实的。无法核实的标记 unverified 单独返回,不要算作错误,也不要放行。
这是最多人跳过的一种,也是唯一能治"AI 自信编造"的一种。跳过的原因是它看起来像多此一举,而"写完之后自己复查一遍"这句话,你得到的永远是"已复查,无误"。执行者不能是裁判员。
进阶用法是派三个视角不同的攻击者:一个查事实、一个查逻辑跳跃、一个假装是客户当场提问。
④ 多产再择优 —— 求品味
结构:一个 agent 大量生成,一个独立的裁判 agent 按你事先定好的规则打分。
它解决的瓶颈是「好的标准」无法前置描述。这是典型的品味抉择:四十条不同的结果摆在面前你三秒能挑出最好的那条,但让你先写出优秀的定义,你写不出来。
判断逻辑也简单:问你好的标准,一般你也说不上来,就是感觉这条不行,想要什么你又不知道,就适合这个模式,脑暴往往也是这类。
在 GTM 场景里常见的是:
- 写 Hero 区域的 Slogan
- 开场白
- 落地页 headline
- 冷邮 CTA
- 报价包装的多个变体
- 广告文案的角度测试
Prompt 示例:
为这封邮件写 20 个标题,然后由一个独立的裁判 agent 按以下规则逐条打分:45 字符以内、不含冒号、不是问句、包含一个具体名词。给我得分最高的 5 条和各自的分数,以及每个标题为什么胜出。
生成者不能兼任裁判,它永远选自己最"标准"的那条。另外,筛选过滤的规则必须可判定:
- ❌ 要抓人
- ✅ 45 字符以内、无冒号、无问句、含一个具体名词
不可判定的规则等于没写。跑完之后去看被淘汰的那 35 条,它们比留下的 5 条更能告诉你你的真实标准是什么。
三、【收敛类】从不确定收敛到一个答案
这一类的共同前提:终点不明确。 共同风险:AI 会给你一个看起来收敛了的假答案。
解决方案依旧两种:
- ⑤ 打淘汰赛 —— 选项已知,要排序
- ⑥ 循环到成真 —— 步数未知,要跑到真为止
两个分支的区别在于:选项是否已存在。
⑤ 打淘汰赛 —— 选项已知,要排序
结构:并非每一项打绝对分,而是持续两两对决,赢家晋级下一轮。
它解决的瓶颈是绝对分不可靠。同一个 agent 给第 3 份材料打的 8 分和给第 33 份打的 8 分,根本不在一个尺度上。因为评分会随着流程推进漂移。而相对比较不需要一把稳定的绝对尺子,它只需要在单次比较内部自洽,这个要求更简单,更稳定。
判别逻辑:当你遇到"这些分数看着都差不多,看不出谁真的更好"的时候,就用这个。
在 GTM 场景里常见的是:
- 候选人筛选
- 供应商选型
- 功能优先级排期
- 内容选题排序
- 哪个客户案例该放首页
前置动作:先建评分卡,先给人类看,再让它看第一份材料。评分卡是人类筛选后的基准标准,而不是 AI 自己的标准。
Prompt 示例:
给这 40 份申请排序。第一步:从这份职位描述里提炼出评分卡,先给我看,等我确认。确认之后,两两对决地比较候选人,而不是逐个冷打分。最后除了排名,另外告诉我:我最有可能后悔淘汰掉的是哪两个。
如果不构建评分卡直接比较淘汰,测的只是"谁的材料写得更漂亮"。是 AI 主观的。另外,排序真正的价值不在第一名,有时候第一名你自己多半也能猜到,更重要的是在"我最可能后悔淘汰的那两个"。这个问题一定要单独问。
⑥ 循环到成真 —— 步数未知,要跑到真为止
结构:一个带退出条件的循环。跑一轮、检验、没达成就再跑一轮。它解决的瓶颈是步数未知。正因为不知道要试几次,所以它写不成固定流程,只能写成一个判别条件。
唯一的硬要求:终点必须是一个可验证的真实状态,不是一个步数。
- ❌ 改三轮
- ✅ 直到每条主张旁边都有出处
- ❌ 多试几个原因
- ✅ 直到总数对上
而且成功条件和退出条件必须同时给。只给成功条件,它跑不出来的时候要么无限转,要么替你编一个假的成功。退出条件的标准写法是"连续两轮没有新发现就停"。
判别方式:你不清楚过程,反正查到对上为止。
在 GTM 场景里常见的是:
- 预测数据和 CRM 对不上
- 归因数据有缺口
- 漏斗数字前后矛盾
- 数据清洗到全部达标
Prompt 示例:
预测数和 CRM 里的数对不上。不断提出关于差异原因的假设并逐个验证,直到有一个能解释这个缺口为止,然后修复它,再验证修复有效。两个停止条件:总数对上,或者连续两轮没有新发现。跑完告诉我你排除了哪些假设。
如果终点条件本身没法自动验证,这个模式就不成立,退回模式 ③,用人来当那个验证环节。
选型速查
按顺序问自己,第一个"是"就是答案:
- 材料已经存在,而且每一项需要不同处理 → ①
- 材料已经存在,每一项处理方式相同,且彼此独立 → ②
- 要造新东西,需要正确 → ③
- 要造新东西,但我说不清什么叫好 → ④
- 选项都有,只是要排个序 → ⑤
- 我连要跑几步都不知道,但结果可验证 → ⑥
组合公式
单个模式解决单一瓶颈,真实的世界往往会选择多种组合。

成本参考
关注成本,决定要不要先切片测试。
- 低:① 一个分诊 + 每桶一个处理;⑥ 串行,同一时间只有一个 agent 在跑
- 中:③ 通常 2–4 个;④ 生成可合批,裁判只需一个
- 高:② agent 数量等于项目数,四十份材料就是四十个;⑤ 比较次数随规模增长
⑥ 有个特殊性,它单位时间便宜,但总量不可预测,这正是退出条件必须写死的原因。
其余三条省钱原则不变:
- 先跑三个再放开
- 重复性阶段用便宜模型
- 贵的模型只留给合并和裁判这两个真正需要判断的环节