← NewMax Share
2026年8月18日11 分钟阅读Yangyi

Multi-Agent 工作流的 6 种模式与选型指南

#AI Agent#Multi-Agent#方法论#AI落地#工作流

文章摘要

MultiAgent 的 Loop 归纳为处理、生成、收敛三大类共六种模式:分类再处理、拆开再汇总、先做再拆台、多产再择优、打淘汰赛、循环到成真。本文逐一拆解每种模式的结构、解决的瓶颈、GTM 场景落点、Prompt 示例和常见翻车点,附选型速查流程、组合公式与成本参考。

MultiAgent 的 Loop 总结下来其实有 3 种判别分类,共计 6 种模式。针对 6 种不同的模式,有 6 种处理方案。以下逐一阐释。

六种模式分类图

一、【处理类】手上已经有一堆东西

这一类的共同前提:材料已经有了,AI 不需要创造任何东西,只需要过一遍。 共同风险:AI过完之后你以为覆盖了全部内容,但可能并没有。

解决方案有两种:

  • ① 分类再处理 —— 异构处理
  • ② 拆开再汇总 —— 同构处理

① 分类再处理 —— 异构处理

结构:一个分诊 agent 把全部材料读一遍打标签,然后每个标签配一个专属处理 agent。分诊只做一件事,就是决定归属;然后专属Agent挨个处理,以此降低幻觉。

它解决的瓶颈是判断归属。活儿本身不难,写四种回复模板你自己十分钟就能写完;难的是四百封信里哪封该用哪套。这种任务的典型特征是高数量、低判断力:单看每一件都不值得你花时间,但是每次都得判断做出不同处理,也很浪费注意力。

在 GTM 场景里常见的是:

  • 入站线索分诊(真需求 / 竞品来摸底 / 求职 / 垃圾访客)
  • 邮件回信分诊(感兴趣 / 合作 / 客服支持 / 退订)
  • 支持工单路由
  • CRM 存量数据清洗

Prompt 示例:

读完每一封邮件,把每封归入「感兴趣 / 合作 / 客服支持 / 退订」四类之一,然后按类别各写对应的跟进话术。任何把握低于 80% 的,单独放进第五类「没把握」,附上你犹豫的理由,不要硬归类进前四类里。

AI 一般不会跳出你的框架,如果你不给它第五个分类,它就把不确定的硬塞进某个分类,导致出现幻觉。所以必须显式给出"没把握"这一类,并设置置信阈值。当然,如果你有计算标准或者给定一些 few shot 效果会更好。

那份不确定清单是人类真正该重点关注的东西,它暴露的不是 AI 的能力上限,是 AI 无法理解的分类标准。

② 拆开再汇总 —— 同构处理

结构:经典的 map-reduce。N 个 agent 一人拿一项同时跑,最后一个 agent 把所有结果合成一份答案。

它解决的瓶颈是上下文窗口。一个 agent 读四十份通话纪要,读到第二十份的时候第一份的细节已经开始模糊了;换成四十个 agent 各读一份,每一份都是独立的。相当于通过 Token 代偿来降低上下文过载的幻觉。

要不要采用这个结构,只需要关注一件事:各项任务之间是否互相独立。第 7 份的结论如果依赖第 3 份的产出,这个模式就不成立了。

在 GTM 场景里常见的是:

  • 批量通话纪要提异议
  • 多个目标账户各自做调研
  • 全站页面对照定位声明做一致性审计
  • 四十篇历史内容提取钩子模式
  • 多份流程文档找互相冲突的地方

这是六种里用得最多的一种。

Prompt 示例:

读这个文件夹里全部 40 份通话纪要,一份纪要一个 agent,提取客户提出的每一条异议。然后合并成一份按出现频次排序的清单,每一条异议后面必须挂上它来自哪次通话。只出现过一次但你认为重要的,单独列一节,不要因为频次低就丢掉。

合并环节是整条流水线上唯一的单点,也是最爱偷工减料的地方。它有三个惯性幻觉:

  • 丢掉低频但重要的信息
  • 把相似的强行合并成一条
  • 丢掉了出处

所以三个对策一起上:

  • 强制每条结论标记来源
  • 要求单列低频项
  • 先出全量再排序,而不是边读边筛选

二、【生成类】要造出还不存在的东西

这一类的共同前提:产出物是新的,没有标准答案可以对照。

共同风险:AI 会自信地交出看起来完美的东西。两个分支的区别在于你首先要什么,是优先要结果正确,还是优先要结果优秀。

解决方案也有两种:

  • ③ 先做再拆台 —— 求正确
  • ④ 多产再择优 —— 求品味

③ 先做再拆台 —— 求正确

结构:串联对抗。A agent 产出,B agent 拿着原始材料逐条校对。B 必须看得到源材料,且不能看到 A 的推理过程,只看 A 给的结论。

采用这个模式就一个判断:你会不看原始材料就直接用这个输出吗?如果不会,那就必须上这个模式做初步筛查。后面加上人工回路。

在 GTM 场景里常见的是:

  • 客户提案里的每个数字
  • 竞品对比表的每条声明
  • 带 ROI 测算的报告
  • 对外发布的品牌内容

凡是带数字和带"他们家不支持 X"这类断言的,都需要人工核查,那么就先走一遍 AI 核查吧。

同样的,输出必须是三态:通过 / 不通过(附源材料里出错的那一行)/ 无法核实。

Prompt 示例:

把这份报告里的每一条事实性主张单独抽出来,然后由另一个 agent 拿源文档逐条核对。给我三份清单:核实通过的、核实失败的(附源文档里对应的那一行)、无法核实的。无法核实的标记 unverified 单独返回,不要算作错误,也不要放行。

这是最多人跳过的一种,也是唯一能治"AI 自信编造"的一种。跳过的原因是它看起来像多此一举,而"写完之后自己复查一遍"这句话,你得到的永远是"已复查,无误"。执行者不能是裁判员。

进阶用法是派三个视角不同的攻击者:一个查事实、一个查逻辑跳跃、一个假装是客户当场提问。

④ 多产再择优 —— 求品味

结构:一个 agent 大量生成,一个独立的裁判 agent 按你事先定好的规则打分。

它解决的瓶颈是「好的标准」无法前置描述。这是典型的品味抉择:四十条不同的结果摆在面前你三秒能挑出最好的那条,但让你先写出优秀的定义,你写不出来。

判断逻辑也简单:问你好的标准,一般你也说不上来,就是感觉这条不行,想要什么你又不知道,就适合这个模式,脑暴往往也是这类。

在 GTM 场景里常见的是:

  • 写 Hero 区域的 Slogan
  • 开场白
  • 落地页 headline
  • 冷邮 CTA
  • 报价包装的多个变体
  • 广告文案的角度测试

Prompt 示例:

为这封邮件写 20 个标题,然后由一个独立的裁判 agent 按以下规则逐条打分:45 字符以内、不含冒号、不是问句、包含一个具体名词。给我得分最高的 5 条和各自的分数,以及每个标题为什么胜出。

生成者不能兼任裁判,它永远选自己最"标准"的那条。另外,筛选过滤的规则必须可判定:

  • ❌ 要抓人
  • ✅ 45 字符以内、无冒号、无问句、含一个具体名词

不可判定的规则等于没写。跑完之后去看被淘汰的那 35 条,它们比留下的 5 条更能告诉你你的真实标准是什么。

三、【收敛类】从不确定收敛到一个答案

这一类的共同前提:终点不明确。 共同风险:AI 会给你一个看起来收敛了的假答案。

解决方案依旧两种:

  • ⑤ 打淘汰赛 —— 选项已知,要排序
  • ⑥ 循环到成真 —— 步数未知,要跑到真为止

两个分支的区别在于:选项是否已存在。

⑤ 打淘汰赛 —— 选项已知,要排序

结构:并非每一项打绝对分,而是持续两两对决,赢家晋级下一轮。

它解决的瓶颈是绝对分不可靠。同一个 agent 给第 3 份材料打的 8 分和给第 33 份打的 8 分,根本不在一个尺度上。因为评分会随着流程推进漂移。而相对比较不需要一把稳定的绝对尺子,它只需要在单次比较内部自洽,这个要求更简单,更稳定。

判别逻辑:当你遇到"这些分数看着都差不多,看不出谁真的更好"的时候,就用这个。

在 GTM 场景里常见的是:

  • 候选人筛选
  • 供应商选型
  • 功能优先级排期
  • 内容选题排序
  • 哪个客户案例该放首页

前置动作:先建评分卡,先给人类看,再让它看第一份材料。评分卡是人类筛选后的基准标准,而不是 AI 自己的标准。

Prompt 示例:

给这 40 份申请排序。第一步:从这份职位描述里提炼出评分卡,先给我看,等我确认。确认之后,两两对决地比较候选人,而不是逐个冷打分。最后除了排名,另外告诉我:我最有可能后悔淘汰掉的是哪两个。

如果不构建评分卡直接比较淘汰,测的只是"谁的材料写得更漂亮"。是 AI 主观的。另外,排序真正的价值不在第一名,有时候第一名你自己多半也能猜到,更重要的是在"我最可能后悔淘汰的那两个"。这个问题一定要单独问。

⑥ 循环到成真 —— 步数未知,要跑到真为止

结构:一个带退出条件的循环。跑一轮、检验、没达成就再跑一轮。它解决的瓶颈是步数未知。正因为不知道要试几次,所以它写不成固定流程,只能写成一个判别条件。

唯一的硬要求:终点必须是一个可验证的真实状态,不是一个步数。

  • ❌ 改三轮
  • ✅ 直到每条主张旁边都有出处
  • ❌ 多试几个原因
  • ✅ 直到总数对上

而且成功条件和退出条件必须同时给。只给成功条件,它跑不出来的时候要么无限转,要么替你编一个假的成功。退出条件的标准写法是"连续两轮没有新发现就停"。

判别方式:你不清楚过程,反正查到对上为止。

在 GTM 场景里常见的是:

  • 预测数据和 CRM 对不上
  • 归因数据有缺口
  • 漏斗数字前后矛盾
  • 数据清洗到全部达标

Prompt 示例:

预测数和 CRM 里的数对不上。不断提出关于差异原因的假设并逐个验证,直到有一个能解释这个缺口为止,然后修复它,再验证修复有效。两个停止条件:总数对上,或者连续两轮没有新发现。跑完告诉我你排除了哪些假设。

如果终点条件本身没法自动验证,这个模式就不成立,退回模式 ③,用人来当那个验证环节。

选型速查

按顺序问自己,第一个"是"就是答案:

  • 材料已经存在,而且每一项需要不同处理 → ①
  • 材料已经存在,每一项处理方式相同,且彼此独立 → ②
  • 要造新东西,需要正确 → ③
  • 要造新东西,但我说不清什么叫好 → ④
  • 选项都有,只是要排个序 → ⑤
  • 我连要跑几步都不知道,但结果可验证 → ⑥

组合公式

单个模式解决单一瓶颈,真实的世界往往会选择多种组合。

组合公式

成本参考

关注成本,决定要不要先切片测试。

  • :① 一个分诊 + 每桶一个处理;⑥ 串行,同一时间只有一个 agent 在跑
  • :③ 通常 2–4 个;④ 生成可合批,裁判只需一个
  • :② agent 数量等于项目数,四十份材料就是四十个;⑤ 比较次数随规模增长

⑥ 有个特殊性,它单位时间便宜,但总量不可预测,这正是退出条件必须写死的原因。

其余三条省钱原则不变:

  • 先跑三个再放开
  • 重复性阶段用便宜模型
  • 贵的模型只留给合并和裁判这两个真正需要判断的环节

参考链接

  1. 原始推文线程

    本文内容来源的完整推文 thread

继续阅读

查看全部 →

让 NewMax 帮你把这些方法落地

下载 NewMax,让 AI 在你的电脑上真正动手干活——读写文件、操作软件、跑完整个工作流。