欢迎光临
我们一直在努力

【AI】MoA(Mixture of Agents)· 混合智能体架构

定义:MoA 是 Together AI 于 2024 年 6 月在论文《Mixture-of-Agents Enhances Large Language Model Capabilities》(Junlin Wang 等)中提出的多模型协作架构——用分层结构组织多个 LLM Agent,让每一层的 Agent 都能看到上一层所有 Agent 的输出,逐层迭代精炼,最终由聚合器合成答案。仅用开源模型组合,就在 AlpacaEval 2.0、MT-Bench、FLASK 上超越了 GPT-4o 。

核心架构

用户Query

Layer 1: [LLM-A] [LLM-B] [LLM-C] ← Proposers(提议者),并行生成候选答案
│ (各自看到全部上层输出作为辅助上下文)
Layer 2: [LLM-A] [LLM-B] [LLM-C] ← 基于第一层的多个答案继续精炼

Aggregator(聚合器) ← 综合所有输出,生成最终答案

最终Response

  • Proposer(提议层):多个不同模型并行作答,提供多样性(不同模型的训练数据、对齐方式不同,答案互补)
  • Aggregator(聚合层):一个强模型负责"综合评判",从多个候选中提取最优部分合成最终输出
  • 层数可扩展:论文以两层为主,Genspark 后续实践证明可扩展至三层甚至更多层,跨多轮响应综合进一步提升质量

关键发现:Collaborativeness(协作性)

论文最有价值的洞察是——模型天生具有协作倾向:即使某个模型看到的其他模型输出比自己单独能产生的答案更弱,它参考这些输出后生成的答案仍然会更好。这意味着 MoA 的收益不依赖"所有成员都很强",弱模型的多样视角也能提升整体上限。

MoA vs MoE(关键区分,别混淆)

维度MoE(Mixture of Experts)MoA(Mixture of Agents)
层级 模型内部(Transformer FFN 层) 模型之间(系统编排层)
机制 门控网络路由 token 到不同专家网络 提示词/工作流调度多个完整 LLM
粒度 神经网络参数级 完整模型/Agent 级
训练 需要联合训练 零训练,纯推理时编排
类比 一个大脑内的功能分区 一个团队开会讨论

可以理解为:MoE 是"单模型的分身",MoA 是"多模型的合议"。MoA 名字本身就是向 MoE 致敬,把稀疏激活思想从权重层面搬到了 Agent 层面。

落地与演进

  • Genspark:2025 年 1 月发布《Enhancements in Mixture of Agents》博客,将 MoA 作为其 AI 搜索核心架构(GPT 负责创造性、Claude 负责逻辑推理、Gemini 负责多模态感知的分工);2025 年 4 月转型 Super Agent 后,在 GAIA 基准上超过 Manus 和 OpenAI Deep Research
  • 吴恩达在 2025 年公开信中将其列为"并行智能体"方向的标志性工作,认为可高效并行的 Agent 数量"最终会非常庞大"
  • 行业报告判断:MoA 代表的"模块化、可控性、任务解耦"多 Agent 协同模式,正逐步取代单体模型成为主流工程形态,尤其在金融等高合规场景

工程代价

  • 成本倍增:一次查询 = N 个模型 × M 层调用 + 聚合,token 消耗通常是单模型的 5–10 倍
  • 延迟:层间是串行依赖,总延迟 ≈ 层数 × 单层最慢模型
  • 聚合器是瓶颈:Aggregator 的"判断力"决定上限,前面一堆强模型 + 一个弱聚合器 = 浪费
  • 边际收益递减:论文显示 3 层之后提升趋缓,工程上一般 2–3 层封顶

MoA 实操手册:以"SA522 USB 休眠失败排查"为例

高通 SA522 平台,USB Host 模式,系统休眠唤醒后 USB 外设失效,dwc3 resume 报错。这种问题单一模型容易钻牛角尖,正好是 MoA 的主场。


Step 0 · 任务分级(先决定要不要用 MoA)

级别任务类型用法成本
L0 查寄存器定义、语法问题 单模型直答 1x
L1 常规 bug 分析、方案初稿 单层 MoA:3 Proposer + 1 Aggregator,无精炼层 ~5x
L2 疑难 bug、架构决策、高风险输出 双层 MoA:3 Proposer → 精炼 → 聚合 ~9x

原则:MoA 是"合议庭",不是日常门诊。只对错一次代价高的任务启用。


Step 1 · 选阵容(Proposer 多样性 > 个体强度)

角色推荐模型分工逻辑
Proposer A Claude 逻辑链推理、内核代码分析强
Proposer B GPT / Gemini 知识广度、高通平台经验覆盖
Proposer C DeepSeek / Qwen 中文技术社区案例、不同训练分布
Aggregator 你手上最强的模型 判断力是上限,别省

关键:三个同系列模型 ≈ 一个模型,多样性才是收益来源。


Step 2 · Layer 1:Proposer 统一 Prompt(并行发三个)

【角色】你是资深 Linux 内核/USB 子系统调试专家。

【问题】SA522 平台(Android,dwc3 控制器),系统休眠唤醒后
USB Host 外设失效。Log 关键行:
[ 123.456] dwc3 a600000.usb: runtime resume failed: -110
[ 123.461] xhci-hcd: usb1: port 1 connect timeout

【要求】按分层诊断法输出:
1. 硬件层假设(供电/PHY/时钟)
2. 内核驱动层假设(runtime PM/dwc3 glue/设备树)
3. 每条的验证手段(具体命令或寄存器读取)
4. 按可能性排序,标注你的置信度
不要泛泛而谈,每条必须可执行。

拿到 A、B、C 三份独立答案。这一步不要互相可见,保证观点独立。


Step 3 · Layer 2:精炼 Prompt(互相可见,各回各家改)

把 B、C 的答案附在 A 的输入里:

【原始问题】(同上)

【你上一轮的诊断】
<A的答案>

【另外两位专家的诊断,供参考】
<B的答案>
<C的答案>

【要求】
1. 指出他人答案中你认为错误或过时的点(给出依据)
2. 吸收他人答案中你遗漏的有效假设
3. 输出修正后的最终诊断清单(保持分层结构)
注意:不要因为他人观点数量多就放弃自己的判断,
有依据的少数派意见请保留并标注。

重要——防止"多数暴力"把正确答案票掉,这是 MoA 实践中最常见的翻车点【置信度:高,来自工程实践共识】。


Step 4 · Aggregator 聚合 Prompt(最终裁判)

【原始问题】(同上)

【三位专家精炼后的诊断】
<A'> <B'> <C'>

【要求】
1. 提取三人共识 → 列为"优先验证项"
2. 冲突观点 → 不裁决,各列出验证成本,按成本从低到高排序
3. 少数派但有依据的观点 → 单列"备查项"
4. 输出格式:可勾选的排查 Checklist,
每项含 [验证手段][预计耗时][命中概率]

输出示例(截取):

□ P0 检查 dwc3 的 wakeup interrupt 是否进 devicetree
[adb shell cat /proc/interrupts | grep dwc3][10min][高]
□ P1 确认 USB PHY 供电 LDO 是否被 suspend 关闭
[量测 LDO 输出 / 查 regulator-consumer 配置][30min][高]
□ P2 runtime PM 与系统 suspend 的竞态
[echo on > /sys/…/power/control 关 runtime PM 复测][20min][中]


Step 5 · 沉淀(接上你的自进化体系)

聚合结果验证完毕后,记录命中情况回知识库:

bug-2026-0720-usb-suspend-sa522.md
├── 现象 / log 指纹(供向量检索匹配)
├── MoA 合议结论
├── 实际根因:PHY LDO 在 suspend 被关 ← 命中 Proposer B 的假设
├── 各模型命中率:B✓ A✗ C✗
└── 衍生 skill:dwc3_suspend_checklist

这个"命中率记录"很关键——跑几十轮后你就有了各模型在你领域的真实能力画像,Proposer 阵容可以动态调整。这正是你要的"使用效果反馈(命中/证伪)"闭环。


无代码手动版(5 分钟跑起来)

  • 开 3 个窗口:Kimi / ChatGPT / DeepSeek(或 Cursor、QwenPaw 混用)
  • Step 2 的 prompt 原样贴三个窗口 → 收三份答案
  • 把答案交叉互贴 + Step 3 prompt → 收三份精炼
  • 全部贴给你最信任的窗口 + Step 4 prompt → 出 Checklist
  • 结论存入本地 md 知识库
  • 自动化版架构(文字流程)

    调度脚本(Python/Shell 均可)
    ├─ OpenRouter / 各家 API 统一入口 ← 一个 key 调全部模型,省接入工作
    ├─ 并行请求层:3 路并发调 Proposer(asyncio/多线程)
    ├─ 拼装层:按模板注入交叉答案,再并发一轮
    ├─ 聚合层:单调 Aggregator
    └─ 落库层:结果 + 元数据写入你的本地知识库(SQLite + md 混合)

    现成轮子:Together AI 开源了 MoA 参考实现(GitHub 搜 togethercomputer/MoA),可以直接改它的 proposer/aggregator 配置换成你的模型清单【来源:Together AI 官方 repo】【置信度:高】。


    反向提醒:调试场景有个 MoA 的先天短板——三个模型可能共享同一个错误训练分布(比如都读过同一篇错误的高通文档)。所以对"禅道内部 bug 库里有答案"的问题,先检索你的离线知识库,检索不到再开 MoA 合议。知识库是"记忆",MoA 是"会诊",先查病历再会诊。

    【来源】Together AI 论文(2024.06)、Genspark 官方博客(2025.01)、吴恩达 The Batch 公开信(2025.08)、弗若斯特沙利文金融大模型报告 【置信度】高(架构与论文事实);中(2026 行业落地趋势判断)

    赞(0)
    未经允许不得转载:171主机测评 » 【AI】MoA(Mixture of Agents)· 混合智能体架构
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址