深度 · 进化解读

Anthropic 发布 AI Agent 架构指南:先问三个问题,再决定要不要上多智能体

多智能体系统效果能提 90.2%,但 token 成本也贵 10-15 倍,这套三问框架帮你先想清楚要不要上复杂架构。

一分钟速览
  • Anthropic 发布一份企业级 AI Agent 架构指南,基于 Coinbase、Intercom、Thomson Reuters 等客户的真实落地案例,整理出架构模式与选型方法。
  • 全文给出六种核心架构:单智能体、分层监督式、协作式、顺序工作流、并行工作流、评估器-优化器工作流。
  • Anthropic 内部研究显示,面对需要同时探索多条独立路径的复杂任务,多智能体系统效果比单智能体高出 90.2%,但 token 消耗是单智能体的 10-15 倍。
  • 指南给出一套三问决策框架(要多高的可控性、问题跨几个领域、资源预算多少),帮你判断该用哪种架构,而不是一味追最复杂的方案。
  • 核心方法是「从简单开始、逐步演进」:先用单智能体验证价值,再按业务需求和数据反馈升级,而非一开始就搭复杂系统。
这是 Anthropic 官方发布的企业推广指南,本质是一份带销售落点的自家白皮书。文中 90.2%、10-15 倍 token 成本来自 Anthropic 内部研究,99.99%、20 倍、86% 等来自对应客户的自我披露,均未经第三方独立验证。以下按原文照录方法与数据,不代表已被证实。
1这是什么

一份来自 Anthropic 的企业级 agent 架构手册

Anthropic 最近发布了一份面向企业的 AI Agent 架构指南,汇总了 Coinbase、Intercom、Thomson Reuters 等客户的真实落地案例,给出六种架构模式和一套选型决策框架。

白皮书开篇第一句话就把定位挑明了:生成式 AI 回答问题,AI agent 解决问题。而这份手册要回答的,是下一个更实的问题:同一个业务,到底该用一个 AI 智能体单干,还是搭一整套多智能体系统。它把这个选择拆成可操作的判断框架,每种架构都配上真实客户的量化数据。

为什么值得看:指南给出一个关键量化权衡,面对需要同时探索多条独立方向的复杂任务,多智能体系统效果比单智能体高出 90.2%;但它消耗的 token 量是单智能体的 10-15 倍。这一升一降,就是全文所有选型判断的地基。

先说清楚一件事:AI 智能体(agent)和普通自动化脚本,运作方式差别很大。传统自动化要把每一步都提前写死,流程照着脚本一步步走,遇到没预设过的情况就卡住。agent 的做法是评估任务、挑合适的工具、试一种做法、看结果好不好、再调整策略,跑一个循环直到把事办成。

传统自动化

每一步都要预先写好。流程固定,能追溯,但只会走事先铺好的那条路,碰到边界情况就断。

AI Agent

拿到任务后自己规划:读问题、查账户历史、翻知识库、起草回复、必要时拉人工介入,全程根据中间结果动态调整。

指南开头列了一批客户成绩单,用来说明这些系统在真实生产环境里跑出了什么。

99.99%
Coinbase 用 Claude 驱动的客服 agent,在 2260 亿美元季度交易量下维持的服务可用性
100倍
Tines 把安全运营的多步流程折叠成单 agent 操作后,交付时间提升的倍数
20倍
Inscribe 的欺诈审核 agent 把审核时间从 30 分钟压到 90 秒的提速
86%
Intercom 的 Fin AI agent 在 2.5 万多家客户上达到的问题解决率上限

这四块数字看的不是大小,是覆盖面:客服、安全运营、欺诈审核、跨行业解决率,四种完全不同的活都有 agent 在生产环境里扛住了。它们证明的是「值得投入」,还回答不了「该选哪种架构」。指南还给了一个更贴近日常运营的例子:某零售银行用 agent 处理信贷风险备忘录,过去关系经理要花好几周手动核对十个数据源,现在带来 20% 到 60% 的生产力提升,信贷周转时间缩短 30%。这些数字建立了一个前提,agent 值得投入,但用哪种架构去实现,才是这份指南真正要教的。它一共讲六种架构,其实分三家:让 AI 自己拿主意的(单智能体、分层监督式、协作式),流程由人预先写死的(顺序、并行工作流),外加一个专管质检的(评估器-优化器)。下面按从简单到复杂的顺序一个个看。

2从最简单的架构起步

第一步:先看单智能体够不够用

指南反复强调的第一原则是「从简单开始」。别一上来就搭复杂系统,先看单智能体能不能解决问题,它更便宜、更好排查、指标也更能对上业务结果。

单智能体系统就是一个 AI 智能体在跑一个连续循环:感知环境、决定下一步、动手执行,直到任务完成或者撞上「暂停等人工复核」这样的停止条件。它的核心由几个组件搭起来。

用户任务 In AI 模型 推理引擎 · 感知-决策-行动 结果输出 Out Skills 技能包 trigger / read(触发·读取) MCP 工具 request / response(请求·响应) Memory 记忆 read / write(读·写) 感知 → 决策 → 执行 → 观察结果 → 调整 循环往复,直到完成或触发停止条件
单智能体架构:一个 AI 模型居中,向下接三个能力组件;整体在一个感知-决策-行动的循环里运转

图里三个组件里有两个专门术语,这里先说明白。

MCP(Model Context Protocol)

一套让 agent 连外部系统(数据库、网页搜索、内部工具)的标准接口。agent 靠它才能真正动手查数据、调工具,而不是只会聊天。像给 AI 装了一套万能转接头,不管连数据库还是搜索引擎,接口标准统一,不用每次单独开发对接代码。

Agent Skills(技能包)

把某个领域的专业知识、标准流程、工具用法打包成一个模块,agent 需要时调用,不用把所有专业知识都塞进提示词里。像给 agent 配一套专业工具箱,遇到法律问题掏法律工具箱,遇到财务问题换一套,一个 agent 脑子里不用装满所有领域。

什么时候用 / 什么时候别用

适合:面对开放式问题,一开始看不清路怎么走,不知道要几步、会碰到什么障碍,让 agent 自己边走边调整。

别用:需要第一次就 100% 拿到完美答案的场景。这时单智能体力不从心,要么加专门的 Skills 提升准确率,要么才考虑上多智能体。升级前先想清楚:给单智能体加技能,是不是就够了。

展开看:一个研究 agent 怎么用 8 步走完一次复杂查询

员工问:「研究工程团队正在采用的远程办公效率工具,看看有没有跟我们内部生产力指标相关的。」这个 agent 配了 MCP 连到内容库、业务工具和开发环境,它这样处理:

  • ① 接收问题 → ② 初步分析:判断出这需要两个数据源,外部工具研究和内部公司指标,且外部研究一开始不依赖内部数据,可以拆成并行搜索,最后再做关联。
  • ③ 激活技能:调用研究方法、数据关联、商业洞察三类技能,套用成熟框架而不是从零推理。
  • ④ 任务拆解与规划:定下外部网页搜索、内部数据库查询、并行执行、关联综合的方案。
  • ⑤ 并行调工具:同时跑网页搜索(找效率工具趋势)和 SQL 数据库(查内部生产力指标),两个工具并发,大幅缩短总耗时。
  • ⑥ 迭代精修:看完初步结果,发现需要更具体的工程团队数据,据此追加更精准的二次查询。
  • ⑦ 综合关联 → ⑧ 生成结果:把外部趋势和内部指标交叉比对,产出整合结论。