给 Agent 团队的四个岗位,各挑一个刚好的模型

141 个模型按智力、成本、耗时放进同一个三维空间;每个智力档位里,挑出时间与成本最平衡的那一个。

  1. 1 选一个方案或细调偏好
  2. 2 看四个岗位的推荐
  3. 3 在 3D 图里比较、替换

推荐阵容

任务自上而下分派:规划评审 → 执行编排 → 编码子代理 / 检索侦察

按用量估算每轮成本 $5.22

  1. 01 规划与评审 用量 ×1 占成本 35%

    拆解目标、制定计划并做最终评审,追求最高智力。

    智力
    53.6
    成本/任务
    $1.82
    耗时/任务
    4.5 分钟

    岗位能力 97/100

    看重 综合 30% · Agent 25% · 科学推理 25% · 通用 20%
    • 智力指数 30% 99
    • AA-Omniscience 20% 93
    • AA-Briefcase 15% 99
    • HLE 15% 96
    • GDPval-AA 10% 95
    • CritPt 10% 95

    备选

  2. 02 执行编排 用量 ×2 占成本 59%

    默认任务执行者:完成修改,并把简单任务分派给编码子代理。

    智力
    49.6
    成本/任务
    $1.54
    耗时/任务
    2.7 分钟

    岗位能力 90/100

    看重 Agent 55% · 综合 20% · 编码 15% · 通用 10%
    • 智力指数 20% 91
    • AA-Briefcase 25% 79
    • GDPval-AA 15% 72
    • AutomationBench 15% 94
    • Terminal-Bench 4.0 15% 93
    • AA-Omniscience 10% 94

    备选

  3. 03 编码子代理 用量 ×3 占成本 4%

    按上游规划写代码,完成具体实现任务。

    智力
    37.3
    成本/任务
    $0.07
    耗时/任务
    5.1 分钟

    岗位能力 66/100

    看重 编码 70% · 综合 20% · 通用 10%
    • 智力指数 20% 61
    • Terminal-Bench 4.0 40% 61
    • SciCode 30% 70
    • AA-LCR 10% 89

    备选

  4. 04 检索侦察 用量 ×4 占成本 2%

    抓取网页、爬取资料、搜索本地代码库,追求又快又省。

    智力
    32.1
    成本/任务
    $0.03
    耗时/任务
    2.1 分钟

    岗位能力 47/100

    看重 通用 50% · 综合 20% · Agent 15% · 编码 15%
    • 智力指数 20% 48
    • AA-LCR 20% 54
    • GDP.pdf 20% 49
    • AutomationBench 15% 58
    • Terminal-Bench 4.0 15% 47
    • AA-Omniscience 10% 41

    备选

智力 × 成本 × 耗时

拖动旋转、滚轮缩放;成本与耗时为对数刻度,点击模型查看详情。

正在加载 3D 视图…
  • 规划与评审
  • 执行编排
  • 编码子代理
  • 检索侦察
  • 候选模型
  • 已筛除

候选模型

96
模型岗位能力
Claude Opus 5.5 (Max)

Anthropic

57.6$5.9813 分钟95.5 tok/s
Claude Opus 5.5 (Xhigh)

Anthropic

56.0$3.467.8 分钟89.6 tok/s
Claude Opus 5.5 (High) 规划与评审

Anthropic

53.6$1.824.5 分钟82.0 tok/s
Claude Fable 5.1 (Max)

Anthropic

53.4$7.6312 分钟69.7 tok/s
Claude Fable 5.1 (Xhigh)

Anthropic

53.2$5.989.9 分钟66.8 tok/s
GPT-6 Astra (max)

OpenAI

52.7$3.267.1 分钟63.9 tok/s
GPT-6 Astra (xhigh)

OpenAI

52.4$2.314.9 分钟56.9 tok/s
Claude Opus 5.5 (Medium)

Anthropic

51.2$1.343.4 分钟81.5 tok/s
Claude Fable 5.1 (High)

Anthropic

51.2$3.917.3 分钟58.1 tok/s
GPT-6 Astra (high)

OpenAI

50.9$1.733.2 分钟62.7 tok/s
GPT-6 Astra (medium) 执行编排

OpenAI

49.6$1.542.7 分钟60.0 tok/s
Claude Fable 5.1 (Medium)

Anthropic

48.9$2.985.3 分钟57.8 tok/s

数据来源:Artificial Analysis · 数据更新于 9月28日 14:52 UTC,每小时自动刷新

成本与耗时是 AA Intelligence Index 各评测任务的加权平均;耗时只含解码时间,不含首字延迟与额外开销。

岗位能力 = AA Intelligence Index 各组成评测在全部模型中的百分位,按岗位侧重加权:执行编排看 Agent 类,编码子代理看编码类,检索侦察看长文档与工具调用,规划评审看综合智力与推理。推荐 = 在达到岗位门槛的模型中,按能力、成本、耗时加权打分取最高;成本权重与岗位用量成正比(检索 4 : 编码 3 : 执行 2 : 规划 1)。

运营实体:合肥观策行科技有限公司 皖ICP备2026022706号