给 Agent 团队的四个岗位,各挑一个刚好的模型
141 个模型按智力、成本、耗时放进同一个三维空间;每个智力档位里,挑出时间与成本最平衡的那一个。
- 1 选一个方案或细调偏好
- 2 看四个岗位的推荐
- 3 在 3D 图里比较、替换
推荐阵容
任务自上而下分派:规划评审 → 执行编排 → 编码子代理 / 检索侦察
按用量估算每轮成本 $5.22
-
01 规划与评审 用量 ×1 占成本 35%
拆解目标、制定计划并做最终评审,追求最高智力。
Anthropic
- 智力
- 53.6
- 成本/任务
- $1.82
- 耗时/任务
- 4.5 分钟
岗位能力 97/100
看重 综合 30% · Agent 25% · 科学推理 25% · 通用 20%
- 智力指数 30% 99
- AA-Omniscience 20% 93
- AA-Briefcase 15% 99
- HLE 15% 96
- GDPval-AA 10% 95
- CritPt 10% 95
备选
-
02 执行编排 用量 ×2 占成本 59%
默认任务执行者:完成修改,并把简单任务分派给编码子代理。
OpenAI
- 智力
- 49.6
- 成本/任务
- $1.54
- 耗时/任务
- 2.7 分钟
岗位能力 90/100
看重 Agent 55% · 综合 20% · 编码 15% · 通用 10%
- 智力指数 20% 91
- AA-Briefcase 25% 79
- GDPval-AA 15% 72
- AutomationBench 15% 94
- Terminal-Bench 4.0 15% 93
- AA-Omniscience 10% 94
备选
-
03 编码子代理 用量 ×3 占成本 4%
按上游规划写代码,完成具体实现任务。
OpenAI
- 智力
- 37.3
- 成本/任务
- $0.07
- 耗时/任务
- 5.1 分钟
岗位能力 66/100
看重 编码 70% · 综合 20% · 通用 10%
- 智力指数 20% 61
- Terminal-Bench 4.0 40% 61
- SciCode 30% 70
- AA-LCR 10% 89
备选
-
04 检索侦察 用量 ×4 占成本 2%
抓取网页、爬取资料、搜索本地代码库,追求又快又省。
OpenAI
- 智力
- 32.1
- 成本/任务
- $0.03
- 耗时/任务
- 2.1 分钟
岗位能力 47/100
看重 通用 50% · 综合 20% · Agent 15% · 编码 15%
- 智力指数 20% 48
- AA-LCR 20% 54
- GDP.pdf 20% 49
- AutomationBench 15% 58
- Terminal-Bench 4.0 15% 47
- AA-Omniscience 10% 41
备选
智力 × 成本 × 耗时
拖动旋转、滚轮缩放;成本与耗时为对数刻度,点击模型查看详情。
正在加载 3D 视图…
- 规划与评审
- 执行编排
- 编码子代理
- 检索侦察
- 候选模型
- 已筛除
候选模型
96| 模型 | 岗位能力 | ||||
|---|---|---|---|---|---|
| Anthropic | 57.6 | $5.98 | 13 分钟 | 95.5 tok/s | |
| Anthropic | 56.0 | $3.46 | 7.8 分钟 | 89.6 tok/s | |
| Anthropic | 53.6 | $1.82 | 4.5 分钟 | 82.0 tok/s | |
| Anthropic | 53.4 | $7.63 | 12 分钟 | 69.7 tok/s | |
| Anthropic | 53.2 | $5.98 | 9.9 分钟 | 66.8 tok/s | |
| OpenAI | 52.7 | $3.26 | 7.1 分钟 | 63.9 tok/s | |
| OpenAI | 52.4 | $2.31 | 4.9 分钟 | 56.9 tok/s | |
| Anthropic | 51.2 | $1.34 | 3.4 分钟 | 81.5 tok/s | |
| Anthropic | 51.2 | $3.91 | 7.3 分钟 | 58.1 tok/s | |
| OpenAI | 50.9 | $1.73 | 3.2 分钟 | 62.7 tok/s | |
| OpenAI | 49.6 | $1.54 | 2.7 分钟 | 60.0 tok/s | |
| Anthropic | 48.9 | $2.98 | 5.3 分钟 | 57.8 tok/s |