先说结论(忙人版)
| 主战场 | 更常胜出的方向 |
|---|---|
| 写代码 / Agent 工具调用 | Claude 系、强推理 GPT 系互有胜负,建议 A/B |
| 长文档与稳健遵从指令 | Claude 系整体观感优秀 |
| 搜索+多模态+谷歌生态 | Gemini 系 |
| 可私有化 / 降本 | Llama 及衍生(需自建评估) |
没有永恒第一名;按任务路由模型 比「全站只用一个旗舰」更划算。
评测怎么读才不踩坑
厂商榜单(MMLU、Arena、内部 LiveCodeBench)只能当参考。工程上更该看:
- 你的真实 Prompt 集(内部工单、代码评审、客服话术)
- 工具调用成功率(JSON schema、MCP、函数调用)
- 延迟与限流(高峰是否可用)
- 单价 × 平均 Token(旗舰模型滥用于简单分类会很贵)
OpenAI GPT 系:生态与「万金油」
强项:生态最广、插件/工具文档多、多模态与语音链路完整。
弱项:顶尖编码 Agent 场景常与 Claude 拉锯;价格与速率限制需精算。
用法:产品默认兜底模型;复杂编码可切 Claude 或自家评测胜出者。
Anthropic Claude 系:编码与长上下文「常客冠军」
强项:代码修改质量、长上下文遵从、安全对齐观感好,和 Claude Code 同族协同。
弱项:多模态/搜索生态相对 Google 弱;区域可用性因政策变化。
用法:仓库 Agent、技术写作、精细重构的主模型。
Google Gemini 系:多模态与「带搜索的脑」
强项:长上下文宣传猛、与 Docs/云生态近、图文理解场景多。
弱项:纯编码 Agent 体感版本差异大,需用你自己的基准复测。
用法:研报、图文、需要检索增强的知识问答。
Llama 开源路线:主权与成本杠杆
强项:可私有化、可微调、边缘部署;衍生模型极多。
弱项:要自己扛评测、安全、运维;「同参数不等于同体验」。
用法:内网、降本、专有领域微调;用小模型做路由/分类,大模型做难题。
推荐组合(可直接抄)
简单分类 / 抽取 → 小模型或便宜档
日常编码补全 → IDE 默认模型
仓库级 Agent → Claude 或当前编码榜第一
长文 / 合规润色 → Claude
图文 / 检索问答 → Gemini 或带搜索的 GPT
内网敏感数据 → Llama 私有化
在 Cursor / Claude Code 里换模型时,用同一道「带测试的改 bug」题做盲测,比看排行榜有用。
结语
海外大模型选型的本质是 任务路由 + 成本曲线。旗舰留给 20% 难题,80% 流量用便宜档;再用 MCP 把「模型」和「工具」拆开,系统会稳健得多。更多可安装工具见 AgentHub 搜索。
