模型不是 Agent 的全部,宿主才是
同样的 Claude / GPT,装在不同客户端里,工具调用成功率、权限边界、可调试性 可以差一个数量级。评测 Agent,请先评 宿主(Client / Runtime)。
谁在一梯队(开发者向)
| 宿主 | MCP | Skill/规则 | 典型擅长 |
|---|---|---|---|
| Cursor | 强 | Rules 成熟 | IDE 内工具智能体 |
| Claude Code | 强 | Skill 清晰 | 终端长任务 Agent |
| VS Code + 插件生态 | 视插件 | 视方案 | 原 VS Code 用户迁移 |
| 自建框架(LangGraph 等) | 可接 | 自研 | 产品内嵌 Agent |
评测清单(建议打印)
- 协议:是否一等公民支持 MCP(stdio / SSE)
- 权限:工具调用是否默认确认?能否按 Server 授权?
- 可观测:能否看到工具入参、耗时、失败栈?
- 规则:项目级 Rules / Skill 是否进 Git?
- 团队:配置能否分发?密钥如何注入?
Cursor:MCP 目录党的舒适区
把 AgentHub 上的 MCP 配进 Cursor,是目前摩擦最小的路径之一。适合「人在 IDE 里指挥 Agent 调工具」。
Claude Code:Skill + MCP 的双层结构
Skill 管「怎么做」,MCP 管「用手做什么」。适合流水线式仓库任务,但对不习惯终端的同学有门槛。
VS Code 系:生态大、碎片也多
插件路线灵活,但 MCP / Agent 体验依赖具体扩展版本。选型时锁定扩展 ID 与版本,写进内部 Wiki。
自建 Agent 运行时:产品要内嵌时再上
若你做的是 对客 Agent 产品,最终仍需自建运行时(状态机、队列、审计)。开发期可用 Cursor/Claude Code 验证 MCP 工具集,再迁到服务端。
推荐架构
开发期宿主:Cursor 或 Claude Code
工具层:MCP Servers(Git、DB、Browser、内部 API)
知识层:Skill / Rules(进仓库)
生产期:自建 Runtime + 同一批 MCP
在 AgentHub 浏览 MCP、Skills、指南,先让工具集稳定,再纠结模型品牌。
结语
评测 AI 智能体,请把 「模型榜」和「宿主榜」分开。宿主决定你能不能安全、可控地用上工具;模型决定话术与推理上限。先选宿主与 MCP,再选模型,返工最少。
