为什么 API 账单会指数级爆炸?
在智能体多轮会话与代码库上下文分析中,每次发送给模型的请求中,前缀(System Prompt、代码库规范、MCP 工具定义、项目 AST 骨架)往往占到了 80% 以上的 Token。
如果每轮交互都全量计费,团队的研发成本将不可承受。
三项立竿见影的成本优化工程
- 最大化 Prompt Caching 命中率:
- 将不变的工具列表、系统人设放在请求的最前端;
- 保证静态前缀超过 1024 Token 门槛,且前缀内容在多轮之间字符级严格一致;
- 缓存命中后,输入 Token 成本立减 90%,响应速度提升 2~3 倍!
- 多级模型漏斗(Model Tiering):
- 意图理解与快速分类采用轻量模型(如 Claude 3.5 Haiku / GPT-4o-mini);
- 复杂架构设计与深层 Bug 修复再唤醒旗舰模型(Claude 3.5 Sonnet / o1 / R1);
- 本地模型平替高频只读任务:
- 针对简单的命名建议、格式化、单行注释生成,由本地部署的 Ollama 免费完成。