长上下文时代的迷思:“能装下”不等于“能用好”
随着 Claude 3.5 Sonnet、Gemini 1.5 Pro 等模型支持数十万甚至上百万 Token 上下文,许多开发者误以为可以把整个项目的所有文件一次性全部扔给模型。
实测表明,随着上下文急剧膨胀:
- 注意力钝化(Attention Degradation):模型在超长文本中间段落的信息召回准确率显著下降(Lost in the Middle 现象);
- 推理延迟与费用飙升:首字延迟(TTFT)与单次调用成本呈线性甚至超线性上升。
动态分层上下文拓扑设计
一个成熟的智能体系统应当将上下文划分为四个层级:
- L0 核心指令层(不可裁剪):System Prompt、角色边界、格式规范;
- L1 动态工作记忆层(高优先级):当前任务目标、最近 3 轮工具调用输入输出;
- L2 摘要记忆层(滑动折叠):历史轮次的定期压缩摘要;
- L3 外部持久索引层(按需检索):知识库与代码库,仅在执行特定检索工具时召回 Top-K 片段。