篇章六 · 6.2
四层压缩策略
上下文是稀缺资源。快满时不是一刀切——是四层漏斗逐级启用:从零成本的清空旧结果,到最贵的 LLM 全量摘要,最后还有应急截断。
四层漏斗,由贱到贵
设计原则:能用免费手段就不用 API。点「注入上下文」看水位涨、漏斗逐层触发——每层的代价和损失都标在闸门上。
L1 触发线 L2 触发线 L3 触发线
0%
L1 · Microcompact清空旧 tool_result免费
L2 · SM Compact用 Session Memory 替代免费
L3 · Full CompactLLM 生成 9 段摘要一次 API
L4 · PTL 应急按 API 轮次砍最老的 20%有损!
水位到线,对应层自动开闸泄洪
L3 · Full Compact 的 9 段摘要
① 主要请求与意图② 关键技术概念③ 文件与代码段 ④ 错误与修复⑤ 问题解决过程⑥ 全部用户消息 ⑦ 待办任务⑧ 当前工作⑨ 可选下一步
两阶段生成(<analysis> 想清楚再 <summary> 输出);摘要本身用 forkedAgent 干——共享主对话缓存,压缩成本打折。压缩完重注入:最近读过的 5 个文件、计划、技能、异步 Agent 状态。
熔断器:连续 3 次压缩失败 → 停止重试(防压缩风暴)。L4 PTL 最多重试 3 次,每次删最老一组(或 20%),至少保留一组——再急也不能删成空。
本站要点:压缩不是算法问题是经济学问题——每层都在权衡「省下的 token」和「损失的信息」。下一站是最后一章记忆篇:三套并行系统怎么让你隔天回来还记得昨天。