# 📖 精读报告：Claude Code 省 Token：从可见性到检索路径的工程链路

**一句话总结**：Token 优化不是装一个插件，而是一条「可见性 → 输入压缩 → 输出压缩 → 检索路径」的工程链路，必须先定位瓶颈再对症下药。

**核心论点**：遇到用量见底，换套餐、换模型、要求「回答短一点」都没碰到真正的消耗结构；真正花钱的是反复进入上下文的 git diff、全仓搜索、无关规则与客套输出。

**论证结构**：

1. 先把用量看见：用监控确定瓶颈 —— 论据：Claude Code Usage Monitor 读取本机数据，优先使用官方 statusline 的 rate_limits，本地估算明确标记；价值是把事后才知的消耗变成任务进行中可取舍的信号。
2. 压缩工具输出：少把终端废话塞进上下文 —— 论据：rtk（Rust Token Killer）在 Agent 读取前压缩 stdout：git log 收敛为 hash/作者/标题、测试输出聚焦失败项、长搜索结果按文件归组。
3. 压缩模型输出：让模型少说，不是少想 —— 论据：Caveman 把回答改成短句、要点、路径与命令优先，删除礼貌用语与重复背景，但声明不改变代码、命令与错误文本。
4. 压缩检索路径：别让 Agent 从文件系统里猜答案 —— 论据：CodeGraph 先建本地语义图谱（函数/类/导入/调用链），Agent 通过 MCP 先问「谁调用它」，再读少量目标文件，减少反复 grep 与误读。
5. 不装插件也能立刻做的两件事 —— 论据：定期执行 /context 检查会话装了什么；任务切换用 /clear 开干净会话；审计 CLAUDE.md，把「每次启动都加载的 @引用」改成「任务相关时才读取」，即把常驻知识改成可检索知识。

**论证脉络**：常见误区（换套餐/换模型）→ 消耗结构分析（输入/输出/检索三环节）→ 四个模块逐层展开（监控 → rtk → Caveman → CodeGraph）→ 零成本习惯（/context、/clear、CLAUDE.md 审计）→ 落地清单（症状 → 先做什么 → 不要做什么）。

**核心概念**：rtk（Rust Token Killer：CLI 代理，压缩送入模型的命令输出）；Caveman（输出侧压缩插件，通过 SessionStart / UserPromptSubmit hooks 维持模式）；CodeGraph（本地语义图谱 + MCP 查询，把代码检索从 grep 变成结构化问答）；Usage Monitor（本地 companion，终端监控/预测/导出/状态栏接入）。

**金句摘录**：

- “先确认消耗，再定位浪费属于输入、输出还是检索路径，最后只在对应环节加工具。”
- “把常驻知识改成可检索知识。尤其是团队共享配置，每一次无关加载都会被每位成员的每轮会话放大。”

**批判性思考**：

- 各工具的节省数字均来自项目方自己的 benchmark（作者也标注「只作方向性指标」）——你的任务类型下实际能省多少，是否应该先做一周基线测量？
- 「默认压缩、失败再显式请求原始输出」的团队策略，在排障时被折叠的关键日志本身会不会成为新的风险？
- CodeGraph 的常驻索引对团队是省 token 还是新增运维面？小仓库引入它的收益边界在哪里？

---

（来源：https://mp.weixin.qq.com/s/IYIkYcxHgUYWe8VvNd1lnA · 字数：5155 · 深度：deep）
