📚 Wiki 知识库

搞懂缓存机制,从Gemma4到Claude Code省80%Token

实践哥MinLi🕐 2026-04-07📦 11.3 KB 🟢 已读 𝕏 文章列表

文章通过本地 Gemma4 实验发现大模型对话中存在 100 倍加速的现象,深入剖析了 Transformer 的 KV 缓存原理,并逆向分析了 Claude Code 的精密缓存工程。文章解释了为何连续对话比频繁开启新 Session 更省钱,指出破坏缓存的关键行为(如切换模型、修改 System Prompt),并提供了保护缓存以节省 80% Token 的具体使用姿势。