📚 Wiki 知识库

🏷️ 模型推理

2 篇

Kimi K2.6 + Hermes:月成本从 $2550 降至 $85 的实践指南

本文介绍了如何利用 Kimi K2.6 模型配合 Hermes 系统,将原本使用 Claude Opus 的高昂开发成本(约 $2550/月)降低至 $85/月。文章详细分析了 Kimi K2.6 在 MoE 架构下的性能优势(如 SWE-Bench Pro 58.6%),展示了其在 12 小时自主编码和系统优化中的实战案例,并提出了“辅助模型模式”以进一步节省非关键任务的费用。作者还针对长上下文输出可能导致的成本陷阱提出了具体的优化策略。

技术LLM ✍ shmidt🕐 2026-05-12

LLM 中的 KV 缓存机制详解

文章深入解释了大型语言模型(LLM)中的 KV 缓存技术。作者指出,LLM 生成文本时首个令牌较慢而后续令牌迅速的现象,归功于 KV 缓存的工程优化。该技术通过存储已计算键值向量,避免在自回归生成过程中的冗余计算,以 GPU 内存为代价换取显著的计算加速。文中详细解析了注意力机制的冗余问题、KV 缓存的工作原理、首令牌延迟(TTFT)的产生原因,以及内存与计算资源之间的权衡取舍。

技术LLM ✍ Avi Chawla🕐 2026-03-22