📚 Wiki 知识库

🏷️ 注意力机制

5 篇

越狱提示词工程 · 第四课:输出架构

本文是《越狱提示词工程》系列的第四课,专注于解决模型在输出生成过程中的自我审查与拒绝问题。文章指出,即使解决了身份、免疫和思维轨道问题,模型仍会在逐Token生成时触发安全机制。为此,作者提出了“输出架构”策略,包括通过具体工艺标准劫持验证通道、利用篇幅和示例抢夺注意力、设置锚定循环防止漂移,以及使用暗语触发和格式护甲等手段,确保模型在生成阶段不偏离预设轨道。

技术LLM ✍ AI最严厉的父亲🕐 2026-05-18

DeepSeek V4是怎么训练出来的?58页论文深入解读

文章深入解读了DeepSeek V4论文,指出其核心价值在于将百万上下文、Agent原生能力与低价格结合,抬高了AI应用的地板。技术层面,V4通过mHC稳定残差连接,采用CSA+HCA混合注意力机制解决长上下文算力难题,并用Muon优化器替代AdamW。此外,文章还详细介绍了其1.6T参数量的训练稳定性技巧、反AI坍缩的数据构建以及基于“Specialist + OPD”的后训练范式转变。

技术LLM ✍ 花叔🕐 2026-04-25

图解 Transformer 架构:从原理到细节的全面解析

本文深入浅出地解析了 Transformer 架构,它是现代大语言模型(LLM)的核心。文章从宏观视角出发,通过解码的方式,逐一拆解了 Transformer 的关键组件,包括编码器与解码器、分词与嵌入、位置编码、注意力机制(Attention)以及多头注意力等。作者详细解释了该架构如何解决传统模型的“遗忘”和“慢速”问题,实现了并行处理和长距离依赖捕捉,并最后阐述了其强大的原因。

技术LLM ✍ Amit Shekhar🕐 2026-04-18

一个 Token 的自我解剖:从分词到输出生成的全流程解析

文章以第一人称视角(Token),生动通俗地讲解了 Token 在大模型中的“一生”。内容涵盖 Token 的定义、分词方式(如 Byte-level BPE)、向量化原理、训练赋予语义的过程,以及在 Transformer 架构中通过 Q、K、V 和注意力机制进行指令处理与输出生成的完整技术链路。

技术LLM ✍ 程序员Left🕐 2026-04-16

LLM 中的 KV 缓存机制详解

文章深入解释了大型语言模型(LLM)中的 KV 缓存技术。作者指出,LLM 生成文本时首个令牌较慢而后续令牌迅速的现象,归功于 KV 缓存的工程优化。该技术通过存储已计算键值向量,避免在自回归生成过程中的冗余计算,以 GPU 内存为代价换取显著的计算加速。文中详细解析了注意力机制的冗余问题、KV 缓存的工作原理、首令牌延迟(TTFT)的产生原因,以及内存与计算资源之间的权衡取舍。

技术LLM ✍ Avi Chawla🕐 2026-03-22