📚 Wiki 知识库

🏷️ Deep Learning

3 篇

Step-By-Step LLM Engineering Projects (2026 Edition)

文章提出了一个基于项目的 2026 年 LLM 工程学习路线图。作者主张通过从零构建系统来掌握技术栈,路径涵盖从基础的 Tokenizer、Embedding、Positional Encoding、Attention 机制,到 Transformer 模块构建、训练循环、KV Cache、MoE、量化、服务部署、RAG 及 Agent 等高级系统。该指南强调“实现、绘制、破坏、解释”的学习闭环,旨在帮助读者深入理解大模型原理并具备工程构建能力。

技术LLM ✍ Ahmad🕐 2026-05-25

Top Companies Are Secretly Working on This (It Will Replace LLMs)

文章探讨了顶级科技公司正在秘密研发的架构转变——状态空间模型(SSM)。旨在解决 Transformer 架构在长序列处理中的计算成本高和内存消耗大的问题。文章详细解析了 SSM 的工作原理、相比 LLM 的优势(线性时间复杂度、恒定内存),并展示了 NVIDIA、IBM 和 Microsoft 等公司在 Nemotron、Bamba 和 SambaY 等混合架构上的实际应用进展。

技术LLM ✍ Siddharth🕐 2026-05-06

深度扩展视角:Looped LLM 与 Claude Mythos 架构解析

本文深入探讨了 Looped LLM(循环大语言模型)的演进及其在 Claude Mythos 中的潜在应用。作者从字节跳动实习期间的研究出发,分析了循环架构在多跳推理任务上的优势,并指出 Anthropic 新发布的 Mythos 在 GraphWalk BFS 基准上的异常提升可能与底层状态跟踪能力有关。文章进一步探讨了将 Looped LLM 扩展至大规模应用时面临的“三道门槛”:深度稳定性(借鉴 RNN/SSM 理论解决梯度问题)、推理效率(结合 Diffusion Forcing 和 YOCO 优化并行度)以及单位 FLOPs 的有效性,强调了在算力预算有限时架构选择的重要性。

技术LLM ✍ Rui-Jie Zhu🕐 2026-04-22