📚 Wiki 知识库

🏷️ LLM推理

2 篇

LLM 推理原理:从 Prompt 到流式响应的全流程解析

文章深入剖析了大语言模型(LLM)的推理过程。首先介绍了文本如何通过分词和嵌入转换为向量,接着详细解释了 Transformer 层中的自注意力机制与前馈网络如何协同工作。文章重点揭示了推理过程的两个不同阶段:处理输入时的“预填充”阶段受算力限制,而生成输出时的“解码”阶段受内存带宽限制,这种性能差异导致了首个token与后续token生成速度的不同。

技术LLM ✍ Akshay🕐 2026-05-03

本周顶级 AI 论文选读:自动化研究员、长周期 Agent 评估与 Nemotron 模型

本周重点关注四大 AI 进展:Anthropic 展示 Claude 可进行全自动化对齐研究,成本仅 1.8 万美元且表现接近完美;AiScientist 提出基于文件系统的长周期工程架构;AlphaEval 揭露了 Agent 从研究到生产环境的巨大鸿沟;NVIDIA 发布开源 120B 参数模型 Nemotron 3 Super,采用混合 MoE 架构优化推理吞吐。

技术LLM ✍ DAIR.AI🕐 2026-04-20