斯坦福 AI & ML 课程清单:从入门到大模型
本文列举了斯坦福大学关于人工智能与机器学习的 10 门顶级课程,涵盖了人工智能基础、机器学习、深度学习、强化学习、自然语言处理(NLP)、计算机视觉(CV)、大语言模型(LLMs)及深度生成模型等核心领域,旨在帮助学习者掌握 AI 第一性原理。
本文列举了斯坦福大学关于人工智能与机器学习的 10 门顶级课程,涵盖了人工智能基础、机器学习、深度学习、强化学习、自然语言处理(NLP)、计算机视觉(CV)、大语言模型(LLMs)及深度生成模型等核心领域,旨在帮助学习者掌握 AI 第一性原理。
本文提供了一个为期14周的实战型AI工程师学习路线图,旨在解决初学者“只学不做”的困境。文章从环境搭建开始,详细列出了从AI基础、机器学习、深度学习到现代LLM工程及Agent开发的最佳免费资源(如OpenAI/Anthropic官方课程、Karpathy的教程等)。路线强调通过GitHub项目实践来理解原理,最终掌握部署与评估技能,真正从零开始构建可用的AI系统。
文章详细介绍了 LoRA (Low-Rank Adaptation) 技术,这是一种用于高效微调大型语言模型的方法。通过冻结原始权重并学习两个极小的低秩矩阵,LoRA 能够在保持模型性能的同时,大幅降低显存占用、训练成本和存储空间。文章还解释了 LoRA 的核心数学原理、具体实施步骤以及为何全量微调成本高昂的原因。
本文深入浅出地解析了 Transformer 架构,它是现代大语言模型(LLM)的核心。文章从宏观视角出发,通过解码的方式,逐一拆解了 Transformer 的关键组件,包括编码器与解码器、分词与嵌入、位置编码、注意力机制(Attention)以及多头注意力等。作者详细解释了该架构如何解决传统模型的“遗忘”和“慢速”问题,实现了并行处理和长距离依赖捕捉,并最后阐述了其强大的原因。
本文是一份详细的机器学习(ML)工程师学习路径指南。作者首先纠正了被动观看视频的学习误区,提出“两遍学习法”以建立深刻的技术理解。文章明确了ML工程师与数据科学家及研究员的区别,强调工程实现能力。随后,作者将学习路径分为两个阶段:第一阶段利用 3Blue1Brown 的视频构建数学直觉,涵盖神经网络、梯度下降、反向传播及 Transformer 架构;第二阶段(文中截断处未完)预告将通过 Andrej Karpathy 的课程来提升代码实现能力。
本文详细介绍了AI图像与视频生成背后的核心技术——扩散模型(Diffusion Model)。文章通过通俗易懂的语言,解释了其物理起源、从加噪到去噪的运作原理,以及它如何凭借稳定性优势逐渐取代GAN成为生成式AI的主流范式。
本文是一篇关于从零构建大型语言模型(LLM)架构的深度指南。文章详细解释了 LLM 的工作原理,包括从原始数据收集、清洗、分词,到 Transformer 架构的核心组件(如自注意力机制、位置编码)。同时涵盖了预训练、微调、基于人类反馈的强化学习(RLHF)以及推理优化等关键技术环节,旨在帮助读者理解 ChatGPT 和 Claude 等模型背后的系统构建全流程。