# 看懂这个九个概念,我太奶奶也可以用 AI 赚钱
**作者**: Miles.
**日期**: 2026-05-18T03:32:15.000Z
**来源**: [https://x.com/ma_zhenyuan/status/2056216266634035470](https://x.com/ma_zhenyuan/status/2056216266634035470)
---

去年有个做 SaaS 的朋友,融了 200 万,招了 5 个工程师,花 3 个月开发 AI 客服产品。
上线后发现,用户问个复杂问题,系统就开始胡说八道,Context 窗口撑爆了,Token 成本高到离谱,最后项目黄了。
AI 圈子里每天都在冒新名词。
今天这篇文章,从纯小白视角,系统性拆解 AI 的 9 个核心概念。
看完你会明白,AI 能做什么、做不到什么,以及为什么。
## 1. 大语言模型 (LLM)
LLM = Large Language Model = 大语言模型。
当前主流的大语言模型几乎全部基于 Google 于 2017 年提出的 Transformer 架构,该架构源自论文《Attention is all you need》。
Transformer 的核心机制
Transformer 的核心是注意力机制,尤其是 Self-Attention。它使模型在处理文本时,不仅按顺序逐字处理,而是能同时关注上下文中不同位置的信息。
Self-Attention 机制让模型能够引用文本中其他部分的信息,从而更准确地理解某个词或片段在当前语境中的含义。
LLM 的工作原理
大模型的本质是一个"文字接龙游戏"。它接收输入后,经过内部的矩阵运算,预测出概率最高的"下一个词",并将这个词加回输入中继续预测,直到输出特殊的结束标识符。
你看到的"流式输出"并非产品动画效果,而是其真实生成机制的外显。
LLM 的核心能力:根据已有上下文预测下一个最可能出现的 Token。
它能表现出推理、总结、改写、翻译、代码生成等能力,但底层仍然是概率生成与模式匹配的组合。
## 2. Token 与 Tokenizer
为什么需要 Tokenizer
大模型底层运行的是数学矩阵运算,只能处理数字,无法直接理解人类文字。
Tokenizer(分词器)充当中间层,负责编码(将文字切分并映射为数字)和解码(将数字还原为文字)。
Token 的本质
Token 是大模型处理文本的最基本单元。一句话会被切分为多个片段,这些片段即为 Token。每个 Token 对应一个数字,称为 Token ID。
Token 与词的关系
Token 不等同于完整的词。平均而言:
- 1 个 Token ≈ 0.75 个英文单词
- 1 个 Token ≈ 1.5 到 2 个汉字
代码、JSON、表格、URL、特殊符号密集的内容,通常会消耗更多 Token。
Token 决定三个维度
1. 成本:Token 越多,调用成本越高
2. 速度:Token 越多,生成速度越慢
3. 容量:Token 越多,越容易超出上下文窗口限制
## 3. 上下文 (Context) 与上下文窗口 (Context Window)
Context (上下文)
大模型本身是一个数学函数,并不具备真正的记忆能力。它之所以能"记住"之前的对话内容,是因为系统每次都会将历史对话记录、当前用户问题、正在输出的 Token 以及系统规则等信息打包在一起发送给模型。
大模型每次接收到的这些信息总和即为 Context,可视作其"临时记忆体"。
Context 包括:
- 当前用户输入
- 历史对话记录
- System Prompt
- 可用工具列表
- 工具调用结果
- 平台追加的控制信息
- 模型正在生成的内容
Context Window (上下文窗口)
代表大模型一次性能够容纳的最大 Token 数量上限。
上下文窗口决定的能力边界
- 能否处理长文档
- 能否理解长对话
- 能否分析大型代码仓库
- Agent 能否持续运行
- 工具结果是否会超出容量限制
关键判断
上下文窗口大,不意味着应该无限制地填充信息。Token 越多,成本越高;不相关信息越多,噪音越大,反而会干扰模型判断。
正确策略:只将当前任务最相关的信息提供给模型。
## 4. RAG (检索增强生成)
RAG = Retrieval-Augmented Generation = 检索增强生成。
应用场景
当需要让大模型参考超长文档(如上千页的技术手册)时,将全部内容输入不仅容易超出上下文窗口限制,也会导致极高的计算成本。
RAG 技术原理
RAG 从原始长文档中抽取与用户问题最匹配的若干片段,然后仅将这些片段发送给大模型,让模型基于片段生成答案。这种方式既突破了字数限制,又控制了成本。
RAG 的定位
RAG = Context 管理策略。
它不是让模型变得更智能,而是让模型在回答时能够看到更准确、更相关的材料。
优势:节省成本、降低噪音、提高相关性,适用于企业知识库、客服问答、文档检索等场景。
## 5. 提示词 (Prompt)
Prompt 是给模型输入的问题、指令、要求和规则。
Prompt 的作用是约束模型的生成方向。
两类 Prompt
User Prompt (用户提示词)
用户在界面中直接输入的内容。
System Prompt (系统提示词)
开发者在后台配置的角色定义、行为规则、边界约束和输出风格。
用户通常无法看到 System Prompt,但它会持续影响模型的行为表现。例如:"你是一个耐心的数学老师,不要直接给出答案,要引导学生思考。"
Prompt Engineering 的核心
有效的 Prompt 不在于措辞华丽,而在于清晰表达任务目标、约束条件、输入信息和输出格式。
## 6. 工具 (Tool)
核心痛点
大模型处于封闭环境,无法感知外部世界(例如无法获取实时天气),因为它只能根据训练数据预测下一个词。
Tool 的本质
Tool 本质上是函数。给定输入,即可获得输出(例如天气查询接口)。
调用流程
大模型无法直接调用工具。它通过推理,向中间平台输出一条文本指令(指明要使用的工具及参数)。平台执行工具并获取数据后,将结果反馈给大模型,最后由大模型将结果整合为自然语言回复给用户。
完整链路:
1. 用户提问
2. 平台将问题 + 工具列表发送给模型
3. 模型判断是否需要调用工具
4. 模型生成工具调用指令
5. 平台执行工具
6. 工具返回结果
7. 平台将结果发送给模型
8. 模型将结果整合为自然语言输出
Tool 的意义
Tool = 模型连接外部世界的手和眼。
有了 Tool,AI 从"文本生成器"进化为"任务执行器"。
## 7. MCP (模型上下文协议)
MCP = Model Context Protocol = 模型上下文协议。
为什么需要 MCP
不同的大模型平台(如 OpenAI、Anthropic 等)接入工具的规范各不相同,导致开发者需要为同一个工具编写多套适配代码,生态极度碎片化。
MCP 的作用
MCP 定义了一套统一的工具接入标准,让工具开发者能够"一次开发,多端接入"。
类比:MCP 相当于 AI 工具生态中的 Type-C 接口,或者说"USB-C port for AI applications"。
MCP 包含三部分
1. Tools:让模型与外部系统交互,例如查询数据库、调用 API 或执行计算
2. Resources:为语言模型提供上下文数据,例如文件、数据库 schema 或业务信息
3. Prompts:提供可复用的提示词模板和结构化指令
MCP 定义了一套统一标准,用于连接 AI 应用和外部系统,包括数据源、工具和工作流。
## 8. 智能体 (Agent)
普通聊天模型 vs Agent
普通聊天模型:"你问一句,我答一句"
Agent:"你给我一个目标,我自主拆解步骤并完成任务"
Agent 的核心能力
Agent 不仅能调用单个工具,而是能够围绕目标进行多步规划、条件判断、连续执行,并根据当前状态决定下一步行动。
举例
用户问:"今天我这里天气怎么样?如果下雨,帮我查附近有没有卖伞的店。"
这个任务需要:
1. 定位
2. 查询天气
3. 判断是否下雨
4. 搜索附近店铺
5. 整合结果
Agent 的能力模型
- 任务理解
- 步骤规划
- 工具选择
- 参数生成
- 条件判断
- 结果利用
- 多轮循环
- 最终归纳
Agent = 以目标为中心,能够自主规划、调用工具、循环执行的系统。
这也是为什么"能聊天"不等于"是 Agent"。真正的 Agent 需要具备持续行动能力,而不仅仅是生成一段回答。
## 9. Agent Skill (智能体技能)
痛点
在日常高频使用场景中,用户往往有特定的习惯和输出格式要求。如果每次提问都需要附带一长串要求,体验极差。
Agent Skill 的本质
Agent Skill 本质上是一份写给 Agent 的"说明文档"(通常为 Markdown 格式文件)。
文档结构
分为元数据层(技能名称和描述)和指令层(目标、执行步骤、判断规则、输出格式及示例)。
元数据层:
- name
- description
指令层:
- 目标
- 执行步骤
- 判断规则
- 输出格式
- 示例
价值
挂载该文档后,只要用户的请求与该技能相关,Agent 就会自动按照文档中的规则和步骤执行任务,无需重复输入冗长的 Prompt。
Agent Skill 将反复使用的任务规则外置为结构化说明文档。
它让 Agent 从"临场发挥"转变为"可复用、可维护、可解释的执行逻辑"。
更深层意义
它将原本写在代码、Prompt、人工经验中的知识,沉淀为可版本管理、可复用、可团队协作的文档层能力。
在工程视角下:
- Prompt = 一次性任务说明
- Skill = 可复用任务 SOP
- Tool = 可执行能力
- Agent = 调度 Tool 和 Skill 的任务系统
## 总结
从 LLM 到 Agent Skill,这 9 个概念构成了 AI 产品的底层结构。
如果将其构建为一套完整的 AI 应用,执行流程如下:
```
用户目标
↓
Agent 理解目标
↓
读取相关 Skill
↓
组织 Prompt + Context
↓
调用 LLM 进行规划/判断
↓
必要时通过 MCP 发现 Tool / Resource
↓
调用 Tool 执行动作
↓
将工具结果放回 Context
↓
继续判断下一步
↓
直到任务完成
↓
输出最终结果
```
一句话总结:
LLM 是发动机,Token 是燃料颗粒,Context 是工作台,Prompt 是任务单,Tool 是手和眼,MCP 是统一接口,Agent 是执行者,Agent Skill 是岗位 SOP。
理解这套链路,你就能看懂大多数 AI 产品的底层结构。
## 相关链接
- [Miles.](https://x.com/ma_zhenyuan)
- [@ma_zhenyuan](https://x.com/ma_zhenyuan)
- [6.4K](https://x.com/ma_zhenyuan/status/2056216266634035470/analytics)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [11:32 AM · May 18, 2026](https://x.com/ma_zhenyuan/status/2056216266634035470)
- [6,480 Views](https://x.com/ma_zhenyuan/status/2056216266634035470/analytics)
- [View quotes](https://x.com/ma_zhenyuan/status/2056216266634035470/quotes)
---
*导出时间: 2026/5/18 14:25:00*