LLM、Agent、MCP、Skill 都是什么?20 个高频AI词汇人话解释
最近两年聊 AI,越来越像在听黑话:
LLM、Token、Context、Agent、MCP、Skill、Harness、RAG……
每个字母好像都认识,连起来就不知道在说什么。
其实很多概念没有那么复杂。
这篇不讲学术定义,只讲它们到底是干嘛的。
⸻
01|LLM:AI 的“大脑”
LLM = Large Language Model,大语言模型。
你可以把它理解成 ChatGPT、Claude、Gemini 这类 AI 产品背后的“大脑”。
比如:
- GPT 是模型
- Claude 是模型
- Gemini 是模型
而 ChatGPT 这种你真正打开来使用的东西,是建立在模型之上的产品。
所以:
模型 ≠ AI App。
就像发动机 ≠ 汽车。
⸻
02|Prompt:你给 AI 下的指令
你在聊天框里输入的:
- 帮我分析这份报告
- 给我写一个产品方案
- 把这段话改得自然一点
这些都属于 Prompt。
以前大家很热衷于“提示词工程”,本质就是研究:
怎么说,AI 才更容易理解我要什么。
⸻
03|Token:AI 计算文字的单位
AI 并不是按照“多少字”来读取内容的,AI 会把文字切成一个个 Token。
可以粗略理解成:Token = AI 眼里的文字颗粒。
所以 API 的收费是按:
- 输入多少 Token
- 输出多少 Token
这也是为什么一篇几十万字的文件,会比一句“你好”贵很多。
⸻
04|Context:AI 这一次能看到的所有东西
Context 就是“上下文”。
比如你正在和 AI 聊天,它可能看到:
- 你刚刚问的问题
- 前面的聊天记录
- 上传的文件
- 系统给它的规则
- 搜索出来的资料
- 工具返回的结果
这些加起来,就是它这一次工作的 Context。
所以很多时候上下文变长了,它根本没看到那部分信息,你会觉得它“变笨了”。 ⸻
05|Context Window:AI 的工作记忆有多大
Context Window = 上下文窗口。
可以把它理解成:AI 的办公桌一次能摊开多少资料。
比如一个模型有 128K Context,另一个有 1M Context。
理论上,1M 能一次看到更多内容。
但注意:窗口大,不等于一定用得好。
就像桌子特别大,也不代表你能同时处理桌上所有文件。
⸻
06|Multimodal:不只会看文字
Multimodal = 多模态。
以前的 AI 主要处理文字。
现在可以同时处理:
- 文字
- 图片
- 音频
- 视频
- 屏幕画面
比如你丢一张截图给 AI:这个页面哪里设计得不好?
它能够直接看图分析,这就是多模态。
⸻
07|Reasoning Model:更擅长复杂推理的模型
有些任务不是“知道答案”就够了。
比如:
- 数学题
- 写复杂代码
- 做商业分析
- 制定多步计划
- 找出程序 Bug
这类任务需要模型一步一步分析。
这种能力通常会被称为 Reasoning,也就是“推理”。
所以普通模型更像快速回答问题,推理模型更擅长处理复杂问题。
⸻
08|Hallucination:AI 一本正经地胡说
Hallucination = 幻觉。
比如你问 AI:某本不存在的书是谁写的?
它可能给你编出作者、出版年份甚至 ISBN。
而且语气非常确定。
这就是 AI 最典型的问题之一:
它生成的是“最像正确答案的内容”,不天然等于事实。
所以涉及医疗、法律、数据、新闻、论文等内容,最好查来源。
⸻
09|AI Agent:从“回答问题”变成“帮你做事”
这是最近两年最重要的概念之一。
普通 Chat AI 的模式是:
你问 ↓ AI 回答
Agent 的模式更像:
你给一个目标 ↓ AI 判断怎么做 ↓ 调用工具 ↓ 检查结果 ↓ 继续执行 ↓ 完成任务
比如你说:帮我找出这个项目为什么部署失败,并修好。
普通 AI 可能告诉你几个可能原因。
Agent 则可能直接:
读代码 → 看日志 → 找 Bug → 改文件 → 测试 → 再检查。
这就是最大的区别。
Chat AI 是“给答案”,Agent 是“做事情”。
⸻
10|Tool Calling:AI 开始会“用工具”
模型本身其实做不了很多事情。
它不能凭空:
- 查询实时天气
- 打开你的 Gmail
- 修改 GitHub
- 操作数据库
- 执行代码
所以要给 AI 配工具。
例如:
AI │ ├─ 搜索工具 ├─ 浏览器 ├─ Python ├─ Gmail └─ GitHub
AI 根据任务判断:现在应该调用哪个工具?
这就叫 Tool Calling。
它是 Agent 能真正“做事”的基础。
⸻
11|Computer Use:AI 直接操作电脑
以前 AI 想操作一个软件,通常需要软件提供 API。
Computer Use 更直接:AI直接看屏幕,然后像人一样点鼠标、输入文字、操作网页。
例如:
看到登录按钮 ↓ 点击 ↓ 填写表单 ↓ 下一步 ↓ 读取页面内容
理论上,只要人能通过界面完成的操作,AI 都有可能通过这种方式完成。
⸻
12|Coding Agent:会自己干活的“AI 程序员”
Cursor、Claude Code、Codex 这类产品经常会涉及这个概念。
普通 AI Coding:
帮我写一个登录组件,它给你一段代码。
Coding Agent:
帮我给这个项目加上登录功能,然后它可能自己:
读整个项目 ↓ 找到相关文件 ↓ 修改代码 ↓ 运行程序 ↓ 发现报错 ↓ 继续修改 ↓ 测试
所以 Coding Agent 和“AI 帮你补全几行代码”已经不是一回事。
⸻
13|MCP:AI 世界的“通用插座”
MCP = Model Context Protocol。
先想象一个问题:AI 想连接 GitHub、数据库、Notion、文件系统……
以前每个工具可能都要单独适配,MCP 想做的事情就是制定一个统一标准。
你可以把它理解成:USB-C
以前:
AI - 特殊接口 - GitHub AI - 另一套接口 - 数据库 AI - 又一套接口 - Notion
有 MCP 后:
┌─ GitHub
AI ─ MCP |——数据库 |——文件 └─ 其他工具
所以 MCP 不是某个具体 AI 工具,它是一套让 AI 连接外部工具和数据的协议。
⸻
14|Skill:教 Agent “这件事应该怎么做”
Skill 可以理解成:给 Agent 的专业操作手册。
比如 Agent 本来会 GitHub,但它不一定知道你希望怎么处理 Pull Request。
于是可以给它一个 Skill:
收到 PR ↓ 先检查评论 ↓ 找出需要修改的地方 ↓ 修改代码 ↓ 运行测试 ↓ 检查结果 ↓ 提交
所以 Skill 解决的不是AI 能不能使用 GitHub?
而是AI 知不知道应该按照什么流程使用 GitHub?
一句话:Tool 给它手脚,Skill 教它怎么干活。
⸻
15|Harness:把模型真正变成 Agent 的“整套装备”
Harness 这个词最近也越来越常见。
如果说:LLM 是发动机。
那 Harness 就是围绕发动机装上的:
- 方向盘
- 刹车
- 仪表盘
- 变速箱
- 控制系统
比如一个 Coding Agent 的 Harness 可能负责:
给模型读取文件 允许模型执行命令 管理上下文 调用工具 记录任务状态 处理错误 检查结果 继续下一步
所以同一个模型,放进不同 Harness 里,实际体验可能差非常多。
这也是为什么:“这个 Agent 很强”不一定只是模型强。
⸻
16|Context Engineering:别只研究“怎么问”,开始研究“给 AI 看什么”
Prompt Engineering 研究的是:这句话应该怎么写?
Context Engineering 研究的是:AI 干这个任务之前,到底应该给它哪些信息?
比如一个 Coding Agent 工作时,你可能要给它:
项目代码 + 产品需求 + 设计规范 + 历史修改记录 + Skill + 工具 + 用户偏好
这整套信息怎么组织,就是 Context Engineering。
Agent 越复杂,这件事越重要。
⸻
17|RAG:先查资料,再回答
RAG = Retrieval-Augmented Generation。
名字很吓人,原理其实很简单。
普通 AI:
你问问题 ↓ AI 靠自己脑子回答
RAG:
你问问题 ↓ 先去资料库搜索 ↓ 找到相关内容 ↓ 把资料交给 AI ↓ AI 根据资料回答
所以企业知识库、文档问答,经常会用到 RAG。核心是需要的时候先找出来,再给它看。
⸻
18|API:让程序调用 AI
你在 ChatGPT App 里聊天,是“人调用 AI”。
API 则主要是程序调用 AI。
比如你做了一个翻译 App:
用户输入一句话 ↓ 你的 App ↓ 调用 GPT API ↓ GPT 返回翻译 ↓ 展示给用户
所以开发 AI 产品时,API 是最常见的基础设施之一。
⸻
19|CLI:在终端里用命令操作软件
CLI = Command Line Interface。
比如:
git status npm install vercel deploy
这些不是在软件界面里点按钮,是在 Terminal 里输入命令。
所以Terminal 是那个黑窗口,CLI 是你在里面调用的命令行工具。
现在 Coding Agent 很喜欢 CLI,因为相比到处点按钮,命令更容易被 AI 自动执行。
⸻
20|Vibe Coding:你说需求,AI 大量写代码
这是近一年非常火的一个词。
传统开发:
人设计 ↓ 人写代码 ↓ 人调试
Vibe Coding 更像:
你:这里做一个登录页 AI:写代码 你:太丑了,改简单一点 AI:继续改 你:按钮点不了 AI:修 Bug
人越来越关注:“我要什么结果?”而不是“这一行代码应该怎么写?”
但 Vibe Coding 不等于完全不用懂产品和技术。
项目越复杂,人越需要负责:
- 定义需求
- 判断方案
- 控制质量
- 验收结果
⸻
最后把这些词串起来,其实这 20 个词不是互相独立的。可以把今天的 AI 系统理解成这样:
而最底层负责理解、推理和生成内容的,还是LLM。
所以最近两年的 AI 变化,可以概括成一句话:以前大家研究怎么跟 AI 聊天,现在大家开始研究怎么让 AI 真正干活。