← 全部随笔

LLM、Agent、MCP、Skill 都是什么?20 个高频AI词汇人话解释

最近两年聊 AI,越来越像在听黑话:

LLM、Token、Context、Agent、MCP、Skill、Harness、RAG……

每个字母好像都认识,连起来就不知道在说什么。

其实很多概念没有那么复杂。

这篇不讲学术定义,只讲它们到底是干嘛的。

01|LLM:AI 的“大脑”

LLM = Large Language Model,大语言模型。

你可以把它理解成 ChatGPT、Claude、Gemini 这类 AI 产品背后的“大脑”。

比如:

  • GPT 是模型
  • Claude 是模型
  • Gemini 是模型

而 ChatGPT 这种你真正打开来使用的东西,是建立在模型之上的产品。

所以:

模型 ≠ AI App。

就像发动机 ≠ 汽车。

02|Prompt:你给 AI 下的指令

你在聊天框里输入的:

  • 帮我分析这份报告
  • 给我写一个产品方案
  • 把这段话改得自然一点

这些都属于 Prompt。

以前大家很热衷于“提示词工程”,本质就是研究:

怎么说,AI 才更容易理解我要什么。

03|Token:AI 计算文字的单位

AI 并不是按照“多少字”来读取内容的,AI 会把文字切成一个个 Token。

可以粗略理解成:Token = AI 眼里的文字颗粒。

所以 API 的收费是按:

  • 输入多少 Token
  • 输出多少 Token

这也是为什么一篇几十万字的文件,会比一句“你好”贵很多。

04|Context:AI 这一次能看到的所有东西

Context 就是“上下文”。

比如你正在和 AI 聊天,它可能看到:

  • 你刚刚问的问题
  • 前面的聊天记录
  • 上传的文件
  • 系统给它的规则
  • 搜索出来的资料
  • 工具返回的结果

这些加起来,就是它这一次工作的 Context。

所以很多时候上下文变长了,它根本没看到那部分信息,你会觉得它“变笨了”。 ⸻

05|Context Window:AI 的工作记忆有多大

Context Window = 上下文窗口。

可以把它理解成:AI 的办公桌一次能摊开多少资料。

比如一个模型有 128K Context,另一个有 1M Context。

理论上,1M 能一次看到更多内容。

但注意:窗口大,不等于一定用得好。

就像桌子特别大,也不代表你能同时处理桌上所有文件。

06|Multimodal:不只会看文字

Multimodal = 多模态。

以前的 AI 主要处理文字。

现在可以同时处理:

  • 文字
  • 图片
  • 音频
  • 视频
  • 屏幕画面

比如你丢一张截图给 AI:这个页面哪里设计得不好?

它能够直接看图分析,这就是多模态。

07|Reasoning Model:更擅长复杂推理的模型

有些任务不是“知道答案”就够了。

比如:

  • 数学题
  • 写复杂代码
  • 做商业分析
  • 制定多步计划
  • 找出程序 Bug

这类任务需要模型一步一步分析。

这种能力通常会被称为 Reasoning,也就是“推理”。

所以普通模型更像快速回答问题,推理模型更擅长处理复杂问题。

08|Hallucination:AI 一本正经地胡说

Hallucination = 幻觉。

比如你问 AI:某本不存在的书是谁写的?

它可能给你编出作者、出版年份甚至 ISBN。

而且语气非常确定。

这就是 AI 最典型的问题之一:

它生成的是“最像正确答案的内容”,不天然等于事实。

所以涉及医疗、法律、数据、新闻、论文等内容,最好查来源。

09|AI Agent:从“回答问题”变成“帮你做事”

这是最近两年最重要的概念之一。

普通 Chat AI 的模式是:

你问 ↓ AI 回答

Agent 的模式更像:

你给一个目标 ↓ AI 判断怎么做 ↓ 调用工具 ↓ 检查结果 ↓ 继续执行 ↓ 完成任务

比如你说:帮我找出这个项目为什么部署失败,并修好。

普通 AI 可能告诉你几个可能原因。

Agent 则可能直接:

读代码 → 看日志 → 找 Bug → 改文件 → 测试 → 再检查。

这就是最大的区别。

Chat AI 是“给答案”,Agent 是“做事情”。

10|Tool Calling:AI 开始会“用工具”

模型本身其实做不了很多事情。

它不能凭空:

  • 查询实时天气
  • 打开你的 Gmail
  • 修改 GitHub
  • 操作数据库
  • 执行代码

所以要给 AI 配工具。

例如:

AI │ ├─ 搜索工具 ├─ 浏览器 ├─ Python ├─ Gmail └─ GitHub

AI 根据任务判断:现在应该调用哪个工具?

这就叫 Tool Calling。

它是 Agent 能真正“做事”的基础。

11|Computer Use:AI 直接操作电脑

以前 AI 想操作一个软件,通常需要软件提供 API。

Computer Use 更直接:AI直接看屏幕,然后像人一样点鼠标、输入文字、操作网页。

例如:

看到登录按钮 ↓ 点击 ↓ 填写表单 ↓ 下一步 ↓ 读取页面内容

理论上,只要人能通过界面完成的操作,AI 都有可能通过这种方式完成。

12|Coding Agent:会自己干活的“AI 程序员”

Cursor、Claude Code、Codex 这类产品经常会涉及这个概念。

普通 AI Coding:

帮我写一个登录组件,它给你一段代码。

Coding Agent:

帮我给这个项目加上登录功能,然后它可能自己:

读整个项目 ↓ 找到相关文件 ↓ 修改代码 ↓ 运行程序 ↓ 发现报错 ↓ 继续修改 ↓ 测试

所以 Coding Agent 和“AI 帮你补全几行代码”已经不是一回事。

13|MCP:AI 世界的“通用插座”

MCP = Model Context Protocol。

先想象一个问题:AI 想连接 GitHub、数据库、Notion、文件系统……

以前每个工具可能都要单独适配,MCP 想做的事情就是制定一个统一标准。

你可以把它理解成:USB-C

以前:

AI - 特殊接口 - GitHub AI - 另一套接口 - 数据库 AI - 又一套接口 - Notion

有 MCP 后:

              ┌─ GitHub

AI ─ MCP |——数据库 |——文件 └─ 其他工具

所以 MCP 不是某个具体 AI 工具,它是一套让 AI 连接外部工具和数据的协议。

14|Skill:教 Agent “这件事应该怎么做”

Skill 可以理解成:给 Agent 的专业操作手册。

比如 Agent 本来会 GitHub,但它不一定知道你希望怎么处理 Pull Request。

于是可以给它一个 Skill:

收到 PR ↓ 先检查评论 ↓ 找出需要修改的地方 ↓ 修改代码 ↓ 运行测试 ↓ 检查结果 ↓ 提交

所以 Skill 解决的不是AI 能不能使用 GitHub?

而是AI 知不知道应该按照什么流程使用 GitHub?

一句话:Tool 给它手脚,Skill 教它怎么干活。

15|Harness:把模型真正变成 Agent 的“整套装备”

Harness 这个词最近也越来越常见。

如果说:LLM 是发动机。

那 Harness 就是围绕发动机装上的:

  • 方向盘
  • 刹车
  • 仪表盘
  • 变速箱
  • 控制系统

比如一个 Coding Agent 的 Harness 可能负责:

给模型读取文件 允许模型执行命令 管理上下文 调用工具 记录任务状态 处理错误 检查结果 继续下一步

所以同一个模型,放进不同 Harness 里,实际体验可能差非常多。

这也是为什么:“这个 Agent 很强”不一定只是模型强。

16|Context Engineering:别只研究“怎么问”,开始研究“给 AI 看什么”

Prompt Engineering 研究的是:这句话应该怎么写?

Context Engineering 研究的是:AI 干这个任务之前,到底应该给它哪些信息?

比如一个 Coding Agent 工作时,你可能要给它:

项目代码 + 产品需求 + 设计规范 + 历史修改记录 + Skill + 工具 + 用户偏好

这整套信息怎么组织,就是 Context Engineering。

Agent 越复杂,这件事越重要。

17|RAG:先查资料,再回答

RAG = Retrieval-Augmented Generation。

名字很吓人,原理其实很简单。

普通 AI:

你问问题 ↓ AI 靠自己脑子回答

RAG:

你问问题 ↓ 先去资料库搜索 ↓ 找到相关内容 ↓ 把资料交给 AI ↓ AI 根据资料回答

所以企业知识库、文档问答,经常会用到 RAG。核心是需要的时候先找出来,再给它看。

18|API:让程序调用 AI

你在 ChatGPT App 里聊天,是“人调用 AI”。

API 则主要是程序调用 AI。

比如你做了一个翻译 App:

用户输入一句话 ↓ 你的 App ↓ 调用 GPT API ↓ GPT 返回翻译 ↓ 展示给用户

所以开发 AI 产品时,API 是最常见的基础设施之一。

19|CLI:在终端里用命令操作软件

CLI = Command Line Interface。

比如:

git status npm install vercel deploy

这些不是在软件界面里点按钮,是在 Terminal 里输入命令。

所以Terminal 是那个黑窗口,CLI 是你在里面调用的命令行工具。

现在 Coding Agent 很喜欢 CLI,因为相比到处点按钮,命令更容易被 AI 自动执行。

20|Vibe Coding:你说需求,AI 大量写代码

这是近一年非常火的一个词。

传统开发:

人设计 ↓ 人写代码 ↓ 人调试

Vibe Coding 更像:

你:这里做一个登录页 AI:写代码 你:太丑了,改简单一点 AI:继续改 你:按钮点不了 AI:修 Bug

人越来越关注:“我要什么结果?”而不是“这一行代码应该怎么写?”

但 Vibe Coding 不等于完全不用懂产品和技术。

项目越复杂,人越需要负责:

  • 定义需求
  • 判断方案
  • 控制质量
  • 验收结果

最后把这些词串起来,其实这 20 个词不是互相独立的。可以把今天的 AI 系统理解成这样:

插图

而最底层负责理解、推理和生成内容的,还是LLM。

所以最近两年的 AI 变化,可以概括成一句话:以前大家研究怎么跟 AI 聊天,现在大家开始研究怎么让 AI 真正干活。

READ NEXT / 下一篇看房、签约、入住、退租,给独居者的一份租房指南2026.08.10