AI 概念一眼懂
AI 概念一眼懂
聊 AI 时满天飞的名词——大模型、token、prompt、Agent、MCP、Skill、Harness……听着高深,其实都能用大白话讲明白。这一篇让你一眼看懂全部 AI 概念,以后别人聊 AI,你全能接得住。
怎么读
不用背。像看科普一样扫一遍,心里有个印象即可。真正用到某个概念时(比如你要接 API、要配 Agent),再回来细看对应那一段。
一、最核心的三个词
大模型(LLM):一个读过全网的「超级文科生」
大模型全称「大语言模型(Large Language Model,LLM)」,就是 ChatGPT、Claude、DeepSeek 这些背后的东西。
💡 比喻: 大模型像一个读遍了全世界书和网页的超级文科生。你问它什么,它凭「读过的海量文字」猜出最合理的回答。注意——它是「猜」出来的,不是「查」出来的,所以偶尔会一本正经地胡说(这叫「幻觉」)。
它的核心工作其实特别朴素:根据你给的一段文字,接着往下写。 你说「今天天气真」,它接「好」。把这件事做到极致,就成了能聊天、能写代码的 AI。
Token:AI 眼里的「字」,也是计费单位
AI 不是一个字一个字读,而是把文字切成一小块一小块,每块叫一个 token。
💡 比喻: token 像乐高积木块。一句话被拆成若干积木,AI 一块一块地读、一块一块地拼出回答。
- 粗略记:1 个中文字 ≈ 1~2 个 token,1 个英文单词 ≈ 1 个 token。
- 为什么你要关心它? 因为 AI 服务按 token 收费(输入 + 输出一起算),而且模型一次能处理的 token 有上限。
Prompt:你给 AI 下的「指令」
Prompt(提示词) 就是你发给 AI 的那段话——你的问题、你的要求、你贴的代码,全算 prompt。
💡 比喻: prompt 像给外包的需求文档。写得清楚(背景+目标+要求),对方交付得好;写得含糊("随便做个网站"),交付得也含糊。
「提示词工程(Prompt Engineering)」听着玄乎,本质就是「把需求说清楚的手艺」。怎么把 prompt 写好,用 AI 开发 那篇有专门讲。
二、AI 的「记性」和「脾气」
上下文窗口(Context Window):AI 的「短期记忆」
模型一次对话能「看到」的文字总量(token 数)有上限,这个上限叫上下文窗口。
💡 比喻: 像一张办公桌的大小。桌子(窗口)越大,能同时摊开的资料越多。资料太多桌子放不下时,早先的就被挤下桌——所以聊太久,AI 会「忘记」开头说过的话。
这也解释了为什么 AI「没有长期记忆」:关掉对话,桌子清空,下次从零开始。怎么给 AI 装「长期记忆」,看 AI 记忆体系。
System Prompt:给 AI 定「人设」和「规矩」
System Prompt(系统提示词) 是一段隐藏在最前面的指令,规定 AI 扮演什么角色、遵守什么规则。你平时聊天看不到它,但它一直在起作用。
💡 比喻: 像员工的岗位说明书。「你是一名耐心的编程老师,只用中文、多用比喻回答」——这就是 system prompt,它定调整段对话。
Temperature:AI 的「脑洞大小」
一个能调的参数,控制 AI 回答的「随机/发散」程度。
- 低(如 0.2):稳重、可预测,适合写代码、算数。
- 高(如 0.9):天马行空,适合写诗、起名、头脑风暴。
💡 比喻: 像咖啡的浓淡。淡一点清醒规矩,浓一点亢奋跳脱。
三、两大「接口格式」:OpenAI 格式 vs Claude 格式
当你想用代码调用 AI(而不是网页聊天)时,就要按它规定的「格式」发请求。目前有两大主流格式,很多国产模型也兼容它们。
什么是「格式」
💡 比喻: 像填快递单。你要寄东西,得按快递公司的单子填「寄件人、收件人、内容」。调 AI 也一样,得按它的格式把「对话内容」打包好发过去。
OpenAI 格式(事实标准)
OpenAI 的 Chat Completions 接口格式流传最广,大量模型和工具都兼容它,可以说是行业普通话。
Claude 格式(Anthropic)
Claude 是 Anthropic 公司的模型,它的接口(Messages API)思路几乎一样,也是 messages + 角色,但有些细节不同。
核心是一个 messages 数组,每条消息有个「角色」,system 放在 messages 数组里:
{
"model": "gpt-4o",
"messages": [
{ "role": "system", "content": "你是一名编程老师" },
{ "role": "user", "content": "什么是变量?" },
{ "role": "assistant", "content": "变量就是一个贴了标签的盒子……" }
]
}同样 messages + 角色,但 system 单独一个字段,不放 messages 数组:
{
"model": "claude-sonnet-4",
"system": "你是一名编程老师",
"messages": [
{ "role": "user", "content": "什么是变量?" },
{ "role": "assistant", "content": "变量就是一个贴了标签的盒子……" }
]
}三个角色一看就懂:
| 角色 | 是谁 | 大白话 |
|---|---|---|
system | 系统 | 定规矩、定人设(岗位说明书) |
user | 你 | 用户说的话、提的问题 |
assistant | AI | AI 的回答 |
多轮对话就是把「你问、AI 答、你再问」一条条塞进这个数组里发过去。
你需要记住的
两种格式大同小异,都是「system 定规矩 + user/assistant 你来我往」。新手不用纠结细节:用哪个模型就查哪个的文档,或者直接让 AI 帮你写调用代码。知道「有这两大格式、很多东西兼容 OpenAI 格式」就够了。
四、让 AI「会干活」的进阶概念
前面的 AI 只会「聊天回文字」。要让它真正帮你办事(查数据、发邮件、改代码),就有了下面这些概念。
Function Calling / Tools:给 AI 配「工具」
模型本身只会输出文字,不会真的上网、不会真的查数据库。Function Calling(工具调用) 就是给它配一套「工具」,让它能说「我要用这个工具」,由外部程序去执行,再把结果喂回给它。
💡 比喻: AI 是个聪明但手脚被绑住的军师。给它配几个「跑腿的」(工具:查天气、查数据库、发消息)。军师说「去查下北京天气」,跑腿的去查完回来报告,军师再据此给你答复。
Agent(智能体):能自己规划、自己动手的 AI
Agent = 大模型 + 工具 + 「自己想步骤」的能力。你给它一个目标,它自己拆解成步骤、自己选工具、一步步做,中间根据结果调整,直到完成。
💡 比喻: 普通 AI 像问一句答一句的顾问;Agent 像你雇的一个助理——你说「帮我订下周去上海的高铁并安排酒店」,它自己查车次、比价、下单、订房,全程不用你一步步指挥。
编程里的 AI 工具(如 opencode)就是一种 Agent:你说「修复这个 bug」,它自己去读代码、定位、改文件、跑测试、看结果、接着修。
MCP(模型上下文协议):AI 世界的「USB 接口」
MCP(Model Context Protocol) 是一个开放标准,规定了「AI 和外部工具/数据源之间怎么对接」。有了它,各种工具能以统一方式插到 AI 上。
💡 比喻: MCP 像 USB 接口标准。以前每个设备一个专用插头,乱七八糟;有了 USB,鼠标、键盘、U 盘统统一个口插上就能用。MCP 让「数据库、文件系统、GitHub、你自己的服务」都能用同一种方式接到 AI 上,AI 插上就会用。
你可以把 MCP 理解为「给 Agent 用的标准化工具插座」。想让 AI 会操作某个东西,就给它接一个对应的 MCP(服务器)。
Skill(技能):打包好的「专项本领」
Skill 是把「某类任务的做法、步骤、参考资料」打包成一个模块,需要时加载给 AI,让它瞬间「学会」干这件事。
💡 比喻: 像游戏角色的技能卡,或者《黑客帝国》里「一秒学会功夫」。平时不占脑容量,遇到「做 PPT」的活,就加载「做 PPT 技能」,AI 立刻知道该怎么一步步做。
Skill 和 MCP 的区别:MCP 偏向「给 AI 一个能调用的工具/接口」,Skill 偏向「教 AI 一套做事的方法和流程」。
Harness(脚手架/外壳):把 AI 装进「驾驶舱」
Harness 指包在大模型外面的那层「工程外壳」——负责管理对话、调度工具、维护记忆、和界面对接。你用的 ChatGPT、opencode 这些「产品」,本质都是「大模型 + 一层 harness」。
💡 比喻: 大模型是发动机,harness 是整辆车(方向盘、油门、仪表盘、座椅)。光有发动机你没法开,套上车壳才好用。同一台发动机,装进不同的车壳(harness),就成了不同的产品。
五、其它常听到的名词(扫一眼即可)
| 名词 | 一句话大白话 |
|---|---|
| RAG(检索增强) | 先去资料库里搜相关内容,再连同问题一起喂给 AI,让它「开卷考试」,答得更准、更少胡说 |
| Embedding(向量) | 把文字变成一串数字,让电脑能算「两段话意思像不像」,是 RAG 搜索的基础 |
| 向量数据库 | 专门存 embedding、做「语义搜索」的数据库,RAG 的仓库 |
| Fine-tuning(微调) | 拿你自己的数据再训练一下模型,让它更懂某个专门领域(成本高,新手基本用不到) |
| 多模态 | 不只懂文字,还能看图、听声音、看视频的模型 |
| 幻觉(Hallucination) | AI 一本正经地编造不存在的事实/函数,用 AI 时要警惕它 |
| 推理模型 | 回答前会先「想一想、打草稿」的模型,擅长数学、逻辑、复杂编程 |
| 蒸馏(Distillation) | 用大模型当老师,教出一个又小又快的学生模型 |
| 参数量(如 7B、70B) | 模型的「脑细胞数量」,B=十亿。通常越大越聪明,但也越慢越贵 |
| 开源模型 / 闭源模型 | 开源(如很多本地可跑的模型)能自己下载部署;闭源(如 GPT、Claude)只能通过官方接口用 |
一张图串起来
把上面的概念连起来,一个「会干活的 AI 产品」长这样:
看懂这张图,你就把 AI 的骨架摸清了。
什么才算合格
合格标准
- 能用大白话向别人解释:大模型、token、prompt 分别是什么。
- 知道 OpenAI 格式和 Claude 格式的共同点(system + user/assistant),以及「很多东西兼容 OpenAI 格式」。
- 能说清 Agent 和普通聊天 AI 的区别(自己规划、自己动手)。
- 能用一句话解释 MCP(AI 的 USB 插座)、Skill(技能卡)、Harness(车壳)各是干嘛的。
- 听到「幻觉、RAG、上下文窗口」这些词不再懵。
概念清了,下一步就是真正用起来:用 AI 开发。