主题
AI 术语速查表
读文档、看更新日志时最常见的术语,按使用场景分成三组。每条尽量一句话说清,配合前面的文章深入理解。
1. 模型层:模型是什么、怎么来的
| 术语 | 一句话解释 |
|---|---|
| LLM(大语言模型) | 通过预测下一个词训练出来的通用文本模型,如 GPT、Claude、Gemini 系列 |
| 多模态(Multimodal) | 能同时理解文字以外的图像、音频、视频的模型 |
| 推理模型(Reasoning Model) | 回答前先"内部思考"一段再输出的模型,擅长数学、代码、复杂决策,如 o 系列 |
| Token(词元) | 模型处理文本的最小单位,计费和上下文长度都按它算 |
| 参数(Parameter) | 模型内部的"旋钮"数量,通常越多能力越强、成本越高 |
| 上下文窗口(Context Window) | 模型一次能"看见"的最大 token 数,超出就记不住 |
| 训练(Training) | 用海量数据调整模型参数的过程,由 AI 公司完成 |
| 微调(Fine-tuning) | 在已有模型上用特定数据继续训练,让它更适配某个领域 |
| 蒸馏(Distillation) | 用大模型的输出训练小模型,让小模型便宜且够用 |
| 开源/开放权重(Open Weights) | 模型参数可以下载本地部署,如 Llama、Qwen、DeepSeek |
2. 使用层:日常对话和提示词
| 术语 | 一句话解释 |
|---|---|
| 提示词(Prompt) | 你发给 AI 的完整输入,质量直接决定回答质量 |
| 系统提示词(System Prompt) | 应用在后台预置的隐藏指令,定义 AI 的角色和规矩 |
| 幻觉(Hallucination) | 模型编造看似合理但不存在的内容,冷门事实务必验证 |
| 知识截止(Knowledge Cutoff) | 模型知识的时间边界,之后的更新它不知道 |
| Few-shot(少样本) | 在提示词里给几个输入输出示例,让模型照着模仿 |
| 温度(Temperature) | 控制输出随机性的参数,越低越稳定、越高越发散 |
| 流式输出(Streaming) | 逐字实时显示回答,而不是等全部生成完再显示 |
3. 进阶层:Agent 与应用架构
| 术语 | 一句话解释 |
|---|---|
| Agent(智能体) | 能自主调用工具、多步执行任务的 AI 系统 |
| 工具调用(Tool Calling) | 模型输出结构化指令,让外部程序替它执行操作 |
| MCP(模型上下文协议) | 连接 AI 应用与外部工具的开放标准,相当于工具的 USB 接口 |
| RAG(检索增强生成) | 先从资料库检索相关内容,再让模型基于检索结果回答,减少幻觉 |
| 嵌入(Embedding) | 把文本变成一串数字向量,使"语义相近"可以用距离计算,是搜索和 RAG 的基础 |
| Vibe Coding | 以自然语言描述需求、由 AI 生成代码为主的编程方式 |
| 视觉语言模型(VLM) | 能看懂截图、图表并回答问题的模型,编程工具常用它分析界面 |
4. 工程层:把模型变成可靠服务
开始搭建自己的 AI 应用或批量任务时,会遇到这一层术语。
| 术语 | 一句话解释 |
|---|---|
| API 网关 | 统一管理多个模型通道的中间层,负责路由、鉴权、计费与限流 |
| 负载均衡 | 把请求分摊到多条通道或多个实例上,避免单点过载 |
| 限流(Rate Limit) | 服务端对请求频率和并发数的限制,触发时返回 429 |
| 重试与退避(Backoff) | 请求失败后等待一段时间再重试,等待时间逐次加长 |
| 回退(Fallback) | 主模型不可用时自动切换到备用模型或通道 |
| 护栏(Guardrail) | 在输入输出两侧加的自动检查,拦截敏感内容或危险操作 |
| 评测集(Eval Set) | 一组带标准答案或评分标准的测试样本,用来量化模型表现 |
| 观测(Observability) | 记录请求、延迟、token 用量和失败原因,让问题可回溯 |
| 重排(Rerank) | 在检索结果上用专用模型二次排序,提高相关性 |
| 混合检索 | 关键词检索与向量检索结合,兼顾精确匹配和语义相似 |
| 上下文工程 | 有策略地决定"哪些信息进入窗口":选材、压缩、排序与持久化 |
5. 使用建议
- 不必背表。用到时回来查,读三次自然就记住了。
- 遇到新名词,先判断它属于哪一层:模型能力、使用技巧,还是应用架构——层次对了,理解就不会偏。
- 术语会过时,原理不会。token、上下文窗口、工具调用这些底层概念的生命周期,远长于任何产品名。