主题
大语言模型是什么
从 2022 年底开始,"大语言模型"(LLM,Large Language Model)成了几乎所有 AI 产品的底座。ChatGPT、Claude、Gemini,以及 Claude Code、Cursor 这类编程工具,背后都是同一种技术在驱动。这一篇用最少的术语,把它的工作原理讲清楚。
1. 一个类比:超级自动补全
大语言模型本质上做的事情只有一件:根据前文,预测下一个字(词)出现的概率。
你在手机上打字时见过自动补全——输入"天气真",键盘会建议"不错"。大语言模型就是这个能力的极端放大版:它在互联网规模的海量文本上训练,见过几万亿字的搭配规律,所以能接得又长又通顺。
- 你说:"写一首关于秋天的短诗。"
- 模型做的事:一个字一个字地接续,每接一个字都重新判断"下一个字应该是什么"。
这个原理听起来简单,但"读遍天下文章后学会的接龙",已经足以完成翻译、写代码、总结文档、逻辑推理——因为这些能力本质上都是某种"接续"。
2. Token:模型眼中的文字
模型不认识"汉字"或"单词",它处理的是 Token(词元)——把文本切分后的最小单位。一个英文单词可能是一个 token,也可能被切开;中文通常是 1~2 个字一个 token。
理解 token 有两个实际意义:
2.1 计费与限速按 token 计算
API 服务(包括 STJAPI 这类中转平台)的用量和价格都按 token 计。粗略估算:
text
1 个英文单词 ≈ 1.3 个 token
1 个汉字 ≈ 1~2 个 token
1000 token ≈ 750 个英文单词 ≈ 500~700 个汉字2.2 上下文窗口以 token 为限
模型一次"能记住多少内容"由上下文窗口(Context Window)决定,单位也是 token。比如一个 128K 的窗口,大约能容纳一本 20 万字的小说。超出窗口的内容,模型就"看不见"了——这就是为什么超长对话里模型会"忘事"。
3. 上下文窗口:模型的短期记忆
和模型对话时,真正被处理的只有当前窗口里的内容。理解这一点,能解释很多常见现象:
| 现象 | 原因 |
|---|---|
| 长对话后模型忘了开头的要求 | 早期内容被截断或压缩,移出了窗口 |
| 让模型"总结这篇 300 页 PDF"失败 | 文档 token 数超过了窗口上限 |
| 新开一个对话,模型不记得上次说过什么 | 对话之间不共享记忆,记忆只能由你带进上下文 |
所以和 AI 协作的好习惯是:关键约束(目标、格式、限制条件)在每次任务开头都重申一遍,不要指望它"记得上次说的"。
4. 训练与推理:学会和作答
模型的生命周期分两个阶段,普通人接触到的都是第二个。
4.1 训练(Training)
训练就是"读遍天下文章"的过程。在数十亿参数(可以理解为模型内部的旋钮)上反复调整,直到预测下一个 token 的准确率足够高。这一步成本极高,由 AI 公司完成,普通用户不会参与。
4.2 推理(Inference)
推理是"你提问、模型作答"的过程,也就是你日常使用 AI 的每一秒。推理成本按 token 计费,生成越多、窗口越大,消耗越大。STJAPI 这类平台做的就是把各家的推理能力聚合成统一的 API,方便在不同客户端之间切换。
5. 模型的局限:为什么它会"一本正经地胡说"
基于"概率接龙"的原理,有三个局限需要始终记住:
- 幻觉(Hallucination):模型会编造看似合理但不存在的事实,比如虚构的论文、API 参数。越是冷门的事实,越要验证。
- 知识截止(Knowledge Cutoff):模型的知识停留在训练数据的时间点,问它"最新版本是多少"很可能过时。
- 不会真算:它擅长"像会算的样子写出来",复杂数学或精确计数时最好让它写代码来算,而不是直接心算。
理解了这些局限,你就知道:AI 是强大的助手,但不是可以免检的权威。这也是后面《提示词入门》和《Agent 与 MCP》要解决的问题——用更好的提问方式减少幻觉,用工具让 AI 接触真实数据。
6. 两个实用参数:温度与推理力度
调用 API 或配置客户端时,最常见的两个参数值得弄懂:
6.1 温度(Temperature)
控制输出随机性:温度越低,模型越倾向选概率最高的词,输出稳定保守;温度越高,输出越发散、更有"创意",也更容易跑偏。
text
写代码、抽取数据、格式转换:温度调低(0 ~ 0.3)
头脑风暴、起名、写文案:温度调高(0.7 ~ 1.0)日常编程工具通常已替你选好默认值,不必频繁调整;但当你发现"回答每次都不一样、格式不稳定"时,温度是第一个该检查的参数。
6.2 推理力度(Reasoning Effort)
推理模型在回答前会先"内部思考",思考越长越深入,但也越慢、越贵。多数客户端允许按任务调节:
| 任务类型 | 建议力度 |
|---|---|
| 改错别字、简单问答、格式化 | 低,省时间省钱 |
| 常规功能开发、Bug 定位 | 中,多数场景的最优解 |
| 复杂架构设计、疑难 Bug、数学证明 | 高,用慢换对 |
原则是按难度分配:别用最高档位干最简单的活,也别指望低档位啃硬骨头。更多成本控制思路见《效率与省钱技巧》。
7. 模型那么多,怎么选
GPT、Claude、Gemini、DeepSeek、Qwen……新模型发布速度远超学习速度。好消息是:选模型的判断框架是稳定的。
- 先定任务,再定模型。写代码、长文档分析、多语言、图像理解,各自有擅长的模型,没有全能冠军。
- 看窗口,不止看参数。处理长文档时,上下文窗口大小比"模型有多大"更直接影响体验。
- 小步实测。用你自己的一两个真实任务跑一遍对比,比任何榜单都可靠。
具体的模型家族对比、选型决策表和"哪个场景用哪个"的速查,见《主流模型对比与选型》。
在真实任务里如何系统性地对抗幻觉(交叉验证、溯源、分级信任),见《从零到驾驭 AI:成长路径》第二阶段;遇到没见过的术语,查《AI 术语速查表》。
想知道"预测下一个词"内部到底发生了什么——注意力怎么算、知识存在哪、幻觉为什么是机制必然——继续读《Transformer 与注意力机制剖析》。
8. 三个 5 分钟小实验
原理读完,用任何一个聊天助手(网页版就够)花 15 分钟亲手验证本篇的三个关键结论:
8.1 看见"概率接龙"
text
给一家手冲咖啡店起 5 个店名,要求风格各不相同。同一个问题连发三次,三次结果都不一样——模型是按概率"接"下一个词,每次采样路径不同。这就是 6.1 节温度参数的来源:把温度调低再试,三次结果会明显趋同。
8.2 它认识 token,不认识字母
text
"strawberry" 这个单词里有几个字母 r?不少模型会答错或迟疑——它看到的是 token,不是 r 这个字符(第 2 节)。接着补一句"用 Python 写一行代码数一下",它马上答对。这正是第 5 节"不会真算"的现场版:让模型写代码算,比让它直接心算可靠。
8.3 亲眼抓一次幻觉
text
推荐三篇关于"远程办公对中层管理者影响"的学术论文,给出作者、年份和期刊。把拿到的清单逐条去搜索引擎核对:有的论文不存在,有的作者或年份对不上。这就是第 5 节说的幻觉——接龙机制只保证"像",不保证"真",所以关键结论必须外部验证。
三个实验分别对应本篇的三句话总结:输出是概率采样,处理单位是 token,生成内容要外部验证。