主题
原理深潜
《认识 AI》告诉你"是什么"和"怎么用",这一板块回答**"为什么"和"怎么实现的"**。三篇文章各配伪代码、机制推论和"现象 → 机制 → 对策"对照表——目标是让你读技术报告不再发怵,做生产排障能沿原理缩小搜索空间。
阅读前提
不需要数学背景,但建议先读完《大语言模型是什么》和《模型、API 与客户端》建立基本词汇。
1. 三篇的分工
| 文章 | 回答的核心问题 | 你将能解释的现象 |
|---|---|---|
| LLM 推理全链路 | 从按下回车到第一个字,每步在算什么? | 为什么 prompt 长则首字慢、长会话费用线性涨、temperature=0 不保证逐字复现 |
| Transformer 与注意力 | "预测下一个词"内部发生了什么? | 注意力的 QKV 是什么、知识存在哪、幻觉为什么是机制必然 |
| Embedding 与向量检索 | "语义相似"如何变成毫秒级检索? | 相似≠相关、HNSW 原理、为什么必须混合检索与重排 |
2. 建议阅读顺序
按依赖关系排的路线:
- LLM 推理全链路 —— 起点。Tokenizer → Embedding → Prefill/Decode → KV Cache → 采样,一条链路串起所有工程现象;
- Transformer 与注意力 —— 下钻推理链路里每层在做的两件事(注意力通信 + MLP 加工),把"上下文窗口""幻觉""参数量"落到机制;
- Embedding 与向量检索 —— 独立支线,RAG 的数学与索引基础,与《RAG 检索增强工程》互为表里。
赶时间的话,读第一篇就能拿到最高性价比:它直接解释你每天看到的延迟、费用与稳定性现象。
3. 与应用文章的映射
| 应用文章遇到的问题 | 到深潜哪篇找答案 |
|---|---|
| 《大模型缓存是什么》三层缓存的区别 | 推理全链路 §4.3 |
| 《提示词入门》为什么温度影响稳定性 | 推理全链路 §5 |
| 《生产级 AI 应用架构》为什么结构化输出更可靠 | 推理全链路 §5 |
| 《RAG 检索增强工程》为什么切分策略决定上限 | Embedding 与向量检索 §2 |
| 《Agent 与 MCP》为什么幻觉只能抑制不能消除 | Transformer 与注意力 §6 |
从《AI 应用开发》或《Agent 工程》过来的人,建议把这一板块当作"第 2.5 层":应用层卡住时回来查机制,机制层读完回应用层找用武之地。