主题
2026 主流模型横评
⏳ 本页刻意分两层写:方法论与阵营框架(第 1、2、5、6 章)长期有效;具体型号与价格全部集中在 第 3 章「型号快照」,最后核对于 2026 年 9 月 20 日。使用前请以官方页面为准。
结论先行:2026 年选模型,比的不再只是"谁分数高",而是"在你的场景里、你的预算下、接入是否方便"。 前沿闭源模型差距已很小,开源与国产模型在成本和中文上极具竞争力。本文先给你一套可复用的"分层评估"方法论,再给五大阵营框架、一张集中管理的型号快照、分场景选型指南和"主力 + 备用"极简配置。
基础概念(什么是模型、Token、上下文窗口)见 《什么是大语言模型》;更系统的对比维度见 《模型对比》;怎么用代码调用见 《模型 API 客户端》。
1. 不要只比"谁更强":分层评估方法论
很多人打开评测榜,看谁第一就用谁——这是 2024 年的思路。2026 年要把"模型"拆成三层来看,因为每一层影响你的实际体验,且彼此独立。这一层方法论不随版本过期。
1.1 模型层:底座能力
模型层指模型本身的"智力":推理、编程、写作、多模态、长上下文。这一层看榜单(如编程基准、综合推理榜),但它只决定"上限"。
- 关注点:推理深度、代码能力、写作质感、上下文长度、多模态支持。
- 局限:分数高 ≠ 你好用。你接不进去、用不起,分数再高也无关。
1.2 产品层:你能摸到的样子
同一底座,包装成不同产品,体验天差地别:
- 对话产品(ChatGPT / Claude 网页版 / 通义 / 智谱清言)的界面、记忆、文件上传、联网能力;
- 是否支持"项目/长期记忆"(如 OpenClaw 这类"养龙虾"式长期养成助手);
- 是否有工作流、定时任务、团队协作等附加能力。
产品层决定"你每天用起来顺不顺手"。
1.3 接入层:你能不能把它接进自己的系统
这是 2026 年最常被忽略、却最关键的一层:
- 有没有 OpenAI 兼容的 API(绝大多数中转/聚合平台都兼容,接入成本最低);
- 是否支持 MCP 等工具调用标准,方便 Agent 接外部工具(见 《Agent 与 MCP》);
- 速率限制、稳定性、合规与数据出境要求。
口诀:模型层看上限,产品层看体验,接入层看能不能用。 三层都过关,才是你的"真命模型"。
2. 五大阵营:长期有效的选型框架
具体型号年年换,但阵营格局是稳定的:每个阵营有固定的角色、优势场景和短板。先记住框架,再去快照里查"这个角色当前是谁"。
2.1 闭源前沿阵营(能力天花板)
- 角色:综合能力与生态的上限,复杂任务的保底选择。
- 什么时候选它:关键任务、复杂推理、重度编程与 Agent、不能翻车的交付。
- 典型短板:价格最高;数据合规要求高的场景需评估。
- 价格量级:基准 1×(最贵)。
2.2 开源/高性价比阵营(便宜能打)
- 角色:能力距闭源前沿约 10~15 分,价格却低 10~30 倍,还可自部署。
- 什么时候选它:批量任务、成本敏感业务、隐私要求高的本地部署。
- 典型短板:顶尖能力略逊;自部署有硬件门槛。
- 价格量级:≈0.03×(约为闭源旗舰的 1/30)。
2.3 中国模型阵营(本土化最强)
- 角色:中文理解与本土化合规最优,尺寸覆盖从端侧到云端。
- 什么时候选它:中文业务、国内合规要求、需要全家桶尺寸的场景。
- 典型短板:全球开发者生态弱于闭源前沿。
- 价格量级:中低(约 0.3~0.6×)。
2.4 实时数据阵营(特殊补给)
- 角色:绑定实时社媒数据,做舆情、热点追踪。
- 什么时候选它:需要最新社媒信号的任务。
- 典型短板:通用性一般,不适合当主力。
2.5 多模态生成工具(不是对话底座)
可灵、即梦、Veo、Midjourney 这类严格说是"生成工具"而非"对话底座",按张/秒计费,归入 创作栏目 更合适。本篇聚焦对话/推理底座。
2.6 阵营总览速查
| 阵营 | 角色 | 什么时候选它 | 主要短板 | 价格量级 |
|---|---|---|---|---|
| 闭源前沿 | 能力天花板、生态全 | 关键任务、复杂交付 | 贵 | 高(1×) |
| 开源性价比 | 便宜 10~30 倍、可自部署 | 批量任务、隐私场景 | 顶尖能力略逊 | 极低(≈0.03×) |
| 中国模型 | 中文强、合规好 | 中文业务、国内场景 | 全球生态弱 | 中低 |
| 实时数据 | 实时社媒信号 | 舆情、热点追踪 | 通用性一般 | 中 |
| 多模态生成 | 图文视频产能 | 创作物料 | 非对话底座 | 按张/秒计 |
3. 型号快照(会过期,最后核对 2026-09-20)
本页所有具体型号名集中在这一张表。 新版本发布后只需更新这里,其余章节不用动。看这张表之前先看核对日期——超过三个月就该按 3.1 的方法 自查一遍。
| 阵营 | 角色 | 当前代表型号 | 核对备注 |
|---|---|---|---|
| 闭源前沿 | 综合旗舰 | OpenAI GPT-5.6(Sol/Terra/Luna 三档) | 2026-06 发布,生态最大 |
| 闭源前沿 | 编程/写作标杆 | Anthropic Claude Opus 4.8 / Sonnet 5 | Sonnet 5 是 Agent 工作流主力款 |
| 闭源前沿 | 长上下文 + 闭源性价比 | Google Gemini 3.1 Pro | 1M~2M 上下文,输入价约为旗舰一半 |
| 开源性价比 | 开源之王 | DeepSeek V4 系列 | 2026-09-10 发布 V4.1 Flash 并降价,V4 Pro 流量自动切换 |
| 开源性价比 | 本地低延迟 | Meta Llama 4 Scout | 优化硬件上可达数千 token/s |
| 中国阵营 | 中文全能 | 阿里 Qwen3 系列 | 2026-08-26 上新 Qwen3.8-Flash,尺寸覆盖端侧到云端 |
| 中国阵营 | 中文开源 | 智谱 GLM-5 系列 | 2026-08-27 上线并开源 GLM-5.3-Flash |
| 实时数据 | 社媒实时 | xAI Grok 4 | 差异化在实时 X 平台数据 |
这张表本身就是"型号会过期"的最好证明:快照核对于 2026-09-20,而表中的 DeepSeek V4.1 Flash 发布于 9 月 10 日——本页写完不到两周,旧条目已经过时一次了。
3.1 如何 10 分钟核实最新格局
- 价格:各厂商官方定价页(OpenAI / Anthropic / Google / DeepSeek / 阿里 / 智谱)——价格只信官方;
- 能力排名:LMArena(真人偏好投票)、Artificial Analysis(质量/速度/价格横评);
- 可接入性与横向比价:OpenRouter 等聚合平台的模型列表——能直接看到哪些模型可接、什么价;
- 发布动态:厂商官网新闻与官方公众号。
原则:凡是要写进自己 SOP 或工作流的型号名,先在上面至少一个来源核对一遍。 只用于日常对话则不必频繁核对,按 第 6 章 的三个月复盘节奏即可。
4. 分场景选型指南
场景映射的是"角色",具体型号去 §3 快照 查。
4.1 编程开发
- 首选:编程标杆角色(Claude 系列长期占据此位)。
- 省钱备选:开源之王角色练手与批量;国产阵营部分基准也能打。
- 工具接入见 《编程工具》 与 《模型 API 客户端》。
4.2 写作与长文
- 首选:编程标杆角色的旗舰款(写作质感标杆)或综合旗舰。
- 要点:需要"文风一致 + 结构清晰"选前者;需要"脑暴 + 多轮改写"选生态更顺的后者。
4.3 长文档处理
- 首选:长上下文角色(1M~2M 上下文,几百页 PDF 直接喂)。
- 备选:编程标杆角色(200K~1M)配合分块/RAG,见 Agent 与 MCP。
4.4 中文场景
- 首选:中国阵营(中文与多语言兼顾),开源之王角色中文也顶尖且更便宜。
4.5 低成本 / 大规模调用
- 首选:开源之王角色。日报、批处理、内部助手等对顶尖能力要求不极致的任务都交给它。
- 控成本技巧见 《Token 效率》。
4.6 本地部署 / 隐私敏感
- 首选:本地低延迟角色;中国阵营的小尺寸可做端侧。
- 前提:有显卡或能承受硬件成本,否则优先云端便宜模型。
4.7 Agent 工作流
- 首选:编程标杆的中坚款或长上下文角色——在推理、速度、价格间取平衡。
- 关键:必须支持工具调用(MCP/Function Call),见 《自动化》。
4.8 选型决策树(照着走)
text
你要做什么?
├─ 写代码 / 做 Agent → 编程标杆角色(重编程上旗舰款)
├─ 要最强综合 / 大生态 → 综合旗舰角色
├─ 啃几百页长文档 → 长上下文角色
├─ 中文任务 / 国内合规 → 中国阵营
├─ 省钱批量跑 → 开源之王角色
├─ 本地 / 低延迟 / 隐私 → 本地低延迟角色
└─ 要最新社媒舆情 → 实时数据角色
(每个角色当前是谁 → 查 §3 型号快照)口诀:写代码找编程标杆,长文档找长上下文,省钱找开源之王,中文找国产阵营,舆情找实时数据。
4.9 一个完整选型示例
假设你是一名做"跨境电商选品"的个人创业者,日常工作是:读竞品英文评测(长文档)、写中文商品文案(写作)、批量生成几十个标题(低成本)、偶尔写爬虫脚本(编程)。
text
长文档英文评测 → 长上下文角色
中文商品文案 → 编程标杆角色(写作质感)
批量标题生成 → 开源之王角色(便宜量大)
爬虫脚本 → 编程标杆角色(编程稳)实际配置:主力 = 编程标杆中坚款,备用 = 长上下文角色,批量任务切到开源之王角色。三件套覆盖全部场景,无冗余订阅。
5. API 价格与成本的量级概念
5.1 Token 与价格量级
API 按 Token(词元) 计费,分"输入(prompt)"和"输出(completion)"两档,输出通常更贵。粗略换算:
text
1 个汉字 ≈ 1~2 个 token
1000 token ≈ 500~700 个汉字
1M token ≈ 50~70 万字(约一本厚书)各阵营输入价量级(以闭源旗舰为基准 1×,量级关系比具体数字更稳定):
| 阵营 | 输入价格量级 |
|---|---|
| 闭源前沿 | 1×(最高) |
| 闭源长上下文款 | ≈ 0.5× |
| 中国模型 | 约 0.3~0.6× |
| 开源之王 | ≈ 0.03×(约 1/30) |
| 本地部署 | 硬件折旧 + 电费(边际近乎 0) |
5.2 成本估算示例
假设一个"每天处理 2 万字、生成 5 千字"的助手:
text
日消耗 ≈ 约 3~4 万 token
月消耗 ≈ 约 100 万 token- 用闭源前沿(1×):每月约几十元量级;
- 用开源之王(1/30):每月个位数元量级。
差异在"规模"上被放大:调用量越大,选便宜模型省得越多。 更细的省 token 方法见 《Token 效率》。
5.3 成本为什么在"崩塌"
近几年单位智能成本持续大幅下降,原因有三:
- 开源模型追平:开源阵营把能力差距压到 10~15 分,价格却低 10~30 倍;
- 推理优化:KV 缓存、蒸馏、量化让同等能力跑在更便宜的硬件上(见 《LLM 缓存》);
- 竞争定价:头部厂商互相压价,逼整个市场降价。
对个人这意味着:过去"用 AI 很贵"的顾虑基本不成立,真正的成本变成了"你的问题建模和提示词水平"——这是学就能补的。
6. 极简配置建议:主力 + 备用
不要囤一堆模型。两套"主力 + 备用"角色组合足够覆盖全年(具体型号查 §3 快照):
6.1 通用型(重质量)
- 主力:编程标杆中坚款(编程/Agent/写作均衡)
- 备用:长上下文角色(长文档、多模态、控成本时的兜底)
- 适用:做产品、写代码、跑 Agent 的个人专业用户。
6.2 成本型(重性价比)
- 主力:开源之王角色(日常 80% 任务)
- 备用:中国阵营全能款(中文与多模态补位)
- 适用:学生、自媒体、刚起步的 OPC,预算敏感优先。
6.3 配置检查清单
- [ ] 是否定下了"主力 + 备用"各一个(避免选择瘫痪)
- [ ] 主力是否覆盖你最高频的任务(编程/写作/长文档/中文)
- [ ] 是否确认 API 兼容 OpenAI 协议(接入最省事)
- [ ] 是否用 Token 效率 方法压过一次成本
- [ ] 是否预留一个"多模态生成"工具(视频/图,见 创作)
工具层面的聚合/中转平台(如 STJAPI 类)能让你用一套密钥切多个模型,降低接入成本。选型见 《工具总览》。
6.4 用满三个月再复盘
配置不是一成不变的。建议每三个月做一次轻量复盘:
- [ ] 主力模型是否承担了 70% 以上任务?若否,说明选错了主力
- [ ] 三个月总花费是否在预算内?超了就更多切到便宜模型
- [ ] 有没有出现"主力搞不定、频繁切备用"的任务?据此调整组合
- [ ] 是否出现了新模型、且宣称在你要的场景明显更强?先按 §3.1 核实,小范围试用再决定换
别每月追新。模型迭代快,但"换来换去"的切换成本比模型差距更伤效率。
7. 总结
2026 年选模型的三条铁律:
- 分层看:模型层看上限,产品层看体验,接入层看能不能用(见第 1 章)。
- 按阵营和场景选:记住五大阵营的角色,具体型号去快照查(见第 2、3、4 章)。
- 成本随规模放大:批量任务无脑用便宜模型,关键任务才上闭源前沿(见第 5 章)。
定下配置后,下一步去 《技术雷达与大事记》 看哪些技术值得现在投入,再回到 《自动化》 把模型接进你的真实工作流。