主题
主流模型对比与选型
模型更新比教程写得还快,所以这一篇不追具体版本号,而是给你一套稳定的判断框架:各家模型的定位差异是什么、按场景怎么选、怎么用最小的成本实测。具体版本和能力以模型官网与 STJAPI 控制台实际提供的为准。
1. 主要模型家族一览
| 家族 | 出品方 | 整体定位 | 相对优势 |
|---|---|---|---|
| GPT 系列 | OpenAI | 综合能力均衡,生态最大 | 生态与工具链成熟,多模态全面 |
| Claude 系列 | Anthropic | 编程与长文本见长 | 代码质量、长上下文利用、Agent 自主性 |
| Gemini 系列 | 多模态与超长上下文 | 原生图文音视频处理,窗口大 | |
| DeepSeek 系列 | 深度求索 | 高性价比开源代表 | 推理能力强、价格友好、开放权重 |
| Qwen 系列 | 阿里 | 开源多尺寸全覆盖 | 中文理解好、尺寸梯度全、可本地部署 |
几点阅读提示:
- 定位会漂移。某个版本擅长的领域,半年后可能被另一家追平。记住"当前相对优势"即可,不要把结论当成永久事实。
- 家族内部差异大。同一家族里,旗舰、标准、轻量、推理模型的差距,可能大于两家公司旗舰之间的差距。选型先在家族内部分级,再跨家族比较。
- 开源不等于免费算力。开放权重省的是授权费,自建部署仍然要付显卡、运维和电费。小用量通常直接调 API 更划算。
2. 按场景选模型
| 场景 | 优先考虑 | 理由 |
|---|---|---|
| 日常编程、重构、维护项目 | Claude / GPT / Codex 系旗舰 | 代码能力和 Agent 自主性是关键 |
| 长文档分析(整本书、大代码库) | Gemini / Claude | 上下文窗口大,长文利用率高 |
| 批量简单任务(分类、抽取、格式化) | 轻量模型或开源模型 | 单价低、速度快,质量足够 |
| 数学、复杂推理、疑难 Bug | 推理模型(o 系、DeepSeek-R1 类) | 内部思考链带来正确率提升 |
| 多语言、中文内容创作 | Qwen / DeepSeek / GPT | 中文语料和理解质量占优 |
| 图像理解、截图分析 | GPT / Gemini / Claude | 原生多模态能力 |
| 隐私敏感、离线环境 | Qwen / Llama / DeepSeek 本地部署 | 数据不出本机,见《本地模型怎么选》 |
3. 三步实测法
排行榜只能排除明显不行的,不能告诉你哪个最适合你。用自己的任务实测,三步就够:
3.1 准备两个基准任务
从真实工作里挑一个典型任务(日常量最大的)和一个困难任务(最能拉开差距的),写成一两句话的明确描述。任务要带验收标准,比如"这个函数改完后测试必须通过"。
3.2 固定提示词跑对比
同一个提示词、同一份输入,分别在候选模型上跑一遍。记录三个数:
- 一次通过还是需要返工;
- 返工几轮;
- 消耗的 token 和等待时间。
3.3 用"总成本"做决定
一次通过率低的模型,即使单价便宜,返工的总成本往往更高。最终选择看的是每完成一个任务的完整成本,不是每次请求的单价。
三步法的难点不在流程,而在"任务写得够具体、数字记得下来"。下一节给出可以直接复制的模板、记录表和一份跑完的示例。
4. 实测落地:模板、记录表与示例
4.1 基准任务描述模板
text
【任务类型】典型 / 困难
【任务描述】一两句话写清输入和要得到的输出
【输入材料】附真实材料:一段代码、一份文档或一组数据
【验收标准】逐条列出,每条都可检查
【限定条件】时限、篇幅、不许动哪些部分填好的典型任务示例:
text
【任务类型】典型
【任务描述】把这份 200 行销售流水 CSV 整理成按月汇总表
【输入材料】sales.csv(字段:日期、产品、渠道、金额)
【验收标准】1) 每个自然月一行;2) 金额合计与原表一致;3) 输出 Markdown 表格
【限定条件】只统计已支付订单填好的困难任务示例:
text
【任务类型】困难
【任务描述】定位并修复 test_payment 偶发失败的 Bug
【输入材料】报错日志 + 相关三个模块的源码
【验收标准】测试连续跑 20 次全部通过,且没有新增告警
【限定条件】不重构,只做最小修改4.2 实测记录表
每个候选模型复制一行,边跑边填:
| 模型 | 任务 | 一次通过 | 返工轮数 | 总耗时 | 消耗 token | 费用 | 卡在哪里 |
|---|---|---|---|---|---|---|---|
| 典型 | |||||||
| 困难 |
填完只看两个数:一次通过率和每任务总成本(费用加上返工时间折算)。典型任务差距很小的话,决定就交给困难任务。
4.3 一份跑完的示例(数字为示意)
用上面两个基准任务对比模型 A(旗舰价)和模型 B(标准价):
| 模型 | 典型任务 | 困难任务 |
|---|---|---|
| A | 一次通过,5 分钟,¥0.40 | 返工 1 轮,25 分钟,¥2.10 |
| B | 返工 1 轮,9 分钟,¥0.12 | 返工 4 轮仍未通过,60 分钟,¥0.95 |
结论不是"A 全面更好":批量处理典型任务选 B 更划算——单价低,多出来的一轮返工可以接受;困难任务必须给 A——B 省下的差价远抵不上多耗的时间。这份表就是下一节分级策略的实测依据。
5. 组合使用:分级策略
多数成熟用户的做法不是"选一个",而是分级:
text
轻量模型:补全、格式化、简单问答、批量抽取 → 占请求量的 70%+
标准模型:常规开发、文档写作、日常分析 → 占 20%+
旗舰/推理模型:架构设计、疑难问题、最终审查 → 占 10% 以下在支持多模型的客户端(如 Claude Code 配合模型切换、CC Switch 管理多供应商)里,把分级固化成习惯:先从低档开始,不够再升档,而不是反过来。成本细节见《效率与省钱技巧》,缓存为什么能大幅省钱见《大模型缓存是什么》。
6. 选型检查清单
- 这个场景最看重什么:代码质量、上下文长度、速度,还是价格?
- 候选模型在 STJAPI 控制台的分组里是否可用、状态是否正常?
- 用自己的两个基准任务实测过吗?
- 有没有准备一个能力相近的备用模型,容量不足时切换?
- 批量任务是否已经做了模型分级,而不是全用旗舰?
选定模型后,回到《接入实战》把它配置到客户端;遇到具体模型报错,查《常见问题速查》和《Codex 模型繁忙处理》。