主题
效率与省钱技巧
用第三方接口按用量计费,浪费主要来自三个地方:该用小模型的场景用了大模型、上下文塞了太多无关内容、无效返工。对症下药就够了。
本文聚焦费用。会话与上下文如何影响产出质量,见《通用 AI 编程方法论》。
1. 模型分级使用
1.1 基本原则
不是所有任务都值得用旗舰模型。按任务难度选模型,费用能差出数倍。
1.2 任务与模型匹配参考
| 任务类型 | 建议 |
|---|---|
| 改文案、写注释、简单格式化 | 轻量模型足够 |
| 单文件的小功能、修小 bug | 中档模型 |
| 跨文件重构、架构设计、疑难 bug | 旗舰模型 |
1.3 在客户端里切换
- Claude Code:会话内用
/model切换,或启动时claude --model <模型名>。 - Codex CLI:
/model命令选择当前会话模型。 - Cursor:编辑器右下角模型选择器直接切换。
常见节奏:用中档模型做探索和常规开发,卡住了再切旗舰模型攻坚。
2. 控制上下文成本
2.1 输入输出都在花钱
每次请求都会把上下文重新发送一遍。长会话滚到几万 token 后,每一轮的费用都在放大。
2.2 省上下文的习惯
会话管理的基本做法(新任务开新会话、让 AI 搜索定位文件、长会话总结后续接)与《通用 AI 编程方法论》第 2 节相同——那篇讲质量,这里只补两条与费用直接相关的:
- 每次请求都会重发整个上下文。别把上一轮的长回答原样复制回来继续问,提炼要点再带进来。
- 多次处理同一批文件时,让 AI 记住路径清单直接复用,而不是每轮重新搜索一遍目录。
2.3 善用压缩与总结
Claude Code 上下文快满时会自动压缩(compact),也可以手动 /compact 主动压缩并附带重点提示,例如 /compact 保留当前重构方案和剩余步骤,比默认压缩更保关键信息。
3. 减少无效返工
3.1 返工是最大的浪费
一次方向错误的生成,烧掉的 token 加上人工检查时间,比事先写清楚需求贵得多。返工两次的成本足够你写好一份完整需求。
3.2 性价比最高的三个投入
- 维护好项目规则文件(
CLAUDE.md/AGENTS.md),一次投入长期摊薄。 - 复杂任务先要方案再实现,方向错了改方案比改代码便宜。
- 让 AI 交付前自查并跑验证命令,减少来回拉锯。
4. 额度分配策略
4.1 看清消耗去向
定期在 STJAPI 控制台查看用量明细,弄清楚额度花在哪些项目、哪些时段。发现某个项目消耗异常,通常是会话管理出了问题。
4.2 分配建议
- 日常探索与学习:用低价模型,舍得用。
- 正式开发与攻坚:留给旗舰模型,用在刀刃上。
- 批量机械任务(格式化、批量改名):优先考虑脚本化,能不用 AI 就不用。
4.3 建立自己的用量心视
每周扫一眼:单次会话平均消耗有没有异常大的?有没有明明是小任务却用了旗舰模型的情况?持续校准,同样的额度能多跑一大截。
5. 一页速查
相关阅读:《通用 AI 编程方法论》(质量视角的上下文管理)、《从零到驾驭 AI:成长路径》第五阶段(把省钱习惯固化为流程)。
- 按任务难度选模型,探索用轻量、攻坚用旗舰。
- 新任务新会话,让 AI 自己搜索而不是贴代码。
- 长会话主动
/compact,并提示保留重点。 - 规则文件与先方案后实现,是对冲返工最便宜的保险。
- 每周看一次用量明细,校准自己的习惯。