📉 省钱细节篇 · 把账单再砍一大刀
羊毛(注册福利)+ 方法论(自部署/路由)之后,真正把账单再砍一大刀的,是这三项:选对模型、吃透缓存、用好闲时。它们不靠身份、不限次数、长期有效,而且彼此叠加。
🎯 不试错选模型
💾 缓存命中真省
🌙 夜间峰谷折扣
每项带官方链接
💡 为什么单聊这三点?因为它们不靠身份、不限次数、长期有效,而且彼此叠加。一个典型场景:用轻量模型(选对)+ 固定系统提示走缓存(命中)+ 排到夜间批量跑(闲时),三者叠满后成本可压到「旗舰模型实时调用」的 1/10 甚至 1/20。
一、怎么选对模型(不试错也能选)
一个个试既浪费 token 又浪费时间,而且旗舰模型价格是轻量模型的 10–100 倍。正确做法是「先分类、再映射、让工具替你分级」,而不是靠手感盲试。
1.1 任务分类框架(4 个维度)
| 维度 | 分类 | 说明 |
|---|---|---|
| ① 难度 | 简单 / 中等 / 复杂 / 推理 | 分类、抽取、润色→轻量;写作、总结→主力;多步推理、复杂代码→旗舰。难度决定模型档位。 |
| ② 延迟 | 实时 / 可异步 | 对话、补全要快→低延迟小模型;批量处理可排夜间→更便宜的批量/闲时通道。 |
| ③ 模态 | 文本 / 多模态 | 纯文本用通用 LLM;图像/视频/语音用专用模型,别用旗舰文本模型硬扛多模态。 |
| ④ 成本敏感度 | 高频 / 低频 | 每天百万次调用→必须用小模型/缓存/闲时;偶发重任务→偶尔用旗舰也不心疼。 |
1.2 模型能力梯队速查
| 梯队 | 代表模型 | 适合 | 相对价格 |
|---|---|---|---|
| 🏆 旗舰 | GPT-5 / Claude Opus / Gemini Ultra / Qwen-Max / GLM / DeepSeek-V3 | 最难推理、长程规划、复杂代码 | 最高(基准 1×) |
| 🥈 主力 | GPT-5 mini / Claude Sonnet / Qwen-Plus / DeepSeek 标准 | 写作、总结、Agent、客服 | 约 0.1–0.3× |
| ⚡ 轻量 | GPT-5 nano / Qwen-Turbo / Haiku / DeepSeek-V3-Lite | 分类、抽取、简单问答、批量预处理 | 约 0.01–0.05× |
| 🎯 专用 | Embedding / Whisper / 视觉 / TTS 模型 | 特定模态,别用通用大模型替代 | 按场景极低 |
1.3 不试错的选择法(核心)
1.4 常见任务 → 模型推荐(可直接抄的映射表)
| 任务类型 | 推荐档位 | 举例模型 | 为何不选旗舰 |
|---|---|---|---|
| 文本分类 / 标签抽取 | 轻量 | GPT-5 nano / Qwen-Turbo / Haiku | 逻辑简单,旗舰贵 20–100 倍且无质量增益 |
| 邮件/短文润色、翻译 | 轻量–主力 | Qwen-Turbo / GPT-5 mini | 润色对「聪明度」不敏感 |
| 文档总结、会议纪要 | 主力 | GPT-5 mini / Claude Sonnet / Qwen-Plus | 需一定理解力,但非顶级推理 |
| 客服对话、Agent 执行 | 主力 | Claude Sonnet / Qwen-Plus | 平衡成本与稳定,高频调用压成本 |
| 复杂代码、多步推理 | 旗舰 | GPT-5 / Claude Opus / Qwen-Max | 此处降级会明显掉质量,值得花 |
| 批量预处理后再精修 | 轻量+旗舰两段 | nano 预处理 → 旗舰终判 | 两段法比全旗舰省 70%+ |
📊 盘点:分层路由后整体 API 账单降 50%–90%;选错档位 = 直接多付 3–10 倍,是隐形的最大浪费源。选模型是「零成本优化」,靠分类框架 + 路由工具 + 映射表即可避免试错。
二、缓存命中(真的省,而且很可观)
缓存命中省的不止一点,是 50%–90%。原理是:模型把 prompt 前缀算过的「中间结果」存起来,下次同样的前缀直接复用,不再重新算。
2.1 三大家缓存折扣对比(2026-08 核实)
OpenAI · 自动 Prompt Caching
prompt ≥ 1024 token 自动缓存前缀,缓存输入 50%–90% off:GPT-5 家族达 90%(如 GPT-5 nano $0.05→$0.005);gpt-4o 50%。无需改代码,5–10 分钟 TTL,扩展可达 24h。
Anthropic · 显式 cache_control
标记最多 4 个缓存断点,缓存读取 0.1× 即省 90%。5 分钟 TTL(写入 1.25×)或 1 小时(写入 2×)。2 次以上命中即回本。
Google · 显式 Context Caching
建命名缓存对象复用,缓存 75% off。最小 32768 token,默认 1 小时 TTL。适合超大文档/长上下文场景。
网关层 · 整请求 网关缓存
整请求精确匹配即 100% off(完全不调 provider),TTL 可到 30 天。与厂商缓存叠加,重复 workload 可压到标价 5%–15%。
2.2 怎么让缓存真的命中(实战技巧)
顺序:不变内容放最前。顺序:系统提示 → 参考文档 → 示例 → 历史 → 用户消息。缓存只认「前缀」,把可变内容(用户问题)放最后。
固定:系统提示别加时间戳。在系统提示里塞「当前时间/随机数」会让前缀每秒变,缓存瞬间失效。时间信息放用户消息里。
RAG:文档固定作前缀。检索文档放前缀,相似问题命中同一缓存,输入成本可降 90%。
TTL:按频率选。高频(>2 次/5 分钟)用 5 分钟;低频长文档用 1 小时(Anthropic)或 24h(OpenAI 扩展)。避免频繁重写。
⚠️ 三个常见坑:① 最小阈值——OpenAI 需 ≥1024 token、Gemini 需 ≥32768 token,短提示不触发;② 写入溢价——Anthropic 写入要 1.25–2×,低频(<2 次/5 分钟)不划算;③ 跨机失效——两次请求需落同一机器,可用 prompt_cache_key 把同前缀流量路由到一起。
2.3 不同场景的节省幅度
| 场景 | 缓存命中省 | 注意 |
|---|---|---|
| 聊天机器人(长系统提示) | 输入降 60%–80% | 系统提示需 >1024 token |
| 文档问答(同文档多问) | 输入降 80%–90% | 文档作前缀、固定不变 |
| RAG(共享检索上下文) | 输入降 75%–90% | 相似查询命中同一缓存 |
| Agent(固定工具 schema) | 输入降 40%–60% | 工具定义作缓存断点 |
| 分类/单次短时任务 | 几乎不省 | 低频+短 prompt,缓存无意义 |
📊 盘点:缓存是「改一行代码、长期白捡」的优化。对高频+长上下文场景,输入成本砍 75%–90%;叠网关层可再降。唯一代价是注意最小阈值和写入溢价——写对结构就稳赚。
三、夜间闲时调用(错峰省钱)
「晚间闲时」正是 2026 年国内最火的降本手段——多家平台 7 月集体上线「峰谷定价」,逻辑和电力的峰谷电价一样:夜间算力闲置,打折卖。把非实时任务排到夜间,立省 60%–80%。
3.1 国内平台夜间 / 闲时折扣汇总(2026-08 核实)
阿里云百炼 · Night Plan 22:00–08:00
Qwen 系列夜间特惠:Qwen-Max 2 折(省 80%)、Plus 4 折(省 60%)。周末节假日同样生效,模型能力不变只变计价。Token Plan 个人版可再叠加。
阿里云 Qoder · Night Qoder 22:00–08:00
全系产品(Desktop/CLI/插件)自动享:Qwen-Max 2 折、Plus 4 折,无需报名/兑换码。睡前派长任务,醒来验收。
WorkBuddy · 夜猫子计划 23:00–08:00
GLM-5.2 / Kimi-K3 等旗舰模型专属算力折扣,后台静默运行,关客户端不影响。适合批量文案、全项目重构、财报核算。
3.2 怎么用:把「非实时」任务全排夜间
睡前下发长任务。批量文案、代码重构、财报核算、日志排查——睡前一键派发,关电脑,云端后台跑,次日验收。
训练/微调排闲时。模型微调、Embedding 生成、大数据批处理,全排 22:00 后,吃夜间折扣或半价算力。
实时交互留白天。对话、补全、实时客服等要秒回的,仍走白天正常价;只有「能等一夜」的才排夜间。
配合 Batch API。夜间 + 批量接口(再 5 折)双重叠加,非实时 workload 成本可压到极低位。
📊 盘点:夜间闲时是「无门槛、自动生效」的省钱开关。把批量/长任务排到 22–8 点,单这一项就能省 60%–80%;和缓存、Batch 叠加后,非实时成本可砍到平时的 1/10 量级。
四、组合拳:三者叠一起
单独用已很强,叠起来才是「细节篇」的精髓。下面给一个真实可落地的极致省钱链路。
案例:10 万份文档批量摘要 + 分类
① 选对模型:分类用轻量(GPT-5 nano),摘要用主力(GPT-5 mini),不碰旗舰 → 比全旗舰省 ~90%。
② 缓存命中:固定系统提示 + 共享指令前缀,命中缓存输入 90% off → 再省一大截输入成本。
③ 夜间 + Batch:任务排到 23:00 后,走 Batch API(5 折)再叠加平台夜间折扣(省 60%–80%)→ 非实时部分成本再砍。
五、总账汇总:细节能省多少
| 细节手段 | 投入 | 持续节省 / 收益 | 适用 |
|---|---|---|---|
| 选对模型(分层/路由) | ¥0(榜单+映射表) | API 账单 ↓50%–90% | 所有调用者 |
| 缓存命中(前缀复用) | ¥0(改结构/一行代码) | 输入成本 ↓50%–90% | 高频+长上下文 |
| 夜间闲时调用 | ¥0(排期即可) | 非实时任务 ↓60%–80% | 批量/训练/长任务 |
| 三者叠加(案例) | ¥0 | 综合 ≈ 原价的 1/15–1/20 | 批量文档/数据工程 |
不试错选模型、写对结构吃缓存、非实时排夜间——这三件事都不花一分钱,却能把你的 AI 账单砍掉 90% 以上。选模型是地基(不浪费),缓存是放大器(复用省),闲时是时间杠杆(错峰省)。政策数字于 2026-08-10 核实,具体以各平台官网最新公告为准。