同样是让 AI 干活,Astra 的标准 API 单价,已经是 Sol 当前促销价的 2.5 倍。
先看价格,再聊怎么省。

| 模型 | 输入 | 输出 | | ------------------ | ---: | ---: | | GPT-6 Astra | $10 | $50 | | GPT-5.6 Sol 促销价 | $4 | $20 | | GPT-5.6 Sol 促销前 | $5 | $30 |
单位:美元/百万 Token。普通上下文、标准模式,未计缓存和工具费;截至 2026 年 9 月 5 日。数据:Astra 官方模型页、Sol 官方模型页。
对比现价,输入、输出都贵了 150%。Sol 促销至少持续到 11 月 21 日,后续以官网为准。
但单价高 2.5 倍,不代表每个任务的账单都高 2.5 倍。用了多少 Token、返工几次,都要算。
想少花,先改这 5 个习惯

1. 只给相关材料
让它改一段文案,就圈出那一段和必要背景。别反复塞整库文件。
2. 一次说清验收标准
“帮我优化”太空。改成“面向新手,保留价格和来源,输出 3 个标题,各不超过 20 字”。
3. 修改只发差异
明确“只改第二段,其他不动”。避免为改一句话,反复重写全文。
4. 换题先做交接
长对话结束时,留一份目标、结论、约束、来源和待办,再开新任务;压缩时别丢关键条件。
5. 简单任务先试 Sol
提取字段、改格式、按明确规则整理,先看它能否达标。复杂判断再考虑 Astra。换低价模型省的是单价,不一定省 Token。
三段可直接使用的提示词

这些提示词用于减少无关输入、冗余输出和返工,尚未做前后账单实测,不承诺节省比例。它们不会自动修改模型、推理档或 API 计费模式。
1. 通用任务:把目标一次说清
请完成【任务】。
交付物:【格式、长度、验收标准】。
只使用与任务有关的材料;保留关键事实、数字、来源和约束。
不复述背景,不主动扩展任务。
修改已有内容时,只输出指定部分。
缺少会影响结论的信息时,先问;其余按合理假设推进并注明。
结论后仅补必要依据与未确认项。达到验收标准后停止。
2. 长对话交接:把有用上下文留下
请把本次对话整理成可供新任务继续使用的交接摘要,只包含:
1. 当前目标和验收标准;
2. 已确认事实与关键来源或文件位置;
3. 已完成事项和实际结果;
4. 必须保留的数字、条件、限制与权限边界;
5. 尚未确认的内容和下一步。
删除重复讨论和已放弃方案;若放弃原因会影响后续决定,保留原因。
不把假设写成事实,不把“计划做”写成“已经完成”。
建议控制在500字以内;若压缩会丢失关键条件,允许超出并说明。
复制摘要到新对话时,检查关键数字、文件和条件是否完整。换题可开新任务;仍依赖大量既有细节时,贸然重开可能增加重读和返工。
3. Codex / Agent:明确工作范围,少做无效循环
目标:【我希望完成的结果】。
验收:【可观察的完成标准】。
允许处理的范围:【文件、数据或任务边界】。
先读取完成任务必需的当前信息。搜索先定位,再读取相关片段;需要完整上下文时再扩大范围。
复用已确认且仍有效的事实和结果,不重复全量调查。
仅修改验收所需内容,不顺手重构、扩展功能或输出无关长报告。
验证直接影响结果的行为;同类失败重复时先判断原因,不连续盲试。
只有独立子任务带来的收益足以覆盖交接、复核与返工成本时才委派;遵守当前可用模型和权限。
不要声称已切换模型或推理档,除非实际工具或配置结果证明已生效。
不要为减少Token省略必要的事实核查、测试和授权检查。
最后只交付结果、验证证据和真实剩余问题。达到验收标准后停止。
API 使用者还可以调整什么
- 模型与推理档要在实际配置中设置。 短输出不等于低推理量;在质量达标前提下试用模型支持的较低
reasoning.effort,比较实际 usage。推理文档 - 稳定指令在前,动态材料在后。 缓存要求匹配的前缀;命中时降低缓存输入单价,不减少上下文 Token 总量,也不能保证命中。缓存文档
- 算上缓存写入。 Astra 普通上下文的缓存读取为 $1/M,写入为 $12.50/M;不能把所有输入都按 $1/M 估算。Astra 模型页
- 留意计费档。 Astra Fast 为适用费率的 2 倍;输入超过 272K 时,整个请求的输入及缓存费率为 2 倍、输出为 1.5 倍。普通标准表不能直接套到这些请求。Astra 模型页
- 低价任务也要验收。 JSON 格式正确不代表事实正确;升级模型前先诊断资料、提示词或工具问题,避免两个模型连续白跑。不能用模型切换绕过安全拒绝。
API 单价表不用于推算 ChatGPT/Codex 订阅的 5 小时或每周额度。附图中的 Ultra 也不构成计费倍率证据。
一个条件化算例
若两种模型都使用 100 万普通未缓存输入 Token、10 万输出 Token,且无工具费、缓存写入、长上下文加价或重试:Astra 为 $15,Sol 促销价为 $6。实际任务的推理、输出和返工可能不同;这个算例不是个人账单或实测结果。
若按相同 Token 规模把 70% 的工作量从 Astra 移至 Sol、其余 30% 保留 Astra,理想成本为 0.7 × 0.4 + 0.3 × 1 = 0.58,即低 42%;80% 移至 Sol 则低 48%。按请求数量分流无法直接推出这些比例。原参考的“50%–65%”不能仅由 70%–80% 的请求下沉推出。
用到自己的工作里
挑一个经常重复、结果容易核对的任务,先记录原来的完成质量和用量。试用提示词后,用相同材料与验收标准再比较,并记录返工;不要只比较输出字数。
提示词不会自动切模型,也不能保证省多少。回复短,不代表隐藏推理 Token 也少。
拿一个常做的任务对比:结果、总用量、返工次数。省下来的,才算数。
