摘要 OpenAI 在 2026 年 10 月 2 日发布《GPT-6 系列模型指南》,讲的是怎样在控制时间和成本的前提下用好 GPT-6 Astra、GPT-6.1 Sol、GPT-6 Luna 三款模型。最值得带走的变化有两个:一是省钱主要靠选对模型和用好提示词缓存,缓存输入最多比普通输入便宜 95%,前提是把固定内容放在提示词前面;二是模型变聪明后,过去那种手把手的详细指令反而会碍事,提示词要改成讲清“要什么结果、哪些能自己定、什么算完成”。指南还介绍了中途引导、异步工具、子智能体三样长任务工具,以及“能调 API 就别点屏幕”的计算机使用原则。
过去一年,用 AI 写代码的人大多攒下了一长串规矩:改之前先读这三份文档,每一步都要先问我,测试必须跑两遍。
OpenAI 在 10 月 2 日发布的《GPT-6 系列模型指南》里,引用了自家开发者体验团队 Eric Provencher 的一句话,等于给这些规矩泼了盆冷水:
“模型理解细微差别和模糊含义的能力已经大幅提升,因此,过去有帮助的详尽指导,如今反而可能妨碍模型发挥。”
模型变聪明了,说明书反而要变薄。这份指南篇幅不长,讲的是四件很实在的事:模型怎么选、钱怎么省、提示词怎么改、跑几个小时的长任务怎么管。下面先算账,再改提示词,最后管长任务。
三款模型一张价目表:先选对,再谈省
GPT-6 不是一个模型,是三个。指南开头就把它们和价格摆在一起:

| 模型 | 官方定位 | 输入 | 输出 | 缓存输入 |
|---|---|---|---|---|
| GPT-6 Astra | 最智能,适合难度最大的推理工作 | $10.00 | $50.00 | $1.00 |
| GPT-6.1 Sol | 复杂编程、研究和计算机使用 | $2.00 | $10.00 | $0.10 |
| GPT-6 Luna | 大规模、目标明确的日常重复任务 | $0.10 | $0.50 | $0.01 |
Token 是模型计费的最小文字单位,大致是一个字或半个词。按这张表算,Sol 的价格是 Astra 的五分之一,Luna 又只有 Sol 的二十分之一。同样读一百万 Token,Astra 收 10 美元,Luna 只收 10 美分。
所以指南说得很直白:选模型,本质上是在智能水平与价格之间做权衡。提取发票字段、给请求分类、生成结构化摘要,这类目标明确的重复活交给 Luna;写复杂代码、做研究、操作电脑交给 Sol;最难的推理才请 Astra 出场。
推理级别:让模型想多久
选完模型,还有第二个旋钮。在 API 里可以指定模型为一个任务投入多少推理:
- 低:常规任务,例如提取事实、做小幅修改。
- 中:需要判断的工作,例如规划功能、比较方案。
- 高:高难度调试、深入分析、细致审查。
- 极高 / Max:只在“高”不够用时测试;效果提升抵得过多花的时间和钱,才保留。
有个容易忽略的细节:在 API 里,对话中途调整推理强度不会让缓存失效。也就是说,可以先用低档摸清情况,遇到难点再调高,前面攒下的缓存折扣还在。在 Codex 里则建议先用模型默认级别,简单任务调低,深入分析再调高。
速度:两档加钱提速
第三个旋钮是速度,都要多付钱。
快速模式面向聊天应用、编程工具这类等不得的场景,响应更快也更稳定,每个 Token 更贵。超高速模式加快的是 Token 生成速度,不改变推理强度,目前用于 GPT-6 Astra;按 OpenAI 的 API 文档,它最高可比标准模式快 8 倍,但默认速率限制较低。
指南在这里配了一条开发者的帖子:

这是个人自述,没有对照组,读作“有人这样用”就够了。
提示词缓存:最多便宜 95% 的那一档怎么拿
价目表里最容易被跳过的,是第三列“缓存输入”。它比普通输入便宜一个数量级:
| 模型 | 输入 | 缓存输入 | 便宜多少 |
|---|---|---|---|
| GPT-6 Astra | $10.00 | $1.00 | 90% |
| GPT-6.1 Sol | $2.00 | $0.10 | 95% |
| GPT-6 Luna | $0.10 | $0.01 | 90% |
指南里“最多降低 95%”的说法,对应的正是 Sol 这一行。(折扣比例按价目表计算。)
缓存存的是什么
模型读输入时,会边读边算出一批中间状态。提示词缓存做的事,就是把开头不变的那一段算好的状态存下来。下一次请求如果开头一模一样,这段就不用重算,按缓存价收费。
关键在“开头”两个字。缓存匹配的是前缀,从第一个字开始逐段比对,中间只要有一处变了,从那里往后全部作废。

指南给的做法因此只有两句:
- 把固定的指令和参考资料放在会变化的任务细节之前。
- 保持工具定义一致,不要每次请求都换顺序或改描述。
举个例子。假设一个客服 Agent 每次请求都带 1 万 Token 的固定说明,用的是 Sol:不走缓存,这段每次 2 美分;命中缓存,每次 0.1 美分。一天调用十万次,这一段的开销就从 2000 美元降到 100 美元。(示意计算,未计入缓存写入费用。)
算账时别漏的几项
指南提醒,估算整条工作流的成本时,要把缓存写入费用和适用的长上下文费率一起算进去。OpenAI 的缓存文档还补充了一个门槛:可缓存的前缀至少要 1024 个 Token,太短的提示词吃不到这个折扣。
缓存没命中时,可以去看缓存仪表板和诊断指南,找出是哪一处让前缀对不上。
压缩:对话太长时瘦身
缓存管的是重复的开头,压缩管的是越滚越长的对话。它把上下文体积减下来,同时保留继续执行所需的状态。长任务跑上几个小时,这一项基本是必选。
另外两条省钱的老办法也被点了名:删掉任务用不上的上下文;彼此独立的任务并行跑,别让一个慢步骤拖住无关的工作。
上线前量这三个数
指南建议部署前先拿有代表性的任务跑一遍,量三个数:任务成功率、延迟、每次成功完成任务的成本。
第三个数值得多看一眼。它比“每百万 Token 多少钱”更接近真实账单:便宜的模型如果要重试三次才成功,未必比贵的模型一次做对更省。此外还要想好两件事:怎么监控模型的行为,应用的数据由谁控制、怎么控制。
提示词减肥:四处该改的地方
回到开头那句话。提示词具体该怎么改,指南摘了 Provencher 9 月发表的《重新思考 GPT-6 Astra 的技能与提示词》里的四条。那篇文章给了改写前后的例子,对照着看最清楚。
先说总原则。任务说明只需要讲清四样:想要什么结果、给谁用、有哪些上下文和限制、什么算完成。至于怎么做,尽量留给模型。
一、技能:描述写短,细节按需加载
“技能”(skill)是存成 Markdown 文件的一段提示词,可以附带脚本和资料,用来指导某个特定流程。每个技能有一段描述,模型靠它判断什么时候该用。
问题出在描述太长、太宽。Provencher 举的例子:
| 技能描述 | 结果 | |
|---|---|---|
| 改之前 | 创建并验证 Postgres 迁移。在处理数据库、查询、模型或持久化时使用。 | 只要碰到数据库就被触发 |
| 改之后 | 创建并验证 Postgres 迁移。在新增或修改迁移、审查其上线时使用。 | 只在处理迁移时触发 |
另外两条:技能的主文档只做“目录”,指向补充文档和脚本,细节用到再读;把一步步的操作清单换成指导原则。
二、AGENTS.md:别让它每次都把文档读一遍
AGENTS.md 是放在代码仓库里、给 AI 编程助手看的说明文件,模型在这个仓库里干活时都会读到。
| 写法 | |
|---|---|
| 改之前 | 每次修改前,先读 architecture.md、database.md 和 deployment.md。 |
| 改之后 | 服务边界看 architecture.md,改表结构看 database.md,准备部署时看 deployment.md。 |
改一个错别字也要先读三份文档,纯属烧上下文。说清“哪份文档对应哪种情况”就够了。
同时可以明确放行安全的常规流程。原文的示范是:本地测试用的是一次性数据、碰不到生产环境,直接跑,改动引起的失败自己修、自己重跑,不必每步都来请示。
三、决策边界:把“始终先问我”换成清楚的线
如果以前的模型擅自行动过,你多半加过语气很重的“必须先问”。按 Provencher 的说法,Astra 会把这类话当真,可能在你其实乐意它继续的地方停下来。
指南的建议是写清楚:哪些操作可以独立进行,哪些需要批准。举例来说,摘要怎么组织可以自己定,改变项目范围之前要先确认。
四、做到底:把“完成”定义出来
这一条有点反直觉。Astra 做事细致,但对“该做到哪一步”更谨慎,可能写完第一版就回来等你审阅,其实活还没干完。
所以要在开头就定义完成包含哪些环节:实施改动、跑起来、检查结果、修复问题。同时点明哪些决策留给你审查。
回复也要提要求
除了“做什么”,指南还建议说明“怎样的回复才有用”:用通俗语言,技术细节的深浅跟着读者走,结尾给一段简短的交接说明,交代三件事:改了什么、检查了什么、还有什么需要关注。
最后一个提醒来自 Provencher 的原文:仓库里的技能和说明也会被同事的 Agent 读到,而他们用的可能是别的模型。对 Sol 或 Luna 有帮助的细致指导,可能会把 Astra 管得太死。清理起来也不必全靠手工,可以直接让 Astra 按这几条把现有的规矩审一遍。
长任务:中途改口、边等边干、分头去查
指南说,借助 GPT-6 系列,任务现在可以持续数小时甚至数天。任务一长,麻烦就来了:写第一句提示词的时候,谁也预见不到三小时后会冒出什么问题。
API 这边给了三样工具。
| 能力 | 解决什么 | 要知道的限制 |
|---|---|---|
| 轮次中途引导 | 模型干到一半,想补一句要求或改方向 | 走 Responses WebSocket API;更新先排队,不取消正在运行的工具,也不撤销已完成的操作 |
| 异步工具调用 | 跑测试这类慢工具执行时,模型不必干等 | 依赖该结果的工作,要等结果回来再开始 |
| 多智能体工作流 | 把互不依赖的子任务分给子智能体,再汇总 | GPT-6.1 Sol 通过 Responses API 支持,目前处于测试阶段 |
中途引导值得多说一句。以前想改主意只有两条路:等它跑完,或者打断重来。现在可以边跑边递纸条。但纸条是排队送达的:按 OpenAI 的引导文档,接口回复“已接受”只代表消息进了队列,不代表模型已经照做;已经发出的输出和已经启动的工具都不会被撤回。这项能力只有 GPT-6 系列支持。
异步工具像做饭时的烧水:水壶在烧,人去切菜。应用负责跑慢任务,跑完把结果送回来,模型这段时间继续做别的独立工作。
多智能体适合“分头去查”:比如让几个子智能体各自调查代码库的不同部分,再把发现汇成一份回复。
Codex 里:答问题和改方向
在 Codex 里对应两个动作。
一是随时回答问题。配合 Astra,Codex 会在工作过程中请求澄清。指南的建议是:解决影响下一步的那个问题,同时说明在你做决定期间,哪些独立工作可以继续。如果要离开一阵,先交代哪些任务可以接着干,到哪一步必须停下来等你。
二是需求变了就引导。用新信息引导当前任务,说清哪些要改、哪些保持不变,免得它在已经不合需求的方案上继续花时间。
指南在这里配的是 Peter Steinberger 的帖子:他给 Astra 设了一个长期目标,把项目的数据库访问从同步改成异步工作进程,到发帖时已合入 575 个 PR。

同样是个人自述。它能说明的是“长任务边推进边交付”这种用法,说明不了成功率。
计算机使用:能调 API,就别点屏幕
“计算机使用”(computer use)让模型像人一样直接操作网站和桌面应用:看屏幕、点按钮、填表单。Astra、Sol、Luna 三款都支持,即使对方没有 API 也能用。指南举的例子是一条完整的链路:让模型调查缺陷、修复代码,再在浏览器里打开产品,检查修复是否生效。
但指南紧接着给了一条克制的规则:为每个步骤选最简单可靠的方式。
- API 或已连接的工具能直接完成的,就用它们。
- 需要替你读屏幕、点按钮、填表单时,才用计算机使用。
道理不难懂。调接口是一次确定的请求;点屏幕要截图、识别、定位、点击,每一环都可能出岔子,也更慢。能走门就别翻窗。
想把这项能力接进自己的应用,做法是给模型一个“能运行代码来控制浏览器或桌面”的工具:操作浏览器用 Playwright,操作桌面应用用 PyAutoGUI。两者都是常见的开源自动化库。

四家客户怎么用:让模型交证据
指南结尾列了四家用 GPT-6 Astra 做产品的公司。
| 公司 | 用 Astra 做什么 | 指南给出的细节 |
|---|---|---|
| Harvey(法律) | 结合法院信息、判例法、律所文档和律师偏好,定制文稿 | 联合创始人 Gabe Pereyra:“我们可以为模型提供更多上下文,让结构化输出的质量不断提升。” |
| Cognition(Devin) | 测试软件,并提供测试依据 | 一个 iPhone 游戏案例中,Devin 交出模拟器录屏和一份报告,把已通过的检查项和尚未测试的部分分开 |
| Hex(数据分析) | 把销售渠道表现的问题变成书面分析和交互式仪表板 | 还会让模型检查数据是否合理、分析是否回答了业务问题 |
| Invideo(视频) | 规划时间线剪辑,创建可供剪辑师继续调整的特效 | 公司称调色和色彩校正任务的成功率提升至原来的约三倍;几位剪辑师一天做出约 50 种特效 |
这些都是厂商挑选的案例。Invideo 的“约三倍”是公司自己报告的数字,指南没有给出对比基线和样本量,读的时候记着这一点。
比数字更值得带走的,是 Cognition 和 Hex 的共同做法:不只让模型交结果,还让它交证据。 录屏、已测和未测的清单、对数据合理性的自查,这些东西让人能快速核对,而不是只能选择信或不信。这和前面“交接说明要写清检查了什么、还剩什么”是同一个思路。
可以带回自己项目的三件事
第一,选模型看“每次成功任务的成本”,不看单价。 拿自己真实的任务各跑一遍,同时记下成功率和延迟。Luna 和 Astra 的单价差一百倍,但差距最终落在哪,只有跑过才知道。
第二,把提示词重排一次,再减一次肥。 重排是为了缓存:固定的指令、工具定义、参考资料放前面,会变的任务细节放最后。减肥是为了模型:把“每次都先读”“始终先问”“必须跑测试”这类为旧模型加的规矩逐条过一遍,问一句现在还需不需要。
第三,长任务开工前,先写清两条线。 一条是“完成”包含什么:改完、跑通、检查、修掉问题。另一条是“什么时候必须来问我”。再要求结尾交一份交接说明:改了什么、检查了什么、还剩什么。
需要记住的边界:这是一份厂商的使用指南,讲的是推荐做法,没有给出评测数据;关于 Astra“更谨慎、需要推一把”的描述出自 OpenAI 自己的文章,换一个任务未必如此。多智能体仍在测试阶段,超高速模式有速率限制。上面三条里,除了“量成本”和“固定内容放前面”是指南原话,其余是本文据指南整理的做法。
回到开头那句话:模型变聪明以后,要写的不是更长的说明书,而是更清楚的三样东西——要什么、边界在哪、怎样算完。