GPT-6 用法变了:少教步骤,多划边界

GPT-6 用法变了:少教步骤,多划边界

摘要 OpenAI 在 2026 年 10 月 2 日发布《GPT-6 系列模型指南》,讲的是怎样在控制时间和成本的前提下用好 GPT-6 Astra、GPT-6.1 Sol、GPT-6 Luna 三款模型。最值得带走的变化有两个:一是省钱主要靠选对模型和用好提示词缓存,缓存输入最多比普通输入便宜 95%,前提是把固定内容放在提示词前面;二是模型变聪明后,过去那种手把手的详细指令反而会碍事,提示词要改成讲清“要什么结果、哪些能自己定、什么算完成”。指南还介绍了中途引导、异步工具、子智能体三样长任务工具,以及“能调 API 就别点屏幕”的计算机使用原则。

过去一年,用 AI 写代码的人大多攒下了一长串规矩:改之前先读这三份文档,每一步都要先问我,测试必须跑两遍。

OpenAI 在 10 月 2 日发布的《GPT-6 系列模型指南》里,引用了自家开发者体验团队 Eric Provencher 的一句话,等于给这些规矩泼了盆冷水:

“模型理解细微差别和模糊含义的能力已经大幅提升,因此,过去有帮助的详尽指导,如今反而可能妨碍模型发挥。”

模型变聪明了,说明书反而要变薄。这份指南篇幅不长,讲的是四件很实在的事:模型怎么选、钱怎么省、提示词怎么改、跑几个小时的长任务怎么管。下面先算账,再改提示词,最后管长任务。

三款模型一张价目表:先选对,再谈省

GPT-6 不是一个模型,是三个。指南开头就把它们和价格摆在一起:

原图:GPT-6 Astra、GPT-6.1 Sol、GPT-6 Luna 的定位与价格,单位为美元/每百万 Token。

模型 官方定位 输入 输出 缓存输入
GPT-6 Astra 最智能,适合难度最大的推理工作 $10.00 $50.00 $1.00
GPT-6.1 Sol 复杂编程、研究和计算机使用 $2.00 $10.00 $0.10
GPT-6 Luna 大规模、目标明确的日常重复任务 $0.10 $0.50 $0.01

Token 是模型计费的最小文字单位,大致是一个字或半个词。按这张表算,Sol 的价格是 Astra 的五分之一,Luna 又只有 Sol 的二十分之一。同样读一百万 Token,Astra 收 10 美元,Luna 只收 10 美分。

所以指南说得很直白:选模型,本质上是在智能水平与价格之间做权衡。提取发票字段、给请求分类、生成结构化摘要,这类目标明确的重复活交给 Luna;写复杂代码、做研究、操作电脑交给 Sol;最难的推理才请 Astra 出场。

推理级别:让模型想多久

选完模型,还有第二个旋钮。在 API 里可以指定模型为一个任务投入多少推理:

  • 低:常规任务,例如提取事实、做小幅修改。
  • 中:需要判断的工作,例如规划功能、比较方案。
  • 高:高难度调试、深入分析、细致审查。
  • 极高 / Max:只在“高”不够用时测试;效果提升抵得过多花的时间和钱,才保留。

有个容易忽略的细节:在 API 里,对话中途调整推理强度不会让缓存失效。也就是说,可以先用低档摸清情况,遇到难点再调高,前面攒下的缓存折扣还在。在 Codex 里则建议先用模型默认级别,简单任务调低,深入分析再调高。

速度:两档加钱提速

第三个旋钮是速度,都要多付钱。

快速模式面向聊天应用、编程工具这类等不得的场景,响应更快也更稳定,每个 Token 更贵。超高速模式加快的是 Token 生成速度,不改变推理强度,目前用于 GPT-6 Astra;按 OpenAI 的 API 文档,它最高可比标准模式快 8 倍,但默认速率限制较低。

指南在这里配了一条开发者的帖子:

原图:开发者 Paul Solt 的帖子,称用超高速模式 71 分钟做出一个视频生成应用,2.5 小时做出一个摄影灯控制器。

这是个人自述,没有对照组,读作“有人这样用”就够了。

提示词缓存:最多便宜 95% 的那一档怎么拿

价目表里最容易被跳过的,是第三列“缓存输入”。它比普通输入便宜一个数量级:

模型 输入 缓存输入 便宜多少
GPT-6 Astra $10.00 $1.00 90%
GPT-6.1 Sol $2.00 $0.10 95%
GPT-6 Luna $0.10 $0.01 90%

指南里“最多降低 95%”的说法,对应的正是 Sol 这一行。(折扣比例按价目表计算。)

缓存存的是什么

模型读输入时,会边读边算出一批中间状态。提示词缓存做的事,就是把开头不变的那一段算好的状态存下来。下一次请求如果开头一模一样,这段就不用重算,按缓存价收费。

关键在“开头”两个字。缓存匹配的是前缀,从第一个字开始逐段比对,中间只要有一处变了,从那里往后全部作废。

示意图:提示词缓存按前缀匹配。固定内容放前面,每次只有末尾的任务细节需要重算;把会变的内容放到前面,后面整段都无法复用。

指南给的做法因此只有两句:

  • 把固定的指令和参考资料放在会变化的任务细节之前。
  • 保持工具定义一致,不要每次请求都换顺序或改描述。

举个例子。假设一个客服 Agent 每次请求都带 1 万 Token 的固定说明,用的是 Sol:不走缓存,这段每次 2 美分;命中缓存,每次 0.1 美分。一天调用十万次,这一段的开销就从 2000 美元降到 100 美元。(示意计算,未计入缓存写入费用。)

算账时别漏的几项

指南提醒,估算整条工作流的成本时,要把缓存写入费用和适用的长上下文费率一起算进去。OpenAI 的缓存文档还补充了一个门槛:可缓存的前缀至少要 1024 个 Token,太短的提示词吃不到这个折扣。

缓存没命中时,可以去看缓存仪表板和诊断指南,找出是哪一处让前缀对不上。

压缩:对话太长时瘦身

缓存管的是重复的开头,压缩管的是越滚越长的对话。它把上下文体积减下来,同时保留继续执行所需的状态。长任务跑上几个小时,这一项基本是必选。

另外两条省钱的老办法也被点了名:删掉任务用不上的上下文;彼此独立的任务并行跑,别让一个慢步骤拖住无关的工作。

上线前量这三个数

指南建议部署前先拿有代表性的任务跑一遍,量三个数:任务成功率、延迟、每次成功完成任务的成本。

第三个数值得多看一眼。它比“每百万 Token 多少钱”更接近真实账单:便宜的模型如果要重试三次才成功,未必比贵的模型一次做对更省。此外还要想好两件事:怎么监控模型的行为,应用的数据由谁控制、怎么控制。

提示词减肥:四处该改的地方

回到开头那句话。提示词具体该怎么改,指南摘了 Provencher 9 月发表的《重新思考 GPT-6 Astra 的技能与提示词》里的四条。那篇文章给了改写前后的例子,对照着看最清楚。

先说总原则。任务说明只需要讲清四样:想要什么结果、给谁用、有哪些上下文和限制、什么算完成。至于怎么做,尽量留给模型。

一、技能:描述写短,细节按需加载

“技能”(skill)是存成 Markdown 文件的一段提示词,可以附带脚本和资料,用来指导某个特定流程。每个技能有一段描述,模型靠它判断什么时候该用。

问题出在描述太长、太宽。Provencher 举的例子:

技能描述 结果
改之前 创建并验证 Postgres 迁移。在处理数据库、查询、模型或持久化时使用。 只要碰到数据库就被触发
改之后 创建并验证 Postgres 迁移。在新增或修改迁移、审查其上线时使用。 只在处理迁移时触发

另外两条:技能的主文档只做“目录”,指向补充文档和脚本,细节用到再读;把一步步的操作清单换成指导原则。

二、AGENTS.md:别让它每次都把文档读一遍

AGENTS.md 是放在代码仓库里、给 AI 编程助手看的说明文件,模型在这个仓库里干活时都会读到。

写法
改之前 每次修改前,先读 architecture.md、database.md 和 deployment.md。
改之后 服务边界看 architecture.md,改表结构看 database.md,准备部署时看 deployment.md。

改一个错别字也要先读三份文档,纯属烧上下文。说清“哪份文档对应哪种情况”就够了。

同时可以明确放行安全的常规流程。原文的示范是:本地测试用的是一次性数据、碰不到生产环境,直接跑,改动引起的失败自己修、自己重跑,不必每步都来请示。

三、决策边界:把“始终先问我”换成清楚的线

如果以前的模型擅自行动过,你多半加过语气很重的“必须先问”。按 Provencher 的说法,Astra 会把这类话当真,可能在你其实乐意它继续的地方停下来。

指南的建议是写清楚:哪些操作可以独立进行,哪些需要批准。举例来说,摘要怎么组织可以自己定,改变项目范围之前要先确认。

四、做到底:把“完成”定义出来

这一条有点反直觉。Astra 做事细致,但对“该做到哪一步”更谨慎,可能写完第一版就回来等你审阅,其实活还没干完。

所以要在开头就定义完成包含哪些环节:实施改动、跑起来、检查结果、修复问题。同时点明哪些决策留给你审查。

回复也要提要求

除了“做什么”,指南还建议说明“怎样的回复才有用”:用通俗语言,技术细节的深浅跟着读者走,结尾给一段简短的交接说明,交代三件事:改了什么、检查了什么、还有什么需要关注。

最后一个提醒来自 Provencher 的原文:仓库里的技能和说明也会被同事的 Agent 读到,而他们用的可能是别的模型。对 Sol 或 Luna 有帮助的细致指导,可能会把 Astra 管得太死。清理起来也不必全靠手工,可以直接让 Astra 按这几条把现有的规矩审一遍。

长任务:中途改口、边等边干、分头去查

指南说,借助 GPT-6 系列,任务现在可以持续数小时甚至数天。任务一长,麻烦就来了:写第一句提示词的时候,谁也预见不到三小时后会冒出什么问题。

API 这边给了三样工具。

能力 解决什么 要知道的限制
轮次中途引导 模型干到一半,想补一句要求或改方向 走 Responses WebSocket API;更新先排队,不取消正在运行的工具,也不撤销已完成的操作
异步工具调用 跑测试这类慢工具执行时,模型不必干等 依赖该结果的工作,要等结果回来再开始
多智能体工作流 把互不依赖的子任务分给子智能体,再汇总 GPT-6.1 Sol 通过 Responses API 支持,目前处于测试阶段

中途引导值得多说一句。以前想改主意只有两条路:等它跑完,或者打断重来。现在可以边跑边递纸条。但纸条是排队送达的:按 OpenAI 的引导文档,接口回复“已接受”只代表消息进了队列,不代表模型已经照做;已经发出的输出和已经启动的工具都不会被撤回。这项能力只有 GPT-6 系列支持。

异步工具像做饭时的烧水:水壶在烧,人去切菜。应用负责跑慢任务,跑完把结果送回来,模型这段时间继续做别的独立工作。

多智能体适合“分头去查”:比如让几个子智能体各自调查代码库的不同部分,再把发现汇成一份回复。

Codex 里:答问题和改方向

在 Codex 里对应两个动作。

一是随时回答问题。配合 Astra,Codex 会在工作过程中请求澄清。指南的建议是:解决影响下一步的那个问题,同时说明在你做决定期间,哪些独立工作可以继续。如果要离开一阵,先交代哪些任务可以接着干,到哪一步必须停下来等你。

二是需求变了就引导。用新信息引导当前任务,说清哪些要改、哪些保持不变,免得它在已经不合需求的方案上继续花时间。

指南在这里配的是 Peter Steinberger 的帖子:他给 Astra 设了一个长期目标,把项目的数据库访问从同步改成异步工作进程,到发帖时已合入 575 个 PR。

原图:Peter Steinberger 的帖子,称用 Astra 执行一项长时间重构,已合入 575 个 PR,把代码改为异步工作进程。

同样是个人自述。它能说明的是“长任务边推进边交付”这种用法,说明不了成功率。

计算机使用:能调 API,就别点屏幕

“计算机使用”(computer use)让模型像人一样直接操作网站和桌面应用:看屏幕、点按钮、填表单。Astra、Sol、Luna 三款都支持,即使对方没有 API 也能用。指南举的例子是一条完整的链路:让模型调查缺陷、修复代码,再在浏览器里打开产品,检查修复是否生效。

但指南紧接着给了一条克制的规则:为每个步骤选最简单可靠的方式。

  • API 或已连接的工具能直接完成的,就用它们。
  • 需要替你读屏幕、点按钮、填表单时,才用计算机使用。

道理不难懂。调接口是一次确定的请求;点屏幕要截图、识别、定位、点击,每一环都可能出岔子,也更慢。能走门就别翻窗。

想把这项能力接进自己的应用,做法是给模型一个“能运行代码来控制浏览器或桌面”的工具:操作浏览器用 Playwright,操作桌面应用用 PyAutoGUI。两者都是常见的开源自动化库。

原图:Higgsfield AI 的帖子,演示 GPT-6.1 Sol 在 ChatGPT 中边调研边使用其插件生成并比较视频素材。

四家客户怎么用:让模型交证据

指南结尾列了四家用 GPT-6 Astra 做产品的公司。

公司 用 Astra 做什么 指南给出的细节
Harvey(法律) 结合法院信息、判例法、律所文档和律师偏好,定制文稿 联合创始人 Gabe Pereyra:“我们可以为模型提供更多上下文,让结构化输出的质量不断提升。”
Cognition(Devin) 测试软件,并提供测试依据 一个 iPhone 游戏案例中,Devin 交出模拟器录屏和一份报告,把已通过的检查项和尚未测试的部分分开
Hex(数据分析) 把销售渠道表现的问题变成书面分析和交互式仪表板 还会让模型检查数据是否合理、分析是否回答了业务问题
Invideo(视频) 规划时间线剪辑,创建可供剪辑师继续调整的特效 公司称调色和色彩校正任务的成功率提升至原来的约三倍;几位剪辑师一天做出约 50 种特效

这些都是厂商挑选的案例。Invideo 的“约三倍”是公司自己报告的数字,指南没有给出对比基线和样本量,读的时候记着这一点。

比数字更值得带走的,是 Cognition 和 Hex 的共同做法:不只让模型交结果,还让它交证据。 录屏、已测和未测的清单、对数据合理性的自查,这些东西让人能快速核对,而不是只能选择信或不信。这和前面“交接说明要写清检查了什么、还剩什么”是同一个思路。

可以带回自己项目的三件事

第一,选模型看“每次成功任务的成本”,不看单价。 拿自己真实的任务各跑一遍,同时记下成功率和延迟。Luna 和 Astra 的单价差一百倍,但差距最终落在哪,只有跑过才知道。

第二,把提示词重排一次,再减一次肥。 重排是为了缓存:固定的指令、工具定义、参考资料放前面,会变的任务细节放最后。减肥是为了模型:把“每次都先读”“始终先问”“必须跑测试”这类为旧模型加的规矩逐条过一遍,问一句现在还需不需要。

第三,长任务开工前,先写清两条线。 一条是“完成”包含什么:改完、跑通、检查、修掉问题。另一条是“什么时候必须来问我”。再要求结尾交一份交接说明:改了什么、检查了什么、还剩什么。

需要记住的边界:这是一份厂商的使用指南,讲的是推荐做法,没有给出评测数据;关于 Astra“更谨慎、需要推一把”的描述出自 OpenAI 自己的文章,换一个任务未必如此。多智能体仍在测试阶段,超高速模式有速率限制。上面三条里,除了“量成本”和“固定内容放前面”是指南原话,其余是本文据指南整理的做法。

回到开头那句话:模型变聪明以后,要写的不是更长的说明书,而是更清楚的三样东西——要什么、边界在哪、怎样算完。

Gemini 4 Argon:高分之后,离好用还有多远? 2026-10-04

评论区