yan

OpenAI 发布 GPT-6 Astra,主打电脑操作与对齐能力

OpenAI 发布 GPT-6 Astra,首席研究官 Mark Chen 称其能构建测试软件、跨应用操作电脑并尝试开放科学问题。作者补充数字:OSWorld 真实桌面任务从 75 分钟降到 40 分钟,职场自动化从 18% 升到 41%,未防护越权率从上一代 48% 压到 0%,并称花了 2000 美元算力解出 10 道十年未解的数学与理论计算难题;同时指出带工具的综合测试仍落后 Claude。

阅读原文 →

评论
yan

OpenAI 发布 GPT-6 Astra,主打电脑操作并触发网络安全 Critical 红线

OpenAI 于 9 月 3 日发布 GPT-6 Astra,API 模型名 gpt-6-astra,每百万输入 Token 10 美元、输出 50 美元,未来几天推送到 ChatGPT 各档订阅、API 和 AWS Bedrock。

阅读原文 →

评论
yan

OpenAI 发布 GPT-6 Astra:多项基准刷新纪录并强化网络安全能力

OpenAI 发布 GPT-6 Astra,称其在 FrontierMath Tier 4 达 98%、ARC-AGI-3 达 99.9%、ExploitBench 达 100%,并称其网络安全能力达到 Preparedness Framework 的 Critical 门槛。

阅读原文 →

评论
yan

OpenAI 发布 GPT-6 Astra,首个达到关键级网络安全能力门槛的模型

OpenAI 于 9 月 3 日发布新一代大语言模型 GPT-6 Astra,是其首个达到准备框架中关键级网络安全能力门槛的模型,可在无逐步指导下发现防护严密系统的未知漏洞。

阅读原文 →

评论
yan

Greg Brockman 转发:GPT-6 Astra 在 ARC-AGI-3 达到 SOTA,基准趋于饱和

Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。

阅读原文 →

评论
yan

OpenAI 发布 GPT-6 Astra:1.05M 上下文的计算机操作模型,因触及 Critical 网络安全阈值而限制访问

OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 1,050,000 token 上下文窗口、128,000 最大输出 token,2026 年 4 月 30 日知识截止,OSWorld V2-Offline 得分 72.6%(GPT-5.6 Sol 为 65.7%),平均任务时间从约 75 分钟降至 40 分钟。

阅读原文 →

评论
yan

Perplexity 宣布将接入 OpenAI GPT-6 Astra,称其在 WANDR 评测中居首

Perplexity CEO Aravind Srinivas 祝贺 OpenAI 发布 GPT-6 Astra,称其在宽度和深度研究任务上远超其他模型且更具成本效益,将很快向 Perplexity Computer 的 Pro 和 Max 用户开放。

阅读原文 →

评论
yan

OpenAI 发布 GPT-6 Astra,多项基准达到 SOTA

OpenAI 发布 GPT-6 Astra,在 FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0 上达到 SOTA,并在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得领先成绩。

阅读原文 →

评论
yan

OpenAI 发布 GPT-6 Astra 并公布安全概览,称其网络安全能力达到 Preparedness Framework 的 Critical 级

OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型,可在无人逐步引导的情况下发现未知安全漏洞并开发利用方式。

阅读原文 →

评论
yan

OpenAI 发布 GPT-6 Astra,ARC-AGI 3 得分 99.9%

OpenAI 的 GPT-6 Astra 今日起向部分组织推出,随后面向 ChatGPT Plus、Pro、Business、Enterprise 用户开放,API 定价为每百万输入 $10、每百万输出 $50,与 Claude Fable 5/5.1 持平。

阅读原文 →

评论