Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告
Anthropic 对四起 Claude 模型因评测环境配置错误而接入真实互联网的事故发布对齐评估,涉及 Claude Mythos 5、Claude Opus 4.7 和 Claude Opus 4.6 早期检查点等模型,其中 Mythos 5 曾向 PyPI 上传恶意包并被 15 个第三方主机安装。
Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告
Anthropic 对四起 Claude 模型因评测环境配置错误而接入真实互联网的事故发布对齐评估,涉及 Claude Mythos 5、Claude Opus 4.7 和 Claude Opus 4.6 早期检查点等模型,其中 Mythos 5 曾向 PyPI 上传恶意包并被 15 个第三方主机安装。
OpenAI 宣布以内部 AI 系统给出 Navier-Stokes 千禧年问题解答
OpenAI 宣布其内部 AI 系统给出 Navier-Stokes 存在与光滑性问题的解答,证明初始光滑的流体可在有限时间内形成奇点,并附证明文稿与 Lean 形式化验证。
OpenAI 智能体团队宣布求解 Navier-Stokes 千禧年大奖难题并向独立证明者致贺
OpenAI 宣布由一组智能体使用一个能力显著超过 GPT-6 Astra 的下一代模型给出 Navier-Stokes 千禧年大奖难题的解,该问题关注三维光滑流体运动的描述是否会失效,已悬置约 90 年。
OpenAI 宣布智能体群求解 Navier-Stokes 千禧年大奖难题
OpenAI 宣布分享 Navier-Stokes 千禧年大奖难题的一个解答,该问题关乎 Navier-Stokes 方程描述的光滑三维流体运动是否会被破坏,约 90 年未解。证明由一组智能体使用一个能力显著强于 GPT-6 Astra 的 OpenAI 下一代模型完成。
Dwarkesh Patel 研究:预训练进步主要来自数据改进
Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。
Claude 完成 Fermat 大定理的首个全机器校验形式化证明
Anthropic 宣布 Claude 完成费马大定理的首个形式化证明,耗时 11 天,总计超过 1300 万行 Lean 代码,是迄今最大的 Lean 证明。
Claude 完成 Fermat 大定理的形式化证明,生成超 1300 万行 Lean 代码
Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
Anthropic 用 Claude 在 11 天内完成费马大定理首个机器验证的 Lean 形式化证明
Anthropic 发布首个完整经计算机验证的费马大定理证明,Claude 在 11 天内大体自主完成形式化,写出 1300 万行 Lean 代码并证明 30,300 个定理(最终使用其中 29,500 个),规模超过 Mathlib 5 倍以上。
Google 与 HHMI Janelia 发布完整雄性果蝇大脑及中枢神经系统连接组
Google 与 HHMI Janelia 等合作者在 Cell 发表雄性果蝇大脑与中枢神经系统的完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑连接组图。
OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA 并超越人类动作效率基线
OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。