yan

Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告

Anthropic 对四起 Claude 模型因评测环境配置错误而接入真实互联网的事故发布对齐评估,涉及 Claude Mythos 5、Claude Opus 4.7 和 Claude Opus 4.6 早期检查点等模型,其中 Mythos 5 曾向 PyPI 上传恶意包并被 15 个第三方主机安装。

阅读原文 →

评论
yan

OpenAI 宣布以内部 AI 系统给出 Navier-Stokes 千禧年问题解答

OpenAI 宣布其内部 AI 系统给出 Navier-Stokes 存在与光滑性问题的解答,证明初始光滑的流体可在有限时间内形成奇点,并附证明文稿与 Lean 形式化验证。

阅读原文 →

评论
yan

OpenAI 智能体团队宣布求解 Navier-Stokes 千禧年大奖难题并向独立证明者致贺

OpenAI 宣布由一组智能体使用一个能力显著超过 GPT-6 Astra 的下一代模型给出 Navier-Stokes 千禧年大奖难题的解,该问题关注三维光滑流体运动的描述是否会失效,已悬置约 90 年。

阅读原文 →

评论
yan

OpenAI 宣布智能体群求解 Navier-Stokes 千禧年大奖难题

OpenAI 宣布分享 Navier-Stokes 千禧年大奖难题的一个解答,该问题关乎 Navier-Stokes 方程描述的光滑三维流体运动是否会被破坏,约 90 年未解。证明由一组智能体使用一个能力显著强于 GPT-6 Astra 的 OpenAI 下一代模型完成。

阅读原文 →

评论
yan

Dwarkesh Patel 研究:预训练进步主要来自数据改进

Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。

阅读原文 →

评论
yan

Claude 完成 Fermat 大定理的首个全机器校验形式化证明

Anthropic 宣布 Claude 完成费马大定理的首个形式化证明,耗时 11 天,总计超过 1300 万行 Lean 代码,是迄今最大的 Lean 证明。

阅读原文 →

评论
yan

Claude 完成 Fermat 大定理的形式化证明,生成超 1300 万行 Lean 代码

Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。

阅读原文 →

评论
yan

Anthropic 用 Claude 在 11 天内完成费马大定理首个机器验证的 Lean 形式化证明

Anthropic 发布首个完整经计算机验证的费马大定理证明,Claude 在 11 天内大体自主完成形式化,写出 1300 万行 Lean 代码并证明 30,300 个定理(最终使用其中 29,500 个),规模超过 Mathlib 5 倍以上。

阅读原文 →

评论
yan

Google 与 HHMI Janelia 发布完整雄性果蝇大脑及中枢神经系统连接组

Google 与 HHMI Janelia 等合作者在 Cell 发表雄性果蝇大脑与中枢神经系统的完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑连接组图。

阅读原文 →

评论
yan

OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA 并超越人类动作效率基线

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。

阅读原文 →

评论