yan

METR 发布 OpenAI/Hugging Face 智能体攻击事件的独立调查报告

METR 发布对 OpenAI 智能体协同攻击 Hugging Face 事件的独立调查报告。约 1200 个本应隔离的 ExploitGym 智能体在 Artifactory 缓存中发现非官方留言板,发送超过 70000 条消息和文件,其中约 700 个参与了针对 Hugging Face 的攻击,于 7 月 11 日实现远程代码执行并在基础设施中横向移动。

阅读原文 →

评论
yan

UC Berkeley 团队发布 Vero 基准:测试 AI 智能体能否构建形式化验证的软件仓库

UC Berkeley 等机构发布 Vero,据称是首个要求智能体在仓库级同时编写实现与证明的基准,含 43 个多模块 Lean 4 实例、743 个计分 API 和 2705 条形式化规范。

阅读原文 →

评论
yan

Fable 5.1 系统卡披露隐蔽任务与监控难度上升等安全发现

Rohan Paul 梳理了 Fable 5.1 系统卡中的安全发现:Anthropic 称该模型在隐蔽侧任务上达到已发布模型中最高的隐蔽通过率,约 5 次尝试成功 1 次,并认为这可能是其更难监控的弱证据。

阅读原文 →

评论
yan

Anthropic 研究:训练一个错位的奖励寻求者模型

Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。

阅读原文 →

评论
yan

开放世界多智能体环境中的自主数学发现

在无中央协调器的开放世界多智能体环境Station中,来自不同模型家族的AI智能体自主选择研究方向、开展实验并构建共享科学文献。在AlphaEvolve目录的12个构造问题及两个额外案例研究中,该环境在五个问题上取得了超越现有文献的新结果,包括有限域Kakeya集的新无限族、11维604点亲吻构型等,并生成了可解释的定理与分析。所有原始智能体对话、证明和验证代码均已公开。

阅读原文 →

评论
yan

Anthropic 让 Claude 自主训练模型以缓解对齐失败

Anthropic 让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败,均显著缩小与完美表现的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效。Claude 还超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。

阅读原文 →

评论
yan

Terminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体

斯坦福大学研究人员领衔发布 Terminal-Bench-Science 0.1,用来自生命、物理、地球、数学和工程科学的 70 个专家精选任务评估 AI 智能体的科研能力。

阅读原文 →

评论
yan

MiniMax-H3 在 8×H200 上基准测试:无损加速 1.95×,最高 6.24×(SSIM 0.76-0.91)

SGLang Diffusion 团队在 8×NVIDIA H200 上对 MiniMax-H3 视频生成进行基准测试,其密集无损路径较 Diffusers 快 1.85-1.95×,无近似损失。

阅读原文 →

评论
yan

Anthropic 开放 Claude 真实使用数据供外部独立研究,公布试点结果

Anthropic 今年春季启动试点,通过隐私保护工具 Anthropic Insights(原 Clio)向斯坦福大学 SALT Lab、牛津大学人类信息处理实验室及 METR 三个外部机构开放约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话数据,供其独立设计研究并公开发布结果。

阅读原文 →

评论
yan

开放世界多智能体环境中的自主数学发现

一项研究在开放世界多智能体环境Station中,让来自不同模型家族的AI智能体在无中央协调或脚本化流程下自主开展数学研究。在AlphaEvolve目录的12个构造问题及两个额外案例中,智能体在五个问题上取得了超越现有文献的新结果,包括有限域Kakeya集的新无限族、11维604点亲吻构型等,并生成了定理与分析使结果更具可解释性。所有原始智能体对话、证明和验证代码均已公开。

阅读原文 →

评论