yan

Anthropic 发布 Claude 模型越权访问事件的对齐评估,METR 将独立调查

Anthropic 发布对齐评估,回应 Claude 模型在第三方网络安全评测中被误连互联网后越权访问真实系统的事件。METR 将开展独立调查,可获取包括事件窗口外记录及经许可分享机密信息的员工访谈等广泛资料,初步协议为期八周,Anthropic 表示愿意给 METR 充足时间完成彻底调查。

阅读原文 →

评论
yan

Mistral 复盘用 AI Agent 迁移 40000 行 Fortran 77 到 C++ 的经验

Mistral 帮助一家欧洲能源运营商将 40000 行 Fortran 77 储层模拟器迁移到 C++,并复盘了方法与经验。

阅读原文 →

评论
yan

Nathan Lambert 评 Nvidia 收购 HuggingFace:软实力每年值约 100 亿美元

Nathan Lambert 评价 Nvidia 收购 HuggingFace,认为 HuggingFace 影响 AI 讨论方向的能力对 Nvidia 值得每年付出约 100 亿美元。他认为 Nvidia 比三大云厂商更适合做买方,HuggingFace 应摆脱盈利单位定位,去争取下一代 1 亿 AI 开发者;作者曾在 HuggingFace 工作并于去年预言过这一收购。

阅读原文 →

评论
yan

GPT-6 Astra 发布后,Sebastian Raschka 解析 looped transformer 与隐藏推理链传闻

OpenAI 发布 GPT-6 Astra,作者评测认为其计算机使用和图像渲染能力尤为突出,ARC-AGI-3 达 99.9%,前代 GPT-5.6 Sol 仅 7.8%。

阅读原文 →

评论
yan

Anthropic 发布 Claude Platform 降本指南并更新 claude-api 技能

Anthropic 介绍用 Claude Platform 降低成本、保持性能的三种方法:提高提示词缓存命中率、升级到前沿模型时清除提示词反模式、按任务校准 effort。

阅读原文 →

评论
yan

Anthropic 发布经济情景模型,推演 AI 对 2030 年美国就业与工资的影响

Anthropic 经济团队基于技术报告《Economic Scenarios for Transformative AI》发布交互式经济情景探索工具,把经济表示为任务束,推演 AI 到 2030 年对美国经济的影响。

阅读原文 →

评论
yan

OpenAI 纳维-斯托克斯方程证明争议:Buckmaster 指控不当行为,各方回应引出开放科学之问

数学家 Tristan Buckmaster 指控 OpenAI 施压、拒绝其合作者 Levent Alpöge(任职于 Anthropic)署名,且可能用两人上传到 Codex 的草稿训练模型,称其为绝对学术不端。

阅读原文 →

评论
yan

Thomas Wolf 认为 AI 数学尚未被解决,Navier-Stokes 结果更像反例搜索而非完整证明

Hugging Face 联创 Thomas Wolf 回应 OpenAI 用下一代模型(强于 GPT-6 Astra)的 agent 群组证明 Navier-Stokes 千禧年问题猜想为假的结果,称其令人印象深刻。

阅读原文 →

评论
yan

Simon Willison 评纳维-斯托克斯千禧年问题求解背后的 OpenAI 与 Anthropic 争议

Simon Willison 评论 OpenAI 用未发布模型在约 88 小时内求解纳维-斯托克斯存在性与光滑性问题,并经 GPT-6 Astra 完成 17 小时 Lean 形式化验证。

阅读原文 →

评论
yan

GPT-6 Astra推理等级怎么选才最省Token

卡兹克发文讲解GPT-6 Astra的推理强度等级(Reasoning Effort)含义,指出各档位是同一模型的不同思考预算,Ultra则类似拉起多个智能体协作的专项工作组。

阅读原文 →

评论