ARC-AGI-3 发布仅半年即被 Astra 饱和,进展快于 François Chollet 预期一倍
Sherwin Wu 表示自己曾觉得 ARC-AGI-3 很难,如今该基准已被 Astra 饱和。引用 François Chollet 的话称,ARC 3 发布时他预计前沿模型约一年才能饱和,实际只用了 6 个月,约为预期的 2 倍速度,新一代模型的能力将挑战人们基于旧模型形成的 AI 观点。
ARC-AGI-3 发布仅半年即被 Astra 饱和,进展快于 François Chollet 预期一倍
Sherwin Wu 表示自己曾觉得 ARC-AGI-3 很难,如今该基准已被 Astra 饱和。引用 François Chollet 的话称,ARC 3 发布时他预计前沿模型约一年才能饱和,实际只用了 6 个月,约为预期的 2 倍速度,新一代模型的能力将挑战人们基于旧模型形成的 AI 观点。
François Chollet 评 GPT-6 Astra 在 ARC-AGI-3 上的表现
François Chollet 发文称 GPT-6 Astra 在交互式推理任务上带来阶跃式能力提升,使用标准 harness 在 ARC-AGI-3 上得 66%,配合持续对话 harness 和自定义 compaction 接近 100%,每局成本约 $360。
Artificial Analysis 评测 GPT-6 Astra:编码智能体追平 Fable 5 但价格涨至 2.5 倍
Artificial Analysis 发布 GPT-6 Astra 评测,其 Coding Agent Index 得分 67,约等于 Claude Opus 5 和 Fable 5,且成本不到 Fable 5 的一半;token 效率比 GPT-5.6 Sol (max) 高约 70%。
Tom Tunguz 解析 Meta Muse Spark 双轨定价背后的数据换算力逻辑
Tom Tunguz 分析 Meta 发布 Muse Spark 模型及双轨 API 定价:Standard Tier(muse-spark-1.3)输入 $1.25/m。
Google Cloud 教你用 Cloud Run instances 以每月 $5.70 搭建常驻 Agent
Shir Meir Lador 在 Google AI 开发者博客介绍如何用 Cloud Run instances 以每月 $5.70(1 vCPU、1Gi 内存、共享 CPU)在云端 24/7 运行常驻 Agent。
用 TRL 和 OpenEnv 训练编码模型画水彩:Hugging Face 全流程开源复现
Hugging Face 博客作者基于 Surya Narreddi 的原始想法,用 TRL、OpenEnv 和 Qwen/Qwen3.5-35B-A3B 复现了让语言模型通过 p5.brush 写 JavaScript 画水彩的 RL 训练流程,所有数据集、环境、脚本和模型均开源在 Hub。
Meta Muse Spark 1.3 在 Artificial Analysis 编码智能体指数中与 Claude 组合对比评测结果公布
Artificial Analysis 编码智能体指数显示,Meta Muse Spark 1.3 (max) 在 Muse Code 下得 68 分,仅次于 Claude Code + Opus 5 (xhigh) 的 68 分。
GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本
GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。
美国司法部就 OpenAI 版权诉讼提交意见书支持训练属于合理使用
美国司法部在 OpenAI 与纽约时报的版权诉讼中提交意见书,主张用受版权文本训练 LLM 一般应属合理使用,称模型训练具有非凡转换性,并以国家安全为由警告全面许可要求会削弱美国 AI 开发者竞争力。该意见书属建议性质、不约束法院,仍将数据获取方式与具体输出是否复制受保护段落作为独立问题留给法院逐案判断。
美国司法部在 OpenAI 与纽约时报版权诉讼中支持训练属于合理使用
美国司法部提交立场声明,正式主张在版权文本上训练 LLM 通常构成合理使用,这是华盛顿首次介入 AI 训练版权诉讼潮,但该文件仅具咨询性、对法院无约束力。司法部区分了获取数据、训练和输出三个环节,认为训练用途不同于发表文章、不会替代原作;并警告一刀切的许可要求会抬高小公司门槛。法院仍需逐案裁定,但采纳该框架会把法律压力更多转向数据获取和具体输出环节。