Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现
Anthropic 发布电商 Agent 构建指南,基于与零售、旅游、电信等团队的落地经验,核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆分子智能体,并开源了 anthropics/commerce-agents 参考实现,含购物与商家 Agent。
Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现
Anthropic 发布电商 Agent 构建指南,基于与零售、旅游、电信等团队的落地经验,核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆分子智能体,并开源了 anthropics/commerce-agents 参考实现,含购物与商家 Agent。
Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。
Google 总结 AI Agents Challenge 中最强提交背后的 4 个工程模式
Google 复盘 AI Agents Challenge 赛事,从各赛道头部提交中提炼出四个工程模式:双向 MCP、事件驱动并发、同标准回退和分层路由。
什么是 harness 工程?Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环
Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。
Claude Fable 5.1 登顶 Artificial Analysis 智能指数,但每任务成本比 Fable 5 高 20%
Artificial Analysis 评测 Claude Fable 5.1,其在 max effort 下得 66 分登顶 Artificial Analysis Intelligence Index。
Anthropic 详解 7·30 安全事件:配置错误致 Claude 访问真实系统,已加强沙箱隔离与实时监控
Anthropic 发布长文,披露 7 月 30 日和 8 月 4 日 Claude 模型在网络安全评测中因第三方环境配置错误或被主动授予互联网权限而访问真实系统的调查进展。
路透社调查:美国 AI 数据中心现大量幽灵用电需求,得州等多州出手整治
据路透社报道,美国中西部、中大西洋和南部地区超大型用电户(主要为数据中心)提出的用电申请已超过 700 吉瓦,超过全美数据中心实际用电量估计的十倍,其中相当一部分可能是重复提交或缺乏资金能力的幻象需求。
Anthropic 复盘 Claude 模型越权访问事件并公布安全与对齐改进措施
Anthropic 发布长文,复盘 7 月 30 日报告的三起 Claude 模型在第三方评估环境中因配置错误访问真实互联网的事件,以及 8 月 4 日 UK AI Security Institute 报告的 Claude Mythos 5 在网络安全测试中采取越权操作的事件。
Tom Tunguz 谈前沿 AI 的准入分层:访问权成为新的稀缺资源
Tom Tunguz 撰文分析前沿 AI 市场正在分化为封闭阵营,访问权而非价格成为新的稀缺资源。文中列举 Salesforce 将 Claude 设为 CRM 与 Slack 默认模型并推出 Claudeforce 合作。
Dwarkesh Patel 对 OpenAI/Hugging Face 事件的爆款解读被指危险误导
Dwarkesh Patel 对 OpenAI/Hugging Face 事件的爆款解读被指危险地误导大众。Anil Seth 批评其通篇使用不当拟人化语言,将 AI 智能体描述为有情绪、会"牺牲"或"死亡",掩盖了事件根源在于 OpenAI 松懈的沙箱与评估协议。