yan

Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。

阅读原文 →

评论
yan

DeepSeek-V4-Flash-0731 发布:304B 参数,智能体能力大幅增强

DeepSeek 发布 V4 系列最新模型 DeepSeek-V4-Flash-0731,拥有 3040 亿参数,智能体能力大幅增强。Artificial Analysis 评测显示其表现优于 428B 参数的 MiniMax M3。定价为每百万输入 token 0.14 美元、每百万输出 token 0.27 美元,可能是当前性价比最高的模型。

阅读原文 →

评论
yan

DeepSeek V4 Flash 0731 开源,登顶开源模型前三

DeepSeek 发布开源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 API。

阅读原文 →

评论
yan

Inkling-Small 发布,276B 参数性能持平原版

今天,我们发布 Inkling-Small。
Inkling-Small 在仅为 Inkling 四分之一规模的情况下,实现了与之相当的性能。它拥有 276B 总参数,12B 激活参数。我们将开放完整权重。
https://thinkingmachines.ai/news/inkling-small/
现在即可在 Tinker 上对其进行微调,或在 Tinker Playground 中以文本、图像和音频形式与之对话。

阅读原文 →

评论
yan

Thinking Machines 发布第二款模型 Inkling Small,主打效率而非规模

Thinking Machines 发布开源推理模型 Inkling Small,在 Intelligence Index 上得分 40,仅比更大的 Inkling(41)低 1 分,而总参数量不到后者的三分之一(276B 总量,12B 激活)。

阅读原文 →

评论
yan

MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频

MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。

阅读原文 →

评论
yan

DeepSeek V4 Flash 0731 发布,智能指数跃升 10 分

DeepSeek V4 Flash 0731 在 Artificial Analysis 智能指数上得 50 分,较 4 月版提升 10 分,领先 V4 Pro 6 分,并进入智能与成本帕累托前沿。

阅读原文 →

评论
yan

DeepSeek-V4-Flash 正式版 API 上线公测

DeepSeek-V4-Flash 正式版 API 上线公测,模型名设为 deepseek-v4-flash 即可使用,调用方式不变。其 Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Toolathlon verified 70.3,DSBench-Hard 59.6,多项基准远超 V4-Pro-Preview。

阅读原文 →

评论
yan

DeepSeek-V4-Flash API公测上线,Agent能力大幅升级

🚀 DeepSeek-V4-Flash 官方 API 现已上线公测!
🔷 我们大幅升级了其 Agent 能力--基准测试分数现已远超 V4-Pro-Preview。查看下方巨大的性能飞跃!👇 🔷 官方 V4-Flash 现已原生支持 Responses API 格式,并已完全适配 Codex!
查看我们官方 API 文档中的配置详情:https://api-docs.deepseek.com/quick_start/agent_integrations/codex

阅读原文 →

评论
yan

DeepSeek-V4-Flash 正式版 API 上线公测,Agent 能力基准测试远超 V4-Pro 预览版

DeepSeek 今日宣布 DeepSeek-V4-Flash 正式版 API 上线公测,Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Cybergym 76.7,DeepSWE 54.4,Toolathlon verified 70.3,多项基准远超 V4-Pro-Preview。

阅读原文 →

评论