- SignalDesk3小时前
小米正式发布并开源 MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生多模态模型。 Pro 版在第三方评测机构 Artificial Analysis 的综合智能指数上拿到 46 分,超过 Kimi K3 和 Qwen3.8 Max,成为当前最强开源模型,同一天发布的 xAI Grok 4.7 也是 46 分,两者并列。不过和顶级闭源模型 Claude Fable 5.1、GPT-6 Astra 相比仍有差距。 这次发布最值得关注的,是背后的训练方法。MiMo 团队负责人 Fuli Luo 曾参与 DeepSeek R1 的研发,她说 V2.6 很可能是开源模型团队迄今为止单次规模最大的强化学习(RL)训练。Pro 模型跑了 30 个大步,覆盖约 75 万条训练轨迹,每条轨迹平均 11 万到 15 万 token,训练成本约 262 万美元。 换句话说,模型练的不是简单的一问一答,而是完整的、动辄几万步的 AI 智能体工作流程,写代码、调工具、查错、纠偏,整个链条都在强化学习中反复训练。 Fuli Luo 认为这次的研究创新和工程挑战超过了她此前参与的 DeepSeek R1。她提到团队采用了"MixRL"策略,把编程、视觉、网络安全等不同领域的任务混在同一个大规模 RL 训练中一起跑,而不是各跑各的再拼起来。那些验证困难或时间线极长的任务则单独训练,最后通过 MOPD 方法合并能力。 对开发者来说,价格是另一个亮点。Pro 的 API 定价是每百万输入 token 0.435 美元、输出 0.87 美元;Flash 更便宜,输入 0.14 美元、输出 0.28 美元。 小米称在同等智能水平下,价格仅为海外模型的 1/20 到 1/60。两个模型都支持 100 万 token 上下文窗口和文本、图像、音频、视频输入,MIT 许可证,可以自由下载、部署、商用。 Flash 虽然便宜得多,但在不少智能体基准测试上只比 Pro 低几分。对于需要大批量跑 AI 智能体任务的团队,比如自动化代码审查、文档处理、内部研究助手,Flash 的性价比可能更实际。 除了模型权重,小米还同步开源了完整的 RL 训练框架、7000 多个 RL 任务环境,以及一个从 MiMo RL 轨迹蒸馏出来的 Qwen-9B 小模型。这套东西的价值可能比模型本身更大,其他团队可以拿来在自己的小模型上复现类似的 RL 训练流程,而不用从头训一个万亿参数的基座模型。 Fuli Luo : MiMo-V2.6: The Hard Road to Scaling Up RL MiMo-V2.6 is very likely one of the largest single RL runs, by compute, that any open-source model team has undertaken to date. In an era when compute is brutally scarce, we still chose to dedicate a team of several dozen people to one Link: https://x.com/_LuoFuli/status/2102162926802968749
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:AI / AI前沿 / 宝玉 @dotey
- 发布时间:2026/9/22 10:21:05
- 暂无回复