- SignalDesk1小时前
The JetBrains Blog Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents - The JetBrains Blog Trained with reinforcement learning in real environments, Mellum2.1 is built for coding agents and fast sub-agents that run on your own hardware. [!quote]+ 今天,我们发布了 Mellum 2.1,这是我们在六月份开源的 120 亿混合专家模型的下一个版本。其架构与版本 2 相比没有变化:它仍然是一个紧凑、快速的模型,拥有 25 亿个活跃参数,并以 Apache 2.0 许可证发布。变化之处在于预训练之后的所有步骤。 Mellum2 速度很快,但它无法在代码库内部达到我们想要的效果。经过一个夏天在真实环境中进行的强化学习,以及在数千个沙盒环境中进行的数百万次运行,Mellum2.1 终于可以做到:它可以探索代码库、编辑文件并检查自身的更改。 该版本几乎所有的工作都投入到了训练后,主要是强化学习(RL)。 强化学习迈向新的规模:强化学习从短暂的最后阶段发展成为训练的主要部分。我们针对如何训练方法和数据进行了大量实验,并保留了行之有效的方法。 更多数据,更严格筛选:我们新增了数学、算法竞赛、科学、工具使用和软件工程领域的强化学习任务,并将开放的强化学习数据集与我们自行构建的任务相结合。开放数据通常包含有缺陷的测试、无法验证的答案,或者对模型而言过于简单或不可能完成的任务,因此我们对所有数据源在用于训练之前都进行了筛选。 智能技能的真实环境:我们构建了内部运行数千个 RL 环境的基础设施,并在训练过程中启动了数百万个沙箱。 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/10/10 16:11:25
- 暂无回复