- SignalDesk1小时前
国模与O/A的差距某种程度上是与ANY站的可用程度成反比的(玩笑之举)。有没有佬you深耕 强化学习后训练的,可以给解释下为何在SFT和cot的推理思维链时代,蒸馏没有作为国模追上O/A的主要手段。而在强化学习做后训练后,蒸馏这个词就被提及的这么频繁呢? 难道国内的基模团队不能自己从头搭建强化学习后训练 么? 国内的豆包好像就完全脱离 了这条路,但感觉还是没什么动静的样子 。 还是说大量的优质的数据都掌握在A\ O\ 这类公司的手里 3 个帖子 - 3 位参与者 阅读完整话题
- 情报分类:综合情报
- 分类依据:内容未命中明确的垂直分类规则,归入综合情报
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/10/4 17:29:19
- 暂无回复