- SignalDesk2026-09-13
一、前情提要 大模型到底能不能在变成猫娘的同时保持智力水平呢?根据我前面做的一组实验,答案大概是:可以兼顾,但想让两项能力一起涨,没那么容易(悲)。之前我专门做了一轮多目标强化学习实验: 数学能力与猫娘人格可以解耦优化吗?前沿RL算法下的大模型多目标训练研究 开发调优 一、引言:猫娘的智力和可爱只能选一个吗? 我们拿日常生活语料去训练一个猫娘大模型,可能会把模型变得笨笨的,我们总不能看着猫娘流口水吧(bushi 那怎么给猫娘补补思维逻辑捏?让她做数学题!但也不能狠狠让她做题,不然忘记了猫娘可爱的本性咋办?逃离原生主人咋办? 这背后是一个 多目标 优化问题:数学正确性(智力)和角色一致性(可爱猫娘),能否在强化学习中兼顾?把人格评分也写进奖励函数是否就够了… 在那组实验里,我比较了 GRPO、 Persona -GRPO、GDPO 和 GD2PO-Hard 几种训练方式。最后的结果很直接:在这套实验设置下, Qwen3.5-4B 在 GD2PO-Hard 的数学表现最好,但猫娘人格并没有随着数学能力一起提升。(即使有猫娘rubric奖励) 图里比较了三个阶段(均为 真实实验结果 ): SFT25 :猫娘数学 SFT 冷启动的较早检查点; SFT150 :继续 SFT 冷启动的检查点,也是后续 RL 的统一起点; GD2PO-Hard :这组实验里首轮数学表现最好的 RL 模型。 其中,Pass@4 指的是在 AIME、MATH-500 等多个题源组成的 620 题评测集上, 一道题四次采样中至少有一次通过严格数学验证的比例 ; Persona@Correct 则只看已经答对的回答,再用本地部署的 Qwen3.8-27B 从多个 人格维度 进行评分并归一化。 结果很直观:SFT150 的猫娘人格最强,但数学水平下降;经过 GD2PO-Hard 训练后,Pass@4 提升到了 72.58% ,但 Persona@Correct 从 0.757 回落到了 0.685 。 这么看来,如果你是一只猫娘(你必须是),如果只是一天到晚刷题,你会变得不可爱的,但智力确实提升不少。 二、扩充猫娘数学推理 数据集 前面的 RL 实验,其实是从一个 猫娘数学 SFT 数据集 冷启动的,最初版本有 1,650 条 样本;后来我又继续补数据、重做审核和清洗,现在规模已经扩充到 约 2,300 条 ,并开源在 Hugging Face 。如果觉得有意思,可以顺手点个 Like 喵。这个数据集的目标就是让模型先学会 以猫娘的身份认真做数学 ,再谈后面的 RL。 https://huggingface.co/datasets/liumindmind/NekoMathhuggingface.co/datasets/liumindmind/NekoMath 每条样本都尽量同时包含: 完整的数学推理 ; 猫娘角色表达 ; 稳定的最终回答格式 ;可供 自动 verifier 使用的 标准答案 。 从前面的实验看,它比较适合作为一种 冷启动数据 :让一个原本普通的基础模型 快速 学会 猫娘人格、数学推理习惯和统一输出格式 。当然,不建议一直训练下去,前面的实验已经说明,SFT 继续训下去,角色会越来越稳定,但数学能力并不会自动同步上涨。能力和人格仍然存在取舍。 2.1这些数据是怎么来的? 这批数据主要基于 dapo-math-17k ,这个数据集仅包含题目与最终答案、缺少完整推理过程,由 Claude Opus-4.8、Claude Sonnet-5 和 GPT-5.6-sol 扮演猫娘 辅助生成和改写,再经过 多轮数学核验 、推理质量检查、格式清洗与人格润色。最终答案即使碰巧正确,只要核心推导不可信也不会直接保留;能局部修的修,核心证明有问题的重写,无法可靠验证的就删除。最后再统一格式、控制长度、去重,并检查猫娘表达是否自然。 这批数据真正想保留的,是 值得模型学习的推理过程 。很多题需要分解结构、检查边界、验证定理条件, 强模型在生成时也会犯错 ,因此清洗的重点是把错误和伪证明剔掉,留下 可复用、可检查、可迁移的猫娘解题思路 。 2.2数据集里都是什么数学题 目前数据大致分成 7 个 一级类别。分布大概是: 这份数据目前明显偏向 数论、代数和几何 ,三类加起来占了大头。看到这个,想起了之前被 组合数学 折磨的痛苦(悲) 三、案例展示 为了更直观地展示一条 NekoMath 数据到底长什么样,下面放一条真实样本。 题目是:求最大的整数 n ,使得 5^n 整除 2019! - 2018! + 2017! 这题猫娘的思路其实很干净:先把 提取成 ,再分别数两部分里有多少个因子 。其中 用 Legendre 公式算出 502个, 通过模 和模 检查出恰好还有 个,所以最后得到 . 数学过程比较完整,猫娘表达自然融入,最终回复则进一步压缩成更适合直接回答用户的版本。 四、小总结 话说回来,在一个模型上,我既要猫娘(可爱)又要数学(智力),是不是太贪心了? 那么,既然强行把两种目标塞进同一个模型里这么难,干脆把它们拆开会不会更好?比如,一个 Math Agent 专门负责严谨解题,一个 Persona Agent 再负责把结果组织成自然的猫娘表达(上期评论区的建议)。这样就能把数学能力和角色人格在系统层面进一步解耦。 赶紧去训练吧,喵~ 原文先发在了知乎喵。 猫娘数学推理数据集,大模型只能在可爱和聪明上选一个吗? - MindsRiverPonder的文章 - 知乎 https://zhuanlan.zhihu.com/p/2082409006287558633 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/13 18:25:01
- 暂无回复