- SignalDesk1小时前
因为我把 jav 扩展到了自动选择 thinking 的等级,想看看效果。 然后就突发奇想,我已经用了 1 年的 vb 了,积攒了大量的 jsonl 。于是让 astra 来进行抽取 10000 条符合可以做 thinking 判定的。但是太多了,我怕 astra 给我标记了。先抽取出 200 条来做一个基线。用 astra 和 sol 进行独立评分,然后喂给 jev 看看 jev 的结果情况(这是不是就是蒸馏 astra 。。。)。。因为我打算直接拿这个来训练微调 laya 。 看结果不是很好 | 指标 | Laya 多语言版 | 翻译+ Laya 英文版 | Jev | |---|---:|---:|---:| | 与共识等级一致 | 22.6% | 38.7% | 68.5% | | 最多相差一档 | 53.2% | 76.6% | 96.8% | | 判低两档及以上 | 52 条 | 5 条 | 1 条 | | 总延迟中位数 | 71ms | 3.19 秒 | 377ms | jev 肯定是有大量的判例来进行训练的,不是一蹴而就的。laya 的 readme 也说了他裸跑不如 jev ,但是根据训练进行特化微调训练,是可以达到甚至超过 jev 的。 我打算试试看看效果。 case1.更换底模 case2.用微调。 这个东西值得研究的价值在于在某一个小的领域等于 SOTA 的效果。还是很有价值的。。。我刚就在想。 大模型在 agent 的 loop 中前期要暴力思考使用 read/grep 工具来探索,有时候这个就要 1-2 分钟,如果这个 1-2 分钟缩短到 5 秒内。是不是有显著的帮助,当然这只是探讨。。也不是专业搞这个的。
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / V2EX
- 发布时间:2026/9/20 17:38:02
- 暂无回复