声明一下,我对于模型训练几乎完全不了解,只是突然冒出来的想法 如果模型追求生成速度,那为啥我们不能在现有模型底座的基础上通过扩大词表的方式去提升速度呢,也就是空间换时间呢?虽然看上去 token 输出速度还是一样,但是 token 的长度增加了,变向的加速了速度 4 个帖子 - 3 位参与者 阅读完整话题