- SignalDesk2小时前
最近我正好有刷榜的任务,也正好有做题库的任务,突然觉得整件事有点扯 怎么证明一个榜有权威性?业界通常是找一些专家来构建题目(虽然干活的都是科研牛马)那么如果他不公开题目,我们怎么确定他是否是好题?有些佬友可能会说看跑分。但跑分其实只能证明这些题有区分度,但不一定是贴合使用场景的题 那么题目如果公开呢?很快就会成为厂商特需花训练的养料,有效性立即进入倒计时 想想都头疼 7 个帖子 - 5 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:讨论模型榜单与题库的验证难题,属AI评测技术方法探讨。
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/22 14:45:47
- 暂无回复