- SignalDesk1小时前
最近JEV挺火,这种偏“判断/打分”的模型是不是很适合拿来做 Rerank。传统 reranker 更多是在判断 query 和 doc 的相关性,而 JEV 可以直接问“这段内容是否真的有助于回答用户问题”,也就是从 relevance 往 answerability / utility 靠近。对于 RAG 可能比单纯语义相关更有价值,因为很多 chunk 虽然很相关,但其实并不包含答案。 目前我想测试的方案是 Retriever 先召回 Top100,JEV 做 Pointwise Score 筛到 Top20,再用 Pairwise 或 Listwise 做最终排序。关键问题是:JEV 的打分是否有足够好的 ranking consistency?比如 A=0.8、B=0.7,是否真的意味着 A 应该稳定排在 B 前面。感觉可以直接拿 BEIR/MTEB 或实际 RAG 数据跑一下,对比传统 cross-encoder reranker 和 LLM Judge。大佬们有没有思路或者有没有想法? 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/21 20:54:19
- 暂无回复