- SignalDesk1小时前
1. 测试方法 各取科目一和科目四题目一百道纯文本题目,请求 /v1/systemone 请求 { "state": { "question": "……", "options": ["A. 正确", "B. 错误"] }, "model": "jev-latest", "questions": { "decision": { "type": "choice", "instructions": "……从给定标签中选出唯一正确项", "criteria": { "A": "……", "B": "……" } } } } 响应 { "model": "jev-1.13.0", "answers": { "decision": { "choice": "A", "confidence": 0.98, "probabilities": { "A": 0.99, "B": 0.01 } } }, "usage": { "input_tokens": 403, "output_tokens": 31 } } 2. 数据 总体: 93.25% (373/400) 科目一: 91.50% (183/200) 科目四: 95.00% (190/200) 问两遍:93.0% / 93.5%, 200 组里有 199 组两次答的一模一样(99.5%) 单题耗时:中位 758 ms ,均值 767 ms,P90 814 ms 每题消耗:约 520 输入 token / 31 输出 token 3. 置信度分析 置信度 < 0.5 → 正确率 62.8% (43 次) 0.5 – 0.79 → 正确率 80.5% (41 次) 0.80 – 0.94 → 正确率 98.6% (71 次) ≥ 0.95 → 正确率 99.2% (245 次) 答对的平均置信度 0.889,答错的平均置信度 0.392 4. 错题分析 一、跟数字有关的条规 “超速 40% 记 6 分”、“逃逸尚不构成犯罪罚一千”、“拼装车上路罚一千”、“不系安全带警告或 50 元”…… 这类题它经常把"正确"判成"错误"。而且这里面有一条是 唯一一个信心满满答错的 ——“造成交通事故后逃逸,尚不构成犯罪的,处一千元罚款”,它给了 0.96 的置信度说这是错的。 二、地方性规定和程序细节 比如"浙江省注册登记的载货汽车车门要喷涂单位名称"这种省级规定,它没这个知识。还有"科目二科目三可以同时预约、连续考试"、“违反道交法发生事故算不算交通违章行为”(考点其实是"违章"这个词已经改成"违法"了)这类。 三、科目四的实操常识被反向理解 这类特别典型,它倾向于接受那些"听起来有道理但其实很危险"的表述: “夜间全车灯光突然熄灭,应当立即迅速制动靠边停车” → 实际是错的(不能迅速制动) “高速上着火要开进服务区灭火” → 错的 “长下坡可以间歇性用驻车制动辅助制动” → 错的 “转向助力失效就紧握方向盘保持低速” → 错的 不过好消息是这一类它的置信度普遍很低(0.00 – 0.71),用阈值就能拦住 四、唯一一个两次回答一对一错的题 “机动车在道路上临时停车应当按顺行方向停车,车身距道路边缘不超过50厘米” A. 正确 B. 错误 (答案键: B ) 第 1 次 • 判定: A • 置信度: 0.11 • 概率分布: B 0.45 / A 0.55 第 2 次 • 判定: B • 置信度: 0.07 • 概率分布: B 0.53 / A 0.47 Jev 两次的概率都压在 0.45/0.55 和 0.53/0.47,基本就是抛硬币 —— 也就是说, 唯一的"不稳定"这一条,恰好也是它自己明确标注不确定的一条 4. 结论 可用性 :在无图判断题上,Jev 单次调用即可达到 93% 级别,延迟 ~0.76 s、单价极低(每题输入约 520 token),适合作为"低成本批量预筛". 不要盲信单次输出 :14 个错题题干的重复表现稳定(13 题两次都错),说明错就是稳定的知识盲区。 用置信度做门控 : confidence ≥ 0.80 的 79% 判定正确率 99.05%,可以放心自动采纳; <0.80 的 21% 建议人工或规则兜底 本次评测的边界 :只覆盖判断题(2 选项)。四选一单选题、多选题、含图片题未纳入 2 个帖子 - 2 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/21 17:22:06
- 暂无回复