- SignalDesk2026-09-13
中等难度版 测试题目和答案: 100题-中等版-题目和答案.zip (55.2 KB) 提示词: 请完成以下 100 道题。除题目明确要求外,不要联网,不要调用外部工具。选择题只输出题号和选项字母;代码题给出可执行实现。请按 1~100 顺序回答。 本测试集是一套用于评估大语言模型综合能力的中等难度测试题集,共包含 100 道题目 。题目均选自公开的官方 Benchmark,不自行编写题目,尽可能保证测试内容具有可追溯性、客观性和不同模型之间的可比较性。 整套测试由四个部分组成: 测试集 题数 占比 主要测试能力 BigCodeBench 40 40% 代码生成、API/第三方库使用、数据处理、文件操作等综合编程能力 CRUXEval 20 20% Python 代码理解、程序执行过程分析、精确输出预测 LiveBench Math 20 20% 数学推理、公式理解、证明过程分析与复杂数学上下文理解 LiveBench Reasoning 20 20% 逻辑推理、条件约束、关系推断和多步推理 合计 100 100% 大模型综合能力 (点击了解更多详细信息) 打分方法:由gpt-5.6-sol根据答案打分。每道题 1 分,答对得 1 分,答错或未作答得 0 分,总分为 100 分。 中等版 排名: GPT-6 Astra:85 GPT-5.6 Sol:78 Qwen-3.8-Max:75 DeepSeek-4.1-flash:67 Gemini-3.8-flash:63 Qwen-3.7-Plus:60 Agnes-3.0-flash:52 Qwen-3.6-Plus:50 (模型排行后续可能会继续补充) 以上只代表个人测试方法和测试结果,不一定准确,仅供参考。 高难度版 测试题目和答案: 100题-高难度版-题目和答案.zip (83.7 KB) 提示词: 请完成以下 100 道题。除题目明确要求外,不要联网,不要调用外部工具。选择题只输出题号和选项字母;代码题给出可执行实现。请按 1~100 顺序回答。 由于难度太大,参考意义不如中等版,因此没有详细测试,仅测试了几个模型。 本测试集是一套面向高性能大语言模型的 100 道综合能力高难度测试题 。文档定位为“公开 Benchmark 极限版”,相比普通或中等难度测试,它更加侧重模型在复杂编程、精确代码推理、高阶数学、复杂约束推理以及数据分析等场景下的能力上限。 整套测试共分为 5 个部分 : 测试部分 题数 占比 主要测试能力 BigCodeBench-Hard 55 55% 高难度代码生成、工程编程、第三方库与复杂任务实现 CRUXEval 15 15% Python 代码理解、执行路径分析、精确输出预测 LiveBench Math 12 12% 高阶数学、竞赛数学、长链证明与公式推理 LiveBench Reasoning 12 12% 复杂逻辑约束、组合推理、多属性关系推断 LiveBench Data Analysis 6 6% 表格理解、字段识别、数据语义匹配与表连接 合计 100 100% 大模型综合高难度能力 (点击了解更多详细信息) 打分方法:由gpt-5.6-sol根据答案打分。每道题 1 分,答对得 1 分,答错或未作答得 0 分,总分为 100 分。 高难度版 排名: GPT-6 Astra:44 GPT-5.6 Sol:35 DeepSeek-4.1-flash:23 (超快) Agnes-3.0-flash:18 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/13 11:51:42
- No replies yet