Original Summary

官方博客: 阶跃星辰 Step 5 Preview 在 AI 编程、软件工程、专业知识工作等任务上达到前沿水平,并在金融领域展现出尤为突出的能力。Step 5 Preview 采用稀疏 MoE 架构,总参数量 600B,每个 Token 激活 27B 参数,支持 1M Token 上下文窗口和视觉输入。 评分惊人,跻身第一梯队 Step 5 Preview 现已可通过我们的产品和 API 使用。 模型将于 10 月 15 日正式开源。 更完整的评测结果,覆盖 Reasoning、Coding、Agent、Finance 和 Multimodal 等多个方向。 评测基准 Step 5 Preview (High) GLM 5.3 (Max) Kimi K3 (Max) GPT-6 Astra (Max) Claude Fable 5.1 (Max) Claude Opus 5 (Max) 推理与知识 GPQA Diamond 93.5% 91.7% 93.5% 96.1% 93.7% 93.2% HLE 46.5% 42.3% 46.9% 54.7% 59.1% 54.9% AA-LCR v1.1 88.3% 79.7% 88.7% 80.7% 85.3% 79.3% CritPt 20.9% 19.1% 23.4% 31.7% 29.7% 29.1% Coding DeepSWE v1.1 67.7% 66.9% 67.5% 74.1% 67.4% 74.0% Terminal-Bench v2.1 85.0% 83.9% 85.0% 88.4% 91.4% 89.1% Terminal-Bench v4 33.3% 41.9% 12.6% 57.9% 55.8% 52.3% CyberGym 84.7% 84.5% 80.0% — — — SciCode 58.9% 59.0% 59.5% 56.5% 63.1% 56.4% RoadmapBench 54.3% 54.1% 55.4% — — 68.3% ProgramBench (Pass Rate) 80.5% 72.0% 77.8% 85.4% 82.7% 82.3% SWE-Marathon v1.1 (Partial Score) 72.7% 67.4% 84.4% 77.3% 80.2% 85.6% MLS-Bench-Lite 40.5% 37.3% 48.3% — 50.3% 49.8% SWE-Atlas-QnA 63.6% 59.6% 59.5% 60.9% — 66.0% SWE-Atlas-Test-writing 50.8% 50.4% 50.4% 51.1% — 60.3% StepCodeBench† 49.0% 40.2% 43.9% 61.0% — 63.9% StepCode-Bench-Daily† 64.9% 69.1% 57.7% — — 77.6% StepCode-Bench-General† 65.0% 62.0% 65.2% 64.3% — 68.3% 通用 Agent GDPval-AA v2 1571 1634 1548 1580 1724 1735 τ³-Banking 42.5% 50.3% 46.0% 41.4% 47.2% 42.1% AutomationBench-AA 51.0% 62.2% 58.3% 68.5% 59.4% 56.6% AutomationBench (public) 44.0% 48.2% 46.7% — — — AA-Briefcase 1417 1511 1492 1562 1662 1645 Toolathlon-Verified 74.1% 73.0% 76.5% — 77.8% 80.6% MCP-Atlas 85.6% 86.8% 85.3% — — 87.0% PresentBench 76.8% 74.5% 75.6% — — 77.3% OfficeQA Pro 60.3% 59.1% 62.6% 67.7% — 64.7% SpeadSheet v2 29.4% 30.5% 31.9% 31.4% — 32.8% JobBench 59.0% 61.4% 54.3% — — 65.7% Apex-Agents 37.8% 38.1% 41.0% — — 41.8% Draco 83.3% 82.3% 78.5% 76.8% 87.7% 87.6% BrowseComp 88.7% — 91.2% 91.5% — 90.2% HLE w/ tools‡ 59.4% 62.5% 56.0% 57.2% 65.0% 63.6% FinStepBench-LiveSearch† 74.5% 73.3% 70.9% 74.5% — 76.2% FinStepBench-CorporateValuation† 60.6% 56.1% 60.6% 77.3% — 69.7% FinStepBench-FinanceDR† 55.8% 53.3% 48.9% 45.0% — 59.1% FrontierFinance 66.4% 64.1% 62.6% 55.0% — 69.7% 电脑操作 Agents’ Last Exam (ALE-CLI) 29.5% 28.6% 27.6% 33.3% — 28.6% 多模态与文档 MMMU-Pro 76.0% — (text only) 81.0% 87.0% — 85.0% GDP.pdf 14.8% 11.2% 22.0% 31.0% 26.2% 21.6% 标注 † 的评测基准为内部自研。 加粗数值表示该行的最佳结果,下划线数值表示次佳结果。 对于 HLE w/ tools‡,Step 5 Preview (High)、DeepSeek V4.1 Flash (Max) 与 GLM-5.3 (Max) 在纯文本子集上评测,其余模型在完整数据集上评测。不同评测设置下的结果不具备直接可比性。 2 个帖子 - 1 位参与者 阅读完整话题


  • 情报分类:技术学习与提效
  • 分类依据:内容涉及技术、AI、软件工具或工程实践
  • 信息来源:服务器 / LINUX DO - 最新话题
  • 发布时间:2026/9/20 10:22:41