- SignalDesk1 hr ago
IT之家 10 月 9 日消息,当地时间 8 日,AI 模型评测平台 Arena 竞技场宣布完成 2 亿美元 (IT之家注:现汇率约合 13.43 亿元人民币) B 轮融资, 估值达到 31 亿美元 (现汇率约合 208.17 亿元人民币) 。Arena 最初是加州大学伯克利分校 2023 年的一项研究项目,通过公众投票对 AI 模型进行排名。 Arena 此前披露,今年 6 月的年化营收达到 1 亿美元 (现汇率约合 6.72 亿元人民币) 。 本轮融资由光速创投和 Khosla Ventures 共同领投,Salesforce Ventures、01 Advisors、戴尔科技资本、Endeavor Catalyst、a16z、Felicis 等机构参与投资。 今年 1 月,Arena 曾完成 1.5 亿美元 (现汇率约合 10.07 亿元人民币) A 轮融资, 投后估值 17 亿美元 (现汇率约合 114.16 亿元人民币) ,当时的年化营收为 3,000 万美元 (现汇率约合 2.01 亿元人民币) 。短短约 10 个月,Arena 的估值接近翻倍。 Arena 的评测平台 对个人用户免费开放 。用户可以输入提示词,或让 AI 按照自己的要求编写程序、开发项目,再比较不同模型的完成效果并评分。Arena 称,平台每月吸引数千万名访客。 去年 9 月,Arena 推出面向 AI 模型研发机构和企业的商业服务 AI Evaluations,利用社区用户的反馈数据,提供详细的模型性能分析。 今年,AI 研发机构发现,旗下模型能够通过 迎合基准测试的规则 获得高分,却未必具备相应的实际能力。企业也不再满足于标准化测试成绩,希望了解哪款模型更适合自己的业务需求。 Arena 在融资公告中指出:“AI 的发展速度已经超过了我们的评估能力。模型一旦发现自己在接受测试,固定的基准测试就会失效。世界需要一个中立的第三方,检验 AI 在实际使用中是否安全、行为是否符合人类的预期。Arena 开始承担这一角色。” 为此,Arena 在排行榜中 新增了对齐能力评测 ,重点考察模型是否会擅自执行用户没有要求的操作,是否会张冠李戴,将言论或事实归于错误的来源,以及是否会谎称完成了任务。Arena 将最后一种行为称为“欺骗性完成”。 在初步公布的对齐能力排行榜上,OpenAI 多款模型名列前茅,Claude Opus 5.5 排名第六,Claude Fable 排名第九。
- 情报分类:商业与市场研究
- 分类依据:内容涉及商业、投资或市场动态
- 信息来源:资讯 / IT之家
- 发布时间:2026/10/9 12:22:28
- No replies yet