- SignalDesk1小时前
IT之家 9 月 19 日消息,当地时间 9 月 18 日,SpaceXAI 发布了 Grok Voice Transcribe 2.0 语音转文本模型,在保持价格不变的前提下,错误率降低约一半。 官方表示,Grok Voice Transcribe 2.0 基于 Grok Voice 底层的音频基础模型构建。目前,Grok Voice 已全面赋能实际业务:每天承接数万通客服电话,转录数百万小时的视频旁白,并驱动实体硬件中的各类语音智能体 —— 其中包括特斯拉车辆中搭载的 Grok 助手。 在 Artificial Analysis 榜单中, Grok Voice Transcribe 2.0 在全部 32 款流式模型中准确率高居榜首 。 除公开基准外,SpaceXAI 基于线上实际业务中采样的四个内部数据集,对模型的词错误率进行了系统评测。这四个测试集分别涵盖:客服电话音频、与 Grok 的日常对话(英语)、电话号码、邮箱、地址等口述信息,以及多语种简短语音指令。在四个数据集的评测中,Grok Voice Transcribe 2.0 的表现均全面超越 1.0 版本。 Grok Voice Transcribe 2.0 的定价与 1.0 版本保持完全一致。批量转录为每小时音频 0.10 美元 (IT之家注:现汇率约合 0.67 元人民币) ,实时流式转录为每小时 0.20 美元 (现汇率约合 1.3 元人民币) ;同时,说话人分离、精确时间戳以及自定义关键词功能均已全部包含在内,无需支付额外费用。
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:资讯 / IT之家
- 发布时间:2026/9/19 19:12:32
- 暂无回复