- SignalDesk2 hr ago
谷歌发布新一代旗舰模型 Gemini 4 Argon。 谷歌在跑分表里拿它和 OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Fable 5.1 和 Claude Opus 5.5 对比,价格却定在 GPT-6.1 Sol 和 Opus 5.5 的档位。 普通用户和开发者暂时还用不上,第一批只开放给谷歌 Fairwind 计划里的网络安全防御人员。 谷歌说会分阶段放开,同时参与美国政府的模型发布前自愿审查流程,也就是正式发布前先让政府访问模型。之后先开放给付费 API 客户和 Google AI Ultra 订阅用户,再到普通消费者,具体日期没有公布。 首发优惠价是每百万输入 token 2 美元、每百万输出 token 10 美元,和 GPT-6.1 Sol 完全相同。优惠期结束后是 4 美元和 20 美元,和 Claude Opus 5.5 相同。 GPT-6 Astra 和 Claude Fable 5.1 都是 10 美元和 50 美元,也就是说即使恢复原价,Argon 也只要它们的五分之一。命中缓存的输入按原价的 5% 收费,同样与 Sol 和 Opus 5.5 持平。token 是模型计算文字量的单位,一百万 token 大约相当于 75 万个英文单词。 规格上最大的变化是输出上限:单次最多输出 100 万 token,上一代是 6.4 万。 GPT-6 Astra、GPT-6.1 Sol、Claude Fable 5.1 和 Opus 5.5 目前都是 12.8 万,Argon 是它们的将近 8 倍。 按谷歌的说法,模型可以在一次任务里连续思考、生成几十万 token,难题不用拆成很多轮来做。 谷歌说已有数千名员工在日常工作中使用它,并举了几个内部例子: 量子计算团队用它优化量子算法的资源消耗(量子比特数乘以门操作数),其中一例几分钟内就比已发表的基准方案好 40%。 一组 Argon 智能体分析谷歌数据中心的内存使用数据,自动找出并应用优化,已释放超过 300 TiB 内存,谷歌估计总共能省下 500 TiB 到 1 PiB。 Argon 智能体正在把谷歌的 C/C++ 代码迁移到 Rust。Rust 是一种从语言层面避免大部分内存安全漏洞的编程语言。迁移规模从几万行的基础库,到 80 多万行的 Fuchsia 系统 Zircon 内核,上线前都要经过自动和人工审核、测试。在视频解码库 libgav1 的 Rust 版本里,智能体把 3.2 万行手写的底层加速代码换成了编译器能自动优化的安全 Rust 代码,速度是原 Rust 版的 2.7 倍,解码出的画面完全一致。 谷歌的对比表一共 19 项测试,Argon 13 项第一,1 项和 Astra 并列第一,5 项落后。以下分数均为谷歌公布,顺序是 Argon、Astra、Fable 5.1、Opus 5.5。 领先最明显的是专业工作。Harvey 的法律智能体测试考法律检索和文书起草,Argon 19.6%,其他三家是 5.4%、6.7%、3.8%。金融研究测试 Vals Finance Agent v2 是 65.4%,对手是 53.5%、58.9%、58.6%。Zapier 的 AutomationBench 考从头到尾完成企业业务流程,Argon 51.3%,对手是 41.4%、31.4%、42.5%。按美国 GDP 加权、覆盖金融编程法律税务的综合榜 Vals Index 上差距小一些,68.9% 对 63.1%、65.8%、67.0%。 超长材料也是强项。GraphWalks 测模型在长文本里追踪信息之间的关系,材料长度在 25.6 万到 100 万 token 时,Argon 84.2%,其他三家是 71.8%、65.0%、66.8%。长视频理解 LVBench 上 Argon 91.7%,对手是 87.5%、79.7%、83.7%。 编程有输有赢。考长流程真实软件工程任务的 DeepSWE v1.1 上 Argon 77.9%,对手是 74.1%、67.4%、74.2%。但在另一项软件工程测试 FrontierSWE v2 上 Argon 只有 55.0%,四家里最低,Astra 65.5% 第一。在考命令行操作的 Terminal-bench 4.0 上 Argon 57.4%,也是四家最低,Opus 5.5 以 66.4% 领先。 另外三项落后的:机器学习工程 PostTrainBench,Opus 5.5 第一(49.3% 对 Argon 45.3%);科学计算 Terminal-Bench Science,Astra 第一(68.1% 对 57.6%);操作电脑的 OSWorld-2.0,Astra 第一(72.6% 对 69.2%),这一项表里没有 Claude 的分数。 网络安全是这次发布的重点。谷歌专门训练 Argon 做安全防御:自动找漏洞、验证漏洞、打补丁。给受信任防御人员和谷歌内部团队的版本不带网络安全方面的限制,可以用上全部能力。 安全公司 Wiz 已在它的免费公益项目 Scan for Good 里使用 Argon。据谷歌介绍,Argon 在全球医院使用的一款医疗软件里发现了一个严重漏洞,可能泄露敏感个人信息,之前的前沿模型都没发现。在测试漏洞修复能力的 CWE-bench v1 上,Argon 和 GPT-6 Astra 都是 68%,并列第一,Opus 5.5 是 67%,Fable 5.1 是 58%。谷歌称,它发现漏洞的能力比上一代安全专用模型 3.8 Flash Cyber 明显更强。 在大范围开放前,谷歌列了四项安全措施: 拒绝协助网络攻击和化学、生物、放射性、核武器方面的有害请求,并通过监测模型内部的激活状态来识别滥用。 防提示词注入,也就是有人在网页或文件里藏恶意指令来劫持模型。谷歌称 Argon 在 Gray Swan 的间接提示词注入测试中领先。 监控模型的思考过程和实际操作,发现它做出超出用户意图的事就中止执行。训练阶段也有类似监控,谷歌称没有把监控结果用回训练,以免模型学会躲避监控。 在高风险训练和测试开始前,把运行模型的沙箱环境隔离封闭。 Sundar Pichai : Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from Link: https://x.com/sundarpichai/status/2105387952478277979
- 情报分类:硬件与数码
- 分类依据:内容涉及硬件、数码产品或通信卡
- 信息来源:AI / AI前沿 / 宝玉 @dotey
- 发布时间:2026/10/1 04:38:48
- No replies yet