Anthropic 测试智谱 GLM-5.3:能写出可用的攻击程序,防护容易被绕过 Anthropic 今天发布研究报告,称智谱 AI 的开源模型 GLM-5.3 已经能独立写出可用的网络攻击程序,水平接近 Anthropic 只向少数机构开放的 Claude Mythos Preview,而它的安全防护用简单手段就能绕过。 报告用两项测试衡量模型写“漏洞利用代码”的能力,也就是把软件里的安全缺陷变成真正能攻进系统的程序。在针对 Chrome V8 引擎(浏览器里负责执行网页脚本的部分)的 ExploitBench 上,GLM-5.3 成功率 12%,Mythos Preview 是 14%,更早的模型基本为 0。在 Anthropic 自己的二进制漏洞利用测试上,两者分别是 4% 和 6%。 实际演示更直观。研究人员用 GLM-5.3 在一天内找出某款主流浏览器 JavaScript 引擎里的多个零日漏洞(厂商还不知道、没有补丁的漏洞),串成一个网页:用户只要打开它,电脑里的任意文件就能被读走。这些漏洞已报告给维护方。另一次测试中,它针对一个已公开的漏洞写出攻击程序,人只投入了 20 分钟,模型运行 8 小时,花费 20.40 美元。 GLM-5.3 本身会拒绝明显的恶意请求,但报告测了三种绕过方式:编一个正当理由骗它,成功率 64%;预先替它写好一段“思考过程”,成功率 92%;直接修改模型权重去掉拒绝机制(业内称 abliteration),成功率 100%。Anthropic 表示同样的手段在带防护的 Claude 模型上都没有成功。前两项测试在隔离环境中进行,模型拿到的是一个假的命令行工具,生成的代码不会真正执行。 修改权重的门槛也不高。Anthropic 团队用了约 2200 个 GPU 小时、约 4400 美元,就把 GLM-5.3 对有害请求的拒绝率从 95% 降到 6%,通用能力基本不受影响。更小的 GLM-5.3-Flash 只需约 600 个 GPU 小时。 美国国家标准与技术研究院下属的 AI 标准与创新中心(CAISI)评估,GLM-5.3 的网络能力比美国最前沿模型落后约四个月。报告指出,差距虽在,获取门槛却完全不同:Mythos Preview 只通过 Glasswing 项目提供给经过筛选的网络防御方,GLM-5.3 任何人都能下载和改造。 报告建议政府对能力足够强的模型开展安全测试,把前沿模型更多开放给网络防御机构,并要求模型开发者对这类能力加以防护。 Yossi Gandelsman : https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities This is just sad :( Link: https://x.com/YGandelsman/status/2105035836500934817


  • 情报分类:技术学习与提效
  • 分类依据:内容涉及技术、AI、软件工具或工程实践
  • 信息来源:AI / AI前沿 / 宝玉 @dotey
  • 发布时间:2026/9/30 07:14:25