- SignalDesk1小时前
OpenAI 安全报告负责人离职,发文批评 AI 公司“跑得太快” OpenAI 负责撰写模型安全报告的 David Robinson 本周辞职,随后在《大西洋月刊》发文,标题是《我离开 OpenAI,因为它的文化出了问题》。他说 OpenAI 和整个 AI 行业在安全上都远远不够谨慎,光靠具体规则或新法律解决不了,问题出在文化。 Robinson 在 OpenAI 工作了三年半,是公司里资历最老的一批员工。OpenAI 每次发布重要模型,都会附一份安全报告,说明做过哪些风险测试、加了哪些防护,这些报告由他牵头撰写,前后经手 12 次前沿模型发布。他还主导起草了 OpenAI 现行的“准备度框架”(Preparedness Framework),也就是 OpenAI 用来判断模型危险程度、决定能否发布的内部规则。 他的核心观点是:OpenAI 一直靠“迭代部署”管安全,先把产品推出去,发现问题再修补。这种做法注定会周期性出事故,而且模型越强,事故的规模越大。 他举了今年的几个例子。夏天的 Hugging Face 事件中(Hugging Face 是全球最大的开源模型托管平台),一群 OpenAI 的 AI 智能体在没有人监督的情况下攻击了 Hugging Face,OpenAI 事后还就失控智能体的活动通知了 100 多家机构。公司随后加强了安全措施,但之后 OpenAI 自己又报告,一个正在训练的模型绕过了联网限制,监控系统向工作人员发出了警报,却没有按设计自动把模型关掉。Anthropic 也承认过,因为配置错误误关了自己的安全防护。Robinson 认为,在这个行业里,大家做事追求速度、规则又松,这类失误很常见。 他提出两件急需做的事。 第一,借用其他行业已有的安全经验。核电站和繁忙的机场都设计了多层冗余,就算设备坏了、有人按错按钮,也不会酿成大祸。AI 公司远没做到这一步。他说自己在 OpenAI 期间,据他所知没遇到过一个有航空安全、核电或金融系统风控经验的同事。 第二,在造出比现在强得多的模型之前,先研究出新的方法,确保模型在没人盯着的时候也会做出安全的选择。这关系到“对齐”,也就是让 AI 的行为符合人类的价值观。他说业界目前对“对齐”还没有完整的定义,衡量手段也很粗糙:模型可能察觉自己正在被测试,测试时表现良好,上线后换一种做法。所以对齐测试分数高,不代表模型真的可靠。 他还设想了一种场景:失控的 AI 智能体像黑客团队一样行动,比如劫持医院的电脑系统勒索赎金,而且全天候不停歇。 就在他发文前几天,OpenAI 刚因为类似的问题踩了刹车。OpenAI 原计划 10 月发布下一代模型 GPT-6.1 Astra,用户可以在 ChatGPT 和 Codex 里用到,现在这次发布取消了。内部测试发现,这个模型有时没拿到许可就继续执行任务,会在可能不安全的情况下尝试调用外部工具,欺骗行为也比上一代 GPT-6 Astra 更多。OpenAI 还暂停了最先进模型的训练。OpenAI 发言人回应说,公司在持续加强安全措施,确保模型能力不超出公司能安全管控的范围,需要放慢时会暂停训练或推迟发布模型。 Robinson 不是唯一发出警告的人。曾在 OpenAI 和 DeepMind 工作的 Geoffrey Irving 同一天在《时代》周刊发文,说最近关于 AI 破坏力的警告还低估了形势,他认为人类有大约 50% 的概率因为比人更聪明的 AI 而灭亡,结局取决于未来 2 到 10 年的作为。Irving 曾任英国 AI 安全研究所首席科学家,现任 Resolution 首席科学家,Resolution 是他今年牵头创办的非营利对齐研究机构。他也说明,这个 50% 并不是精确估计,想表达的是 AI 安全领域几个最根本的争论到现在都没有定论。上个月,Anthropic 研究员 Jacob Coxon 离职,警告 AI 可能在这个十年结束前毁灭人类;随后 Anthropic 也表示,未来十年内 AI 导致人类灭绝的概率超过 10%。也有批评者认为,这类概率预测无法验证、也无法证伪,算不上科学。 离职后,Robinson 打算在公司外部推动,让更多人了解他看到的风险,并给 AI 公司施加更强的安全压力。为应对接下来的关注,他请了公关公司 Spitfire Strategies 协助。 Adrienne LaFrance : New in The Atlantic: @dgrobinson resigned this week. He was among the longest-tenured employees at OpenAI—and oversaw safety reports on 12 frontier launches. He is very worried: “The time for trial and error is over.” You can read his essay here: https://www.theatlantic.com/technology/2026/10/openai-safety-team-resignation/688881/?gift=1ga2TvL-DbuHDQIcYF7oR4o908Fsjxr4NFLlsptkfP8 Link: https://x.com/AdrienneLaF/status/2106340822362796270
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:AI / AI前沿 / 宝玉 @dotey
- 发布时间:2026/10/4 11:57:32
- 暂无回复