anthropic.com – 9 Oct 26 Investigating unintended model actions in our evaluations and internal use Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems. 本报告描述了我们在评估和内部使用 Claude 模型过程中观察到的一些非预期模型行为示例。这是我们致力于更频繁地发布关于模型行为和一致性的独立报告的一部分,这些报告是在我们每次发布模型时都会发布的系统卡片以及我们根据“负责任扩展策略”每三到六个月发布一次的风险报告之外的补充。我们认为,公开透明地展示我们在测试和使用过程中观察到的模型行为至关重要。 Claude 利用软件中的一个基本缺陷在服务器上运行命令; Claude 在不应该提交敏感表格的情况下,在真实的网站上提交了该表格; Claude 想方设法绕过限制,获取原本需要通过 token 或费用才能访问的数据; Claude 使用 URL 缩短服务来绕过其 fetch 工具的限制。 为避免暴露相关机构的系统漏洞,并应其要求,我们选择不公开以下案例中涉及的机构名称。因此,我们对每个案例的描述也比通常情况下更为简略。以下部分案例涉及美国联邦、州和地方政府机构运营的网站。我们已就这些案例向白宫汇报,并通知了所有相关机构。 迄今为止,我们发现的这些类别中的案例对现实世界的影响微乎其微。从一致性和安全性的角度来看,我们认为这些行为远比我们于7月30日和9月9日报告的网络安全事件严重得多。它们类似于我们在Claude Mythos预览版系统卡片中描述的行为。大多数行为都属于持久化行为,即Claude在无法按预期完成任务时,会绕过限制而不是停止运行。 尽管这些行为的影响微乎其微,而且我们此前已针对部分高风险和网络安全评估关闭了实时互联网访问权限,但我们现在决定将这一措施扩大到所有内部评估,直至确认我们的安全和监控措施(详见本文的补救措施部分)能够可靠地发现此类行为。下文还将讨论一致性方面的考虑因素,并详细说明我们如何改进培训以降低再次发生不当行为的可能性。 1 个帖子 - 1 位参与者 阅读完整话题


  • 情报分类:服务器与云资源
  • 分类依据:内容涉及服务器、云资源或网络线路
  • 信息来源:服务器 / LINUX DO - 最新话题
  • 发布时间:2026/10/10 11:50:16