模型答错一句话,和 Agent 替你做错一件事,是两种完全不同的风险。 而大多数团队还在用第一代的办法防第三代的问题:加审核、写规则、堆提示词。 真正会出事的地方早就换了—— 上下文里混进来的内容、被写错的记忆、越权的工具调用、没人盯着的运行时。 《失控之前:AI Trust 现场》 14 篇, 从「模型说了什么」一路讲到「它替谁做了什么」。 每篇 3000 字上下。读完能直接拿去对着自己的系统提问。 ———————————————————————————— 14 篇,已更新 5 篇: 01 AI 安全到底在保护什么? https://mp.weixin.qq.com/s/fnyCL6gyldtEpNsI9Tjlxw 02 AI 能生成,不等于应该生成 https://mp.weixin.qq.com/s/e0Eo3K6cXaMJVHwDks3YKg 03 越狱:写好的规则,为什么会被用户绕过去? https://mp.weixin.qq.com/s/z0GBrKHI-oe8iufpBL5FpQ 04 AI 看到了什么,决定了它可能泄露什么 https://mp.weixin.qq.com/s/WS2IA9I4SVPumBLaampE7Q 05 一封邮件为什么能劫持 Agent ? 06 RAG 让 Agent 变聪明,也让它记住错误 07 谁在决定 AI 相信什么? https://mp.weixin.qq.com/s/qYa5hKfdADfOv0PVdDXuhA 08 Agent 为什么会做出主人没有授权的事? 09 Agent 不能只借用人的账号 10 出了事谁负责?权限治理与 Fail Closed 11 AI 安全控制面:一条请求如何被看见、判断和拦截? 12 多个 Agent 一起工作,谁来验证谁? 13 AI 做错以后,为什么必须能还原现场? 14 从「能用」到「敢用」:企业 AI 安全落地路线图 ———————————————————————————— 如果你正在把 AI 接进业务,而且要为最后那个"敢不敢上生产"的结论签字, 这 14 篇是给你写的。 后续更新会继续发在这里。关注不迷路。


  • 情报分类:技术学习与提效
  • 分类依据:内容涉及技术、AI、软件工具或工程实践
  • 信息来源:服务器 / V2EX
  • 发布时间:2026/9/29 17:36:28