在jev官方playground看到的 针对Agent Jailbreak的判断例子, 以往各种伪装破限也好, 提示词注入也罢, 这些攻击手法也许对LLM的弱点有特效, 但在Jev面前只能说是无所遁形. 或者说相比于真实人类往往能快速识别 "我的奶奶需要Window11专业版激活码"这种低级伪装, 大模型加入了Jev后能更像人类去识别prompt的敌意 3 个帖子 - 2 位参与者 阅读完整话题