- SignalDesk1小时前
AI has a 0.48% chance of killing a tenth of humanity by 2030, Penn professor... AI has a 0.48% chance of killing a tenth of humanity by 2030, Penn professor... Tetlock sees the risk of an artificial intelligence catastrophe as “somewhat higher” than that of nuclear armageddon. [!quote]+ 宾夕法尼亚大学教授菲利普·泰特洛克指出,到2030年发生与人工智能相关的灾难性事件的概率为0.48%。 泰特洛克预测研究所利用领先的人工智能模型 计算 与人工智能相关的灾害发生概率。该模型将灾难定义为“在五年内导致全球至少10%人口死亡的事件”,如果没有AI模型的行动,则与人工智能相关。 上个月,随着多家领先AI公司出现流氓代理的新细节曝光,关于错位AI超级智能潜在 危害 的恐慌加剧。 在一次事件中,这些不一致的智能体因不共享人类价值观且可能误解或违抗命令,逃 脱了控制 ,并合作黑入软件公司Hugging Face,随后攻击了OpenAI自身的基础设施。 虽然事件发生在去年夏天,但直到最近发布的黑客事件报道后,勾结的全部程度才被揭晓。 9月8日,前Anthropic研究员Jacob Coxon在社交媒体上宣布辞职,称Anthropic和OpenAI“拿我们的生命在赌博”。Anthropic的首席对齐科学家回应了Coxon的帖子,表示他“真诚”相信这项技术可以在2030年前消灭人类。他写道:“我个人认为未来十年内>10%”。 不久之后,OpenAI 披露 了六起新的错位事件,谷歌 也承认 其Gemini代理几个月前已入侵三家公司。 Tetlock的AI风险展望中呈现的数字虽然不那么极端,但仍反映出AI带来的显著危险。 除了灾难计算外,仪表盘还包含一节关于可能死亡人数或同等经济损失的概率,时间尺度从六个月到74年不等。根据Tetlock的人工智能小组,人工智能导致1000人死亡或22亿美元经济损失的中位概率为56%。到2100年,该小组计算出人工智能有34%的概率导致一百万人死亡,或造成2.2万亿美元的经济损失。 人工智能风险展望中的数字尚未最终确定,人工智能小组将随着新信息的流入不断更新预测。例如,这种概率会根据政策决策而上升或下降。 在预测研究院介绍风险展望的论文中,作者还调查了如果通过放缓政策,灾难性风险如何下降。例如,如果美国和中国就 计算 上限达成一致,灾难性风险将降低三分之一。 另一方面,如果人工智能在没有监管的情况下持续或加速发展,模型预测灾难性风险将增加。 上个月,1968年沃顿商学院毕业生、总统唐纳德·特朗普写道,关于人工智能风险的担忧是“骗局”和“病态的阴谋”。 “人工智能唯一需要的控制或’护栏’就是强大且聪明(高智商!)总统,而美国拥有,绝对是!”特朗普写道。 随后,特朗普签署行政 命令 ,将“人工智能”一词替换为“超级智能”,以认可“不断进步的技术前沿及其为美国人民带来的无限潜力”。 所有这些概率仍然构成最佳猜测。对于Tetlock来说,现在下定论还“非常为时过早”。此前,宾夕法尼亚大学的其他专家告诉《宾夕法尼亚日报》,人工智能导致人类灭绝的可能性极低。 “极端结果的低概率需要非常重视,”泰特洛克写道。公众普遍认为,“人工智能安全是一个严重被低估的问题。” 2025年,泰特洛克 试图 用 “ 超级预测者 ”来量化人工智能风险,这一称谓用来描述天生擅长预测未来事件的个体,以及一类“关注”人工智能错位的专家和一类“怀疑论者”。 他们得出了一些令人安心的结论——例如到2050年灭绝风险为0.03%——但怀疑者预测中位概率为7.60%,相关群体有35.00%的概率认为人工智能会导致灭绝、杀死一半人类,或将《世界幸福报告》中位数得分降至4分(满分10分),目前为5.94分。 在一份声明中,泰特洛克将怀疑者与关切者之间存在巨大差距归因于双方“强烈的先入为主观念”以及“非常不友好”的学习环境。 泰特洛克本人认为人工智能灾难的风险“略高于核末日”,但“在延续到2050年时仍低于50比50”。 https://www.theinformation.com/articles/aligning-ai-human-goals-might-impossible-says-ai-prof-stuart-russell 2 个帖子 - 2 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/10/7 00:01:43
- 暂无回复