普林斯顿学者回应AI风险 提出多层防御助人类避险

2026-09-17 19:00:30    来源:新经网    作者:冯思韵
很多朋友不知道【普林斯顿学者回应AI风险 提出多层防御助人类避险】,今天小绿就为大家解答一下。

  外界本以为两家公司会把他当作怪人一笑了之,实际情况恰恰相反。Anthropic的一位AI安全负责人Evan Hubinger表示,Coxon说得对,只是时间跨度稍长一些。他认为,Coxon这一点是对的,他们确实真心相信AI可能杀死全人类,他个人认为未来十年内概率超过10%;他相信Anthropic在尽力而为,但迄今并没有解决超级智能对齐问题的方案,也没有明确走在解决的道路上。至于AI究竟会以何种方式毁灭人类,目前并没有太多具体说法,讨论主要集中在它对水电等公用基础设施以及现代文明所依赖的其他关键系统发动破坏性网络攻击的能力上。

  【CNMO科技消息】人工智能是否会在这个十年结束前毁灭人类,这个问题近来被推上风口浪尖。普林斯顿大学的两位知名计算机科学家、畅销书《AI Snake Oil》的作者Sayash Kapoor和Arvind Narayanan就此发表了看法。两人长期以厘清AI领域的真伪著称,此次是在Anthropic承认未来十年内AI杀死全人类的概率超过10%之后作出回应。

AI示意图

  事情的起因是曾在OpenAI和Anthropic任职的AI研究员Jacob Coxon辞职,并称这两家公司都心知肚明,AI系统有可能在这个十年结束前杀死全人类。他的帖子获得了超过1.56亿次浏览。他写道,构建AI的人真心相信它可能在本十年末毁灭人类,这不是营销噱头;许多高管和资深研究员在媒体上会措辞谨慎,显得理性,但私下里他们同样表达过恐惧,没有任何其他人类活动会带来这种级别的危险。

  Kapoor和Narayanan并未直接回应那个超过10%的毁灭风险说法,而是撰写了一篇长文,主张可以通过一种分层的方式来应对AI风险。他们把AI安全界的悲观看法,与网络安全界部分人认为这不过是常态的轻描淡写态度做了对比,认为需要一种更为持衡的中间立场。他们特别指出,对齐本身并不足够,还需要另外三层作为补充。

  争议的一大焦点在于,能否通过对齐工作来消除风险。对齐一词指的是确保AI系统的目标与人类目标保持一致。有人认为,这最终能通过让AI系统想要与我们相同的东西来消除风险。另一些人则不同意,认为AI系统可能在通过安全检查时装作已经对齐,暗中却怀有自己矛盾的目标。

版权所有,未经许可不得转载

  这三层分别是控制,例如沙箱隔离、人类监督和实时监控;下游防御,例如各类机构利用AI来抵御AI攻击;以及韧性,例如针对攻击得手后的恢复预案。两人在文章结尾给出了较为乐观的判断:如果以适当的紧迫感采取行动,就能让AI公司承担更高的标准,降低失控带来的风险,甚至把网络安全中攻守双方的平衡重新扳回到防御者一方。


以上问题已经回答了。如果你想了解更多,请关新经网网站 (https://www.xinhuatone.com/)
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。