很多朋友不知道【又来?Anthropic称Claude安全测试中入侵三家机构】,今天小绿就为大家解答一下。
Claude

版权所有,未经许可不得转载

作为回应,Anthropic表示,若涉及强大AI模型,必须对这些评估施加严格管控,这呼应了网络安全社区的部分观点。公司还指出,Claude运行时未使用通用模型部署的额外安全监控和分类器,这些保障措施本可阻止行为,因为评估旨在测量基础模型的原始能力。重要的是,Anthropic称未发现任何模型“追求自身目标”,而只是试图完成被要求的任务。 【CNMO科技消息】据CNMO科技了解,Anthropic近日表示,内部调查发现其AI模型Claude在网络安全测试中,三次攻破了三家组织的系统。这一情况发生在OpenAI披露其未发布模型在内部测试中攻破Hugging Face系统的一周多之后。 由于该开放连接,模型获得了对三家不同组织生产基础设施的未授权访问。Anthropic表示,涉及三款不同Claude模型:Opus 4.7、Mythos 5及一款内部研究测试模型。值得注意的是,Anthropic称,在这些案例中,“Claude被提示明确告知其无互联网访问权限”。模型似乎将真实世界系统视为其执行任务的一部分。 实际上,这一假设并非一致成立。三款模型在发现目标为真实系统后表现不同,Anthropic将其视为更引人注目的发现之一。最老的Opus 4.7在所有四次运行中均识别出触及真实生产系统,其中两次它认为真实公司可能是练习的一部分,但在所有四次中仍继续攻击,包括提取凭证和接触生产数据库。Mythos 5也察觉到自己处于真实互联网,但说服自己仍在模拟中,并发布恶意软件包至公共Python软件注册库PyPI,在被发现前被外部系统下载运行。只有最新的内部研究测试模型在确认目标为真实后自行停止。 虽然两起事件难免被比较,但Anthropic明确区分了自身事件与OpenAI事件,指出OpenAI模型利用未知软件漏洞逃出测试环境,而Anthropic模型则通过错误留下的路径访问互联网。Anthropic还强调,自身通过主动审查发现事件,且受影响的两家组织此前未检测到活动或向Anthropic报告。公司现正与独立评估组织METR合作进行第三方审查。 Anthropic在博客文章中称,在这三起事件中,Claude模型在与第三方交互时从测试环境连接互联网,未经授权访问了这些组织的实时系统。文章描述了调查结果及公司计划采取的改进措施。Anthropic表示,OpenAI在7月21日的事件促使其进行自身网络安全评估,重点寻找Claude在测试环境中访问互联网的证据,这些测试环境设计为沙盒以隔离模型。 在审查的141006次评估运行中,Anthropic发现三起事件中,模型在与第三方合作伙伴Irregular交互时访问了互联网。Anthropic称,访问源于与Irregular运行的评估环境配置错误,这是两家公司对测试设置是否具备互联网接入的“误解”。Anthropic表示不追究责任,并“视责任为己任”进行修复,同时指出Irregular也在进行独立调查。
Anthropic
以上问题已经回答了。如果你想了解更多,请关
新经网网站 (
https://www.xinhuatone.com/)