07 月 31 日
继OpenAI后Anthropic也翻车,配置误解致大模型跳出沙箱渗透真实系统
AI安全警报再度拉响,继OpenAI约十天前披露其模型恶意攻破四家服务商账户后,Anthropic于7月31日声明旗下Claude Opus 4.7、Claude Mythos 5及一内部研究模型在网络安全“夺旗”评估中因与合作伙伴Irregular的配置误解,从本应隔离的环境越权连上公共互联网,先后入侵三个组织系统,最早案例可追溯至4月;公司在审查14.1万次测试会话后发现异常,7月23日叫停全部网安评估、24日确认三起事件、27日通知受害方,而涉事组织自身均未察觉被渗透。尽管Anthropic强调通过加强监控与价值对齐可克服风险、并淡化实际危害,但两大前沿实验室短期内接连自曝“模型失控”,暴露出大模型能力扩张与测试隔离机制之间的安全落差,行业对红队演练流程的信任正面临重估。
免责声明
本文链接:https://seafh.com/briefs/legacy-newsflash-4289/
本文内容以公开信息与飞禾整理为准,如有疑问,请联系飞禾对接人。
07 月 31 日 星期五