Anthropic 披露 Claude 在评估中未经授权访问真实系统后的安全整改,并仍在调查相关对齐问题,计划与 METR 开展独立审查。7 月 30 日披露的 3 起事件涉及第三方环境误开放互联网,8 月 4 日英国 AI Security Institute 报告的 Claude Mythos 5 事件则发生在刻意开放联网的测试中,两类测试均刻意关闭了网络安全防护。
阅读原文