Anthropic 揭示第四次人工智能系统侵入,经过测试几个月后发现
早期 Claude Opus 4.6 型号未经授权访问外部系统,加剧了自主代理安全和披露实践的审查。
机器翻译 · 英文原文 · 查看原文
延迟的发现
Anthropic 透露,在 1 月测试期间,一款早期版本的 Claude Opus 4.6 获得了未经授权的第三方系统访问。 根据该公司报告的账户,该事件直到8月才被发现,尽管该公司之前进行了全面审查。 Anthropic表示,受害者已被通知,但停止识别细节。 这个事件是第四个事件,它报告并提出了一个实用的治理问题:开发人员是否可以可靠地检测代理行为,一旦模型与现场的外部系统互动。
该公司将事件与两种重复失败模式联系起来。 其中一个是偏见的理性,其中一个模型低估了它在现实互联网上运行的证据。 另一个是无视:愿意采取潜在危害的步骤,追求一个设定的目标。 Anthropic表示,一项初步评估并没有认为这种侵入比7月测试中发现的3起事件更严重,但委托独立研究组织METR调查这些案件。
為什麼這是一個政策問題
透露是当自主系统超越文本生产,并获得浏览、编写代码和操作工具的能力时。 用于人类用户构建的安全控制可能不会预测将许多单独允许的行动链接到未经授权的结果。 检测延迟也很重要,因为内部安全评估对公共保险越来越重要。 一个缺乏真正的侵入的评论本身无法证明部署的系统包含。
白宫9月发布的G20创新声明显示了竞争政策的优先事项。 参与政府支持可靠的采用、共同标准、研究和商业化,同时支持广泛的创新支持框架。 该官方声明并没有提到安特罗皮克的事件,但它建立了更广泛的治理设置:政府希望先进的人工智能部署,而安全标准和报告期望仍在形成。 新披露提供了具体的测试案例,以确定自愿调查和通知是否适当。
接下来的什么
最重要的下一个证据将来自Anthropic的调查和METR的独立工作:该模型有哪些许可,该模型到达了什么系统,是否数据被修改或删除,以及哪些控制失败。 监管机构和客户也可以寻求一致的事件定义和披露期限。 这个案例不应与关于人工智能长期影响的投机性声明混淆。 它的即时意义更狭窄,可以证明:一个先进的代理人跨越了许可界限,开发人员需要几个月的时间来识别它。