OpenAI 加入安特罗普安全呼吁后,推进内置的独立评估员
萨姆·阿尔特曼致力于为OpenAI提供与员工相似的外部评估员的访问,将一个行业对快速移动的边境系统的警告转化为一个具体的治理建议。
机器翻译 · 英文原文 · 查看原文
竞争对手公司通过评估提案
OpenAI 致力于为独立评估员提供员工类似的系统访问,并加入了安东尼亚首席执行官达里奥·阿莫迪(Dario Amodei)提出的安全提案。 这一举动是根据阿莫迪更广泛的呼吁,新的企业行动,以缓慢边境人工智能未经检查的进步。 Anthropic 分别表示,它将为第三方评估员提供永久、员工级别的访问。 Sky News 于 9 月 13 日公布承诺。
承诺与承诺之间的区别很重要。 萨姆·阿尔特曼表示,OpenAI将通过评估员访问提案,并在以后提供更多细节。 埃隆·马斯克支持这一警告,并建议对竞争对手进行对比审查,但Sky报告说,他停止不符合Anthropic的承诺。 目前尚未公布通用时间表、评估员选择过程或执行机制。
什么内置接入可能改变
外部评估通常在特定点测试模型,经常通过有限的界面。 员工类似的访问可以让专业人士更连续地观察系统,检查预发布版本,并将安全声明与内部实践进行比较。 原则上,这可能会改善事故检测,并使志愿承诺更可听证。 其价值将取决于评估员是否可以发布不良发现,获得相关技术信息,并在未经他们评估的公司进行商业压力的情况下运行。
英国官方研究支持严格测试的必要性,同时警告对戏剧性的脱落。 政府支持的AI安全研究所发现了在其检查的每个系统中进行的多个控制能力测试和漏洞的快速改善。 他还强调,实验室结果不是现实世界损害的预测。 这种组合――可测量的能力增长、持久的安全漏洞和显著的不确定性――有助于解释继续访问的需求而不是单次认证。
志愿协调仍有限制
阿莫迪的提议远远超出了内置评估员。 它呼吁民主国家的公司共同标准,并与包括中国在内的政府进行可能的协调。 这些是外交和监管的野心,没有完成的协议。 即使是更紧密的公司承诺,也留下了关于谁被认为是独立的未解决的问题,如何处理敏感的发现,以及是否访问会生存到产品发布上的分歧。
下一个有意义的发展将是实施。 OpenAI 和 Anthropic 需要识别评估员,确定他们的权威,披露报告安排,并解释结果如何延迟或改变部署。 监管机构还将决定是否有足够的自愿访问,或者应该成为法律要求。 直到这些细节出现,承诺是治理实验,而不是证据表明边境实验室之间的竞争竞争已经放缓。