OpenAI는 Anthropic Security Call 이후 내장된 독립적 인 평가자를위한 촉진에 합류합니다.
Sam Altman은 OpenAI가 외부 평가자에게 직원과 같은 접근을 제공하기 위해 노력하여 빠르게 움직이는 국경 시스템에 대한 산업 경고를 구체적인 통치 제안으로 바꾸었습니다.
기계 번역 · 영어 원문 · 원문 보기
경쟁 회사가 평가 제안을 채택합니다.
OpenAI는 독립적 인 평가자들에게 직원과 같은 시스템에 대한 액세스를 제공하기 위해 노력하고 있으며, 안드로피스의 CEO 인 Dario Amodei가 진행한 안전 제안에 합류했습니다. 이 움직임은 Amodei의 광범위한 호소를 따르는 새로운 기업 행동으로 국경 인공 지식의 검증되지 않은 발전을 느리게합니다. Anthropic은 별도로 제3자 평가자에게 직원 수준의 영구적 인 액세스를 제공 할 것이라고 말했습니다. Sky News는 9월 13일에 약속을 발표했다.
헌신과 헌신 사이의 차이점은 중요하다. Sam Altman은 OpenAI가 평가자 액세스 제안을 채택하고 나중에 더 많은 세부 사항을 제공 할 것이라고 말했습니다. Elon Musk는 일반적인 경고를 지지하고 경쟁자들 사이의 상호 검토를 제안했지만, Sky는 그가 Anthropic의 약속에 부합하지 않고 멈추었다고보고했다. 일반적인 일정, 평가자 선택 과정 또는 집행 메커니즘은 아직 발표되지 않았습니다.
무엇을 변경할 수 있는 내장 액세스
외부 평가는 일반적으로 특정 지점에서 모델을 테스트하며 종종 제한된 인터페이스를 통해 테스트합니다. 직원 유사한 액세스는 전문가가 시스템을 더 지속적으로 관찰하고, 사전 출시 버전을 검토하고, 안전 요구 사항을 내부 관행과 비교할 수있게 할 수 있습니다. 원칙적으로, 이것은 사고 탐지를 개선하고 자발적 인 약속을 더 청구 할 수있게 할 수 있습니다. 그 가치는 평가자가 부정적인 발견을 게시하고 관련 기술 정보를 얻고 평가하는 회사로부터 상업적 압박없이 작동할 수 있는지 여부에 달려 있습니다.
영국 공식 연구는 엄격한 테스트가 필요하다는 것을 지원하고 극적인 추방에 대한 경고를 제공합니다. 정부가 지원하는 AI 보안 연구소 (AI Security Institute)는 각 시스템에서 여러 통제 능력 테스트 및 취약점에서 빠른 개선을 발견했습니다. 또한 실험실 결과는 실제 세계의 해를 예측하지 않는다는 것을 강조했다. 이 조합 - 측정 가능한 능력 성장을, 지속적인 보안 격차와 상당한 불확실성 - 한 번의 인증 대신 지속적인 액세스에 대한 요구를 설명하는 데 도움이됩니다.
자원봉사활동은 여전히 한계가 있다.
Amodei의 제안은 삽입 된 평가자를 넘어서고 있습니다. 그것은 민주주의 국가의 기업들 사이의 공통 표준을 요구하고 중국을 포함한 정부와의 가능한 조정. 이들은 외교적, 규제적 야망이며, 완성되지 않은 협정이다. 심지어 더 좁은 기업 약속은 누가 독립적 인 자격을 갖추고 있는지, 어떻게 민감한 발견이 처리 될 것인지, 접근이 제품 출시에 대한 분쟁이 살아남는지에 대한 해결되지 않은 질문을 남깁니다.
다음 중요한 발전은 실행이 될 것이다. OpenAI와 Anthropic은 평가자를 식별하고, 그들의 권한을 정의하고, 보고서 조치를 공개하고, 발견이 어떻게 지연되거나 배포를 변경할 수 있는지 설명해야합니다. 규제 기관은 또한 자발적 접근이 충분한지 또는 법적 요구 사항이 될 것인지 결정할 것입니다. 이러한 세부 사항이 나타날 때까지, 약속은 국경 실험실 간의 경쟁 경기가 느려졌다는 증거가 아닌 통치 실험이다.