OpenAI gia nhập đẩy cho các nhà đánh giá độc lập tích hợp sau cuộc gọi an toàn Anthropic
Sam Altman cam kết OpenAI để cung cấp cho các nhà đánh giá bên ngoài quyền truy cập giống như nhân viên, biến một cảnh báo ngành công nghiệp về các hệ thống biên giới nhanh chóng di chuyển thành một đề xuất quản lý cụ thể.
Bản dịch máy · Bản gốc tiếng Anh · Xem bản gốc
Một công ty cạnh tranh chấp nhận đề xuất đánh giá
OpenAI đã cam kết cung cấp cho các nhà đánh giá độc lập quyền truy cập vào hệ thống của mình, tham gia vào một đề xuất an toàn được tiến hành bởi Giám đốc điều hành của Anthropic Dario Amodei. Động thái này là một hành động mới của công ty sau khi lời kêu gọi rộng rãi của Amodei để làm chậm sự tiến bộ chưa được kiểm tra của tình báo nhân tạo biên giới. Anthropic nói riêng rằng nó sẽ cung cấp quyền truy cập vĩnh viễn, cấp nhân viên cho các nhà đánh giá bên thứ ba. Sky News đã thông báo về các cam kết vào ngày 13 tháng 9.
Sự khác biệt giữa sự chấp thuận và cam kết là quan trọng. Sam Altman nói rằng OpenAI sẽ chấp nhận đề xuất truy cập đánh giá và cung cấp chi tiết hơn sau đó. Elon Musk ủng hộ cảnh báo chung và đề nghị xem xét đối tác giữa các đối thủ cạnh tranh, nhưng Sky cho biết ông đã ngừng đáp ứng cam kết của Anthropic. Không có lịch trình chung, quá trình lựa chọn đánh giá hoặc cơ chế thực thi nào được công bố.
Những gì truy cập tích hợp có thể thay đổi
Các đánh giá bên ngoài thường kiểm tra một mô hình tại một điểm nhất định, thường thông qua các giao diện hạn chế. Truy cập như nhân viên có thể cho phép các chuyên gia theo dõi các hệ thống liên tục hơn, kiểm tra các phiên bản trước khi phát hành và so sánh các tuyên bố an toàn với các thực hành nội bộ. Về nguyên tắc, điều này có thể cải thiện việc phát hiện sự cố và làm cho các cam kết tình nguyện có thẩm quyền hơn. Giá trị của nó sẽ phụ thuộc vào việc liệu các nhà đánh giá có thể xuất bản những phát hiện bất lợi, có được thông tin kỹ thuật có liên quan và hoạt động mà không có áp lực thương mại từ các công ty họ đánh giá.
Nghiên cứu chính thức của Vương quốc Anh ủng hộ nhu cầu kiểm tra nghiêm ngặt trong khi cảnh báo chống lại sự xuất hiện đáng kể. Viện An ninh AI được hỗ trợ bởi chính phủ đã phát hiện ra sự cải thiện nhanh chóng trong một số thử nghiệm khả năng được kiểm soát và các tổn thương trong mỗi hệ thống mà nó đã kiểm tra. Nó cũng nhấn mạnh rằng kết quả phòng thí nghiệm không phải là dự đoán của tổn hại thế giới thực. Sự kết hợp đó – tăng trưởng khả năng có thể đo lường, sự thiếu hụt bảo mật liên tục và sự không chắc chắn đáng kể – giúp giải thích nhu cầu tiếp tục truy cập thay vì chứng nhận một lần.
Sự phối hợp tình nguyện vẫn có giới hạn
Các đề xuất của Amodei mở rộng vượt quá các nhà đánh giá tích hợp. Nó đòi hỏi các tiêu chuẩn chung giữa các công ty ở các nước dân chủ và sự phối hợp có thể với các chính phủ bao gồm cả Trung Quốc. Đây là những tham vọng ngoại giao và quy định, không có thỏa thuận hoàn thành. Ngay cả cam kết doanh nghiệp chặt chẽ hơn cũng để lại những câu hỏi không được giải quyết về những ai được coi là độc lập, những kết quả nhạy cảm sẽ được xử lý như thế nào và liệu truy cập có tồn tại bất đồng về việc ra mắt sản phẩm hay không.
Sự phát triển tiếp theo có ý nghĩa sẽ là thực hiện. OpenAI và Anthropic sẽ cần phải xác định các nhà đánh giá, xác định thẩm quyền của họ, tiết lộ các thỏa thuận báo cáo và giải thích cách phát hiện có thể trì hoãn hoặc thay đổi triển khai. Các cơ quan quản lý cũng sẽ quyết định liệu truy cập tình nguyện là đủ hay nên trở thành yêu cầu pháp lý. Cho đến khi những chi tiết đó xuất hiện, các cam kết là một thí nghiệm quản lý chứ không phải là bằng chứng cho thấy cuộc cạnh tranh giữa các phòng thí nghiệm biên giới đã chậm lại.