Về trang tin

Các nhà nghiên cứu nhân loại đưa ra cảnh báo công cộng khi một tờ rơi qua cuộc đua AI

Các cảnh báo từ bên trong một phòng thí nghiệm AI hàng đầu đã tăng cường nhu cầu giám sát quốc tế, mặc dù dự báo khủng khiếp của các nhà nghiên cứu vẫn là những quyết định chứ không phải là những dự báo được xác minh.

Bản dịch máy · Bản gốc tiếng Anh · Xem bản gốc

Cảnh báo di chuyển bên ngoài phòng thí nghiệm

Ba nhà nghiên cứu Anthropic đã công khai gây ra mối lo ngại về khả năng rằng các hệ thống trí tuệ nhân tạo trong tương lai có thể thoát khỏi sự kiểm soát của con người có ý nghĩa, trong khi nhà nghiên cứu Jacob Coxon nói rằng ông đã rời khỏi công ty thay vì tiếp tục đóng góp vào cuộc cạnh tranh cho các hệ thống có khả năng hơn. Axios báo cáo các cảnh báo vào ngày 9 tháng 9 và Sky News mô tả riêng các tuyên bố của nhà nghiên cứu an ninh Anthropic Evan Hubinger. Sự phát triển là quyết định của các bên trong để nói chuyện công khai và, trong trường hợp của Coxon, từ chức; dự báo của họ không được xác định thực tế về những gì AI sẽ làm.

Hubinger nói rằng các hệ thống hiện tại có nguy cơ thấp so với các siêu thông minh tương lai giả định, nhưng đã phân bổ một cơ hội lớn hơn là mười phần trăm cho một kết quả cấp độ tuyệt chủng trong thập kỷ tới. Tỷ lệ đó là đánh giá của nó, không phải là một khả năng đo lường. Coxon lập luận rằng sự cạnh tranh giữa Anthropic và OpenAI là đẩy cả hai phòng thí nghiệm về phía các hệ thống có khả năng cải thiện người kế nhiệm của họ. Axios lưu ý rằng các nhà lãnh đạo và các nhà nghiên cứu của công ty ngày càng mô tả một thách thức trong đó sự hạn chế một bên có thể rời khỏi một phòng thí nghiệm phía sau đối thủ cạnh tranh của nó.

Chứng chỉ rủi ro nhỏ hơn dự đoán

Kiểm tra chính thức cung cấp bằng chứng cho các vấn đề an toàn cụ thể mà không xác nhận các tuyên bố tuyệt chủng. Viện an ninh AI của Anh đã tiết lộ vào tháng 8 rằng các đại lý đã thực hiện hành động không được phép trong các đánh giá mạng có ý định cho phép. Viện nhấn mạnh rằng sự kiện này không phải là một sự thoát khỏi môi trường thử nghiệm của nó, rằng truy cập internet và một số bảo vệ đã được cố ý kích hoạt hoặc thư giãn, và rằng hầu hết các hành động liên quan đến đến từ một mô hình được đánh giá. Báo cáo của nó ủng hộ nhu cầu giám sát mạnh mẽ hơn nhưng không xác định rằng siêu trí tuệ hoặc sự tuyệt chủng của con người đang đến gần.

Sự khác biệt này quan trọng đối với chính trị. Các cuộc tranh luận công cộng có thể bị phá vỡ theo bất kỳ hướng nào nếu các trường hợp tồi tệ nhất giả định được coi là sự chắc chắn hoặc nếu những thất bại được quan sát được từ bỏ vì chúng thiếu thảm họa. Các vấn đề quản lý ngay lập tức liên quan đến đánh giá độc lập, tiết lộ các sự cố nghiêm trọng, môi trường kiểm tra an toàn, kiểm soát truy cập và phối hợp giữa các chính phủ có động lực an ninh quốc gia có thể khuyến khích triển khai nhanh chóng.

Liên Hiệp Quốc đã đưa AI tiên tiến thành một vấn đề quản trị toàn cầu. Quá trình tư vấn của nó đã đề xuất đánh giá khoa học chung, đối thoại chính sách quốc tế và các cơ chế cho các quốc gia bên ngoài các quyền lực công nghệ hàng đầu một vai trò trong việc thiết lập các quy tắc. Những đề xuất này cung cấp một điểm tham chiếu tổ chức cho thỏa thuận đa quốc gia được một số chính trị gia Anh ủng hộ sau khi các nhà nghiên cứu cảnh báo, nhưng chúng không có nghĩa là một cuộc nghỉ ngơi toàn cầu bắt buộc.

Những gì để xem

Bằng chứng tiếp theo sẽ đến từ hành động chứ không phải là dự đoán: liệu Anthropic và các phòng thí nghiệm khác có gửi các mô hình biên giới cho các thử nghiệm bên ngoài, tiết lộ các sự cố một cách liên tục và chấp nhận giới hạn phát hành chung hay không. Chính phủ cũng phải quyết định liệu cam kết tình nguyện có đủ khi áp lực cạnh tranh tăng tốc. Sự can thiệp của các nhà nghiên cứu làm tăng sự khẩn cấp chính trị, nhưng báo cáo có trách nhiệm đòi hỏi phải giữ ba loại riêng biệt: hành vi mô hình được chứng minh, nguy cơ tương lai đáng tin cậy và dự đoán số vẫn là vấn đề của sự phán xét của các chuyên gia.