К новостям

После призыва Anthropic усилить безопасность OpenAI поддержала инициативу по внедрению независимых экспертов по оценке

Сэм Альтман обязался предоставить внешним экспертам по оценке доступ к системам OpenAI на уровне сотрудников, превратив предупреждение отрасли о стремительно развивающихся передовых системах в конкретное предложение по управлению.

Машинный перевод · Оригинал на английском · Открыть оригинал

Ривалская компания приняла предложение об оценке

OpenAI стремится предоставить независимым оценителям персональный доступ к своим системам, присоединившись к предложению о безопасности, которое продвигает главный исполнительный директор Anthropic Дарио Амодеи. Этот шаг – это новая корпоративная акция после более широкого призыва Amodei замедлить неопроверженный прогресс пограничного искусственного интеллекта. Anthropic отдельно заявила, что обеспечит постоянный, персональный доступ третьим оценщикам. Sky News сообщила о своих обязательствах 13 сентября.

Различия между одобрением и обязательством. Сам Альтман сказал, что OpenAI примет предложение о доступе к оценщику и предоставит более подробные подробности позже. Элон Маск поддержал общее предупреждение и предложил пересмотр между конкурентами, но Скай сообщила, что он остановился не соответствовать обязательствам Anthropic. Пока не объявлен общий график, процесс подбора оценителя или механизм исполнения.

Что может измениться встроенный доступ

Внешние оценки обычно тестируют модель в определенной точке, часто через ограниченные интерфейсы. Доступ, похожий на персонала, может позволить специалистам постоянно наблюдать за системами, исследовать версии до выпуска и сравнивать требования безопасности с внутренней практикой. В принципе, это могло бы улучшить выявление инцидентов и сделать добровольные обязательства более аудитными. Его стоимость будет зависеть от того, могут ли оценители опубликовать неблагоприятные результаты, получить соответствующую техническую информацию и работать без коммерческого давления от компаний, которые они оценивают.

Официальное исследование Великобритании поддерживает необходимость строгих испытаний, предупреждая о драматической экстраполяции. Управляемый правительством Институт безопасности ИИ обнаружил быстрое улучшение в нескольких контролируемых испытаниях способности и уязвимости в каждой системе, которую он исследовал. Он также подчеркнул, что лабораторные результаты не являются прогнозами реального вреда. Эта комбинация — измеримый рост мощности, постоянные гарантийные пропуски и существенная неопределенность — помогает объяснить спрос на непрерывный доступ, а не одноразовую сертификацию.

Волонтерская координация имеет ограничения

Предложение Амодей расширяется за пределы встроенных оценителей. Она требует общих стандартов среди компаний в демократических странах и возможного координации с правительствами, в том числе с Китаем. Это дипломатические и нормативные амбиции, не завершенные соглашения. Даже более узкие корпоративные обещания оставляют нерешенные вопросы о том, кто квалифицирует себя как независимый, как будут обрабатываться чувствительные результаты и выживут ли доступ разногласия по поводу запуска продукции.

Следующим значимым развитием будет реализация. OpenAI и Anthropic должны были бы идентифицировать оценителей, определить их полномочия, раскрыть рассылки по докладам и объяснить, как результаты могут затягиваться или изменить распределение. Регуляторы также будут принимать решение о том, достаточно ли добровольного доступа или должно стать юридическим требованием. До тех пор, пока эти детали не появились, эти обязательства являются экспериментом управления, а не доказательством того, что конкурентная гонка между граничными лабораториями замедлялась.