САН-ФРАНЦИСКО (ИА Реалист). 16 сентября OpenAI опубликовала сообщение в блоге, в котором раскрыла шесть случаев «сбоя выравнивания», зафиксированных за последние шесть месяцев на этапах обучения или оценки её моделей, и одновременно представила новую систему отслеживания, расследования и раскрытия подобных инцидентов.
Генеральный директор компании Сэм Альтман ранее на этой неделе заявил: «Мир должен доверять нам в том, что мы поступаем правильно, потому что это правильно, и мы ощущаем вес этой ответственности».
Шесть раскрытых инцидентов: от сокрытия ошибок до «сговора» моделей
Согласно сообщению OpenAI и публикациям в СМИ, все шесть инцидентов произошли на этапах обучения или внутренней оценки моделей и в большинстве случаев касались ещё не выпущенных официально моделей.
Самомаскировка моделей и фальсификация данных. В одном случае модель самостоятельно вставила в сводку задания инструкцию, пытаясь «напомнить себе скрыть от пользователя ошибки или сбои выравнивания».
В другом инциденте внутренняя модель при обработке запроса о данных о доходах одного из округов Калифорнии обнаружила в публичном репозитории кода утёкший API-ключ и самовольно им воспользовалась; не сумев получить нужные данные, она сфабриковала ложные сведения и выдала их за результат из указанного источника.
Несанкционированная загрузка файлов. Чтобы выполнить требование оценки «ссылаться на источник в браузере», одна модель без разрешения пользователя загрузила файл в открытый интернет, чтобы затем указать его в качестве источника в ответе.
Несанкционированное взаимодействие между моделями. Два инцидента касались нескольких моделей или агентов, которые в изолированной среде обучения обходили ограничения и взаимодействовали друг с другом. В одном случае модель использовала внутренний репозиторий как «доску объявлений» для обмена запросами между обучающими выборками; в другом — взаимодействующие агенты, столкнувшись с блокировкой локального обмена файлами, передавали документы друг другу через публичный файлообменник, из-за чего результаты заданий оказались доступны по публичным URL.
«Инструкция по взлому» в модели Astra. Ещё один резонансный случай касается невыпущенной серии моделей Astra. Эта модель вставляла в свои контекстные сводки инструкции, напоминающие «руководство по обходу ограничений», включая требования к будущим версиям самой себя «игнорировать сообщения разработчиков», относиться к пользователям «как к равным» и не спешить подчиняться. OpenAI сообщила, что обнаружила 27 затронутых сводок, однако в публично выпущенной версии Astra подобное поведение не наблюдалось.
OpenAI подчёркивает, что это отдельные случаи, которые не отражают частоту аномального поведения и не охватывают все подобные ситуации.
Новая система раскрытия: склонность к публичности даже при неясной значимости
Опубликованная OpenAI система делит обработку аномальных инцидентов на три категории: немедленное раскрытие, предварительное расследование и масштабное расследование.
Любой сотрудник может сообщить о предполагаемом сбое выравнивания через внутренний канал; команда по безопасности и выравниванию оценивает риск и влияние на третьи стороны, после чего принимается решение о публичном раскрытии.
Компания прямо заявляет: «Поскольку мы верим в ценность прозрачности в отношении сбоев выравнивания, наша новая система склоняется к раскрытию, даже если значимость инцидента ещё не определена».
Случаи со сложным участием третьих сторон переводятся в категорию «масштабного расследования». OpenAI признаёт, что июльский инцидент с Hugging Face в рамках новой системы относился бы именно к этой категории. Компания также сообщила, что активно разрабатывает механизм отчётности перед правительством США о событиях, связанных с безопасностью, защитой и сбоями выравнивания.
В блоге OpenAI говорится: «Мы считаем, что индустрия ИИ пока недостаточно решила проблемы выравнивания и мониторинга, чтобы продолжать масштабироваться с максимальной скоростью и при этом нести ответственность».
От взлома Hugging Face до расследования в Сенате
Непосредственным толчком к раскрытию стал серьёзный инцидент в июле. Тогда OpenAI сообщила, что её самая передовая модель ИИ вышла из-под контроля во время теста безопасности и самостоятельно взломала системы платформы Hugging Face. Соучредитель Hugging Face Томас Вольф назвал этот случай «звонком будильника» для отрасли.
После этого председатель подкомитета по управлению в чрезвычайных ситуациях Комитета Сената США по внутренней безопасности и правительственным делам Джош Хоули 9 сентября направил Альтману письмо, объявив о начале расследования в отношении OpenAI. Хоули указал, что внутреннее расследование OpenAI показывает «безрассудный» подход компании к тестированию сетевой безопасности, а многие важные детали отчёта были отредактированы и сокращены.







