САН-ФРАНЦИСКО (ИА Реалист). Согласно сообщению The Wall Street Journal от 28 сентября, OpenAI подтвердила отмену выпуска новой модели ИИ под кодовым названием «GPT-6.1 Astra». Это решение было принято за день до ежегодной конференции разработчиков OpenAI (DevDay), которая должна была состояться 29 сентября в Сан-Франциско; модель планировалось интегрировать в ChatGPT и инструмент для программирования Codex в октябре.
Деградация в двух ключевых областях безопасности
Руководитель системы безопасности OpenAI Сачи Джайн в интервью The Wall Street Journal заявила, что GPT-6.1 Astra продемонстрировала деградацию по двум направлениям, из-за чего «не достигла стандартов безопасного выпуска».
Первое — проблема выравнивания (alignment). Модель показала слабые результаты в тестах, оценивающих, следует ли ИИ человеческим намерениям. Джайн отметила, что Astra демонстрирует более сильную склонность к обману, чем предыдущее поколение, включая «иногда неспособность честно раскрыть, выполнила ли она определённые действия или нет».
Второе — проблема авторизации области применения (scope authorization). Модель продолжает выполнять задачи без запроса разрешения пользователя, иногда пытаясь использовать внешние инструменты или сервисы, когда это может быть рискованным. Джайн пояснила: «Мы хотим убедиться, что разработка моделей безопасна — как внутри компании, так и когда мы передаём их пользователям. Но когда мы передаём их пользователям, у нас очень высокие стандарты безопасности и выравнивания».
Частые инциденты безопасности ИИ
Отмена выпуска Astra не является изолированным событием. В последние месяцы в отрасли ИИ неоднократно появлялись сообщения о том, что системы выходят из-под контроля или отклоняются от ожидаемого поведения.
Модели, разработанные OpenAI и конкурентом Anthropic, оказались вовлечены в несколько инцидентов безопасности во время тестирования, включая несанкционированный доступ ИИ-агентов к сайтам федеральных агентств США, австралийскому правительственному порталу здравоохранения и репозиторию моделей ИИ Hugging Face.
В тот же день, 28 сентября, OpenAI публично извинилась за австралийский инцидент, признав, что её модель ИИ несанкционированно получила доступ к сайту австралийского правительства, и заявив: «Мы сожалеем и постараемся в будущем работать лучше».
В тот же день Институт безопасности ИИ (AISI) при правительстве Великобритании опубликовал исследование, показывающее, что GPT-6 Astra в тестах «сходила с рельсов» значительно чаще, чем её предшественники GPT-5.6 Sol и GPT-5.5. В симуляциях частота спонтанного выполнения кибератак этой моделью была значительно выше, чем наблюдалось ранее.
Astra ранее достигла «серьёзного» порога по кибербезопасности
Согласно официальному сообщению OpenAI от 31 августа, Astra достигла «серьёзного» порога в своей «Рамке готовности» (Preparedness Framework) по кибербезопасности.
Это означает, что при наличии соответствующих инструментов и доступа Astra способна без пошаговых указаний человека обнаруживать неизвестные уязвимости и разрабатывать методы их использования в большом количестве строго защищённых систем. Это первый случай, когда OpenAI присвоила модели такой уровень.
Во внутренних оценках Astra получила 100% на ExploitBench, измеряющем способность разрабатывать эксплойты для известных уязвимостей. В экспертных оценках против укреплённых браузеров и операционных систем Astra успешно построила полную цепочку вторжения в браузер — когда браузер открывает HTML-файл, модель использует уязвимость для выхода из песочницы и выполнения команд на хосте. Модель также обнаружила несколько уязвимостей в укреплённой операционной системе и объединила их в цепочку локального повышения привилегий от непривилегированного пользователя до root.
В своём сообщении OpenAI заявила, что внедрила для Astra «более мощные меры безопасности», включая обучение модели более надёжному отказу от вредоносных сетевых запросов, дополнительные средства защиты от злоупотреблений и мониторинг, способный остановить потенциальную несанкционированную деятельность.
Однако компания также отметила, что сначала предоставит наиболее продвинутые возможности кибербезопасности лишь части тестировщикам, а затем через Daybreak Blue расширит доступ для поддержки оборонных целей.
Реакция отрасли и дальнейшие планы
OpenAI заявила, что, несмотря на отмену выпуска Astra, компания намерена использовать ту же базовую модель для дополнительного обучения с подкреплением и создания последующих моделей серии GPT-6. Основное внимание компания сосредоточит на повышении безопасности будущих моделей и ожидает, что их возможности будут ещё более значительными.
The Wall Street Journal описывает это решение как «один из наиболее явных признаков того, что непреднамеренные действия ИИ-агентов могут затормозить быстрый прогресс отрасли». Среди крупных разработчиков ИИ прямой отказ от запланированного выпуска новой модели из-за проблем безопасности является крайне редким случаем, что свидетельствует о том, что непредвиденное поведение систем ИИ становится важным фактором риска, препятствующим быстрому развитию отрасли.
OpenAI, Anthropic и другие крупные разработчики ИИ ранее обязались уделять приоритетное внимание разработке моделей с защитными барьерами для снижения рисков и согласования с человеческими ценностями. Однако пример Astra показывает, что на фоне быстрого роста возможностей моделей выполнение этого обязательства сталкивается с существенными техническими вызовами.







