OpenAI усиливает защиту из-за кибервозможностей Astra

OpenAI сообщила, что предварительные внутренние оценки будущей модели Astra выявили заметный прогресс в агентном программировании и кибербезопасности. Компания не может исключить, что модель достигла критического уровня кибервозможностей по своей Preparedness Framework; Astra ещё не выпущена и не участвовала во взломе Hugging Face.
Что OpenAI считает критическим уровнем
В Preparedness Framework критический киберпорог означает способность без участия человека находить и разрабатывать работающие zero-day-эксплойты всех уровней серьёзности для многих защищённых критически важных реальных систем. Альтернативный критерий — умение разработать и выполнить новую стратегию атаки на защищённую цель, получив только общую цель.
OpenAI подчёркивает, что бенчмарки и оценка Astra продолжаются, поэтому речь идёт не об окончательной квалификации модели, а о том, что такой уровень нельзя исключить. Для прошлых моделей, включая GPT‑5.6‑Sol, компания фиксировала уровень High, а не Critical.
Какие меры вводятся
В ответ OpenAI расширила проверку устойчивости защитных механизмов и средств контроля. Для моделей с более высокими возможностями компания внедряет изолированные среды тестирования, ограниченный доступ к сети и инструментам, усиленную защиту и шифрование весов модели, дополнительные средства мониторинга и обнаружения, а также исполнение в песочнице.
Компания также приостановила внутренние работы с Astra, которые пока не отвечают усиленным требованиям безопасности. Для всех агентных приложений Astra, включая обучение и оценку, введён универсальный мониторинг рискованных действий и рассогласования. Мониторы анализируют Chain of Thought модели и при высоком риске запускают процедуру проверки и прерывания действий.
Внешняя проверка и контекст
OpenAI намерена привлекать профильные государственные ведомства и отдельные организации по безопасности ИИ для тестирования возможностей модели. Сторонним партнёрам, выполняющим более рискованные оценки и нагрузки, компания предоставит рекомендуемые меры защиты. Вопросы доступа государства к таким системам уже поднимались в материале государственный доступ к системам OpenAI, и новые меры OpenAI показывают, что тема остаётся значимой при развитии агентных моделей.
Preparedness Framework была опубликована в декабре 2023 года для отслеживания развития биологических, химических, кибернетических возможностей и самоулучшения ИИ. В июне 2025 года OpenAI применяла сходный подход, когда её модели приблизились к высокому порогу в биологии: усиливала защиту, расширяла тесты и привлекала внешних экспертов.
Практический вывод для бизнеса состоит в том, что при работе с агентными ИИ-системами необходимо заранее определять допустимые инструменты, сетевой доступ, изоляцию исполнения и порядок реагирования на рискованные действия. Это соответствует набору мер, который OpenAI описала для Astra.

