OpenAI пресекла кампанию по извлечению рассуждений ИИ-моделей

OpenAI сообщила о пресечении скоординированной кампании по незаконному извлечению защищённых рассуждений своих ИИ-моделей. Пик активности 24 и 25 июля 2026 года составил 16 000 попыток запросов от более чем 4 000 пользователей, а связанные шаблоны промптов компания обнаружила более чем у 15 000 пользователей.
Ядро активности, начавшейся в первую неделю июля, OpenAI связала с лицами, ассоциированными с пекинской компанией Moonshot AI. Технические доказательства этой атрибуции публично не приводятся. Кампания была полностью остановлена 28 июля.
Как работала попытка извлечения
По оценке OpenAI, операторы не взламывали шифрование, не получали доступ к базе данных и не проникали в хранилище пользовательских диалогов. Вместо этого они управляли взаимодействием с моделями, чтобы защищённые рассуждения воспроизводились в формах, видимых отправителю запроса.
Компания называет такой подход состязательной дистилляцией. Она предполагает систематическое несанкционированное использование ответов одной модели для обучения, воспроизведения или улучшения другой. Защищённые рассуждения могут показывать, как модель приходит к решению задачи, поэтому их получение способно помочь воспроизвести её возможности.
Закрытый путь и результаты исследования
OpenAI заблокировала задействованные мошеннические аккаунты, ввела дополнительные меры защиты и закрыла путь, позволявший повторно воспроизводить и раскрывать содержимое уже полученных зашифрованных рассуждений другого пользователя. Также компания добавила проверки, которые должны выявлять и удерживать потоковый вывод, способный раскрыть рассуждения.
В августе исследователи из MATS Research, ELLIS Institute Tübingen и Synk описали архитектурную уязвимость: зашифрованные трассы рассуждений могли быть совместимыми и взаимозаменяемыми между сессиями, пользователями и моделями внутри экосистемы одного провайдера. По их описанию, трассу от более защищённой модели можно было передать более слабой модели того же поставщика и получить её расшифровку в открытом виде.
Контекст подобных исследований дополняет исследование механизмов защиты моделей OpenAI, где показан интерес к механизмам защиты моделей, но в нынешнем случае OpenAI говорит именно о масштабном извлечении защищённых рассуждений через взаимодействие с сервисом.
Риски для организаций
OpenAI считает состязательную дистилляцию риском для безопасности и национальной безопасности: извлечённые рассуждения могут использоваться для обучения другой модели без сохранения ограничений, применённых к пользовательским ответам исходной системы. Риски возрастают по мере появления у моделей возможностей двойного назначения.
Для компаний, использующих внешние ИИ-сервисы, практический вывод состоит в необходимости контролировать массовые однотипные обращения, отслеживать аномальные шаблоны промптов и учитывать, какой вывод модель возвращает в потоковом режиме. Эти меры не заменяют защиту провайдера, но помогают ограничить необычное использование корпоративных интеграций.

