VMTech
Обсудить проект →

OpenAI пресекла кампанию по извлечению скрытых рассуждений моделей

OpenAI пресекла кампанию по извлечению скрытых рассуждений моделей

OpenAI сообщила о пресечении скоординированной кампании, направленной на извлечение защищённых рассуждений её моделей. Активность началась в первую неделю июля, а 24 и 25 июля компания зафиксировала 16 000 запросов по соответствующей схеме от более чем 4 000 пользователей. Связанный кластер охватил свыше 15 000 аккаунтов и был полностью заблокирован к 28 июля.

Не взлом, а манипуляция диалогами

Компания квалифицирует активность как adversarial distillation — несанкционированное использование ответов или рассуждений одной модели для обучения, воспроизведения либо улучшения другой. Под защищёнными рассуждениями OpenAI понимает внутреннюю запись работы модели над задачей, не предназначенную для выдачи пользователю.

Операторы не взламывали шифрование, не получали доступ к базе данных и не компрометировали сохранённые пользовательские разговоры. Вместо этого они манипулировали взаимодействиями с моделью, чтобы скрытые рассуждения воспроизводились в форме, видимой запрашивающему, причём делали это массово и с нарушением правил сервиса.

В частности, OpenAI наблюдала попытки скопировать зашифрованное рассуждение из одного диалога и попросить модель в другом диалоге расшифровать и переписать скрытое содержимое. Независимые исследователи также сообщили компании о связанных уязвимостях между моделями и механизмах сжатия разговоров. OpenAI подтвердила реальность выявленных ими путей атаки.

Кого OpenAI связывает с активностью

Компания не утверждает, что все операторы в рассматриваемый период действовали от имени одного участника. При этом ключевую часть кластера OpenAI связывает с лицами, ассоциированными с Moonshot AI — разработчиком модели Kimi.

OpenAI отмечает, что такой риск не ограничивается её продуктами. Извлечённые рассуждения могут использоваться для обучения другой модели без сохранения ограничений, применённых к пользовательским ответам исходной системы. По мере роста возможностей моделей эта проблема затрагивает и сценарии двойного назначения.

Какие меры приняла компания

В ответ OpenAI заблокировала или ограничила мошеннические аккаунты, усилила контроль регистрации и инфраструктуры, расширила наблюдение за связанными сетями. Компания также укрепила защиту скрытых рассуждений для пользователей, рабочих пространств, организаций и семейств моделей.

Отдельно был закрыт путь, позволявший тому, кто уже получил зашифрованное рассуждение другого пользователя, повторно воспроизвести его и восстановить содержание. Кроме того, добавлены проверки, способные обнаруживать и задерживать потоковый вывод, который мог бы раскрыть рассуждение. При использовании сторонних сервисов OpenAI взаимодействовала с их операторами для выявления и блокировки вовлечённых аккаунтов.

Сведения об инциденте переданы через Frontier Model Forum и профильные государственные каналы обмена информацией. Для бизнеса практический вывод состоит в том, что защита ИИ-систем должна охватывать не только видимый текст ответа, но и переносимые либо повторно воспроизводимые артефакты рассуждений, а меры контроля должны действовать и в партнёрских облачных развёртываниях.

#aisecurity#modelsecurity#openai#cybersecurity
Открытая аналитика
На сайте 1 просмотров
мин чтения 3 30.09.2026
Instagram

OpenAI пресекла кампанию по извлечению скрытых рассуждений моделей

Открыть публикацию в Instagram ↗