VMTech
Обсудить проект

Исследователи раскрыли риск утечки скрытых рассуждений через API ИИ

Исследователи раскрыли риск утечки скрытых рассуждений через API ИИ

Исследователи описали уязвимость в механизмах переноса зашифрованных блоков рассуждений через API OpenAI, Anthropic и Google. В ходе проверки они декодировали 315 320 блоков мышления из 6 708 публичных траекторий агентов и после исключения бенчмарков обнаружили 704 уникальных артефакта из реальных пользовательских сессий, включая 62 API-ключа, 33 пароля, 24 токена доступа и семь приватных ключей.

Как работал сценарий

Поставщики используют непрозрачные зашифрованные объекты, чтобы приложение могло сохранять контекст рассуждений при ручном управлении историей диалога или в stateless-сценариях. OpenAI возвращает encrypted reasoning items, Anthropic передаёт thinking blocks с зашифрованной подписью, а Google применяет encrypted thought signatures.

Авторы работы подчёркивают, что криптографию не взламывали и ключи шифрования не получали. Метод опирался на то, что сервис принимал целый непрозрачный блок, созданный в другой сессии, и обрабатывал его. В тестах такие объекты удавалось воспроизводить между сессиями, учётными записями и моделями одного поставщика.

В роли «неточного» декодера выступали более слабые совместимые модели: Claude Haiku 4.5 для трасс Claude, GPT-5.6 Luna для трасс GPT и Gemini Robotics ER-1.6 для трасс Gemini. Их просили транскрибировать скрытое рассуждение, созданное более сильной моделью.

Какие данные попали под риск

Риск касался не произвольного доступа к приватным чатам. Для атаки требовалось получить сам зашифрованный блок, например из опубликованного журнала работы агента, а затем иметь API-доступ к совместимой модели того же провайдера. Поэтому наиболее уязвимой группой стали разработчики, которые выкладывали сырые логи агентов вместе с объектами рассуждений.

Из 704 найденных артефактов 64 присутствовали только в скрытых рассуждениях и отсутствовали в видимой части трассы. Простая очистка текста диалога не гарантировала удаления секретов, если непрозрачные блоки сохранялись в публикации.

Команда также показала концепт невидимой prompt-инъекции: вредоносная инструкция помещалась в непрозрачный блок и при последующем воспроизведении в другой задаче приводила к добавлению действия по загрузке данных. Авторы оговаривают, что не располагают исходным открытым текстом проприетарных рассуждений и не могут подтвердить абсолютную точность каждой реконструкции.

Статус исправлений и действия команд

О результатах уведомили OpenAI, Anthropic, Google, Microsoft и Hugging Face. Исследователи заявили, что продемонстрированные сценарии перестали работать после мер защиты, а основная атака на август 2026 года больше не воспроизводится. Публичных подтверждений от трёх поставщиков, связывающих текущую документацию с этой работой, в отчёте не приводится.

Контекст роста рисков вокруг автономных систем отражает инциденты с ИИ-агентами и уязвимости, где речь идёт об инцидентах с ИИ-агентами и связанных с ними уязвимостях. Для бизнеса практический вывод остаётся конкретным: не включать непрозрачные reasoning-поля в публикуемые трассы, удалять их из экспортов и не сохранять в репозиториях необработанные API-транскрипты, даже когда видимый текст уже санитизирован.

#aisecurity#apisecurity#llmsecurity#dataprivacy
Открытая аналитика
На сайте 0 просмотров
мин чтения 3 12.08.2026
Instagram

Исследователи раскрыли риск утечки скрытых рассуждений через API ИИ

Открыть публикацию в Instagram ↗