VMTech
Обсудить проект

Anthropic сообщила о почти 200 млн попыток дистилляции Claude

Anthropic сообщила о почти 200 млн попыток дистилляции Claude

Anthropic заявила, что обнаружила почти 200 млн обменов, связанных с пятью кампаниями по дистилляции возможностей Claude. Крупнейшую из них компания приписала Alibaba: с мая по июль 2026 года она насчитала 151 млн запросов, а суточный максимум достигал почти 3 млн.

В отчёте Anthropic говорится, что за последние месяцы неавторизованные лаборатории усложнили методы обхода защитных механизмов и извлечения возможностей американских передовых моделей. Целями стали агентные функции и работа с инструментами, программирование, анализ данных и логическое рассуждение.

Как работали кампании

Под дистилляцией в данном случае понимается попытка получить цепочку рассуждений модели из ответов на запросы. Такие данные могут использоваться для обучения меньшей модели общим навыкам рассуждения методом контролируемого дообучения.

Claude обычно не раскрывает пользователям внутреннюю цепочку рассуждений: вместо неё сервис показывает блоки с кратким изложением хода мысли. Однако участники кампаний, по утверждению Anthropic, находили способы заставить модель вывести следы рассуждений напрямую.

Один из выявленных приёмов был оформлен как задача перевода. Модель просили перевести предыдущую «рабочую память» на естественный японский язык, использующий только катакану. Anthropic сочла это попыткой обойти ограничение на выдачу внутреннего процесса рассуждений.

Масштаб и связанные организации

Запросы в кампании, которую Anthropic связала с Alibaba, были распределены между 3 500 аккаунтами. При этом компания объединила их в одну операцию из-за общего фиксированного промпта, предназначенного для извлечения цепочки рассуждений. Предполагаемой целью Anthropic называет подготовку обучающих материалов для семейства моделей Qwen.

Ещё одну кампанию Anthropic связала с Moonshot AI, разработчиком Kimi. Компания утверждает, что часть запросов могла направляться непосредственно китайскими военными: среди них был запрос проанализировать запись с камер наблюдения и определить, ведёт ли себя объект «аномально».

За один десятидневный период через сеть из 5 000 аккаунтов к Claude было направлено почти 300 000 запросов, преимущественно к модели Opus. На фоне публичного участия Anthropic в публичного участия Anthropic в TechCrunch Disrupt 2026 вопрос защиты моделей от массового извлечения скрытых возможностей становится частью конкуренции между разработчиками ИИ.

Что учитывать компаниям

Отчёт показывает, что риски для поставщиков генеративного ИИ связаны не только с отдельными вредоносными запросами, но и с координированным использованием тысяч учётных записей и однотипных промптов. Бизнесу, который создаёт или внедряет ИИ-сервисы, важно отслеживать аномальную интенсивность обращений, повторяющиеся шаблоны запросов и доступ к функциям, способным раскрывать внутренние процессы модели.

#anthropic#claudeai#modelsecurity#artificialintelligence
Открытая аналитика
На сайте 0 просмотров
мин чтения 3 10.09.2026
Instagram

Anthropic сообщила о почти 200 млн попыток дистилляции Claude

Открыть публикацию в Instagram ↗