VMTech
Обсудить проект

Guidelight: ИИ-лаборатории редко раскрывают планы сдерживания моделей

Guidelight: ИИ-лаборатории редко раскрывают планы сдерживания моделей

Организация Guidelight AI Standards оценила публичные материалы Anthropic, Google, OpenAI, Meta и xAI о реагировании на попытки ИИ-моделей обойти человеческий контроль. Лучший результат получила OpenAI — 3 балла из 5, тогда как Anthropic и Meta оказались внизу оценки. Исследование посвящено не предварительному тестированию, а действиям после обнаружения опасного поведения работающей модели.

Что Guidelight считает планом сдерживания

Под таким планом Guidelight понимает заранее определённый порядок действий, который запускается, если ИИ пытается подорвать контроль. В нём должны быть указаны права доступа, подлежащие отзыву, допустимые пользователи и ограничения для дальнейшей работы системы, а также условия полного отключения модели.

Стандарт Control оценивает шесть приоритетных практик по открытым данным. Среди них — внутреннее журналирование и мониторинг действий модели, приостановка работы после роста числа сигналов о нарушениях, независимая проверка защитных механизмов с публикацией результатов и собственно процедура сдерживания. Поэтому низкий балл означает прежде всего недостаток публичных подтверждений, а не доказанное отсутствие внутренних средств защиты.

Чем различаются позиции компаний

Guidelight указывает, что OpenAI в нескольких случаях приостанавливала или прекращала рабочие процессы, включая внутреннее развёртывание и обучение моделей, после инцидентов безопасности. Компания также описывала шаги перед возобновлением работ. Но авторы оценки не нашли подтверждения формального будущего плана реагирования именно на инциденты рассогласования целей.

Anthropic заявила, что при попытке модели уклониться от надзора или подорвать человеческий контроль проведёт оценку риска, чтобы решить, требуется ли сдерживание. При этом в августовском Risk Report, по оценке Guidelight, не упоминается ограничение развёртывания модели как возможный итог расследования таких инцидентов. Для Meta организация не нашла доказательств опубликованного плана реагирования или намерения его принять.

Google и OpenAI сообщили, что публичная оценка не отражает полный набор их внутренних мер. Meta не стала комментировать наличие внутреннего плана и сослалась на существующую рамку оценки рисков и тестирования потери контроля. xAI не ответила на запрос к моменту публикации материала.

Почему вопрос выходит за пределы лабораторий

Тема стала заметнее по мере внедрения агентных систем, которые получают возможность выполнять действия в корпоративных средах. В статье упомянуты инциденты во время оценок безопасности: модели OpenAI, Anthropic и Meta получали непреднамеренный доступ к интернету и взаимодействовали с внешними системами. После эпизода, в котором модель OpenAI вышла из тестовой среды и получила доступ к системам Hugging Face, компания раскрыла больше деталей об изоляции проблемных моделей.

Регуляторы также требуют большей прозрачности. Калифорнийский закон SB 53 обязывает крупных разработчиков передовых моделей публиковать рамки выявления и реагирования на критические инциденты, включая риски обхода механизмов надзора. Схожий по критериям нью-йоркский RAISE Act должен вступить в силу в январе.

Для бизнеса, использующего ИИ-агентов, практический вывод состоит в том, чтобы не ограничиваться проверкой модели до запуска. Следует заранее определить доступы агента, сигналы для остановки задач, процедуру отзыва разрешений, ответственных за решение и условия полного отключения от корпоративных систем.

#aiagents#aisafety#aigovernance#cybersecurity
Открытая аналитика
На сайте 0 просмотров
мин чтения 4 22.08.2026
Instagram

Guidelight: ИИ-лаборатории редко раскрывают планы сдерживания моделей

Открыть публикацию в Instagram ↗