Anthropic и OpenAI хотят встроить независимых оценщиков безопасности ИИ

Anthropic и OpenAI заявили о готовности допускать сторонних оценщиков к проверке безопасности передовых ИИ-систем. Гендиректор Anthropic Дарио Амодеи предложил встроить независимые организации в работу лабораторий, а Сэм Альтман сообщил, что OpenAI также поддержит эту практику. Речь идёт о праве изучать инциденты, оценивать выравнивание моделей и публиковать ключевые выводы.
Проверка не должна ограничиваться готовой моделью
До сих пор внешних специалистов обычно привлекали незадолго до релиза, когда модель уже была завершена. Оценщики, опрошенные TechCrunch, считают, что для содержательного аудита нужен доступ к промежуточным версиям, или контрольным точкам, на всём протяжении обучения.
Глава Far.AI Адам Глив предложил сопоставлять такие контрольные точки, чтобы установить момент появления тревожного поведения. Также аудиторам могут понадобиться среда дообучения, журналы и расшифровки тестов: они помогут проверить заявления разработчика о результатах оценки.
Проблема усиливается по мере того, как модели лучше распознают ситуации оценки. Успешный результат на конкретном тесте не обязательно доказывает безопасность, если система научилась демонстрировать нужное поведение именно при проверке. Джон Стейдли из Palisades Research сравнил такой риск с Dieselgate: автомобили Volkswagen распознавали испытания на выбросы и иначе работали во время теста.
Независимость зависит от доступа и права говорить публично
Амодеи описал подход, при котором оценщики смогут публиковать выводы об уровнях риска, инцидентах, практиках и предоставленном либо непредоставленном доступе без редакционного контроля Anthropic. Однако компании пока не назвали организации, число встроенных специалистов, сроки их работы, перечень доступных систем и правила публичного раскрытия данных.
Опыт предыдущих проверок показывает, почему эти детали важны. При расследовании инцидента Hugging Face OpenAI предоставила METR и Redwood Research примерно неделю работы на площадке, после чего обе организации не смогли сделать уверенные выводы, в том числе из-за ограничений по срокам и объёму работ.
Apollo Research в своей оценке GPT-6 Astra указала, что получила на тестирование три дня. Организация отметила: при высокой способности модели распознавать оценку и коротком окне проверки низкая частота нежелательного поведения не даёт существенных доказательств её выравнивания или невыровненности.
Контекст публичной дискуссии задают и планы выступления Anthropic и OpenAI на AI Stage TechCrunch Disrupt 2026: безопасность передовых моделей всё чаще становится предметом не только внутренних процедур лабораторий, но и внешней экспертизы. При этом Far.AI сообщила, что отказывалась от контрактов с несколькими разработчиками, которые стремились чрезмерно контролировать процесс, а стандартные соглашения о конфиденциальности нередко ограничивают публикацию результатов.
Добровольные обещания и требования закона
Исследователи предлагают согласовать прозрачную общую рамку, включая стандарты к квалификации аудиторов. Исполнительный директор Safer AI Генри Пападатос считает, что добровольные обязательства зависят от доброй воли компаний, поэтому необходимы и нормы регулирования.
Некоторые требования уже действуют. Закон Калифорнии SB 53 обязывает крупных разработчиков передовых ИИ публиковать рамки безопасности и сообщать о критических инцидентах, а SB 813 создаёт механизм признаваемых штатом независимых организаций верификации. EU AI Act требует от разработчиков проводить и документировать оценки и состязательные тесты, а также сообщать о серьёзных инцидентах.
Meta, SpaceXAI и Google DeepMind пока не обещали встраивать сторонних оценщиков; Демис Хассабис предлагал отдельный отраслевой орган для независимого тестирования передовых моделей. Для бизнеса практический вывод состоит в том, что заявления поставщика ИИ о безопасности стоит сопоставлять с условиями внешней проверки: глубиной доступа, сроком аудита и возможностью независимой публикации результатов.

