OpenAI предложила принципы независимой оценки безопасности ИИ

OpenAI опубликовала подход к независимой оценке безопасности передовых ИИ-моделей. Компания выделила четыре направления: проверку обоснований безопасности, защитных механизмов, оценок опасных способностей и расследование критических инцидентов рассогласования моделей.
OpenAI заявила, что готова предоставлять независимым оценщикам глубокий доступ к процессам обучения, тестирования и развертывания. В числе возможных материалов названы сведения о технических защитах, доступ к мониторингу цепочек рассуждений, конфиденциальные данные и внутренняя среда развертывания для реагирования на инциденты и red teaming.
Что именно предлагают проверять
Первое направление касается safety case — структурированного обоснования того, почему риски модели приемлемо контролируются для конкретной деятельности: обучения, оценки или развертывания. Такой документ связывает отдельные утверждения о безопасности с подтверждающими их доказательствами, а также фиксирует допущения, неопределенности и остаточные риски.
Независимые эксперты должны оценивать, подтверждены ли такие утверждения, соблюдались ли условия safety case на этапах обучения и внедрения и не остаются ли существенные пробелы. Для этого, по мнению OpenAI, потребуются специалисты по выравниванию моделей, мониторингу, кибербезопасности, биологическим и химическим рискам, а также red teaming.
Второе направление — проверка защитных механизмов при внутреннем и внешнем использовании моделей. Компания предлагает испытывать их в режиме «серого ящика», в том числе на устойчивость к обходу ограничений и на способность предотвращать опасное усиление возможностей в кибербезопасности и биологических задачах.
Оценки способностей и расследование инцидентов
Отдельно OpenAI предлагает проверять качество оценок из Preparedness Framework. Они охватывают химические и биологические риски, кибербезопасность и способность ИИ к самоулучшению. Вопросы для аудиторов включают корректность порогов риска, актуальность тестов после достижения моделями высоких результатов и полноту проверок на тяжелые формы рассогласования.
Четвертое направление — независимое расследование критических инцидентов, в которых модель действовала без разрешения или пыталась уклониться от надзора. В таких случаях могут потребоваться экспертиза в цифровой криминалистике, анализе цепочек рассуждений и выравнивании моделей. OpenAI отмечает, что часть данных расследования может быть слишком чувствительной для публикации.
Требования к независимой проверке
Компания предлагает заранее согласовывать область проверки и конкретные утверждения, которые будут оцениваться. Методики, критерии и неопределенности должны быть прозрачны, а отчеты — отделять прямые выводы от интерпретаций. Оценщики также должны раскрывать и устранять конфликты интересов, включая финансовые стимулы и прежнее участие в проверяемой работе.
Доступ к информации должен быть соразмерен задаче, но ограничен требованиями права, безопасности и защиты интеллектуальной собственности. При работе с особо чувствительными данными OpenAI допускает использование устройств или помещений компании. Лаборатории, в свою очередь, должны получать разумный срок на устранение выявленных проблем до публикации результатов.
Для бизнеса практический вывод состоит в необходимости заранее формулировать проверяемые утверждения о безопасности ИИ-систем, сохранять доказательства работы защит и определять порядок независимой проверки. Такой подход помогает обсуждать риски, доступ и конфиденциальность до того, как потребуется реагировать на критический инцидент.

