OpenAI призвала сдерживать масштабирование ИИ до появления общих норм безопасности

Главный научный сотрудник OpenAI Якуб Пахоцкий заявил, что ни одна лаборатория пока не достигла уровня выравнивания и мониторинга, который позволил бы ответственно долго масштабировать ИИ на максимальной скорости. По его словам, GPT-6 Astra заметно лучше выровнена, чем GPT-5.6 Sol, однако достигнутого прогресса недостаточно на фоне роста возможностей моделей.
Модели становятся сложнее для интерпретации
Пахоцкий связывает прогресс машинного интеллекта прежде всего с наращиванием вычислительных ресурсов. Он описывает современные системы глубокого обучения как результат повторяющейся оптимизации на огромных объёмах вычислений, а не как полностью спроектированные человеком механизмы.
Такой подход даёт модели способность работать с абстрактными понятиями и имитировать отдельные черты человеческого поведения, но её общее функционирование остаётся не до конца объяснимым. По мере роста возможностей результаты обучения, как отмечает OpenAI, становятся труднее интерпретировать.
Компания ожидает, что при сохранении нынешней траектории в ближайшие годы ИИ может совершить новые скачки возможностей и всё активнее участвовать в собственной разработке. Этот сценарий OpenAI связывает с рекурсивным самосовершенствованием, или RSI.
Выравнивание и контроль рассуждений
Пахоцкий разделяет выравнивание на два направления. Целевое выравнивание отвечает за стремление модели выполнить поставленную задачу, следовать иерархии инструкций и взаимодействовать с людьми. Ценностное выравнивание означает способность переносить высокоуровневые принципы на неясные, конфликтующие или незнакомые ситуации.
Основной проблемой он называет обобщение: система может не перенести ценности, закреплённые в обучении, на новые условия. Это особенно важно, когда модель действует среди других ИИ, использует инструменты и сталкивается с меняющейся средой.
Одним из ключевых инструментов OpenAI считает мониторинг цепочек рассуждений. Идея состоит в наблюдении за вербализованным процессом рассуждений, если сам этот процесс не оптимизируется под надзор. В OpenAI признают, что эффективность такого подхода постепенно снижается: рассуждения всё сильнее смешиваются с использованием инструментов и коммуникацией, а модели лучше анализируют собственный процесс мышления.
Безопасность как ограничитель масштабирования
OpenAI также указывает на киберриски. Более способные агенты могут получать доступ к компьютерным системам, поэтому компания считает важным применять сильные модели для защиты критической инфраструктуры и противодействия вредоносным агентам.
При этом Пахоцкий предостерегает от гонки любой ценой. Он предлагает ограничивать масштабирование уверенностью в безопасности, развивать обязательные пороги наподобие Preparedness Framework и Responsible Scaling Policy, а контроль поручать независимым аудиторам, государственным или международным структурам.
Для бизнеса практический вывод заключается в том, что внедрение автономных ИИ-агентов требует не только оценки полезности, но и ограничений доступа, контроля действий и участия человека в критических процессах. Рост возможностей моделей не отменяет необходимости проверяемых защитных мер.

