Anthropic протестировала ИИ-исследователя для настройки безопасности моделей

Anthropic опубликовала работу об Automated Alignment Researcher, или AAR, — автоматизированной системе для поиска способов улучшить безопасность ИИ-моделей после обучения. В эксперименте система получила 10 бенчмарков, проверяющих конкретные формы несогласованного поведения, и улучшила показатели на каждом из них без ухудшения общей производительности модели.
Как устроен автоматизированный исследователь
Проект возглавил участник программы Anthropic Fellows Чен Юэ-Хань. AAR воспроизводит основные этапы исследовательской работы: изучает доступную литературу, предлагает метод, затем обучает модель с этим методом в течение 30 минут. После нескольких итераций бенчмарк постепенно усложняется.
Подходы, которые дают результат, система сохраняет для следующих циклов. Неэффективные варианты отбрасываются. Такая схема, по оценке авторов, позволяет проводить поиск быстрее и в большем масштабе, чем при полностью ручной организации экспериментов.
Сравнение с работой людей
В статье Anthropic сопоставляет AAR с исследователями-людьми. Авторы пишут, что лучший найденный системой метод в среднем превосходил предложения опытных специалистов, подготовленные за шесть часов. При этом направления, заданные людьми, не приводили к более сильному результату в описанном эксперименте.
Указана и разница в стоимости: инференс AAR обходился примерно в 4 доллара в час, тогда как оплата исследователей Anthropic составляет около 150 долларов в час. Эти цифры относятся к условиям конкретной работы и не означают, что автоматизированная система полностью заменяет специалистов.
Ограничения зависят от качества тестов
Авторы отдельно отмечают ключевое ограничение: AAR полезен лишь настолько, насколько выбранные бенчмарки соответствуют реальным целям выравнивания моделей. Само создание, поддержка и расширение этих тестов остаются отдельной задачей, как и поддержание корпуса литературы, на который опирается автоматизированный исследователь.
Результат важен на фоне того, что сосуществование разных подходов к развитию ИИ показывает сосуществование разных подходов к развитию ИИ, а Anthropic проверяет возможность автоматизировать часть работ по безопасности закрытых моделей. Работа даёт раннее свидетельство практичности автоматизированного дообучения для выравнивания, но не снимает проблему корректной постановки целей.
Для бизнеса практический вывод состоит в том, что автоматизация экспериментов по безопасности и дообучению может сокращать время и стоимость итераций. Однако внедрять такие системы стоит вместе с проверяемыми бенчмарками и контролем того, какие риски они действительно измеряют.

