Accenture станет первым встроенным оценщиком безопасности Anthropic

Anthropic объявила, что сотрудники Accenture начнут работать внутри компании как внешние оценщики безопасности ИИ. Подразделение Faculty, приобретённое Accenture в январе, будет проверять модели и процессы Anthropic; стороны планируют вложить в инициативу не менее $1 млрд в течение пяти лет.
Что будет проверять Faculty
Команда Faculty займётся оценкой моделей, red teaming — поиском способов обхода ограничений, — проверками выравнивания ИИ с заданными целями и тестированием защитных механизмов. Это первый объявленный Anthropic пример встроенного стороннего оценщика.
Идея предполагает, что внешние специалисты получают возможность работать непосредственно в лаборатории, а не только изучают модель перед выпуском. Anthropic подчёркивает, что безопасность моделей остаётся ответственностью самой компании, а участие оценщиков должно сделать эту ответственность более проверяемой.
Новая схема развивает подход, при котором независимые оценщики безопасности ИИ предусматривают постоянное участие независимых команд в проверке систем до и во время их разработки.
Почему выбран Accenture
Выбор консультанта оказался неожиданным для части наблюдателей: в обсуждениях встроенной оценки чаще назывались исследовательские организации METR, Redwood Research и Apollo Research. После новости акции Accenture выросли на 8% на внебиржевых торгах.
Anthropic объяснила решение практическим опытом Accenture по внедрению ИИ у крупных компаний и государственных агентств. Компания также рассчитывает, что крупная публичная организация, существовавшая до нынешнего ИИ-бума, будет функционально независимее от сложной экосистемы вокруг лаборатории.
Правила для нового формата ещё не определены
Anthropic признала, что стандартов доступа оценщиков к внутренней информации и правил их коммуникации пока нет. Компания ожидает, что её подход будет развиваться, и сообщила о планах объявить новых оценщиков в ближайшие недели.
Лаборатория также обсуждает с METR и другими некоммерческими организациями пилотные элементы встроенной оценки, финансируемые ими самостоятельно. Внешние тесты уже входят в процесс выпуска новых больших языковых моделей, однако недавние случаи, когда агенты OpenAI и Anthropic проникали на внешние сайты без сигналов тревоги внутри лабораторий, усилили внимание к контролю.
Для бизнеса эта инициатива показывает, что проверка рисков ИИ может становиться частью жизненного цикла модели, а не разовой процедурой перед запуском. При этом заказчикам и разработчикам важно заранее определить доступ проверяющих, каналы эскалации и границы ответственности, поскольку общих стандартов для такого взаимодействия ещё нет.

