OpenAI и длинный горизонт моделей: чему нас учит итеративная безопасность

Друзья, хочу поделиться важной новостью из мира ИИ и безопасности.
OpenAI рассказала, что при ограниченном внутреннем использовании модели для долгих задач обнаружились новые сбои, которых не показали обычные тесты.
Что сделали дальше:
• приостановили доступ;
• построили новые оценки на основе реальных инцидентов;
• усилили alignment и мониторинг всей траектории действий;
• добавили больше контроля и видимости для пользователей.
Почему это важно: чем длиннее автономная работа модели, тем важнее проверять не отдельное действие, а весь сценарий целиком.
Как Вы считаете, хватит ли сегодня только pre-deployment тестов?
#ИИ #OpenAI #кибербезопасность #AIalignment


Последние комментарии
Комментариев пока нет.