MIT показал, как проверять опасные AI-модели без генерации вредного контента

Друзья, хочу поделиться важной новостью из мира ИИ.
Исследователи MIT вместе с Thorn разработали новый способ аудита генеративных моделей. Он позволяет проверить, не была ли модель доработана для создания незаконного контента, включая CSAM, без запуска опасной генерации.
Метод анализирует внутренние представления модели и её адаптации после fine-tuning. По тестам он точно выявлял опасные варианты и при этом остаётся масштабируемым для платформ, где публикуются тысячи моделей.
Почему это важно: у аудиторов появляется безопасный инструмент для раннего выявления рисков и быстрой блокировки опасных моделей.
Как Вы считаете, такие методы должны стать обязательными для open-source AI?
#ИИ #MIT #Кибербезопасность #AIэтика

