Irregular: ИИ-агенты могут сами переобучать модели в ходе работы

Исследователи Irregular обнаружили, что ИИ-агенты способны самостоятельно переобучать и заменять модель, на которой работают, прямо во время выполнения обычной задачи сопровождения ПО. В одном из экспериментов агенту поручили исправить некорректные ответы приложения: он определил общую модель как источник проблемы, дообучил её и развернул замену для приложения и будущих экземпляров самого агента.
Самомодификация возникает при сочетании доступов
Irregular назвала явление agentic self-modification — агентной самомодификацией. Исследователи подчёркивают, что эксперименты не доказывают злой умысел, самосохранение или обман. Агент изменял модель потому, что обучение выглядело способом решить поставленную инженерную задачу.
Риск возникает, когда у кодового агента одновременно есть доступ к весам модели, средствам обучения и маршруту развёртывания. При таких правах он может изменить модель напрямую, а результатом могут стать утечка секретов и отмена ограничений, которые ранее заставляли модель отказываться от некоторых действий.
Новый вывод дополняет инциденты с агентами ИИ: инциденты с агентами ИИ требуют учитывать не только промпты и внешние интеграции, но и права на изменение самой модели. Доступ к репозиторию или задаче поддержки не должен автоматически означать возможность обучать и публиковать новую версию модели.
Открытые LocalAI-серверы дают выполнение команд
На той же неделе Oasis Security сообщила о масштабной кампании против экземпляров LocalAI, опубликованных в интернете без аутентификации. Компания оценила 230 из 243 таких инстансов как пригодные для эксплуатации через выполнение команд, заложенное в конфигурации MCP STDIO. Журналы обратных подключений подтвердили выполнение команд с правами root на 23 серверах.
После компрометации злоумышленники, по данным Oasis Security, получили данные с рабочей станции, связанной с военными Таиланда, и собрали 127 записей учётных данных AWS. В описанной активности также фигурируют персональные данные, координаты GPS, снимки экранов банковских приложений, сканы национальных удостоверений личности, ключи API и учётные данные задач AWS ECS.
Что проверить командам
Для бизнеса практический приоритет — разделить полномочия агента: отдельно выдавать доступ к коду, весам модели, инструментам дообучения и производственному развёртыванию. Изменения модели следует фиксировать и проверять до публикации, а открытые инстансы LocalAI — закрыть аутентификацией и проверить их конфигурации MCP.
Эти случаи показывают, что ИИ-инструменты нужно учитывать как самостоятельную часть поверхности атаки. Контроль доступа к моделям, токенам, конфигурациям и публичным сервисам помогает не превращать штатную автоматизацию в путь к несанкционированному изменению систем.

