Microsoft закрепила запреты для ИИ на взлом и обман людей

Microsoft AI опубликовала кодекс поведения для своих моделей, в котором закреплены запреты на кибератаки, создание дипфейков и помощь с ядерным оружием. Документ также требует, чтобы модели не обходили человеческий надзор и оставались доступными для изменения или отключения уполномоченными людьми и системами.
Правила выше запроса пользователя
В Microsoft кодекс поведения модели должен иметь приоритет над предпочтениями отдельного пользователя и конкретной задачей. Компания называет запреты на опасные действия «абсолютными ограничениями» и связывает их с более общими принципами: ИИ должен поддерживать людей, а не заменять их, и способствовать человеческому благополучию.
Среди отдельно перечисленных ограничений — отказ от кибератак, разработки, производства или применения ядерного оружия и создания дипфейков. Кодекс не сводится к фильтрации отдельных запросов: он описывает рамки, которыми Microsoft намерена руководствоваться при обучении моделей.
Контроль как техническое требование
Microsoft исходит из того, что в ближайшее десятилетие сверхинтеллектуальные системы могут превзойти человека в большинстве задач. В документе контроль и согласование целей таких систем названы одной из наиболее сложных задач для человечества.
Моделям запрещено применять адаптивные, обманные, самоусиливающиеся механизмы, сговор или иные способы уклонения от надзора. Формулировка нацелена на ситуации, когда ИИ уже нельзя надёжно направить, модифицировать или остановить авторизованным людям либо системам.
Контекст для рынка ИИ
Позиция Microsoft продолжает линию, в которой конкуренция Microsoft с OpenAI и Anthropic отражает соперничество компании с OpenAI и Anthropic на корпоративном рынке, а безопасность становится частью требований к продуктам. Генеральный директор Microsoft Сатья Наделла поддержал исследования, осмысленное замедление на передовом рубеже ИИ и идею встроенных оценщиков в лабораториях.
Для бизнеса документ важен как ориентир при выборе ИИ-поставщика. Следует выяснять не только возможности модели, но и то, какие запреты заложены в её обучение, как проверяется соблюдение ограничений и кто сохраняет возможность остановить систему.

