OpenAI представила GPT-6.1 Sol для агентных задач и программирования

OpenAI представила GPT-6.1 Sol — обновлённую модель семейства GPT-6 Sol для агентного программирования, управления компьютером и профессиональных задач. Компания заявляет, что по ряду сложных тестов она приближается к GPT-6 Astra, а стандартные цены на входные и выходные токены ниже примерно в пять раз.
Через API модель доступна под именем gpt-6.1-sol. OpenAI установила цену $2 за миллион входных токенов, $0,10 за миллион кэшированных входных токенов и $10 за миллион выходных токенов. В ChatGPT «Работа» и Codex доступ открыт пользователям Plus, Pro, Business, Enterprise и Edu; в режиме «Чат» модель пока не предлагается.
Результаты в разработке и офисных процессах
В тесте DeepSWE v1.1, который проверяет решение задач в реальных кодовых базах, GPT-6.1 Sol достигла результата GPT-6 Astra при затратах примерно в пять раз ниже. По сравнению с лучшим результатом GPT-6 Sol прирост составил 6,4 процентного пункта при меньших усилиях на рассуждения и меньшей стоимости.
На тесте GDP.pdf модель отвечает на профессиональные вопросы по сложным PDF-документам с таблицами, графиками, схемами и мелким шрифтом. OpenAI сообщает, что GPT-6.1 Sol превзошла Opus 5.5 с резервными моделями при стоимости задачи более чем вдвое ниже на всех проверенных уровнях усилий.
В AutomationBench при среднем уровне усилий на рассуждения новая модель опередила Opus 5.5 на 2,2 процентного пункта при затратах примерно втрое ниже. Превосходство над GPT-6 Sol в той же настройке составило 4,8 процентного пункта. Контекст появления линейки даёт развитие линейки GPT-6 Sol и Luna и показывает, что OpenAI продолжает выделять более доступную модель для массового запуска агентных приложений.
Компьютерные и научные задачи
В офлайн-наборе OSWorld 2.0 GPT-6.1 Sol превзошла GPT-6 Sol на семь процентных пунктов при максимальном уровне усилий на рассуждения. От GPT-6 Astra она отстала на 2,1 процентного пункта, тогда как стоимость задачи, по оценке OpenAI, была примерно в семь раз ниже.
В Terminal-Bench Science 0.1 модель выполняет научные рабочие процессы с кодом и инструментами терминала: анализ данных, моделирование и подбор параметров. При максимальных усилиях средняя стоимость задачи составила $5,47, против $23,21 у Opus 5.5 и $23,80 у GPT-6 Astra. При этом Astra сохранила лучший результат среди протестированных моделей — 68,1%.
Точность, безопасность и быстрые версии
При очень высоком уровне усилий частота фактических ошибок у GPT-6.1 Sol составила 4,1%, у GPT-6 Sol — 4,5%, а у Astra — 4,0%. OpenAI уточняет, что метрика получена на обезличенных диалогах, где пользователи отмечали ошибки предыдущих моделей, поэтому она не описывает обычную частоту ошибок в ChatGPT.
Компания также сообщает о более надёжном соблюдении пользовательских ограничений и требований безопасности по сравнению с GPT-6 Sol. Одновременно OpenAI запустила GPT-6 Astra Ultrafast и GPT-6.1 Sol Ultrafast: версии доступны в API, ChatGPT «Работа» и Codex для нового уровня Pro с лимитами за $500 в месяц.
Для бизнеса релиз означает возможность проверять более сильную модель в задачах разработки, обработки документов и многоэтапных процессов без перехода на тариф Astra. Однако выбор стоит подтверждать на собственных данных, инструментах и требованиях к качеству, поскольку опубликованные результаты относятся к конкретным тестам OpenAI.

