OpenAI представила Ultrafast для GPT-5.6 Sol с ускорением до 14 раз

OpenAI представила режим Ultrafast для модели GPT-5.6 Sol. В превью компания обещает до 14-кратного ускорения по сравнению со стандартной обработкой и генерацию до 750 выходных токенов в секунду. Функция пока открыта лишь небольшой группе клиентов.
Что заявляет OpenAI
Ultrafast предназначен для ускорения работы новейшей и наиболее мощной модели OpenAI, GPT-5.6 Sol. Выходные токены компания определяет как отдельные фрагменты текста, которые языковая модель создаёт при взаимодействии с человеком.
OpenAI подчёркивает, что прежде получение скорости, близкой к реальному времени, обычно требовало выбора меньшей или более специализированной модели. Новый режим компания описывает как движение к большему объёму полезной работы за секунду без такого выбора.
В линейке GPT-5.6 уже появлялись ускоренные варианты: запуск Fast mode для GPT-5.6 Sol показывает, как OpenAI запускала Fast mode для Sol наряду со снижением цен на Luna и Terra. Ultrafast позиционируется как отдельный режим с заявленной производительностью до 750 токенов в секунду.
Технологическая основа и доступность
Режим Ultrafast работает на базе партнёрства OpenAI с производителем чипов Cerebras. Компания не раскрыла в сообщении технические параметры инфраструктуры, стоимость использования или условия для подключения к превью.
Доступ к функции расширят по мере роста доступных мощностей. Это означает, что заявленная скорость на старте не является общедоступной возможностью для всех пользователей GPT-5.6 Sol.
Где OpenAI предлагает применять режим
Среди корпоративных сценариев OpenAI называет реагирование на инциденты, обслуживание и поддержку клиентов, анализ финансовых рынков и электронную коммерцию. Эти задачи предполагают быстрое формирование текстовых ответов или обработку поступающей информации.
Для компаний практический вывод состоит в том, чтобы оценивать Ultrafast на собственных задачах, чувствительных к задержке, когда доступ к превью станет возможен. При планировании внедрения стоит отдельно учитывать ограниченную доступность режима и проверять фактическую скорость в конкретном рабочем процессе.

