OpenAI раскрыла бенчмарки чипа Jalapeño для ИИ-инференса

OpenAI представила первые результаты тестирования ускорителя Jalapeño на конференции Hot Chips. В бенчмарке Semianalysis InferenceX система показала больше токенов на пользователя и более высокую пропускную способность на киловатт, чем доступные передовые процессоры для инференса; сравнение велось с системой Nvidia Blackwell.
Результаты и сроки развёртывания
Ричард Хо, руководитель аппаратного направления OpenAI, назвал результаты значительным шагом вперёд относительно текущего уровня. По его словам, Jalapeño способен обслуживать больше ИИ-нагрузки на единицу энергии и быстрее возвращать ответы. Он также отметил возможность сочетать высокую эффективность при обслуживании большого числа клиентов с низкой задержкой.
При этом до массового появления Jalapeño конкурентная среда может измениться. Хо ожидает развёртывания в очень небольших объёмах в конце 2026 года, а более существенных поставок — в 2027 году. Поэтому опубликованные показатели характеризуют сравнение с доступной на момент теста системой Nvidia Blackwell, а не рынок на дату будущего запуска.
Как устроен подход OpenAI
OpenAI впервые объявила о Jalapeño в октябре прошлого года. Ускоритель разрабатывается в тесном сотрудничестве с Broadcom, а собственные модели OpenAI помогали в процессе разработки. Компания планирует развивать Jalapeño как многопоколенную платформу, синхронно создавая ИИ-продукты, модели, чипы и память.
Полностековый подход позволил сфокусироваться на этапах инференса, которые часто создают задержки. В частности, Jalapeño рассчитан на сокращение задержек на стадиях предварительной обработки запроса, или prefill, и коммуникаций между компонентами системы.
OpenAI заявляет, что архитектура минимизирует перемещение данных и коммуникационные задержки. Состояние модели, включая KV-кэш, используемый при генерации ответа, можно явно разместить и хранить локально, активируя нужное сочетание вычислений, памяти и сети для каждой фазы инференса. Контекст появления платформы задаёт ускоритель Jalapeño для энергоэффективного инференса LLM и показывает, почему энергоэффективность стала одной из центральных характеристик ускорителей для LLM.
Что учитывать компаниям
Пока Jalapeño не доступен для широкого развёртывания, его результаты следует воспринимать как заявленные OpenAI показатели в конкретном бенчмарке. Для бизнеса практический вывод состоит в том, чтобы при планировании ИИ-инфраструктуры сопоставлять не только пиковую вычислительную мощность, но и токены на пользователя, задержку, расход энергии и особенности работы с KV-кэшем на собственных сценариях инференса.

