VMTech
Обсудить проект

OpenAI представила первые показатели ускорителя Jalapeño для инференса

OpenAI представила первые показатели ускорителя Jalapeño для инференса

OpenAI опубликовала первые результаты испытаний Jalapeño — собственного ускорителя для ИИ-инференса. В тестах на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T система показала в 1,5–1,9 раза больше полезной работы на ватт при пиковой пропускной способности и в 1,7–3,6 раза меньшую сквозную задержку по сравнению с сопоставляемыми системами.

Компания проверяла платформу в публичном бенчмарке InferenceX от SemiAnalysis, который оценивает полный цикл обслуживания запроса. OpenAI сравнивала решения в диапазоне режимов: от высокой пропускной способности до интерактивной обработки с низкой задержкой.

Эффективность и задержка на трёх моделях

Для сопоставления результатов OpenAI нормализовала показатели по опубликованному энергопотреблению ускорителей. Номинальная мощность Jalapeño составляет 700 Вт, однако устойчивое потребление в испытанных нагрузках не превышало 550 Вт.

На GPT-OSS 120B Jalapeño достиг 85 448 смешанных токенов в секунду на киловатт против 44 960 у GB200. Сквозная задержка составила 1,03 секунды против 1,80 секунды. На DeepSeek R1 670B компания указала 19 641 смешанный токен в секунду на киловатт против 11 781 у GB300 и задержку 1,65 секунды против 5,99 секунды.

На Kimi K2.5 1T, самой крупной публичной модели в тесте, ускоритель выдал 18 195 смешанных токенов в секунду на киловатт против 11 862 у GB300. Сквозная задержка составила 1,56 секунды вместо 5,31 секунды. OpenAI называет сочетание пропускной способности, энергоэффективности и задержки положением на границе Парето.

Архитектура для агентных нагрузок

Jalapeño проектировался для обслуживания современных языковых моделей и интерактивных агентов. При инференсе обработка промпта, или prefill, в большей степени зависит от вычислений, тогда как поэтапная генерация ответа, decode, ограничена пропускной способностью памяти. Передача данных между ядрами и чипами добавляет задержку.

По описанию OpenAI, система старается сократить перемещение данных: состояние модели, включая KV-кеш, можно явно разместить и удерживать локально. Сеть встроена в архитектуру и позволяет сохранить нагрузку внутри единой связанной системы. Контекст разработки ускорителя даёт ускоритель для энергоэффективного инференса LLM — его представили как платформу для масштабируемого и энергоэффективного инференса LLM.

ИИ в разработке самого ускорителя

OpenAI заявляет, что использовала ИИ при проектировании Jalapeño и вышла на tapeout за девять месяцев. Модели помогали исследовать варианты реализации, ускорять циклы проектирования, измерений и верификации, а также оптимизировать арифметические схемы.

Для программирования платформа использует локальные тензоры, явные коммуникации и предсказуемую синхронизацию. С помощью Codex и GPT-Astra команда за два месяца вывела на высокую производительность три открытые модели, которые изначально не входили в производственный план. Для отдельных блоков внимания и mixture-of-experts в GPT-OSS реализации, сгенерированные ИИ, работали в 1,5–1,8 раза быстрее существующих версий, написанных инженерами; компания отдельно подчёркивает, что это не показатель всей модели.

Что будет дальше

OpenAI планирует начать развёртывание Jalapeño в собственной вычислительной инфраструктуре к концу года. Компания продолжит использовать ускорители NVIDIA и других партнёров для обучения и инференса, а также готовит второе и третье поколения собственной платформы.

Для бизнеса эти результаты подчёркивают практический критерий оценки ИИ-инфраструктуры: важны не только показатели токенов в секунду, но и производительность на ватт со сквозной задержкой в целевом пользовательском сценарии.

#aiinference#aichips#datacenter#openai
Открытая аналитика
На сайте 1 просмотров
мин чтения 4 25.08.2026
Instagram

OpenAI представила первые показатели ускорителя Jalapeño для инференса

Открыть публикацию в Instagram ↗