OpenAI раскрыла стратегию вычислений и результаты чипа Jalapeño

OpenAI опубликовала первые измеренные результаты Jalapeño — собственного чипа для ИИ-инференса, и описала вычислительную стратегию как единую систему из дата-центров, микросхем, моделей, платформы разработчиков, потребительских и корпоративных продуктов, а также ИИ-устройств. В публичном бенчмарке InferenceX с моделью GPT-OSS 120B Jalapeño показал более высокую пиковую производительность на киловатт и меньшую задержку токенов, чем коммерческие системы, участвовавшие в сравнении.
Компания называет Jalapeño своим первым кастомным чипом для инференса. По утверждению OpenAI, ускоритель также показал сильные результаты на DeepSeek R1 и Kimi K2, что должно указывать на применимость его преимуществ не к одному семейству моделей. Следующие поколения собственного кремния уже разрабатываются.
Ставка на совместную оптимизацию
OpenAI объясняет эффект от Jalapeño не отдельным компонентом, а совместной разработкой модели, программного обеспечения для обслуживания, чипа, памяти и сети. Такой подход, по версии компании, позволяет одновременно улучшать пропускную способность, задержку, энергоэффективность и стоимость запуска моделей.
Собственный ускоритель не означает отказа от внешних поставщиков. OpenAI подчёркивает, что Microsoft и чипы NVIDIA были основой её роста. В текущий портфель также входят AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy и SoftBank. Партнёры закрывают разные задачи: облачную инфраструктуру, ускоренные вычисления, низколатентный инференс, строительство дата-центров и энергоснабжение.
Для разных нагрузок, включая обучение передовых моделей, массовый инференс и постоянно работающих агентов, нужны разные сочетания оборудования, сетей, энергопотребления и задержек. OpenAI намерена использовать наиболее производительные системы там, где критична способность модели, а при масштабных задачах оптимизировать эффективность и стоимость.
Эффективность как экономика продукта
Компания связывает эффективность инфраструктуры с полезным результатом на единицу вычислений. Среди факторов названы модели, которым требуется меньше попыток для ответа, маршрутизация запросов, управление контекстом, оптимизированное ПО и специализированное оборудование.
OpenAI также привела результат GPT-5.6 Sol с максимальным режимом рассуждений в Artificial Analysis Coding Agent Index: модель достигла нового максимума, использовав на 54% меньше выходных токенов, чем другая ведущая модель. Компания считает, что для заказчиков такие изменения могут означать более быстрые результаты, меньше повторных запусков, более надёжные продукты и снижение совокупной стоимости успешно выполненной работы.
Что учитывать компаниям
Практический вывод из позиции OpenAI — оценивать ИИ-системы не только по цене вычислительных ресурсов или характеристикам отдельного ускорителя. Для бизнеса важнее сопоставлять стоимость завершённой задачи с качеством результата, числом повторных попыток, задержкой и возможностью выполнять более длинные рабочие процессы.
Одновременно появление собственного чипа Jalapeño расширяет выбор OpenAI между внутренней платформой и решениями партнёров. Для заказчиков это подчёркивает значение архитектуры всей цепочки: модель, ПО, инфраструктура и экономические условия использования должны рассматриваться вместе.

