OpenAI впервые подробно раскрыла результаты по Jalapeno — своему кастомному inference-чипу для ИИ. Это не очередной абстрактный рассказ про инфраструктуру, а вполне конкретный сигнал: компания хочет ускорять модели не только за счёт новых алгоритмов, но и за счёт собственного железа. По официальным данным OpenAI, Jalapeno уже показывает более высокую производительность на ватт и меньшую задержку по сравнению с коммерчески доступными системами, с которыми его сравнивали.
Что произошло
OpenAI сообщила, что протестировала Jalapeno — свой первый чип, созданный специально под inference-нагрузки современных языковых моделей и AI-агентов. Компания утверждает, что система вокруг этого чипа даёт сразу два преимущества, которые обычно приходится балансировать между собой: более высокую пропускную способность и более низкую задержку.
В качестве ориентира OpenAI приводит результаты на публичном бенчмарке InferenceX и на нескольких известных моделях, включая GPT-OSS 120B, DeepSeek R1 и Kimi K2.5 1T. По заявлению компании, Jalapeno показал примерно в 1,5–1,9 раза больше полезной AI-работы на ватт при пиковой пропускной способности и в 1,7–3,6 раза более низкую end-to-end задержку, чем системы сравнения. Для интерактивных сценариев OpenAI также заявляет прирост производительности на уровне 2,1–4,1 раза.
Отдельно OpenAI делает акцент на том, что Jalapeno проектировался именно под реальные LLM-нагрузки: prefill, decode, работу с памятью, сетью и KV-cache. То есть речь не просто о ещё одном ускорителе, а о попытке собрать полный стек под задачи, где AI-агенту нужно действовать быстро и в несколько шагов подряд.
Ещё один важный момент: OpenAI утверждает, что использовала собственные модели и для разработки самого чипа. По словам компании, ИИ помогал ускорять цикл проектирования и оптимизировать отдельные вычислительные блоки. Также OpenAI пишет, что с помощью Codex и GPT-Astra команда за два месяца довела до высокой производительности три open-weight модели, которые изначально не входили в основной производственный план.
Почему это важно
Главное здесь не только в железе как таковом. Jalapeno — это признак того, что крупнейшие AI-компании всё активнее переходят к вертикальной интеграции: модель, софт, сеть, память, серверная архитектура и чип проектируются как единая система. Для рынка это важно по трём причинам.
Во-первых, AI-агенты очень чувствительны к задержке. Когда модель должна не просто ответить одним сообщением, а пройти цепочку действий, открыть инструменты, дождаться результатов и сделать следующий шаг, каждая лишняя секунда начинает дорого стоить. Если OpenAI действительно добивается более низкой задержки на inference, это напрямую усиливает агентные сценарии.
Во-вторых, эффективность на ватт становится одним из ключевых ограничителей роста. Спрос на вычисления растёт быстрее, чем доступность новых мощностей. Поэтому любой заметный выигрыш по throughput на киловатт — это уже не инженерная деталь, а фактор экономики продукта: ниже себестоимость, выше стабильность, больше шансов масштабировать сервис без резкого роста расходов.
В-третьих, это удар по логике, где почти вся ценность сосредоточена только в модели. OpenAI фактически говорит: будущее конкурентной гонки — не только в том, кто сделал лучший LLM, но и в том, кто лучше построил весь путь от токена до ответа. Если эта ставка сработает, преимущество будут получать не просто лаборатории с сильными моделями, а игроки, которые умеют оптимизировать полный стек.
Что дальше
OpenAI пишет, что планирует начать развёртывание Jalapeno в своей вычислительной инфраструктуре до конца года. Компания при этом не отказывается от ускорителей NVIDIA и других партнёров, а скорее строит гибридную стратегию: использовать всё доступное железо, но параллельно продвигать собственную многопоколенческую платформу.
Если развёртывание пройдёт успешно, пользователи, скорее всего, заметят это не по названию чипа, а по косвенным эффектам: ответы станут быстрее, агентные функции — стабильнее, а доступ к мощным моделям — дешевле для самой платформы и потенциально доступнее для рынка.
Пока важно помнить, что все цифры в новости исходят от самой OpenAI, хотя компания и ссылается на публичные модели и понятные метрики вроде latency и performance per watt. Но даже с этой оговоркой новость сильная: OpenAI показала, что уже не просто разрабатывает модели, а строит собственный вычислительный фундамент под следующую фазу AI-рынка.
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно