Содержание
OpenAI Jalapeno — собственный ускоритель инференса для LLM, который компания разработала вместе с Broadcom. Чип рассчитан на обслуживание запросов ChatGPT, Codex, OpenAI API и будущих агентных AI-продуктов.
Анонс вышел 24 июня 2026 года. OpenAI говорит о специализированном ASIC, а не об универсальной видеокарте. Компания не заявила, что Jalapeno заменит GPU в обучении крупных моделей.
Jalapeno ускоряет стек OpenAI, а не весь рынок LLM
OpenAI описывает Jalapeno как чип с фиксированными и программируемыми вычислительными блоками. Фиксированная логика берет повторяющиеся операции инференса. Программируемая часть нужна для изменений в моделях и серверном стеке.
Инференс — это запуск уже обученной модели на реальных запросах. Когда мы просим ChatGPT написать код или разобрать таблицу, дата-центр тратит мощность именно на инференс.
По смыслу Jalapeno близок к Google TPU. Разница в фокусе: TPU используют и для обучения, и для инференса, а Jalapeno пока описали только как ускоритель инференса для стека OpenAI.
Девять месяцев до tape-out — главный заявленный рекорд
В анонсе OpenAI компания утверждает, что вместе с Broadcom довела Jalapeno до manufacturing tape-out за девять месяцев. Для advanced ASIC это агрессивный график. После tape-out дизайн уходит на производство масок и первых кристаллов.
OpenAI называет этот цикл самым быстрым среди передовых полупроводников. Формулировка сильная, но tape-out не равен готовому парку серверов. Между первым кремнием и стабильной эксплуатацией остаются валидация, прошивки, платы, стойки и софт.
Jalapeno не разовая проба пера. Компания сразу говорит о вычислительной платформе на несколько поколений таких чипов. Первое развертывание запланировали ближе к концу 2026 года.
Восемь стеков HBM3E и почти без привычных спецификаций
OpenAI раскрыла только базовую компоновку Jalapeno. Чип выполнен как современный multi-chip module с интерпозером: крупный логический кристалл стоит по центру, а по бокам размещены восемь стеков HBM3E.
- Упаковка: multi-chip module с интерпозером.
- Логика: крупный центральный вычислительный кристалл.
- Память: восемь стеков HBM3E рядом с логикой.
- Сроки: первая установка платформы ближе к концу 2026 года.
HBM3E здесь выглядит ожидаемо. LLM-инференс упирается не только в математику, но и в доступ к весам модели. Чем ближе память к логике, тем проще кормить вычислительные блоки данными без лишних поездок по плате.
Цифр по производительности нет. OpenAI не назвала техпроцесс, площадь кристалла, TDP, пропускную способность памяти и объем HBM3E. Поэтому сравнивать Jalapeno с GPU Nvidia или TPU по таблицам пока нечестно.
Для пользователей ChatGPT это не означает новой кнопки в интерфейсе. Jalapeno работает глубже — на уровне дата-центров, где считают запросы к моделям. Первые системы с этим ускорителем OpenAI планирует развернуть к концу 2026 года.
Публичных данных о цене, TDP, техпроцессе и объеме HBM3E у Jalapeno на 24 июня 2026 года нет.