Искусственный интеллект

OpenAI показала первые бенчмарки чипа Jalapeño для инференса

На Hot Chips компания раскрыла детали Jalapeño: в тесте SemiAnalysis InferenceX система показала больше токенов на пользователя и выше пропускную способность на киловатт, чем актуальные передовые процессоры для инференса

Один основной источник · Как мы проверяем новости

OpenAI показала первые бенчмарки чипа Jalapeño для инференса
Иллюстрация к материалу RedBTC News

Что произошло

OpenAI на конференции Hot Chips представила более детальный обзор Jalapeño и первые результаты тестирования новой системы.

На бенчмарке SemiAnalysis InferenceX Jalapeño показал больше токенов на пользователя и более высокую пропускную способность на киловатт по сравнению с доступными сейчас передовыми процессорами для инференса.

Детали

Richard Ho, глава аппаратного направления OpenAI, заявил, что результаты демонстрируют существенный прирост производительности относительно передового уровня. По его словам, Jalapeño способен выполнять больше AI-нагрузки на единицу энергии и быстрее возвращать ответы.

При этом сравнение проводилось с системой Nvidia Blackwell. В источнике отмечается, что к моменту полного развертывания Jalapeño конкурирующие решения могут существенно продвинуться.

Ho оценил, что Jalapeño начнут развертывать в конце 2026 года в очень малых объемах, а более заметное внедрение ожидается в 2027 году.

Контекст

Jalapeño впервые анонсировали в прошлом октябре. Чип разработан OpenAI в тесном сотрудничестве с Broadcom, а собственные модели OpenAI помогали в процессе разработки.

OpenAI планирует сделать Jalapeño многопоколенческой платформой, в которой AI-продукты, модели, чипы и память развиваются согласованно.

Почему это важно

OpenAI связывает преимущества Jalapeño с полноуровневым подходом к разработке. Компания утверждает, что это позволило проработать отдельные этапы инференса, где часто возникают задержки.

В частности, Jalapeño спроектирован так, чтобы снижать задержки на этапах prefill и коммуникации. OpenAI также заявляет, что система минимизирует перемещение данных и коммуникационные задержки, сохраняя состояние модели, включая KV cache, локально при генерации ответа.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. techcrunch.com