openai
Заказной чип OpenAI обещает быстрый инференс
Promtime
openaiOpenAI представила первые результаты Jalapeño, заказного чипа для инференса, который, по данным Hacker News Codex, показывает свыше 700 токенов в секунду на пользователя при одной одновременной сессии для модели DeepSeek R1 без спекулятивного декодирования и разделения этапов предварительной обработки и генерации.
В OpenAI заявляет, что Jalapeño создан с нуля для инференса современных моделей и сочетает высокую пропускную способность с низкой задержкой и меньшим энергопотреблением. Первые результаты получены на кремнии A0, а улучшенная версия B0, по данным Hacker News Codex, уже находится на производстве.
Коротко
- Jalapeño проектировали как универсальный ускоритель для разных моделей и сценариев, а не как чип, заточенный только под продукты OpenAI.
- На тестах InferenceX ускоритель показал высокую производительность на ватт, включая режимы низкой задержки и высокой параллельной нагрузки.
- Вариант B0 должен повысить производительность на ватт примерно на 25%, но сроки коммерческих поставок Jalapeño пока не раскрыты.
Для рынка инференса это важнее, чем очередной показатель пиковой вычислительной мощности. Дата-центры сталкиваются с ограничениями по электроэнергии, поэтому эффективность напрямую влияет на объём выдаваемых токенов и стоимость сервиса. Судя по выбору однородного пула ускорителей и акценту на HBM4, OpenAI строит систему для меняющейся смеси запросов, где фиксированное разделение оборудования может быстро стать невыгодным.
Jalapeño прошёл путь от найма команды до tape-out примерно за 16 месяцев
Программу OpenAI запустила совместно с Broadcom, начав проектирование с нуля исключительно для инференса больших языковых моделей. По данным Hacker News Codex, работы стартовали в середине 2024 года, а от формирования команды до передачи дизайна на производство прошло около 16 месяцев.
В статье OpenAI чип описан как универсальный ускоритель, способный работать с разными моделями и нагрузками. В лаборатории проверили запуски через набор InferenceX вместе с инженерами OpenAI, хотя полный комплект тестов не выполнялся. В качестве демонстрации на Jalapeño также запустили Doom, перенесённый на чип с помощью запросов к Codex.
Результаты OpenAI и Hacker News Codex получены на ранней ревизии A0, спустя примерно девять месяцев после начала программы. По данным Hacker News Codex, у OpenAI уже есть ревизия B0, находящаяся на производстве. Для неё заявлено улучшение производительности на ватт примерно на 25% по сравнению с A0.
На DeepSeek R1 Jalapeño выдаёт свыше 700 токенов в секунду на пользователя
В тестах с DeepSeek R1 при одной одновременной сессии Jalapeño показал более 700 токенов в секунду на пользователя. Эти результаты получены с однотокеновым предсказанием, без speculative decoding и без раздельных пулов для предварительной обработки и генерации.
На Kimi K2.5 ускоритель достиг почти 700 токенов в секунду на пользователя, тогда как следующий результат в приведённом сравнении составил 100 токенов. Для GPT-OSS в режиме, сопоставляющем интерактивность и потребление, показатель Jalapeño оказался почти вдвое выше максимального результата GB200 и более чем в 50 раз выше точки GB200 при одной одновременной сессии.
Для Kimi K2.5 и GPT-OSS также приводится результат около 1 400 токенов в секунду на пользователя, однако источник не связывает это значение с одной конкретной конфигурацией. Проверенные оценки GSM8k для всех названных моделей оказались сопоставимы с результатами на ускорителях Nvidia.
Сравнение с Blackwell остаётся предварительным. Jalapeño использует HBM4 и по стадии разработки ближе к Vera Rubin, чем к более раннему Blackwell. В материалах Hacker News Codex указано, что Rubin уже начал поставляться заказчикам, тогда как Jalapeño пока представлен инженерными образцами.
Версия B0 получила 13,4 PFLOPS и рассчитана на 700 Вт
Ревизия B0 должна обеспечивать 13,4 PFLOPS в формате MXFP4 на вычислительном кристалле размером с фотошаблон, изготовленном по техпроцессу TSMC N3P. Для сравнения, вычислительный кристалл Rubin даёт 17,5 PFLOPS в плотном формате NVFP4 и использует тот же технологический узел.
При этом TDP Jalapeño составляет 700 Вт, тогда как для кристалла Rubin в источнике указаны конфигурации от 900 до 1 150 Вт. По данным Hacker News Codex, Jalapeño обладает максимальной среди сопоставленных ускорителей пропускной способностью HBM на ватт и производительностью на ватт, близкой к конфигурации Rubin Max-Q мощностью 1 800 Вт.
Для внешних соединений OpenAI использует отдельный чиплет ввода-вывода N3E с 32 линиями SerDes по 800G. 24 линии дают 600 ГБ/с для масштабирования внутри стойки, ещё 8 линий дают 200 ГБ/с для домена из 2 048 ускорителей в нескольких стойках. Связь с хост-процессором построена на PCIe Gen 5.
Архитектура не разделяет предварительную обработку и генерацию по разным пулам чипов. Черновая и основная модели используют общие ускорители и фабрику, а OpenAI объясняет такой подход изменением соотношения входных токенов, записей и чтений кэша и выходных токенов в разных поколениях моделей.
Пределы первых измерений
Пока опубликованы результаты на относительно короткой нагрузке 8k1k, а тестов AgentX нет. Такой набор не показывает поведение длинного контекста и многошаговых запросов, где важны маршрутизация, префиксный кэш, управление кэшем и инфраструктура выгрузки. Дата поставок готовых систем и их цена в опубликованных материалах не названы.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
