openai

Как Python-библиотека OpenAI доросла до миллиарда

Promtime

openai

Habitat в OpenAI начинался как обычная Python-библиотека, а сегодня, по данным инженерного блога OpenAI, держит 22 миллиона запросов в секунду. Обслуживает он миллиард пользователей ChatGPT: отметку в миллиард активных пользователей в месяц сервис прошёл к июню 2026 года.

Коротко

  • OpenAI опубликовала историю внутреннего хранилища Habitat: код, который писали как библиотеку на Python, превратился в распределённую по миру платформу, на которую опирается повседневная работа ChatGPT.
  • Недельная аудитория ChatGPT поднялась с 300 миллионов в декабре 2024 года до 900 миллионов в феврале 2026 года, а в июне 2026 года сервис перешагнул миллиард активных пользователей в месяц.
  • Цифру в 22 миллиона запросов в секунду приводит сама OpenAI, а устройства Habitat в публикации нет: ни модели данных, ни схемы репликации, ни числа регионов, ни деталей отказоустойчивости.

Если вы не следили за цифрами, короткая справка. ChatGPT запустился в ноябре 2022 года и, по оценкам Exploding Topics, набрал первый миллион пользователей за пять дней. К январю 2023 года там насчитывали около 30 миллионов пользователей в неделю, к ноябрю 2023 года уже 100 миллионов. По данным DemandSage со ссылкой на оценки Sensor Tower в изложении Reuters, ChatGPT стал первым приложением, дошедшим до миллиарда активных пользователей за три года после запуска.

Habitat вырос из Python-библиотеки в глобальную платформу хранения

История в публикации такая: код, который писали как вспомогательную библиотеку на Python, дорос до распределённой по миру платформы хранения. По описанию OpenAI, сейчас она обслуживает миллиард пользователей ChatGPT и принимает 22 миллиона запросов в секунду.

Рядом стоит масштаб пользовательской стороны. ChatGPT обрабатывает более 2 миллиардов запросов в сутки, а пользователи отправляют около 2,5 миллиарда промптов в день. Цифра в 22 миллиона в секунду относится к обращениям к самой платформе хранения, и приводит её OpenAI.

Платформой хранения тут называют слой, к которому обращается приложение, когда ему нужны данные, вместо работы с диском конкретной машины. Такой слой живёт отдельно от сервисов, которые им пользуются, и масштабируется отдельно от них.

Недельная аудитория ChatGPT дошла до 900 миллионов к февралю 2026 года

В декабре 2024 года у ChatGPT было 300 миллионов пользователей в неделю, в феврале 2025 года 400 миллионов, к октябрю 2025 года от 700 до 800 миллионов, а к февралю 2026 года 900 миллионов. Месячная аудитория в миллиард пришла в июне 2026 года.

Эти цифры OpenAI называла и сама. По данным Exploding Topics, в отчёте компании за сентябрь 2025 года фигурировали 700 миллионов активных пользователей в неделю, а в феврале 2025 года операционный директор Брэд Лайткэп говорил о 400 миллионах. Февральский отчёт 2026 года, по данным DemandSage, зафиксировал 900 миллионов, что более чем вдвое превышает показатель февраля 2025 года.

По данным Business of Apps, ChatGPT стал самым скачиваемым приложением 2025 года с 770 миллионами установок и принёс OpenAI 8 миллиардов долларов, на 128% больше, чем годом ранее.

Почему такое хранилище не помещается на один сервер?

Потому что одна машина упирается в предел по диску, памяти и сети, а отказ такой машины выключает сервис целиком. Распределённое хранилище раскладывает данные по множеству узлов, и мощность добавляют, добавляя узлы. Представьте картотеку, которая перестала влезать в один шкаф: папки разносят по шкафам в разных зданиях, на каждую держат копию в соседнем здании и заводят правило, как быстро понять, где лежит нужная.

Правила и есть вся сложность. В разборах архитектуры распределённых key-value хранилищ, например у Algomaster, набор задач описывают одинаково: разбиение данных на части, согласованное хеширование, репликация, выбор лидера, теорема CAP, выбор модели согласованности и устройство самого движка хранения.

Термины из этого списка расшифровываются просто. Разбиение данных означает, что набор режут на части и каждая часть живёт на своём узле. Репликация означает, что у части есть копии на других узлах. Выбор лидера задаёт, чья копия считается главной при записи.

Там же перечисляют вопросы, на которые такая система обязана отвечать: как хранить и доставать данные, как не потерять записи при падении узла, как ровно разложить данные по узлам, как удержать копии согласованными и как заметить отказ и восстановиться после него.

Из публикации не понять главного: как устроен Habitat внутри, какая у него модель данных, как согласуются копии между регионами и что осталось от исходной Python-библиотеки. Цифру в 22 миллиона запросов в секунду называет сама OpenAI, других источников для неё нет. На наш взгляд, для текста, который строится вокруг истории роста, технических деталей пока скупо.

Чего ждать от второй части

Судя по адресу публикации, это первая часть, и дата второй не называется. Интересного в ней ровно то, чего нет сейчас: как Habitat делит данные между узлами, сколько у него регионов, какие гарантии согласованности он даёт приложению и что происходит при отказе узла под нагрузкой в 22 миллиона запросов в секунду. Пока ни одного из этих ответов в открытом виде нет.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.