В корпоративный Codex завозят GLM-5.3 Flash и Kimi K3

Корпоративный клиент OpenAI может потратить часть денег, уже обещанных OpenAI, на открытую модель у стороннего провайдера, и эти траты зачтутся так, будто он платил самой OpenAI. На этом построена интеграция Baseten и OpenAI, о которой объявили в посте в Twitter: GLM-5.3 Flash и Kimi K3 работают прямо внутри Codex.
Коротко
- Baseten вошёл в B2B Marketplace OpenAI как поставщик инференса открытых моделей, то есть его серверы запускают GLM-5.3 Flash и Kimi K3 и отвечают на запросы из Codex.
- Расходы на эти модели корпоративные клиенты OpenAI засчитывают в своё обязательство по расходам перед OpenAI, так что траты у партнёра идут в тот же предоплаченный зачёт, что и траты у самой OpenAI.
- Сразу подключиться не получится: по данным The State of AI, встроенный доступ к открытым моделям в Codex выдают через лист ожидания, а сроки его открытия в анонсе не указаны.
Если вы не следили, Codex умел работать с открытыми моделями и раньше. По данным Explainx, 17 июня 2026 года Tibo Sottiaux из команды Codex в OpenAI напомнил, что Codex App, CLI и SDK работают с любой открытой моделью, а не только с моделями OpenAI. Тот же сайт пишет, что пост набрал больше 1,6 миллиона просмотров за сутки.
Траты на GLM-5.3 Flash и Kimi K3 идут в зачёт обязательства перед OpenAI
Baseten стал поставщиком инференса открытых моделей в B2B Marketplace OpenAI. Инференс здесь означает саму работу модели: серверы Baseten принимают запрос, прогоняют его через GLM-5.3 Flash или Kimi K3 и возвращают ответ. Корпоративные клиенты OpenAI видят эти модели прямо в Codex, как встроенные.
С деньгами схема такая же простая. Обязательство по расходам работает как предоплаченный абонемент: компания заранее согласует с OpenAI сумму, а траты на открытые модели у Baseten списываются из того же зачёта. Как пишет Lavx, использовать обязательство можно и внутри Codex, и через Responses API, а сам Baseten называют одним из первых поставщиков открытых моделей в этом маркетплейсе.
Доступ устроен двумя дорожками. По данным Lavx, встроенные в Codex модели за счёт обязательства выдают через лист ожидания Baseten, а для остальных сценариев предлагают прямые консультации с инженерами компании. О листе ожидания пишет и The State of AI.
Чем это отличается от запуска Codex с открытой моделью своими силами
Главное отличие в том, что раньше модель приходилось подключать самому. По данным Explainx, самодельный путь выглядит так: запустить Codex через Ollama с GLM-5.2 и Kimi-K2.7-Code или вызвать codex --oss. Нужна настройка wire_api = responses, а Ollama советует контекст не меньше 64 тысяч токенов.
У такого пути, как пишет тот же Explainx, есть пробелы: в десктопном выборе моделей не видно собственных провайдеров, а функции вроде computer use и автоматизации браузера остаются только для GPT. В справке ChatGPT Learn уточняется, что Codex с версии 0.134.0 хранит профили в ~/.codex/profile-name.config.toml, но собственные провайдеры моделей не переносятся через управляемую конфигурацию Work Cloud.
Что Baseten обещает по надёжности и данным
По данным самой Baseten, её инференс работает больше чем на 90 кластерах в более чем 20 облаках в режиме active-active: если отваливается провайдер или регион, трафик уходит в другое место, а работа не встаёт. Компания также ссылается на отношения с более чем 200 поставщиками вычислений.
С данными, как утверждает Baseten, обходятся так: инфраструктура в США, нулевое хранение (zero data retention) для всех промптов, привязка развёртываний к регионам, детальная аутентификация и авторизация, отчёты об использовании по модели, пользователю или ключу. Blaxel, ставший частью Baseten, выдаёт каждому агенту свою песочницу.
Зачем Codex несколько моделей сразу
В Baseten объясняют это так: компании переходят к смеси моделей, каждая из которых выигрывает по своему сочетанию ума, цены, задержки и доступной мощности. Задачи раздаёт маршрутизатор, статический или адаптивный, и каждая уходит к модели с лучшим балансом цены, качества и скорости для конкретной работы.
Представьте диспетчерскую такси: короткую поездку отдают ближайшей недорогой машине, переезд с вещами отдают фургону. По словам Baseten, генерация кода особенно тяжела для инференса: много ходов диалога, длинные промпты по большим репозиториям и огромные окна контекста нагружают каждую часть инфраструктуры.
Второй довод компании касается скорости. Как утверждает Baseten, цикл между выходом новых открытых и закрытых моделей сократился до недель, поэтому ни одна модель надолго не остаётся лучшей для всех задач. Крупные открытые модели компания, по её словам, запускает в Model APIs в день выхода, а переход на новую модель сводится к правке одной строки кода.
Цены в анонсе не раскрыты: неизвестно, по каким ставкам GLM-5.3 Flash и Kimi K3 списываются из обязательства и совпадают ли они с прямыми ценами Baseten, а почти все цифры о надёжности и хранении данных исходят от самой Baseten. На наш взгляд, самая практичная часть сделки в общем зачёте: команде, вероятно, будет проще попробовать открытую модель в Codex, не заводя отдельный бюджет под нового поставщика.
Когда откроется лист ожидания
Сроки выхода из листа ожидания не называются, как и критерии отбора. Открыт и вопрос, закроет ли интеграция пробелы самодельного пути, о которых пишет Explainx: будут ли с открытыми моделями доступны computer use и автоматизация браузера и появятся ли они в десктопном выборе моделей. Отдельно стоит следить, как быстро в списке появятся модели новее GLM-5.3 Flash и Kimi K3.
Читайте также
- Codex доделывает задачи в облаке, пока ноутбук спит
- OpenAI вдвое урезала Pro за 200 долларов и завела Pro за 500
- Codex Security Cloud ищет уязвимости при закрытом ноутбуке
- OpenAI ускорила Codex до 8 раз, но только на Pro 500
- GPT-6 Astra на части аккаунтов похожа на gpt-5.6-luna
- 45% экономии у агента AWS тают до 28% рядом с DeepSeek
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
