openai

Юристы и рекрутеры OpenAI сами перешли на Codex

Promtime

openai

В OpenAI неограниченный бюджет токенов есть у всех: у инженеров, исследователей, финансистов и маркетинга. Автор Pragmaticengineer съездил в офис компании и поговорил с семью инженерами и их руководителями о том, как за несколько месяцев Codex стал основой почти всей работы.

Коротко

  • Codex-приложение вышло на Mac в феврале и на Windows в марте, ChatGPT Work на том же харнессе в июле; после этого неинженерные отделы перенесли туда свои рабочие процессы.
  • Число пулл-реквестов на инженера растёт хоккейной клюшкой, нагрузка на отдельные системы сборки и выката выросла примерно в 10 раз за полгода, говорит вице-президент по инженерии Венкат Венкатарамани.
  • Внутренняя версия Codex подключена почти ко всем системам компании и заметно опережает публичную, а дежурства по инцидентам в OpenAI никуда не делись: Sevbot сам митигации не применяет.

Если вы не следили, имя Codex у OpenAI не новое. Как пишет Kunal Ganglani, первый Codex вышел в августе 2021 года как модель на базе GPT-3 для перевода текста в код, а 23 марта 2023 года её API закрыли, отправив пользователей на GPT-3.5-Turbo и GPT-4. Нынешний Codex носит то же имя, но это другой продукт: облачный агент, представленный в мае 2025 года, который читает репозитории, правит файлы, гоняет тесты и открывает пулл-реквесты.

С января IDE в OpenAI теряет пользователей, а неинженерные отделы дошли до 90%

Codex-приложение для Mac вышло в феврале, для Windows в марте, ChatGPT Work на харнессе Codex в июле. По внутреннему графику использования токенов, финансы, рекрутинг и юристы за четыре месяца прошли путь от почти нулевого использования Codex до 90%. Сейчас почти все сотрудники работают с Codex и Work каждую неделю, и распоряжения сверху не было.

Самое любопытное, что около 40% неинженерных команд подключились тогда, когда приложение было к ним откровенно недружелюбным: с февраля по апрель Codex всё ещё показывал код на экране. Люди терпели, потому что он собирал презентации, документы и таблицы.

Дальше сработала длина задач. В Codex появилась настройка /goal: вы ставите цель, и агент работает, пока не закроет её. С апреля по май доля выросла с 60 до 90%. Эндрю Амбросино, лидер направления Desktop, связывает это с тем, что харнесс научился тянуть долгие задачи: тред живёт днями, а длинный агент сам порождает других агентов, и человеку остаётся меньше поверхности для управления.

С января в компании падает использование IDE. В декабре 2025 года команда Codex сомневалась, выпускать ли десктопное приложение: был CLI, были большие IDE, а после ноябрьского выхода Antigravity как форка VS Code был и соблазн тоже форкнуть редактор. Ставку сделали на то, что с ростом агентов IDE значит меньше; в июне в приложение всё же завезли правку файлов.

Нагрузка на часть систем выросла примерно в 10 раз за полгода

Число пулл-реквестов на инженера, по словам Венката Венкатарамани, вице-президента по инженерии Applied Infra, растёт хоккейной клюшкой, и каждый участок сборки, тестов и выката получает кратно больше нагрузки. На отдельных системах это примерно десятикратный рост: в большинстве компаний он растянулся бы на два-три года, в OpenAI занял около полугода.

Упирается всё по очереди: система контроля версий должна принимать больше кода, CI/CD масштабироваться следом, релизные процессы переваривать более высокую частоту изменений. Венкатарамани говорит, что новый набор инфраструктурных задач появляется каждый месяц: стоит создать запас ёмкости, как модель открывает очередную волну возможностей.

Поэтому в компании пересобирают привычные вещи. Код-ревью и пулл-реквесты, по словам Венкатарамани, в нынешнем виде имеют всё меньше смысла; вместо одного универсального ИИ-ревьюера запускают несколько агентов с разными специализациями, а изменения классифицируют по риску. Рискованные идут более строгим путём, вплоть до обязательного человека после агентов, а отдельные участки кодовой базы можно подписать на агента, который сам одобряет безопасные PR.

Почему агент на выкатке строит себе дашборд

Потому что дашборд под конкретное изменение руками никто не собирает. Раньше инженеры заводили дашборды под сервисы, теперь агент делает это на уровне отдельной выкатки: читает кодовую базу, находит, где живёт фиче-флаг, разбирается, что меняется, решает, какие сигналы говорят об успехе и провале, строит дашборд и следит за ним.

До этого этапа агент собирает контекст. Документацию в OpenAI перенесли внутрь исходного кода, у Codex есть доступ к гиту и GitHub, Slack и Notion, Databricks, Datadog и внутренним логам, плюс к внутренним скиллам, часть которых поддерживает сам Codex. Новичкам на онбординге советуют задавать вопросы ему.

Дальше агент собирает код, гоняет тесты, чинит сломанное, открывает пулл-реквест и нянчит его, пока CI не позеленеет. Проблемные PR перф-харнесс отправляет в A/B-фреймворк Synthetics на оценку производительности, а Perf Factory просеивает алерты и дашборды в проде, склеивает дубли, отделяет настоящие регрессии задержек, доискивается причин и предлагает правки. Устроено это как цех, где робот не только точит деталь, но и сам её замеряет и подстраивает станок.

Обновления нативных приложений по-прежнему ждут ревью Apple и Google

Один узел конвейера ускорить не получается. Каждое обновление нативного приложения проходит ручную проверку Apple и Google, а это часы или дни. Когда пулл-реквестов становится в десять раз больше, бэкенд и веб доезжают до пользователей быстрее, а мобильные приложения упираются в ту же процедуру, что и в 2008 году, когда открылся App Store.

Сулман Чоудри, глава инженерии ChatGPT, пришёл из Facebook и помнит, как там в 2010-е разгоняли мобильные релизы: с ежемесячных до раз в две недели, затем до еженедельных. Параллельно эксперименты и фиче-флаги позволили выкатывать код раньше, чем функцию включают удалённо.

По словам Чоудри, сейчас та же проблема пришла на новом витке: код пишется за минуты, а до телефона едет днями, и у Codex, где использование во многом мобильное, разрыв уже болезненный для команды и пользователей. До состояния, когда мобильный релиз так же быстр, как веб, говорит он, пока далеко.

Про деньги в материале нет ничего: график показывает долю отделов, а не расход токенов, и неограниченный бюджет внутри лаборатории, которая сама делает модели, стоит не то же, что снаружи. Автор Pragmaticengineer прямо признаётся, что сомневался в агентах-специалистах: доступ к коду и документации у них тот же, что у обычного агента, разница в контексте и фокусе. На наш взгляд, главный ограничитель в том, что внутренний Codex подключён почти ко всем системам OpenAI, и снаружи такой конвейер на публичном продукте не собрать.

Куда целится Sevbot

Инцидентный агент Sevbot, тоже построенный на Codex, сейчас собирает контекст по аварии, перечисляет возможные митигации и отвечает на вопросы в Slack, но применяет их только по команде инженера. В OpenAI хотят довести его до автономных действий на рутинных инцидентах, чтобы ночью никого не будили, а разбор шёл утром, и дальше до чего-то вроде автономного SRE на каждое изменение. Сроков не называют, дежурства пока остаются.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.