Путь «hi» в Claude Code: десять слоёв до весов модели

Когда Claude Code запускает команду в вашем терминале, её вывод вообще не попадает в модель: сначала его читает обвязка, и только потом она решает, звать ли API снова. Из таких деталей собран сайт The-agent-stack, где обычное «hi» проходит десять слоёв, от интерфейса до весов модели на GPU.
Коротко
- Клиффорд и Гаурав из Nori Agentic нарисовали в пиксель-арте путь одного запроса req_7f3a и поделили десять слоёв на ваши, от интерфейса до инструментов, и провайдерские, от API до весов.
- Провайдеры кэшируют префикс промпта обычно на срок от пяти минут до часа, поэтому правка в системном промпте или описании инструмента сбрасывает всё после неё, а долгие паузы между репликами видны прямо в счёте.
- Граница вашего контроля проходит по HTTP POST к API: дальше не видно, как обслуживают запрос, а цен, задержек и конкретных сроков кэша у отдельных провайдеров разбор не приводит.
Если вы не следили, у Claude Code короткая, но плотная история. По данным Howborisusesclaudecode, его предшественником был clide, внутренний CLI для правок кода 2022–2023 годов, а демо Бориса Черни «Claude CLI» позже переименовали в Claude Code. По данным ScriptByAI, исследовательское превью открылось 24 февраля 2025 года, общая доступность пришла 22 мая. Как пишет Taskade, к ноябрю 2025 года Claude Code перешагнул годовой темп выручки в миллиард долларов.
Четыре слоя до API принадлежат вам, а цикл в них крутит обвязка
Интерфейс отвечает только за показ: терминал, панель в редакторе, нативное приложение или чат-бот могут быть лицом одного агента, а в Agent Client Protocol эта роль называется клиентом. По данным Taskade, у Claude Code пять поверхностей с общим движком, поэтому CLAUDE.md, настройки и MCP-серверы переезжают вместе с вами.
Контекст включает всё, что модель видит до ответа, и большую часть берут с файловой системы: AGENTS.md, skills, исходники, вывод прошлых вызовов инструментов. Что грузить и в каком порядке, решает обвязка. Как пишет ScriptByAI, Claude Code читает настройки из CLAUDE.md и переходит к AGENTS.md, если первого файла нет.
Обвязка, по определению авторов, представляет собой код вокруг модели, который делает из неё агента: прочитать контекст, вызвать модель, оценить ответ, запустить запрошенные инструменты, вернуть результаты и пойти на новый круг. Claude Code, Codex и Nori здесь три обвязки. Набор инструментов у каждой свой, от shell и правки файлов до MCP-серверов, поэтому одна модель ведёт себя по-разному.
Результат инструмента приходит не в модель, а обратно в обвязку. Она читает вывод, решает следующий шаг и только потом зовёт API, и так проходит каждый вызов. Обвязка похожа на диспетчера такси: водитель докладывает ему о каждом заказе, а куда ехать дальше, решает диспетчер.
После HTTP POST к API ваш контроль заканчивается
API в схеме Nori служит линией, за которой вы не видите и не меняете, как обслуживается запрос. На самой границе остаются два рычага: политика корпоративного плана для всей команды и AI-шлюз, подменный API, который считает расходы по каждому пользователю, ограничивает доступные модели и выдаёт один ключ на нескольких провайдеров.
Дальше начинается гиперскейлер, то есть дата-центр, где работает модель. Запрос попадает в регион провайдера, его направляют на конкретную машину, а обслуживают два соседних сервиса: кэш и инференс. GPU стоят внутри инференса, на них загружены веса.
По ту сторону границы работает и часть Claude Code. По данным GitHub, Auto Mode вышел в общую доступность 10 июля 2026 года, а 19 сентября его классификатор по умолчанию переехал на сервер для пользователей API, Enterprise и поддерживаемых провайдеров, что убрало накладные расходы на классификацию.
Кэш промпта живёт от пяти минут до часа, а KV-кэш растёт с каждым токеном
Кэширование нужно, чтобы не платить дважды за работу прошлого запроса. Провайдеры кэшируют префикс промпта, то есть его начало, поэтому ранняя правка в системном промпте или описании инструмента сбрасывает всё, что идёт после неё. Так закладки в книге теряют смысл, если в первой главе переверстали страницы.
Живут такие кэши обычно от пяти минут до часа, поэтому выбор обвязки и долгие паузы между репликами видны прямо в счёте. По данным GitHub, с релиза 13 августа форкнутые субагенты Claude Code по умолчанию наследуют текущий разговор и кэш промпта.
Инференс читает весь промпт за один проход, затем генерирует по токену, собирая ваш запрос в пакет с чужими, чтобы железо не простаивало. Каждый новый токен обычно требует перечитать всё предыдущее, поэтому сервис хранит результат этого чтения, ключ и значение на каждый токен, и использует их повторно. Такой склад называется KV-кэшем. Из-за него второй токен куда дешевле первого, а длинный разговор стоит и времени, и памяти.
Модель с триллионом параметров может тратить на токен как куда меньшая
Арифметику делает GPU: несколько сотен небольших процессоров с тензорными ядрами, каждое умножает плитку матрицы за инструкцию, и рядом память с высокой пропускной способностью. Скорость генерации ограничена тем, как быстро веса выходят из этой памяти, сырая вычислительная мощь здесь вторична.
Веса представляют собой выученные числа, которые и есть модель: токен проходит слой за слоем матричных умножений, пока с другого конца не выпадет один выходной. Плотная модель гоняет каждый токен через все эти числа. В смеси экспертов каждый слой разбит на много блоков, и небольшой роутер выбирает для токена несколько из них.
Как в поликлинике: пациента отправляют к паре нужных врачей, остальные свободны. Поэтому, как пишут авторы, число параметров перестало предсказывать стоимость, а разреженная модель с триллионом параметров на каждом токене выполняет работу куда меньшей. Сколько блоков в слое и сколько выбирает роутер, разбор не уточняет.
Схема честно показывает устройство, но обходит цену. Разбор не называет ни тарифов за промах кэша, ни задержек, ни сроков жизни кэша у конкретных провайдеров, а слои после API описаны в общем виде, ведь снаружи их и не видно. На наш взгляд, тексту, который прямо связывает кэш со счётом, не хватает хотя бы одного примера расчёта.
Сколько стоит промах кэша
Ответа в разборе нет, и дата, когда схему дополнят цифрами, не называется. Открытым остаётся вопрос, во что у конкретного провайдера обходится ход после паузы дольше срока жизни кэша: схема даёт только общий ориентир от пяти минут до часа. Неизвестно и то, появятся ли у Клиффорда и Гаурава расчёты для отдельных обвязок.
Читайте также
- Claude Code отдал свой TypeScript вместе с source maps
- Claude Code пустил в проекты весь лист ожидания Pro и Max
- Claude Code 2.1.294 чинит хуки, которые пропускали запреты
- Мод для Claude Code сам меряет идеи и откатывает неудачи
- Claude разбирал ошибки 500 и вышел на злоупотребление
- Проекты Claude Code научились запускать потоки локально
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
