Перейти к содержанию

claude-code

Путь «hi» в Claude Code: десять слоёв до весов модели

Claude News

Когда Claude Code запускает команду в вашем терминале, её вывод вообще не попадает в модель: сначала его читает обвязка, и только потом она решает, звать ли API снова. Из таких деталей собран сайт The-agent-stack, где обычное «hi» проходит десять слоёв, от интерфейса до весов модели на GPU.

Коротко

  • Клиффорд и Гаурав из Nori Agentic нарисовали в пиксель-арте путь одного запроса req_7f3a и поделили десять слоёв на ваши, от интерфейса до инструментов, и провайдерские, от API до весов.
  • Провайдеры кэшируют префикс промпта обычно на срок от пяти минут до часа, поэтому правка в системном промпте или описании инструмента сбрасывает всё после неё, а долгие паузы между репликами видны прямо в счёте.
  • Граница вашего контроля проходит по HTTP POST к API: дальше не видно, как обслуживают запрос, а цен, задержек и конкретных сроков кэша у отдельных провайдеров разбор не приводит.

Если вы не следили, у Claude Code короткая, но плотная история. По данным Howborisusesclaudecode, его предшественником был clide, внутренний CLI для правок кода 2022–2023 годов, а демо Бориса Черни «Claude CLI» позже переименовали в Claude Code. По данным ScriptByAI, исследовательское превью открылось 24 февраля 2025 года, общая доступность пришла 22 мая. Как пишет Taskade, к ноябрю 2025 года Claude Code перешагнул годовой темп выручки в миллиард долларов.

Четыре слоя до API принадлежат вам, а цикл в них крутит обвязка

Интерфейс отвечает только за показ: терминал, панель в редакторе, нативное приложение или чат-бот могут быть лицом одного агента, а в Agent Client Protocol эта роль называется клиентом. По данным Taskade, у Claude Code пять поверхностей с общим движком, поэтому CLAUDE.md, настройки и MCP-серверы переезжают вместе с вами.

Контекст включает всё, что модель видит до ответа, и большую часть берут с файловой системы: AGENTS.md, skills, исходники, вывод прошлых вызовов инструментов. Что грузить и в каком порядке, решает обвязка. Как пишет ScriptByAI, Claude Code читает настройки из CLAUDE.md и переходит к AGENTS.md, если первого файла нет.

Обвязка, по определению авторов, представляет собой код вокруг модели, который делает из неё агента: прочитать контекст, вызвать модель, оценить ответ, запустить запрошенные инструменты, вернуть результаты и пойти на новый круг. Claude Code, Codex и Nori здесь три обвязки. Набор инструментов у каждой свой, от shell и правки файлов до MCP-серверов, поэтому одна модель ведёт себя по-разному.

Результат инструмента приходит не в модель, а обратно в обвязку. Она читает вывод, решает следующий шаг и только потом зовёт API, и так проходит каждый вызов. Обвязка похожа на диспетчера такси: водитель докладывает ему о каждом заказе, а куда ехать дальше, решает диспетчер.

После HTTP POST к API ваш контроль заканчивается

API в схеме Nori служит линией, за которой вы не видите и не меняете, как обслуживается запрос. На самой границе остаются два рычага: политика корпоративного плана для всей команды и AI-шлюз, подменный API, который считает расходы по каждому пользователю, ограничивает доступные модели и выдаёт один ключ на нескольких провайдеров.

Дальше начинается гиперскейлер, то есть дата-центр, где работает модель. Запрос попадает в регион провайдера, его направляют на конкретную машину, а обслуживают два соседних сервиса: кэш и инференс. GPU стоят внутри инференса, на них загружены веса.

По ту сторону границы работает и часть Claude Code. По данным GitHub, Auto Mode вышел в общую доступность 10 июля 2026 года, а 19 сентября его классификатор по умолчанию переехал на сервер для пользователей API, Enterprise и поддерживаемых провайдеров, что убрало накладные расходы на классификацию.

Кэш промпта живёт от пяти минут до часа, а KV-кэш растёт с каждым токеном

Кэширование нужно, чтобы не платить дважды за работу прошлого запроса. Провайдеры кэшируют префикс промпта, то есть его начало, поэтому ранняя правка в системном промпте или описании инструмента сбрасывает всё, что идёт после неё. Так закладки в книге теряют смысл, если в первой главе переверстали страницы.

Живут такие кэши обычно от пяти минут до часа, поэтому выбор обвязки и долгие паузы между репликами видны прямо в счёте. По данным GitHub, с релиза 13 августа форкнутые субагенты Claude Code по умолчанию наследуют текущий разговор и кэш промпта.

Инференс читает весь промпт за один проход, затем генерирует по токену, собирая ваш запрос в пакет с чужими, чтобы железо не простаивало. Каждый новый токен обычно требует перечитать всё предыдущее, поэтому сервис хранит результат этого чтения, ключ и значение на каждый токен, и использует их повторно. Такой склад называется KV-кэшем. Из-за него второй токен куда дешевле первого, а длинный разговор стоит и времени, и памяти.

Модель с триллионом параметров может тратить на токен как куда меньшая

Арифметику делает GPU: несколько сотен небольших процессоров с тензорными ядрами, каждое умножает плитку матрицы за инструкцию, и рядом память с высокой пропускной способностью. Скорость генерации ограничена тем, как быстро веса выходят из этой памяти, сырая вычислительная мощь здесь вторична.

Веса представляют собой выученные числа, которые и есть модель: токен проходит слой за слоем матричных умножений, пока с другого конца не выпадет один выходной. Плотная модель гоняет каждый токен через все эти числа. В смеси экспертов каждый слой разбит на много блоков, и небольшой роутер выбирает для токена несколько из них.

Как в поликлинике: пациента отправляют к паре нужных врачей, остальные свободны. Поэтому, как пишут авторы, число параметров перестало предсказывать стоимость, а разреженная модель с триллионом параметров на каждом токене выполняет работу куда меньшей. Сколько блоков в слое и сколько выбирает роутер, разбор не уточняет.

Схема честно показывает устройство, но обходит цену. Разбор не называет ни тарифов за промах кэша, ни задержек, ни сроков жизни кэша у конкретных провайдеров, а слои после API описаны в общем виде, ведь снаружи их и не видно. На наш взгляд, тексту, который прямо связывает кэш со счётом, не хватает хотя бы одного примера расчёта.

Сколько стоит промах кэша

Ответа в разборе нет, и дата, когда схему дополнят цифрами, не называется. Открытым остаётся вопрос, во что у конкретного провайдера обходится ход после паузы дольше срока жизни кэша: схема даёт только общий ориентир от пяти минут до часа. Неизвестно и то, появятся ли у Клиффорда и Гаурава расчёты для отдельных обвязок.

Читайте также

  1. Claude Code отдал свой TypeScript вместе с source maps
  2. Claude Code пустил в проекты весь лист ожидания Pro и Max
  3. Claude Code 2.1.294 чинит хуки, которые пропускали запреты
  4. Мод для Claude Code сам меряет идеи и откатывает неудачи
  5. Claude разбирал ошибки 500 и вышел на злоупотребление
  6. Проекты Claude Code научились запускать потоки локально

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.