research
Каждый коммит добавляет в CLAUDE.md 4,9 инструкции
Promtime
researchФайлы инструкций для кодовых агентов, такие как CLAUDE.md, растут без остановки: за жизненный цикл они вырастают более чем втрое (+226%) и прибавляют по 4,9 инструкции чистыми на каждый коммит. Такие данные приводит препринт Кушала Чакрабарти, выложенный на Arxiv 11 августа; в выборку вошли 247 694 жизненных цикла инструкций в 1 867 репозиториях.
Коротко
- Авторы дали явлению имя: катастрофическое запоминание, зеркало катастрофического забывания, вокруг которого выстроено непрерывное обучение, а рост файла останавливают только закрытие репозитория или его переписка целиком.
- Дописать инструкцию всегда дёшево, а удалить, когда её обоснование утрачено, стоит O(2^|D|) при |D| инструкциях; заодно чем старше инструкция, тем реже её убирают, логарифмический риск снижается на 0,032 за коммит.
- Комментарии в промпте, фиксирующие скрытый ход рассуждений за инструкцией, сняли 99,3% лишних инструкций на перевёрнутом IFEval и улучшили следование инструкциям в реальных сценариях на бенчмарке WildIFEval до 23,1%.
Почему это важно. Описанная в препринте проблема выглядит зеркальным отражением того, вокруг чего построено непрерывное обучение: там борются с забыванием, здесь с невозможностью забыть. Для команд, которые держат агентов на длинных файлах инструкций, это означает, что контекст постепенно заполняется правилами, чью причину уже никто не помнит, а стоимость каждого запуска растёт вместе с ними. Предложенное лечение, комментарии рядом с инструкциями, вероятно, обойдётся дешевле периодических полных переписей.
Работа описывает экономику отдельной инструкции внутри такого файла. Дописать новую строку почти ничего не стоит, а удалить старую без риска регрессии по корректности, когда её обоснование уже потеряно, обходится в O(2^|D|) при |D| инструкциях в промпте. Именно эту несовершенную память авторы считают источником расхождения.
CLAUDE.md и подобные файлы лежат в репозитории и задают агенту правила работы с кодовой базой. Они редактируются вместе с проектом, и каждый коммит способен добавлять или снимать строки, поэтому авторы считают не размер файла, а число живых инструкций в нём.
Возраст инструкции работает против её удаления. Чем дольше строка живёт в файле, тем ниже шанс, что её уберут: логарифмический риск удаления падает на 0,032 с каждым коммитом. Рост прекращается в двух случаях: репозиторий выходит из обращения либо файл переписывают заново целиком.
Вторая часть работы проверяет лечение на управляемом стенде. Инверсия IFEval даёт задачи, для которых оптимальный промпт известен заранее, что позволяет измерить лишние инструкции напрямую. Комментарии, кодирующие скрытые рассуждения, убрали 99,3% избыточных строк: разрастание промпта упало с +211,3% до +1,4%.
Тот же приём авторы перенесли на WildIFEval, набор инструкций из реальных задач. Там комментарии улучшили следование инструкциям в агентных сценариях, по данным препринта, до 23,1%. Работа предлагает относиться к инструкциям для агентов как к коду, которому пока не хватает комментариев.
Что дальше. Препринт опубликован в первой версии 11 августа и отнесён к разделам искусственного интеллекта, машинного обучения и программной инженерии. Аннотация заканчивается вопросом о том, почему у английского, ставшего новым кодом, до сих пор нет комментариев. Как именно такие комментарии должны храниться в файлах инструкций и поддерживаться инструментами, из аннотации не следует.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
