Тест NoLiMa прогнали на 13 моделях с заявленным окном от 128 тысяч токенов. Одиннадцать из них уже на 32 тысячах показали меньше половины своего результата на коротком контексте, у GPT-4o точность упала с 99,3% до 69,7%.
Anthropic описывает механизм как бюджет внимания: n токенов дают n² попарных связей, и каждый новый расходует конечный ресурс. Chroma в работе о деградации контекста зафиксировала снижение надёжности у всех 18 проверенных моделей.
Команда /context в Claude Code 2.1.220 разбивает окно по категориям и показывает строку Autocompact buffer, зарезервированное место под будущее резюме. Автосжатие срабатывает у самого предела, поэтому /compact разумнее запускать с запасом, а на границе задач делать /clear.

