anthropic

Доля решённых задач падает до 0,5% к концу сессии

Claude News

anthropic

Точность моделей проседает задолго до заполнения окна. В тесте NoLiMa 11 из 13 моделей с заявленным контекстом от 128k на 32k токенов опустились ниже половины своего короткого базового результата: у GPT-4o 69,7% против 99,3%.

SlopCodeBench (arXiv 2603.24755, март 2026) заставил 11 моделей дорабатывать собственный код на 93 контрольных точках. Целиком задачу не решил ни один агент, лучший результат на контрольной точке 17,2%, к финальной строгие решения упали до 0,5% при росте стоимости в 2,9 раза. Структурная деградация видна в 80% прогонов.

Автор советует делать /clear на границах задач, а /compact запускать заранее, пока остаётся запас. В Claude Code 2.1.220 команда /context отдельной строкой показывает Autocompact buffer, зарезервированное место под будущее саммари.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.