anthropic

Замер ponytail: −10,3% к счёту вместо обещанных −20%

Claude News

anthropic

JetBrains прогнал 80 парных задач на скилле ponytail для Claude Code, третьем инструменте в серии проверок надстроек, экономящих токены. Заявлено −54% кода, −22% токенов, −20% стоимости и −27% времени. Медианный замер дал −15% кода, −10,3% стоимости (p=0,004) и −11% времени.

Тестировали на Claude Code 2.1.201 с моделью claude-sonnet-5 на среднем уровне рассуждений, бенчмарк SkillsBench. Экономия собирается там, где агент переусложняет: на крупных сборках код упал на 31%, на изначально коротких задачах медиана не сдвинулась.

Если просто положить SKILL.md в папку скиллов, модель не вызвала его ни разу за 10 сессий. Все числа сняты в ветке, где набор правил внедряется хуком SessionStart.

По качеству 65 задач получили одинаковый балл, 9 стали хуже, 6 лучше. Вся программа оценки стоила $246,09.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.