Sonnet 5.5 сэкономил CodeRabbit вдвое больше обещанного

Anthropic обещала, что Sonnet 5.5 будет обходиться до 30% дешевле на задачу. На ревью кода экономия вышла вдвое больше: по замерам CodeRabbit вызовы Claude стоили примерно на 60% меньше за ревью, чем у Sonnet 5, а новая модель при этом поймала больше известных багов и работала примерно вдвое быстрее.
Коротко
- CodeRabbit прогнал Sonnet 5.5 через свой конвейер ревью на двух наборах: 13 трудных пулл-реквестов с известным багом и 44 открытых пулл-реквеста, где собрано 85 известных проблем.
- На трудном наборе Sonnet 5.5 нашёл 6 багов из 13 против 4 у Sonnet 5 при точности 41,2% против 40,0%, а ревью на 44 пулл-реквестах шло в среднем 6:33 вместо 13:31.
- Подвох в размере выборки: 13 случаев мало, качество на большом наборе судья ещё не оценил, а Opus 5.5 на тех же задачах ловил 8 багов в режиме Standard и 10 в Max.
Если вы не следили: CodeRabbit гоняет через свои тесты каждый Sonnet начиная с Sonnet 4, и линейка всё время качалась между двумя крайностями. Sonnet 4.6 ловил около 63% известных проблем, но при точности 29% комментировал всё подряд. Sonnet 5 сменил курс: комментарии стали чище, точность выросла до 38–40%, зато охват упал примерно до 50% и размножились мелкие придирки.
Sonnet 5.5 поймал 6 трудных багов из 13, Sonnet 5 только 4
Набор Signal состоит из 13 настоящих пулл-реквестов из Elasticsearch, Puma, vLLM, Cilium, axios и Next.js, в каждом по одной проверенной ошибке. Девять случаев имеют сложность 3, три сложность 4, один сложность 5. Sonnet 5.5 с включённым размышлением нашёл 6 из них через комментарии, по которым можно действовать, Sonnet 5 нашёл 4.
Точность почти совпала: 41,2% у Sonnet 5.5 и 40,0% у Sonnet 5 при 17 и 15 комментариях соответственно. Критическими Sonnet 5.5 не пометил ни одного замечания, Sonnet 5 пометил два, и одно из них оказалось ошибочным. Четыре находки Sonnet 5.5 касались багов, которые Sonnet 5 пропустил, а два бага, найденных Sonnet 5, новая модель упустила.
Opus 5.5 на тех же 13 случаях в сентябрьском тесте CodeRabbit поймал 8 багов в режиме Standard при точности 66,7% и 10 в режиме Max при 52,0%. В таблице Anthropic к запуску разрыв меньше: Sonnet 5.5 отстаёт от Opus 5.5 примерно на три пункта в большинстве строк, а на Terminal-Bench 4.0 даже опережает его, 70,6% против 66,4%.
На 44 пулл-реквестах ревью заняло 6:33 вместо 13:31
Второй набор, OSS August, крупнее: 85 известных проблем в 44 пулл-реквестах, в основном логические ошибки, неверное использование API, гонки, обращения к null и уязвимости. Судья здесь ещё не выставил оценки, поэтому CodeRabbit публикует только объём комментариев, время, токены и стоимость.
Sonnet 5.5 с включённым размышлением оставил 111 комментариев против 146 у Sonnet 5, то есть на 24% меньше. Критических у него 4 против 14, придирок 9 против 30. В CodeRabbit просят читать эти цифры как нагрузку на разработчика, который будет всё это разбирать, и пока без выводов о качестве.
Со скоростью оговорок нет. Среднее ревью заняло 6:33 против 13:31, медианное 5:44 против 13:49, а все 44 ревью вместе 4 часа 49 минут против 9 часов 55 минут. У Sonnet 5 четыре генерации длились дольше десяти минут, у Sonnet 5.5 ни одной.
Ревью на Sonnet 5.5 обходится в 0,46 доллара вместо 1,16
Прайс не изменился: 2 доллара за миллион входных токенов, 10 за выходные, 0,20 за чтение из кэша и 2,50 за запись в кэш. Opus 5.5 стоит вдвое дороже, 4 и 20 долларов. Раз цены у Sonnet 5.5 и Sonnet 5 одинаковые, вся разница в счёте объясняется числом токенов.
На Signal вызовы Claude стоили 0,47 доллара за ревью у Sonnet 5.5 с размышлением и 1,16 у Sonnet 5, на OSS August 0,46 и 1,16. В расчёт вошли только вызовы Claude по прейскуранту, а вспомогательные модели для сводок и проверки, одинаковые у обеих сторон, не учитывались.
На одном основном вызове ревью в Signal Sonnet 5 читал 247,5 тысячи токенов против 110,7 тысячи у Sonnet 5.5 с размышлением, писал 21,6 тысячи против 5,8 тысячи и выдавал 2 771 слово размышлений против 464. По всему конвейеру, включая вспомогательные модели, Sonnet 5 израсходовал на 27% больше токенов на Signal и на 49% больше на 44 ревью OSS August.
Размышление добавило один пойманный баг и около 15% к счёту
Все прогоны проигрывали одну и ту же запись: сводки файлов, пошаговые описания и группировку по слоям брали из заранее записанной «кассеты», менялись только модель ревью и режим размышления. Похоже на экзамен, где всем раздают один билет, так что разница зависит только от отвечающего. Каждый комментарий оценивал независимый судья тремя голосами, засчитывались комментарии с большинством «за».
Sonnet 5.5, в отличие от Opus 5.5, разрешает выключить размышление на уровнях усилия low, medium и high, в руководстве Anthropic по миграции этот режим называется between_tools. С размышлением модель поймала на Signal 6 багов из 13 при точности 41,2% и 17 комментариях, без него 5 при 38,5% и 13 комментариях.
С размышлением основной вызов давал около 5 800 выходных токенов против 2 900, а счёт вырос примерно на 15%. Среднее ревью при этом шло на 31 секунду быстрее, что CodeRabbit относит к шуму. Режимы расходились в обе стороны: с размышлением модель нашла баг конфигурации в vLLM и ошибку сериализации вызовов инструментов при стриминге, без него поймала случай с terms enum в Elasticsearch.
Главная оговорка в масштабе: 13 случаев показывают направление, и отдельный голос судьи здесь весит много. Один из семи засчитанных комментариев Sonnet 5.5 прошёл голосами два к одному, без него точность падает до 35,3%, а четыре случая из 13 не взяла ни одна конфигурация Sonnet. На наш взгляд, режим с размышлением выглядит выгодной сделкой: около 15% к счёту за лишний пойманный баг и чуть более высокую точность.
Когда судья дойдёт до 44 пулл-реквестов
Оценки судьи для OSS August пока не готовы, и срок не называется. Именно они покажут, не потерял ли Sonnet 5.5 в охвате из-за того, что пишет на четверть меньше комментариев. CodeRabbit тем временем переводит на Sonnet 5.5 простые и средние ревью и обещает расширить перевод в ближайшие недели. Когда очередь дойдёт до самых сложных изменений, компания не говорит.
Читайте также
- Opus 5.5 у CodeRabbit поймал 11 новых багов, но упустил 9
- Sonnet 5.5 обогнал Opus 5.5 в Terminal-Bench 4.0
- Sonnet 5.5 выдал 410 млн токенов ради третьего места
- claude.ai разогнали в 3 раза за две недели с помощью Claude
- Opus 5.5 подешевел, но ломает агентов ошибкой 400
- Ответ Opus 5.5 стоил в 3,4 раза больше, чем у GPT-6 Sol
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
