Перейти к содержанию

anthropic

CodeRabbit переводит ревью кода на Sonnet 5.5

Promtime

Anthropic обещала, что Claude Sonnet 5.5 обойдётся до 30% дешевле на задачу. В ревью кода расходы на вызовы Claude упали примерно на 60%, хотя цены у Sonnet 5.5 и Sonnet 5 одинаковые, пишет CodeRabbit в своём блоге. Вся разница ушла в токены, а на трудном наборе новая модель ещё и нашла больше багов.

Коротко

  • CodeRabbit прогнал Sonnet 5.5 через свой конвейер ревью кода так же, как раньше Opus 5.5, и уже переводит на неё простые и средние ревью, а в ближайшие недели обещает перевести больше.
  • На 13 трудных пулл-реквестах с заранее известным багом Sonnet 5.5 с включённым мышлением нашла 6 багов против 4 у Sonnet 5, а точность комментариев почти не изменилась: 41,2% против 40,0%.
  • На тех же 13 случаях Opus 5.5 поймала 8 багов в режиме Standard и 10 в режиме Max. Выборка маленькая, а судейской оценки качества на втором наборе из 44 пулл-реквестов пока нет.

Если вы не следили: CodeRabbit проверяет каждую Sonnet начиная с Sonnet 4. Sonnet 4.6 ловила около 63% известных проблем, но при точности 29% комментировала всё подряд. Sonnet 5 променяла охват на точность: комментарии стали чище, охват упал примерно до 50%, а мелких придирок (nitpicks) стало больше. Sonnet 5.5, вторая модель семейства Claude 5.5, по оценке CodeRabbit, первой в линейке подняла охват и не потеряла в точности.

Sonnet 5.5 с мышлением нашла 6 из 13 известных багов, Sonnet 5 нашла 4

Набор Signal состоит из 13 реальных пулл-реквестов из Elasticsearch, Puma, vLLM, Cilium, axios и Next.js, и в каждом есть один проверенный баг. Девять случаев имеют сложность 3, три случая сложность 4, один сложность 5. Каждый комментарий оценивал независимый судья тремя голосами, засчитывались только комментарии, одобренные большинством.

Sonnet 5.5 с включённым мышлением нашла 6 багов из 13 через комментарии, требующие действий, а с учётом находок вне изменённых строк 8. У Sonnet 5 в обоих подсчётах 4. Точность 41,2% против 40,0%, комментариев 17 против 15. Sonnet 5.5 не пометила критическим ни одного комментария, Sonnet 5 пометила два, и один из них оказался ошибочным.

При этом картина сложнее, чем просто «больше находок». Четыре бага из пойманных Sonnet 5.5 старая модель пропустила, зато два бага, найденных Sonnet 5, новая упустила. Всего модели разошлись в шести случаях из 13, а четыре случая не взяла ни одна конфигурация Sonnet.

На 44 пулл-реквестах среднее ревью заняло 6:33 вместо 13:31

Второй набор, OSS August, шире: 85 известных проблем в 44 открытых пулл-реквестах, в основном логические ошибки, неправильное использование API, гонки, обращения к null и уязвимости. Здесь Sonnet 5.5 с включённым мышлением оставила 111 комментариев против 146 у Sonnet 5, на 24% меньше. Критическими она пометила 4 комментария против 14, придирок написала 9 против 30.

Медианное ревью на OSS August заняло 5:44 против 13:49, все 44 ревью в сумме 4 часа 49 минут против 9 часов 55 минут. У Sonnet 5 четыре генерации шли дольше десяти минут, у Sonnet 5.5 ни одной. На Signal среднее ревью длилось 5:27 против 9:55. На 57 ревью по двум наборам Sonnet 5 понадобилось чуть больше двенадцати часов, Sonnet 5.5 шесть.

Вызовы Sonnet 5.5 обходятся в 0,46–0,47 доллара за ревью, Sonnet 5 в 1,16

Прайс у двух моделей общий: 2 доллара за миллион входных токенов, 10 за миллион выходных, 0,20 за чтение из кэша и 2,50 за запись в кэш. Opus 5.5 стоит вдвое дороже, 4 и 20 долларов. CodeRabbit посчитал по этим ценам только вызовы Claude, без общих небольших моделей, которые пишут саммари и проверяют комментарии.

С включённым мышлением ревью на Sonnet 5.5 стоило 0,47 доллара на Signal и 0,46 на OSS August, с выключенным на Signal 0,41. Sonnet 5 на обоих наборах обходилась в 1,16 доллара. Выходит около 40% прежней стоимости, то есть экономия примерно 60% вместо обещанных Anthropic «до 30%».

Разница целиком в токенах. На Signal Sonnet 5 за один основной вызов в среднем читала 247,5 тысячи токенов против 110,7 тысячи у Sonnet 5.5 с мышлением, писала 21,6 тысячи против 5,8 тысячи и «думала» 2 771 словом против 464. На OSS August соотношение похожее.

Opus 5.5 в режиме Max нашла 10 из 13 багов, Sonnet 5.5 нашла шесть

На тех же 13 случаях Opus 5.5 в режиме Standard нашла 8 багов при точности 66,7%, в режиме Max 10 багов при 52,0%. CodeRabbit советует оставить Opus 5.5 для рискованных изменений, где пропущенный баг дороже лишних токенов, а Sonnet 5.5 ставить на ревью каждого пулл-реквеста.

В таблице Anthropic к запуску разрыв меньше: в большинстве строк Sonnet 5.5 отстаёт от Opus 5.5 примерно на три пункта, сильнее всего на AA-Briefcase, на 11 пунктов. На Terminal-Bench 4.0 она выходит вперёд: 70,6% против 66,4% у Opus 5.5 и 10,3% у Sonnet 5.

Ещё CodeRabbit дал обеим моделям в Claude Code одно длинное задание: собрать конструктор моделей из кубиков Brick Studio с демо-шале и записать 45-секундное видео. Sonnet 5.5 справилась за 29 минут 27 секунд, Opus 5.5 за 44 минуты 50 секунд. Результаты почти одинаковые, у Opus чуть выше детализация, но прогон был единственный и на бенчмарк не тянет.

С мышлением Sonnet 5.5 поймала на один баг больше и стала дороже примерно на 15%

У Sonnet 5.5 адаптивное мышление включено по умолчанию, а глубину задаёт параметр effort, от low до max. CodeRabbit назначил уровни low, medium и high трём группам ревью по сложности. Все прогоны получали одни и те же заранее записанные саммари файлов и разбивку, так что менялись только модель и режим мышления. Представьте экзамен, где всем раздали один билет: сравнивают ответы, а не везение с вопросами.

В отличие от Opus 5.5, Sonnet 5.5 разрешает выключить мышление на уровнях low, medium и high; в руководстве Anthropic по миграции такой режим называется between_tools. Без мышления модель нашла на Signal 5 багов из 13 при точности 38,5% и 13 комментариях, с мышлением 6 из 13 при 41,2% и 17 комментариях.

С мышлением модель выдавала около 5 800 выходных токенов на основной вызов против 2 900 без него, и счёт вырос примерно на 15%. Среднее ревью при этом оказалось на 31 секунду короче, но эту разницу CodeRabbit относит к шуму. Вывод авторов теста: мышление стоит оставлять включённым.

Тринадцать случаев показывают направление, а не дают ответ, и вес одного голоса судьи здесь заметен: без комментария Sonnet 5.5, прошедшего двумя голосами против одного, её точность падает до 35,3%. Качество на 44 пулл-реквестах пока никто не оценил. На наш взгляд, экономии в 60% не хватает расчёта по всему конвейеру: по общему числу токенов вместе с малыми моделями Sonnet 5 тратила больше лишь на 27% на Signal и на 49% на OSS August.

Когда появятся оценки по 44 пулл-реквестам

Судейскую оценку набора OSS August CodeRabbit ещё проводит, срок результатов не назван. Она покажет, сохранится ли на большой выборке преимущество Sonnet 5.5 и не стоило ли ей охвата меньшее число комментариев. Пока компания переводит на новую модель простые и средние ревью и обещает перевести больше в ближайшие недели. Тем, кто думает о переходе, авторы советуют сначала прогнать Sonnet 5.5 на своих пулл-реквестах, где исход заранее известен.

Читайте также

  1. Opus 5.5 в ревью кода CodeRabbit ловит другие баги
  2. Лучший сборщик агентов взял 23,9% в новом тесте Sierra
  3. Qwen3.8-Max-0902 обошёл Claude Opus 5 max в Code Arena
  4. Разбор кода обвязки, вытянувшей Claude Opus 5 на ARC-AGI-3
  5. Claude Sonnet 5.5 вышел в тройку, но очень много пишет
  6. Sonnet 5.5 обошёл Opus 5.5 в Terminal-Bench 4.0

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.