Opus 5.5 у CodeRabbit поймал 11 новых багов, но упустил 9

В Cal.com два параллельных задания затирали друг другу счётчик повторов. Боевой ревьюер CodeRabbit эту гонку пропустил, а обе конфигурации Opus 5.5 её поймали и предложили атомарный инкремент. Главная причина попробовать Opus 5.5 в ревью, по разбору CodeRabbit, в том, что модель ловит другой набор багов. Правда, обмен идёт в обе стороны: часть багов, которые находил прежний ревьюер, она пропускает.
Коротко
- CodeRabbit прогнал две конфигурации Opus 5.5, Standard и Max, через свой конвейер ревью и сравнил их с боевым набором моделей на 80 известных паттернах багов и 13 сложных случаях.
- В открытом бенчмарке Standard поймала 51 проблему из 80 против 49 у базового набора, а на тесте Signal конфигурация Max нашла 10 из 13, базовый набор только пять.
- Цена токена упала на 20% относительно Opus 5, но во всех прогонах Opus 5.5 тратил на 40,6–60,1% больше токенов, чем боевой набор, и писал больше комментариев.
Если вы не следили: CodeRabbit, по его собственным данным, тестирует каждый Opus начиная с четвёртой версии. В разборе Opus 5 конфигурация x-high, по данным CodeRabbit, писала точнее боевого набора (39,3% против 35,2%), но ловила меньше известных багов (55,2% против 61,1%). Вывод тогда был жёсткий: Opus 5 не лучший универсальный ревьюер, скорее отдельная «полоса точности» в схеме маршрутизации.
Standard нашла 11 багов, которых не видел боевой ревьюер, и упустила девять
Standard объединяет низкие уровни усилия рассуждений, Max высокие, причём обе задают настройки по всему конвейеру, одним значением effort в API они не сводятся. На бенчмарке OSS August из 80 общих паттернов базовый набор поймал 49 (61,3%) при точности 39,3% и 116 комментариях. Standard нашла 51 (63,8%) при точности 38,6% и 127 комментариях, Max 50 (62,5%) при 35,7% и 140 комментариях.
Средний счёт скрывает обмен. Standard поймала 11 проблем, которые базовый набор пропустил, и упустила девять, которые тот ловил. Сменив ревьюер, вы меняете и то, какие именно баги проскакивают в прод, даже если общий балл подрос.
Пример из Cal.com показателен. Два задания одновременно читали retryCount = 0, каждое прибавляло единицу и записывало 1, так что из двух попыток в счётчике оставалась одна. Как если бы двое одновременно списали с доски ноль, прибавили по единице и оба написали на доске «1». Исправление с increment: 1 передаёт сложение самой базе, и второе задание доводит счётчик до 2.
На 13 сложных случаях Signal конфигурация Max нашла 10, базовый набор пять
Signal меньше и труднее открытого теста. Через обычные actionable-комментарии, то есть замечания, по которым можно сразу действовать, Max поймала 10 из 13 (76,9%), Standard 8 (61,5%), базовый набор 5 (38,5%). Точность у Standard 66,7%, у Max 52,0%, у базового набора 29,4%. Точность здесь означает долю комментариев, которые судья бенчмарка засчитал за целевую проблему.
Комментариев Max написала 25 (13 с меткой major и 12 с меткой minor), Standard 21 (14 и 7), базовый набор 17 (11 и 6). Метки серьёзности ставит сама модель, и число отдельных багов они не отражают.
Если учесть находки за пределами изменённых строк, обе конфигурации Opus доходят до 10 из 13, базовый набор до семи. Standard и Max при этом промахнулись на разных случаях, так что рост усилия стабильного прироста находок не давал.
Токен подешевел на 20%, а токенов уходит на 40,6–60,1% больше
Базовые ставки Opus 5.5: 4 доллара за миллион входных токенов и 20 долларов за миллион выходных вместо 5 и 25 у Opus 5. Чтение из кэша подешевело на 60%, с 0,50 до 0,20 доллара за миллион. По данным Anthropic, именно чтение из кэша составляет большую часть затрат в агентной работе и программировании.
Но счёт зависит и от объёма. По сводке команды CodeRabbit, Standard потратила больше токенов, чем боевой набор, на 49,2% на OSS August и на 40,6% на Signal, Max на 57,6% и 60,1% соответственно. Рост считали от боевого набора, скидку от Opus 5, так что сравнения разные. Вход и выход в сводке не разделены, доллары и задержка не посчитаны.
В CodeRabbit советуют считать вход, выход, чтение и запись кэша отдельно по всему ревью, включая повторы, проверочные вызовы и запасные модели. Короткий видимый ответ ещё не значит дешёвый вызов, ведь рассуждения тоже расходуют бюджет токенов.
На medium Opus 5.5 догонял Opus 5 на high, а личный проект вёл всю ночь
Рассуждения в Opus 5.5 всегда адаптивные: запросы, которые явно включают или выключают thinking, модель отклоняет. Главным рычагом остаётся effort, начинать советуют с medium. Заявлено, что на medium Opus 5.5 догонял или обгонял Opus 5 на high в многошаговых задачах по коду примерно на половине токенов.
Принудительные вызовы инструментов убрали. Схема задаёт аргументы, но работает как бланк заказа: поля официант заполнит верно, а принесёт ли бланк вообще, решает сам. Поэтому конвейер должен проверять, что вызов случился. Ещё появились fast mode, работа без обязательного хранения данных и биологический классификатор.
Gowtham, который вёл эти оценки, рассказал в подкасте CodeRabbit, как оставил Opus 5.5 на ночь над личным проектом, и результат впечатлил и его, и команду. Ещё модель собрала Palmera Bay по мотивам Grand Theft Auto: San Andreas с детальным миром, хотя и дольше, чем Sunhaven на Fable 5.1, и написала ботов, играющих в неё, Sunhaven и Westline от Astra.
Ограничения авторы называют сами: разные тесты и конфигурации не дают прямого сравнения с Opus 5, а точность отражает вердикт судьи, не принятие разработчиком. На наш взгляд, скидка в 20% мало что говорит о счёте, пока токенов уходит на 40,6–60,1% больше, а долларовую стоимость ревью замеры CodeRabbit не показывают.
Скидка против лишних токенов. Эффективность Opus 5.5 в CodeRabbit называют открытым вопросом и советуют командам проверить, превращаются ли низкие цены в дешёвое ревью в продакшене. Для своего прогона предлагают сравнить баги, которые ловит только текущий ревьюер, с теми, что ловит только замена, и положить рядом счёт, время, полезные находки, потерянные баги и комментарии, которые придётся читать. Начинать советуют со Standard.
Читайте также
- claude.ai разогнали в 3 раза за две недели с помощью Claude
- Opus 5.5 подешевел, но ломает агентов ошибкой 400
- Ответ Opus 5.5 стоил в 3,4 раза больше, чем у GPT-6 Sol
- Workbench стал Playground и остался без истории промптов
- Fable 5.1 отказалась бить манекен, но газ на плиту поставила
- Cowork и чат съезжаются в одного Claude
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
