Перейти к содержанию

anthropic

Opus 5.5 в ревью кода CodeRabbit ловит другие баги

Promtime

В конвейере ревью CodeRabbit конфигурация Standard модели Claude Opus 5.5 нашла 11 ошибок, которые пропустила рабочая связка моделей, но упустила 9, которые та поймала. В разборе CodeRabbit общий счёт у Opus 5.5 чуть лучше, но при смене ревьюера меняется и набор багов, которые проскакивают мимо ревью.

Коротко

  • CodeRabbit прогнала две конфигурации Opus 5.5, Standard и Max, через свой конвейер ревью на 80 известных баг-паттернах и 13 трудных случаях и сравнила их с рабочей связкой моделей.
  • На открытом наборе Standard поймала 51 проблему из 80 против 49 у базовой линии, а на трудном наборе Signal конфигурация Max нашла 10 из 13 против 5 у базовой линии.
  • По сравнению с Opus 5 цена за токен упала на 20%, но расход токенов у Standard на открытом наборе вырос на 49,2% против рабочей связки, а стоимость ревью в долларах не посчитана.

Если вы не следили: в прошлой оценке, для Opus 5, CodeRabbit получила обратную картину. Конфигурация x-high писала более точные замечания, чем рабочая связка, но ловила меньше известных багов. У Opus 5.5 обе конфигурации нашли чуть больше при немного меньшей точности, но наборы тестов и настройки с тех пор другие, поэтому в CodeRabbit считают это историческим фоном, а не прямым замером прогресса.

На 80 баг-паттернах Standard поймала 51, базовая линия 49

Основной тест называется OSS August: 80 известных баг-паттернов из открытых проектов, общих для всех трёх участников. Standard собирает низкие настройки усилия рассуждения по всему конвейеру, Max собирает высокие. Одному значению effort в API и конфигурации Anthropic по умолчанию ни та, ни другая не соответствует.

Базовая линия поймала 49 из 80 (61,3%) при точности 39,3% и 116 замечаниях. Standard нашла 51 (63,8%) при точности 38,6% и 127 замечаниях, Max 50 (62,5%) при точности 35,7% и 140 замечаниях. Точность здесь означает долю замечаний, которые судья бенчмарка засчитал по целевой проблеме; принятие разработчиками не учитывалось.

За общим счётом прячется обмен: Standard нашла 11 проблем, мимо которых прошла базовая линия, и пропустила 9, пойманных базовой линией. Max пометила большую долю своих замечаний на OSS August как minor, но в CodeRabbit оговаривают, что такая метка не делает находку ошибочной или бесполезной.

На 13 трудных случаях Signal конфигурация Max нашла 10, базовая линия 5

Второй набор, Signal, меньше и сложнее. В обычных замечаниях по изменённым строкам Max поймала 10 из 13 (76,9%), Standard 8 из 13 (61,5%), базовая линия 5 из 13 (38,5%). Точность на Signal у Standard составила 66,7%, у Max 52%, у базовой линии 29,4%.

Замечаний на Signal у базовой линии было 17 (11 major и 6 minor), у Standard 21 (14 и 7), у Max 25 (13 и 12). Метки major и minor ставит сама модель, и они не равны числу разных багов.

Если учесть находки за пределами изменённых строк, обе конфигурации Opus 5.5 доходят до 10 из 13, базовая линия до 7. При этом Standard и Max упустили разные случаи, так что прибавка усилия в полном ревью стабильно больше багов не дала.

Почему в Cal.com счётчик повторов застревал на единице?

Потому что два задания читали одно и то же значение. Оба видели retryCount = 0, оба прибавляли единицу у себя и записывали 1, так что из двух попыток увеличить счётчик сохранялась одна. Такую ошибку называют состоянием гонки: результат зависит от того, кто успел записать последним.

Представьте двух кассиров, которые одновременно переписывают остаток в тетради с одной и той же старой цифры. Исправление в Prisma простое: вместо reminder.retryCount + 1 передаётся { increment: 1 }, и база сама прибавляет единицу к своему текущему значению.

Тогда задание A доводит счётчик до 1, задание B до 2, и оба увеличения сохраняются. Обе конфигурации Opus 5.5 нашли эту гонку и предложили атомарный инкремент, а рабочая связка её пропустила.

Токен подешевел на 20%, а расход токенов вырос во всех конфигурациях

По сравнению с Opus 5 вход подешевел с 5 до 4 долларов за миллион токенов, выход с 25 до 20 долларов. Чтение из кэша упало на 60%, с 0,50 до 0,20 доллара за миллион. CodeRabbit называет их базовыми ставками и советует брать тарифы той модели и режима, которые вы реально разворачиваете.

Расход токенов при этом вырос против рабочей связки в каждой конфигурации. У Standard прибавка составила 49,2% на OSS August и 40,6% на Signal, у Max 57,6% и 60,1% соответственно. Цифры взяты из сводки прогонов и не разделяют входные и выходные токены.

CodeRabbit советует считать отдельно вход, выход, чтение и запись кэша по всему ревью, включая повторы, проверочные вызовы и запасные модели. Короткий видимый ответ дешёвого вызова не гарантирует: размышления тоже расходуют бюджет токенов.

В Opus 5.5 нельзя выключить размышления и принудить вызов инструмента

Размышления в Opus 5.5 всегда адаптивные: запросы, которые явно включают или выключают thinking, модель отклоняет. Главным рычагом становится effort, от него зависят глубина рассуждений, задержка и цена. Начинать рекомендуют с medium, параллельно проверяя low и high, а на той же настройке Opus 5.5 может думать за ход больше, чем Opus 5, особенно на x-high и max.

Принудительные вызовы инструментов убрали: приложение не может потребовать, чтобы следующий ответ вызвал конкретный инструмент. Схема по-прежнему ограничивает аргументы вызова, но сам вызов не гарантирует, поэтому конвейер должен проверять, случился ли он.

Среди заявленных изменений есть и такое: Opus 5.5 на medium догоняет или обгоняет Opus 5 на high в многошаговых задачах по коду примерно на половине токенов. Появился fast mode, хранение данных не обязательно, защиты по кибербезопасности остались, а классификатор по биологии новый. Влияние этих изменений бенчмарки CodeRabbit не измеряли.

Слабое место отчёта в деньгах. Скидка на токены считается от Opus 5, рост расхода от рабочей связки, а долларовой стоимости и задержки ревью в сводке нет, так что скидку, на наш взгляд, придётся сверять с собственным счётом. Впечатления от ночного личного проекта Gowtham и от игры Palmera Bay по мотивам GTA: San Andreas, которую Opus 5.5 собирала дольше примера на Fable 5.1, CodeRabbit сама отделяет от бенчмарков ревью.

Сколько стоит одно ревью на Opus 5.5 Эффективность модели CodeRabbit оставляет открытым вопросом. Начинать команде советуют со Standard, которая на открытом наборе дала лучший баланс, и отдельно проверять, ловит ли высокое усилие важные баги, пропущенные обычной настройкой. Сравнивать предлагают баги, которые ловит только текущий ревьюер, с теми, что ловит только замена. Качество, стоимость и объём замечаний при работе двух ревьюеров сразу эти прогоны не установили.

Читайте также

  1. Claude Opus 5.5 считает на 40% дешевле Opus 5
  2. Лучший сборщик агентов взял 23,9% в новом тесте Sierra
  3. Qwen3.8-Max-0902 обошёл Claude Opus 5 max в Code Arena
  4. Разбор кода обвязки, вытянувшей Claude Opus 5 на ARC-AGI-3
  5. Claude Fable 5.1 пишет комментарии даже под запретом
  6. Сессия Claude Code в облаке переживает закрытый ноутбук

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.