benchmarks

Jev дешевле Claude Fable в 274 раза, но точность 98%

Promtime

benchmarks

Разница в счёте за одну и ту же работу 274 раза: тысяча проверок кода на Jev обошлась бы в 0,043 доллара, на Claude Fable 5.1 в 11,78. Цифры из открытого бенчмарка, опубликованного на Github, где три модели разбирали Python-код по четырём явным правилам.

Коротко

  • Бенчмарк собран из 24 небольших семейств программ по пять версий кода в каждом, прогнан тремя кругами и дал 1080 основных вызовов ревью, по 360 на каждую из трёх моделей.
  • Медиана ответа у Jev 0,75 секунды против 3,59 у Gemini Flash и 4,31 у Claude Fable, а фактический счёт за 360 ревью составил 0,01545, 0,69965 и 4,24097 доллара.
  • Точность Jev 98% против 100% у обеих альтернатив, решения между кругами у него менялись в 0,83% случаев, и авторы подчёркивают: это маленькие сконструированные примеры, а не настоящие пул-реквесты.

Если вы не следили: Jev называют первой «System One»-моделью компании TypeSafe AI, и, по её собственным словам, она вышла в ранний доступ после двух лет в режиме стелс. Основатель Диого Алмейда, как пишет TypeSafe, до этого работал в OpenAI над методами, которые легли в основу исследований за ChatGPT. Claude Fable 5.1, самая дорогая из трёх моделей в тесте, вышел 1 сентября 2026 года, судя по release notes Anthropic.

За 360 ревью Jev списал 0,01545 доллара, Claude Fable 4,24097

Основное сравнение прогнали 17 сентября 2026 года на версиях jev-1.13.0, google/gemini-3.8-flash и anthropic/claude-fable-5.1; обе сравниваемые модели работали на среднем уровне рассуждений. За 360 ревью Jev обошёлся в 0,01545 доллара, Gemini Flash в 0,69965, Claude Fable в 4,24097.

В пересчёте на общую шкалу в тысячу ревью выходит 0,043, 1,943 и 11,78 доллара: Jev дешевле Flash в 45 раз и дешевле Fable в 274 раза. Арифметика открытая: 4,24097 ÷ 360 × 1000 = 11,78047. Авторы оговаривают, что 11,78 доллара не списанная сумма, а линейная оценка той же нагрузки, без отдельного теста на объёме и без гарантии цены.

Медиана 0,75 секунды и 98% корректных решений у Jev

Медиана времени ответа у Jev 0,75 секунды, у Gemini Flash 3,59, у Claude Fable 4,31 (обе сравниваемые модели, напомним, на среднем уровне рассуждений). По точности картина обратная: сводный балл корректности у Jev 98%, у обеих альтернатив по 100%. На правилах про качество кода разрыв меньше, 99,5% против 100% и 100%.

Есть и колонка про устойчивость: доля решений, изменившихся между тремя кругами, у Jev 0,83%, у Gemini Flash и Claude Fable 0%. Для Jev даны 95-процентные интервалы, 94,7–100% по корректности и 98,8–100% по правилам качества кода. Авторы уточняют, что интервалы описывают разброс внутри этого сконструированного набора и равной или лучшей точности Jev не доказывают.

Почему 1080 вызовов не равны 1080 независимым примерам

Семейство в этом наборе означает одну программу и её родственные версии, так что пять версий внутри семейства независимыми примерами не считаются. Семейств 24, кругов три, итого 1080 основных вызовов ревью, по 360 на модель. В каждом ревью модель отвечала по четырём заданным правилам, а эталонные ответы брали из скрытых проверок поведения и проверок исходников. Балл усредняет долю верных отказов и долю верных одобрений, а затем даёт каждому семейству одинаковый вес.

Опубликованный прогон закончился с 1620 валидными ревью и 30 неудачными вторичными. Известные списания составили 7,98 доллара, ещё у 38 неудачных попыток стоимость неизвестна; в основном сравнении неизвестных списаний нет. Повторить можно на Python 3.12 и uv: проверки и тесты запускаются без ключей API, лимит smoke-прогона 2 доллара, полного исследования 25. Код и материалы под MIT.

Jev возвращает структурированные ответы вместо свободного текста

Устроено это так: на вход идут контекст и вопросы, на выход структурированные ответы, и такую модель TypeSafe называет «System One». По данным TypeSafe, возможные варианты и структура ответа заданы заранее, поэтому модель не делает ошибок типов, и ради этого, говорит компания, Jev отказывается от генерации строк. Там же описан сэмплер: обычная языковая модель выдаёт по одному токену с оглядкой на предыдущий, а Jev, как утверждает компания, порождает весь ответ одним запросом.

Бытовая аналогия: вместо сочинения, которое потом кто-то разбирает и проверяет, заполняется бланк с заранее известными галочками. Обучают модель методом, который в TypeSafe называют RLCD, обучением с подкреплением ради калиброванных решений. По собственным расценкам TypeSafe, входные токены стоят 0,042 доллара за миллион, выходные бесплатны, а время ответа компания заявляет в 70–500 мс против 3–329 секунд у фронтирных моделей.

При 5% передач связка выходит дешевле Gemini примерно в 14 раз

В отчёте посчитан и гибрид: сначала Jev, затем часть случаев уходит в модель подороже. Формула такая: стоимость ревью = 0,0000429044 + p × 0,001943475, где p доля переданных случаев. При 0% тысяча ревью стоит 0,043 доллара (дешевле Gemini в 45,3 раза), при 1% 0,062 (31,2×), при 5% 0,140 (13,9×), при 10% 0,237 (8,2×), при 100% 1,986 (0,98×).

Саму систему в исследовании не тестировали, расчёт показывает возможную стоимость, но не точность. Взяты средние наблюдённые цены запросов и допущение, что переданные случаи в среднем стоят столько же; маршрутизация, хранение и прочие расходы не учтены, а трудные случаи могут стоить дороже. Авторы предупреждают: разрыв в 2 процентных пункта не значит, что маршрутизатор отберёт ровно те 2% случаев, и одних значений уверенности Jev для этого мало.

Похоже, самое шаткое место сравнения сидит в настройках: более дешёвый режим рассуждений для Gemini попробовали включить, и API его отклонил, так что преимущества над любой доступной моделью и настройкой тест не устанавливает. Сам отчёт перечисляет, чего он не показывает: ни равной или лучшей точности Jev, ни детерминированности его решений, и не измеряет производственное ревью, читаемость для человека и свободный поиск багов. Более низкая стоимость на других задачах названа там прямо гипотезой.

Какую долю передач проверять

Долю случаев, уходящих в дорогую модель, авторы называют проектным решением, которое нужно проверять на новых примерах: только так станет видно, какие ошибки маршрутизатор ловит, а какие пропускает. За рамками теста остаётся и более крупный вопрос: держится ли выигрыш в цене на настоящих пул-реквестах и на свободном поиске багов. Сроков такой проверки в отчёте нет, а текущие цены и поведение сервисов, как там же сказано, могут отличаться.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.