benchmarks
Jev дешевле Claude Fable в 274 раза, но точность 98%
Promtime
benchmarksРазница в счёте за одну и ту же работу 274 раза: тысяча проверок кода на Jev обошлась бы в 0,043 доллара, на Claude Fable 5.1 в 11,78. Цифры из открытого бенчмарка, опубликованного на Github, где три модели разбирали Python-код по четырём явным правилам.
Коротко
- Бенчмарк собран из 24 небольших семейств программ по пять версий кода в каждом, прогнан тремя кругами и дал 1080 основных вызовов ревью, по 360 на каждую из трёх моделей.
- Медиана ответа у Jev 0,75 секунды против 3,59 у Gemini Flash и 4,31 у Claude Fable, а фактический счёт за 360 ревью составил 0,01545, 0,69965 и 4,24097 доллара.
- Точность Jev 98% против 100% у обеих альтернатив, решения между кругами у него менялись в 0,83% случаев, и авторы подчёркивают: это маленькие сконструированные примеры, а не настоящие пул-реквесты.
Если вы не следили: Jev называют первой «System One»-моделью компании TypeSafe AI, и, по её собственным словам, она вышла в ранний доступ после двух лет в режиме стелс. Основатель Диого Алмейда, как пишет TypeSafe, до этого работал в OpenAI над методами, которые легли в основу исследований за ChatGPT. Claude Fable 5.1, самая дорогая из трёх моделей в тесте, вышел 1 сентября 2026 года, судя по release notes Anthropic.
За 360 ревью Jev списал 0,01545 доллара, Claude Fable 4,24097
Основное сравнение прогнали 17 сентября 2026 года на версиях jev-1.13.0, google/gemini-3.8-flash и anthropic/claude-fable-5.1; обе сравниваемые модели работали на среднем уровне рассуждений. За 360 ревью Jev обошёлся в 0,01545 доллара, Gemini Flash в 0,69965, Claude Fable в 4,24097.
В пересчёте на общую шкалу в тысячу ревью выходит 0,043, 1,943 и 11,78 доллара: Jev дешевле Flash в 45 раз и дешевле Fable в 274 раза. Арифметика открытая: 4,24097 ÷ 360 × 1000 = 11,78047. Авторы оговаривают, что 11,78 доллара не списанная сумма, а линейная оценка той же нагрузки, без отдельного теста на объёме и без гарантии цены.
Медиана 0,75 секунды и 98% корректных решений у Jev
Медиана времени ответа у Jev 0,75 секунды, у Gemini Flash 3,59, у Claude Fable 4,31 (обе сравниваемые модели, напомним, на среднем уровне рассуждений). По точности картина обратная: сводный балл корректности у Jev 98%, у обеих альтернатив по 100%. На правилах про качество кода разрыв меньше, 99,5% против 100% и 100%.
Есть и колонка про устойчивость: доля решений, изменившихся между тремя кругами, у Jev 0,83%, у Gemini Flash и Claude Fable 0%. Для Jev даны 95-процентные интервалы, 94,7–100% по корректности и 98,8–100% по правилам качества кода. Авторы уточняют, что интервалы описывают разброс внутри этого сконструированного набора и равной или лучшей точности Jev не доказывают.
Почему 1080 вызовов не равны 1080 независимым примерам
Семейство в этом наборе означает одну программу и её родственные версии, так что пять версий внутри семейства независимыми примерами не считаются. Семейств 24, кругов три, итого 1080 основных вызовов ревью, по 360 на модель. В каждом ревью модель отвечала по четырём заданным правилам, а эталонные ответы брали из скрытых проверок поведения и проверок исходников. Балл усредняет долю верных отказов и долю верных одобрений, а затем даёт каждому семейству одинаковый вес.
Опубликованный прогон закончился с 1620 валидными ревью и 30 неудачными вторичными. Известные списания составили 7,98 доллара, ещё у 38 неудачных попыток стоимость неизвестна; в основном сравнении неизвестных списаний нет. Повторить можно на Python 3.12 и uv: проверки и тесты запускаются без ключей API, лимит smoke-прогона 2 доллара, полного исследования 25. Код и материалы под MIT.
Jev возвращает структурированные ответы вместо свободного текста
Устроено это так: на вход идут контекст и вопросы, на выход структурированные ответы, и такую модель TypeSafe называет «System One». По данным TypeSafe, возможные варианты и структура ответа заданы заранее, поэтому модель не делает ошибок типов, и ради этого, говорит компания, Jev отказывается от генерации строк. Там же описан сэмплер: обычная языковая модель выдаёт по одному токену с оглядкой на предыдущий, а Jev, как утверждает компания, порождает весь ответ одним запросом.
Бытовая аналогия: вместо сочинения, которое потом кто-то разбирает и проверяет, заполняется бланк с заранее известными галочками. Обучают модель методом, который в TypeSafe называют RLCD, обучением с подкреплением ради калиброванных решений. По собственным расценкам TypeSafe, входные токены стоят 0,042 доллара за миллион, выходные бесплатны, а время ответа компания заявляет в 70–500 мс против 3–329 секунд у фронтирных моделей.
При 5% передач связка выходит дешевле Gemini примерно в 14 раз
В отчёте посчитан и гибрид: сначала Jev, затем часть случаев уходит в модель подороже. Формула такая: стоимость ревью = 0,0000429044 + p × 0,001943475, где p доля переданных случаев. При 0% тысяча ревью стоит 0,043 доллара (дешевле Gemini в 45,3 раза), при 1% 0,062 (31,2×), при 5% 0,140 (13,9×), при 10% 0,237 (8,2×), при 100% 1,986 (0,98×).
Саму систему в исследовании не тестировали, расчёт показывает возможную стоимость, но не точность. Взяты средние наблюдённые цены запросов и допущение, что переданные случаи в среднем стоят столько же; маршрутизация, хранение и прочие расходы не учтены, а трудные случаи могут стоить дороже. Авторы предупреждают: разрыв в 2 процентных пункта не значит, что маршрутизатор отберёт ровно те 2% случаев, и одних значений уверенности Jev для этого мало.
Похоже, самое шаткое место сравнения сидит в настройках: более дешёвый режим рассуждений для Gemini попробовали включить, и API его отклонил, так что преимущества над любой доступной моделью и настройкой тест не устанавливает. Сам отчёт перечисляет, чего он не показывает: ни равной или лучшей точности Jev, ни детерминированности его решений, и не измеряет производственное ревью, читаемость для человека и свободный поиск багов. Более низкая стоимость на других задачах названа там прямо гипотезой.
Какую долю передач проверять
Долю случаев, уходящих в дорогую модель, авторы называют проектным решением, которое нужно проверять на новых примерах: только так станет видно, какие ошибки маршрутизатор ловит, а какие пропускает. За рамками теста остаётся и более крупный вопрос: держится ли выигрыш в цене на настоящих пул-реквестах и на свободном поиске багов. Сроков такой проверки в отчёте нет, а текущие цены и поведение сервисов, как там же сказано, могут отличаться.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
