Gemini 4 Argon сильна в офисных задачах и проседает в коде

В таблице, которую Google опубликовала вместе с Gemini 4 Argon, есть показательная строка. На юридическом тесте Harvey модель набирает 19,6%, почти втрое больше Claude Fable 5.1, и всё равно до конца доводит лишь одну задачу из пяти.
Как пишет The New Stack, новый флагман Google обходит лучшие модели OpenAI и Anthropic в большинстве тестов, иногда с большим отрывом. Там же, где Argon уступает, разрыв доходит до 10 пунктов, а получить модель пока нельзя.
Коротко
- Google показала Gemini 4 Argon, по сути замену Gemini 3.5 Pro; первыми модель получают участники программы Fairwind, затем платные клиенты API и подписчики AI Ultra, потом все остальные.
- В 13 тестах из 18 Argon занимает первое место или делит его, сильнее всего в офисных задачах, а на вводный период цена составит 2 доллара за миллион входных токенов.
- Все цифры взяты из анонса самой Google, в коде модель последняя на FrontierSWE v2 и Terminal-Bench 4.0, а результаты по уязвимостям сравниваются только с собственной Gemini 3.8 Flash Cyber.
Если вы не следили: на конференции I/O в мае Google анонсировала Gemini 3.5 Pro и планировала выпустить её в июне, но вместо неё вышла серия моделей Flash. По данным Let's Data Science, Сундар Пичаи тогда просил подождать до следующего месяца. Codersera насчитала три пропущенных срока (июнь, середина июля, начало августа) и четыре Flash-модели за это время, а 9to5Google пишет, что 3.5 Pro в итоге отменили и Argon получила новую схему названий.
На DeepSWE v1.1 у Argon рекордные 77,9%, а на FrontierSWE v2 и Terminal-Bench 4.0 она последняя
Google отдельно хвалит Argon за программирование, и одна строка таблицы это подтверждает. На DeepSWE v1.1, тесте на длинные инженерные задачи, у модели 77,9%, новый рекорд; у Claude Opus 5.5 74,2%, у GPT-6 Astra 74,1%. Первое место и на Vibe Code Bench с 91,9%, но там все четыре модели набирают больше 89%.
Из пяти тестов, где Argon не первая, два про код. На FrontierSWE v2 у неё 55,0% против 65,5% у GPT-6 Astra, на Terminal-Bench 4.0 57,4% против 66,4% у Opus 5.5, и в обоих Argon последняя из четырёх. Остальные проигрыши: PostTrainBench (45,3% против 49,3% у Opus 5.5), Terminal-Bench Science 0.1 (57,6% против 68,1% у GPT-6 Astra) и OSWorld-2.0 на офлайн-подмножестве с частичным зачётом (69,2% против 72,6% у GPT-6 Astra).
На AutomationBench от Zapier Argon почти на девять пунктов опережает Opus 5.5
Сильнее всего модель в офисной работе. На AutomationBench у Argon 51,3% против 42,5% у Opus 5.5, на Vals Finance Agent v2 65,4% против 58,9% у лучшего соперника, Fable 5.1. На юридическом тесте Harvey у Argon 19,6%, у Fable 5.1 6,7%, у Opus 5.5 3,8%.
С длинным контекстом у Google тоже хорошо. В GraphWalks на входах от 256 тысяч до миллиона токенов Argon набирает 84,2%, больше чем на 12 пунктов выше GPT-6 Astra с 71,8%, а на длинных видео в LVBench 91,7%. На Vals Index, Agent's Last Exam, Chartography и короткой версии GraphWalks отрыв обычно меньше двух пунктов, на RiemannBench по математике у Argon 76,0%.
Есть и сторонние оценки. По данным Artificial Analysis, Argon сравнялась с GPT-6 Astra в их Intelligence Index при 60% стоимости задачи по вводным ценам. Arena.ai сообщает, что Gemini 4 Argon (High) заняла первое место в Text Arena с 1525 очками при смешанной цене 8 долларов за миллион токенов и восьмое в Code Arena: WebDev с 1679 очками.
После вводного периода выходные токены подорожают с 10 до 20 долларов за миллион
На старте Google берёт 2 доллара за миллион входных токенов и 10 долларов за миллион выходных, кэшированный ввод идёт со скидкой 95%. Потом цена вырастет до 4 и 20 долларов. Столько же, 20 долларов за миллион выходных токенов, Anthropic берёт за Opus 5.5.
Google участвует в добровольном процессе правительства США, который даёт доступ к моделям до релиза, и собирается дорабатывать ограничения по отзывам первых тестировщиков. Testing Catalog перечисляет защиты от злоупотреблений в кибербезопасности и CBRN (химическое, биологическое, радиологическое и ядерное оружие), от косвенных промпт-инъекций и несогласованного поведения агентов, а также изолированные песочницы для рискованного обучения. По данным 9to5Google, Google следит за внутренними активациями модели и её цепочкой рассуждений и при необходимости останавливает выполнение.
Анонс вышел через день после того, как Пичаи после встречи с Дональдом Трампом подписал обязательство о «самоконтроле» вместе с Anthropic, Meta, Nvidia, OpenAI и SpaceX. По оценке The New Stack, механизма, который заставил бы его соблюдать, у этого обязательства не видно.
Участники Fairwind получают Argon без киберограничений
Google обучила Argon самостоятельно находить, проверять и закрывать уязвимости. Участники Fairwind и внутренние команды Google получают модель без киберограничений. Wiz, которую Google купила в марте за 32 миллиарда долларов, уже использует Argon в программе Scan for Good. По словам Google, модель нашла в медицинском софте, которым пользуются больницы по всему миру, критическую уязвимость, открывавшую доступ к чувствительным персональным данным, и прежние передовые модели её пропустили.
На внутреннем тесте Google по поиску уязвимостей у Argon 85,8%, на тесте Wiz по пентесту 70,9%, и сравнение дано только с Gemini 3.8 Flash Cyber (71,0% и 58,2%). На CWE-bench v1, единственном тесте по безопасности с цифрами соперников, Argon делит первое место с GPT-6 Astra и Grok 4.7 от xAI с 68%, Opus 5.5 на пункт ниже. Модели OpenAI и Anthropic там работают в своих агентных обвязках, Codex и Claude Code, так что таблица оценивает модель вместе с инструментами.
Лимит вывода вырос с 64 тысяч до миллиона токенов
Миллион входных токенов для передовых моделей уже стандарт, а Argon ещё и выдаёт до миллиона токенов на выходе, прежние Gemini ограничивались 64 тысячами. В Google объясняют, что запас на сотни тысяч токенов в одной траектории даёт модели рассуждать глубже и решать трудные задачи за один заход. Представьте экзамен, где вместо одного листка выдают толстую тетрадь: решение не приходится обрывать на середине.
Примеры таких длинных задач Google берёт из своей практики, как пересказывает Testing Catalog. Argon пользуются тысячи сотрудников, модель за минуты улучшила опубликованный базовый результат оптимизации квантового алгоритма на 40%, а группа агентов нашла в дата-центрах оптимизации памяти, освободившие больше 300 TiB, с прогнозом экономии от 500 TiB до 1 PiB.
По данным Testing Catalog, агенты также переносят код с C и C++ на Rust, от библиотек в десятки тысяч строк до ядра Fuchsia Zircon больше чем на 800 тысяч строк, с автоматическим и ручным аудитом перед продакшеном. В Rust-порте видеодекодера libgav1 Argon заменила 32 тысячи строк SIMD-кода безопасным Rust, который работал в 2,7 раза быстрее при идентичном выводе.
Все цифры в таблице от самой Google, а самые впечатляющие результаты по безопасности сверить не с чем, кроме её собственной Flash-модели. Судя по подбору тестов, ставку Google сделала на офисную работу и длинный контекст, а не на код, где Argon выигрывает лишь половину сравнений. На наш взгляд, считать расходы стоит по постоянной цене: длительность вводного периода не названа, а траектория на полный миллион выходных токенов обойдётся тогда в 20 долларов.
Когда Argon дойдёт до API
Дату широкого запуска Google не называет. Сначала компания соберёт отзывы участников Fairwind и доработает ограничения, затем модель получат платные клиенты API и подписчики AI Ultra, и только после них разработчики, компании и обычные пользователи. Сколько продлится вводный период с ценой 2 и 10 долларов за миллион токенов, тоже не сказано.
Читайте также
- Gemini 3.8 Live Extended Thinking подвинула GPT Live 1
- Google тестирует обновление Gemini Flash на LM Arena
- Embed 5 от Cohere делит индекс и поиск между двумя моделями
- Sonnet 5.5 обошёл Opus 5.5 в Terminal-Bench 4.0
- Gemini 3.8 Flash TTS разыгрывает диалог по сценарию
- Дообучение MiMo-V2.6-Pro обошлось Xiaomi в 2,62 миллиона
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
