open-models

GLM-5.2 (max) сравнялась с Claude Opus 4.8 на Harvey LAB-AA

Claude News

open-models

По независимому замеру Artificial Analysis, GLM-5.2 (max) вышла на уровень Claude Opus 4.8 по метрике all-pass rate в бенчмарке Harvey LAB-AA. Оценка идёт по строгой схеме Harvey: задача засчитывается, только если проходят все критерии рубрики, без частичного зачёта.

Бенчмарк построен на юридических задачах. Модель разбирает контракты из data room по сделкам M&A, ищет положения о смене контроля и уступке прав и готовит отчёт для команды сделки в формате coc-analysis-report.docx.

Помимо all-pass rate, Artificial Analysis замеряет стоимость задачи с разбивкой по input, cache hit, cache write, reasoning и answer токенам, число output-токенов на задачу, время декодирования и среднее количество ходов агента на задачу.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.