По независимому замеру Artificial Analysis, GLM-5.2 (max) вышла на уровень Claude Opus 4.8 по метрике all-pass rate в бенчмарке Harvey LAB-AA. Оценка идёт по строгой схеме Harvey: задача засчитывается, только если проходят все критерии рубрики, без частичного зачёта.
Бенчмарк построен на юридических задачах. Модель разбирает контракты из data room по сделкам M&A, ищет положения о смене контроля и уступке прав и готовит отчёт для команды сделки в формате coc-analysis-report.docx.
Помимо all-pass rate, Artificial Analysis замеряет стоимость задачи с разбивкой по input, cache hit, cache write, reasoning и answer токенам, число output-токенов на задачу, время декодирования и среднее количество ходов агента на задачу.

