benchmarks

ИИ-агенты провалили большинство медицинских тестов в США

Claude News

benchmarks

Новый бенчмарк CHI-Bench показал, что лучшие ИИ-агенты не справляются с 72 процентами реальных медицинских процессов. Исследователи протестировали 30 моделей в 75 сложных сценариях, включая согласование лечения и управление уходом.

Лучший результат показал Claude Code на базе Opus 4.6 с показателем успешности всего 28 процентов. На втором месте оказался GPT-5.5 от OpenAI с результатом 21 процент. При повторных запусках надежность падает еще сильнее, ни одна модель не преодолела порог в 20 процентов при троекратном прохождении одного теста.

Тестирование имитирует реальную работу клиник и состоит из десятков шагов. Результаты показывают, что готовность ИИ-агентов к автономной работе в медицине сильно преувеличена.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.