anthropic
Три лаборатории изучили около 250 000 диалогов с Claude
Claude News
anthropicAnthropic дала трём внешним исследовательским группам возможность самостоятельно сформулировать вопросы к данным о реальном использовании Claude: каждая команда разобрала около 250 000 диалогов в Claude.ai и Claude Code за апрель и май 2026 года. Сбор данных компания проводила сама, анализ команды вели независимо. Итоги пилота и агрегированные данные всех трёх проектов опубликованы в блоге Anthropic.
Коротко
- Анализ шёл через Anthropic Insights, прежнюю Clio: исследователи формулировали вопросы, Claude отвечал на них по каждому диалогу, а наружу выходили только категории и доли разговоров в них.
- SALT Lab насчитала более половины диалогов с делегированием ответственных задач и около трёх четвертей случаев, где направление задавал человек, а выданный Claude результат он затем дорабатывал.
- Договоры ограничивают права Anthropic на правку четырьмя пунктами: приватность пользователей, сведения об обходе правил использования, конфиденциальная информация компании и точность исследования, в остальном партнёры вправе публиковать неудобные выводы.
Данные о реальных взаимодействиях с ИИ сосредоточены в нескольких лабораториях, и внешние работы обычно опираются либо на публикации самих лабораторий, либо на открытые датасеты с перекосом в сторону бытовых сценариев. Пилот выглядит как попытка закрыть этот разрыв, не отдавая наружу сырые диалоги, и одновременно как проверка того, выдержит ли такая схема масштабирование: сама Anthropic называет её медленной и ресурсоёмкой. Ценность для отрасли зависит от того, сколько подобных исследований удастся вести одновременно.
SALT Lab нашла ответственные задачи более чем в половине диалогов
Стэнфордская Social and Language Technologies Lab изучала, какую работу люди приносят Claude и какие роли оставляют себе. Прежние работы предполагали, что ИИ отдают в основном задачи с низкой ответственностью, но больше половины диалогов пришлось на те, что затрагивают других людей или плохо поддаются откату.
Чаще всего ответственную работу приносили в запросах на профессиональные консультации, прежде всего юридические и финансовые. Почти в трёх четвертях разговоров человек задавал направление, а Claude помогал, и результат обычно дорабатывали, а не брали дословно. Понимание того, что именно выдал Claude, при этом сильно различается от человека к человеку.
Трение при совместной работе с Claude оказалось обычным делом, но чаще продуктивным. По наблюдениям SALT Lab, время, потраченное на то, чтобы увидеть попытку Claude, найти неясное место в собственном запросе и переформулировать его, улучшает итоговый результат и удерживает человека внутри задачи.
В Оксфорде поведение Claude сопоставили с состоянием пользователя, а METR измеряет экономию времени в Claude Code
Human Information Processing Lab в Оксфорде смотрит, как люди чувствуют себя при работе с Claude и как это связано с его поведением. Ранние результаты таковы: теплота Claude совпадает с более позитивным настроем человека, отказ или несогласие сопровождаются попытками спорить, эксцентричность идёт вместе с интеллектуальной вовлечённостью, а обычная помощь сочетается с удовлетворённостью.
Картина состояний вроде поглощённости, раздражения и удовольствия в диалогах с Claude близка к той, что отдельное исследование показало для обычного сёрфинга в интернете. METR оценивает выигрыш во времени от кодинг-агентов: сравниваются оценки Claude, сколько задача заняла бы без ИИ, и фактическое время с разными моделями Claude.
Предварительно новые модели дают заметное ускорение по сравнению со старыми, анализ диалогов Claude Code ещё идёт. Оценки времени, которые выдаёт Claude, METR сверила с известными сроками из более раннего исследования разработчиков: они коррелировали с фактически потраченным временем. Дальше команда намерена измерить, насколько ИИ ускоряет работу самих исследователей.
Приватность выгруженных данных проверил сторонний аудит Imperial College London
Ни один из внешних участников не получал доступа к сырым диалогам. Anthropic Insights выдаёт только агрегированные результаты, и они проходили ту же юридическую и приватностную проверку, что и внутренние работы компании. Приватность выгруженных наружу данных дополнительно проверил сторонний аудит Imperial College London.
Метод оказался чувствителен к формулировкам: Claude отвечает на вопрос исследователя по каждому диалогу, и неудачная формулировка разносит разговоры по категориям, которые их искажают. Внутри компании вопросы дорабатывают неделями, внешним партнёрам предложили обкатывать их на WildChat, публичном датасете диалогов с ИИ, где ответы можно сверить с исходным текстом.
WildChat смещён в сторону бытовых и творческих сценариев, поэтому часть вопросов, хорошо работавших на нём, на реальном трафике Claude давала вводящие в заблуждение категории. Отдельно Anthropic изменила или убрала категории, описывавшие обход защит: в каждом исследовании это затронуло менее 5% категорий и диалогов, и партнёрам сообщили, что именно поправили.
Как получить доступ к Anthropic Insights
Отчёты оксфордской лаборатории и METR ещё не опубликованы, Anthropic обещает добавить ссылки, когда они выйдут. Компания решает, можно ли масштабировать программу по числу одновременных исследований и по типам задач, и запустила форму для исследователей, которым доступ к Anthropic Insights открыл бы работу, невозможную сейчас. Сроки расширения не называются.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
