anthropic

Автоисследователь Anthropic обгоняет людей за шесть часов

Claude News

anthropic

Anthropic опубликовала в пятницу статью «Automated Researchers Can Reliably Mitigate Alignment Failures»: автоматизированные исследовательские системы улучшили результат модели на всех десяти бенчмарках несоответствующего поведения и не ухудшили общее качество. О работе сообщил Techcrunch; её вёл стипендиат программы Anthropic fellows Чен Юэ-Хань.

Коротко

  • Automated Alignment Researcher повторяет обычный исследовательский цикл: система ищет по литературе, предлагает метод, дообучает модель по нему в течение тридцати минут и снова прогоняет целевой бенчмарк. Удачные методы сохраняются, неудачные отбрасываются.
  • Час работы автоисследователя обходится примерно в 4 доллара на инференс через API, тогда как за час работы штатного исследователя-человека Anthropic платит 150 долларов, следует из статьи. Обе цифры даны за час работы.
  • По утверждению авторов, лучший метод AAR в среднем за шесть часов обгоняет то, что предлагают опытные люди, а направления исследования, заданные человеком, к более сильным результатам не приводят. Сравнение приведено в самой работе.

Значение работы выходит за пределы десяти бенчмарков и одного эксперимента: она переносит узкое место исследования выравнивания с людей на метрики и на инфраструктуру вокруг них. Если оптимизацию ведёт система, качество и полнота бенчмарков определяют, что именно будет улучшено, а что останется незамеченным, и цена ошибки в выборе метрик растёт. Разрыв в стоимости часа выглядит не менее важным: он снимает практический потолок на число параллельных попыток, которые лаборатория может себе позволить в единицу времени.

Каждая итерация автоисследователя укладывается в тридцать минут дообучения модели

Схема AAR повторяет привычный порядок работы живого исследователя. Система просматривает доступную литературу, формулирует метод, дообучает модель по этому методу в течение тридцати минут и снова замеряет результат на целевом бенчмарке. От итерации к итерации показатель растёт, а весь набор состоит из десяти бенчмарков, каждый из которых описывает отдельный вид несоответствующего поведения модели.

Методы, которые дают прирост, сохраняются, остальные отбрасываются, и за счёт этого перебор гипотез идёт быстро и в большом масштабе, без участия человека на каждом шаге. Итоговый результат: улучшение на каждом из десяти бенчмарков без ухудшения общего качества модели. Название Automated Alignment Researcher авторы используют как прямой аналог человеческой исследовательской роли в лаборатории.

Час автоисследователя стоит около 4 долларов против 150 долларов у человека

Сравнение с людьми авторы приводят в работе напрямую, вместе с цифрами. «Лучший метод AAR в среднем за шесть часов обгоняет то, что предлагают опытные люди», говорится в статье; там же указано, что заданные человеком направления исследования не дают более сильных результатов.

Расчёт стоимости авторы приводят там же, рядом с этим сравнением. Час работы автоисследователя обходится примерно в 4 доллара на инференс через API, тогда как за час работы своего штатного исследователя-человека Anthropic платит 150 долларов. Оба показателя относятся к одному часу работы.

Techcrunch трактует полученный результат шире: если система способна улучшать собственное обучение выравниванию, тем же способом она может влиять и на другие части тренировочного процесса, вплоть до вытеснения исследователей-людей из части процессов. Это оценка издания, а не измеренный результат самого эксперимента.

Подход работает ровно настолько, насколько бенчмарки отражают цели выравнивания

В работе перечислены и ограничения подхода, и их несколько. Автоматизированный исследователь полезен ровно в той мере, в какой бенчмарки отражают настоящие цели выравнивания, а сами эти наборы нужно ещё создать и поддерживать. Отдельной задачей остаётся база литературы, из которой система берёт гипотезы: её нужно обновлять и расширять.

«В целом эти результаты дают раннее свидетельство того, что автоматизированное посттренировочное выравнивание может стать практичным в близкой перспективе», говорится в статье. Обучение моделей силами других моделей давно стало популярной целью для новых ИИ-лабораторий, и здесь этот подход показан на узком участке: посттренировочной работе над выравниванием. Рекурсивное самоулучшение многие называют следующим значимым шагом в развитии ИИ.

Сроки внедрения AAR не названы

Статья не описывает, применяется ли автоматизированный исследователь в текущем обучении моделей Anthropic и когда это может произойти: авторы ограничиваются оценкой близкой перспективы, без дат, планов развёртывания и указания на масштаб. Открытым остаётся и то, кто будет строить бенчмарки под новые виды несоответствующего поведения, поскольку именно от этого набора зависит, что автоисследователь вообще сможет исправить.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.