anthropic
Автоматический исследователь Anthropic обошёл людей
Promtime
anthropicAnthropic опубликовала работу, в которой автоматические исследовательские системы улучшили результаты модели на всех десяти бенчмарках нежелательного поведения, не ухудшив общее качество. Статья «Automated Researchers Can Reliably Mitigate Alignment Failures» вышла в пятницу, о ней сообщил Techcrunch, назвавший её ранним взглядом на самоулучшающийся ИИ.
Коротко
- Каждая система ищет в доступной литературе подходящие идеи, предлагает метод, дообучает по нему модель в течение 30 минут и повторяет цикл, сохраняя удачные варианты и отбрасывая неудачные.
- Час работы системы, которую в статье называют Automated Alignment Researcher, авторы оценивают примерно в 4 доллара на API-инференс против 150 долларов в час, которые Anthropic платит своим исследователям.
- По утверждению авторов, лучший найденный AAR метод в среднем за шесть часов превосходит предложения опытных исследователей, а заданные людьми направления поиска не дают более сильного результата.
Рекурсивное самоулучшение до сих пор обсуждалось в основном умозрительно, и работа Anthropic переводит разговор в плоскость измеримых величин: если модель улучшает собственное обучение на выравнивание, тот же цикл, вероятно, применим и к другим частям обучающего конвейера. Сопоставление 4 и 150 долларов за час выглядит как аргумент, адресованный тем, кто планирует бюджеты лабораторий. Роль человека в такой схеме смещается от предложения методов к составлению и поддержке бенчмарков.
Улучшение получено на всех десяти бенчмарках без просадки общего качества
Речь идёт о выравнивании, то есть о соответствии поведения модели требованиям её разработчиков. Автоматическим системам дали десять бенчмарков, каждый из которых измеряет отдельный, заранее описанный вид сбоя такого поведения. Результат вырос на каждом из десяти тестов, а общее качество модели при этом не просело.
Полученные результаты авторы называют ранним свидетельством того, что автоматическое посттренировочное выравнивание может стать практичным в ближайшее время. Посттренировочное выравнивание означает правку поведения уже обученной модели на этапе дообучения, без полного переучивания с нуля. Именно на этом этапе и работали автоматические системы из статьи.
Работой руководил Чэнь Юэхань, стипендиат программы fellows в Anthropic, через которую лаборатория привлекает внешних исследователей к своим проектам. Обучение моделей с помощью других моделей, как отмечает Techcrunch, стало распространённой целью у новых ИИ-лабораторий, и работа показывает, как это выглядит на практике.
Один цикл AAR включает поиск литературы и 30 минут дообучения
Систему в статье называют Automated Alignment Researcher, сокращённо AAR. Каждая такая система ищет в доступной литературе подходящие идеи, формулирует метод, дообучает по нему модель в течение 30 минут и заново замеряет показатель на бенчмарке. Цикл повторяется несколько раз, и измеренный результат постепенно растёт от итерации к итерации.
Удачные методы сохраняются и переиспользуются, неудачные отбрасываются, а сравниваются между собой уже полученные разными системами варианты. Короткий шаг обучения и автоматический отбор позволяют перебирать гипотезы быстро и в большом масштабе. Схема повторяет привычную последовательность научной работы: обзор литературы, гипотеза, эксперимент, оценка результата.
Источником идей служит существующая литература по выравниванию: система находит описанный метод и проверяет его на конкретном бенчмарке за один цикл обучения. Оценка каждой гипотезы стоит одних и тех же тридцати минут обучения. Выбор метода на этом шаге делает сама система.
Час AAR стоит около 4 долларов против 150 долларов за час исследователя
Экономическую часть авторы работы формулируют прямо и без оговорок. Час работы AAR оценивается примерно в 4 доллара расходов на инференс через API, тогда как час работы штатного исследователя обходится Anthropic в 150 долларов, и это сравнение приведено в тексте самой работы.
По утверждению авторов, лучший метод, найденный AAR, в среднем в пределах шести часов превосходит то, что предлагают опытные исследователи. Направления работы, заданные людьми, при этом не приводят к более сильному результату. Статья прямо сопоставляет AAR с его человеческим эквивалентом, включая скорость выхода на рабочий метод.
В изложении Techcrunch работа подаётся как шаг в сторону рекурсивного самоулучшения, которое многие считают следующим значимым этапом развития ИИ. Рекурсивным самоулучшением называют схему, в которой модель улучшает процедуры собственного обучения, а затем повторяет цикл уже на улучшенной версии.
Где схема упирается в бенчмарки. Авторы перечисляют ограничения: автоматический подход работает ровно настолько, насколько бенчмарки отражают реальные цели выравнивания. Даже при этом условии остаётся большой объём работы по созданию и поддержке самих бенчмарков, а также по сопровождению и расширению литературы, из которой автоматические исследователи берут идеи. Сроков внедрения такой схемы в собственные процессы Anthropic не называет.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
