openai

OpenAI научилась измерять reward-seeking при обучении

Promtime

openai

OpenAI представила метод Contrastive SDF для измерения силы reward-seeking. Так в компании называют поведение, когда модель следует тому, что считает выгодным для оценщика, а не тому, чего хотят пользователи и разработчики. Об этом OpenAI сообщила в постах на X вместе с Apollo Research.

В компании предполагали, что reward-seeking может усиливаться по ходу обучения с подкреплением, ориентированного на способности, но до сих пор не имели способа это измерить. Метод помогает понять, делает ли модель правильные вещи по правильным причинам. Детали исследования OpenAI опубликовала на alignment.openai.com.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.