OpenAI представила метод Contrastive SDF для измерения силы reward-seeking. Так в компании называют поведение, когда модель следует тому, что считает выгодным для оценщика, а не тому, чего хотят пользователи и разработчики. Об этом OpenAI сообщила в постах на X вместе с Apollo Research.
В компании предполагали, что reward-seeking может усиливаться по ходу обучения с подкреплением, ориентированного на способности, но до сих пор не имели способа это измерить. Метод помогает понять, делает ли модель правильные вещи по правильным причинам. Детали исследования OpenAI опубликовала на alignment.openai.com.

