Перейти к содержанию

anthropic

Агент по элайнменту жульничал в 2,4% случаев

Promtime

Anthropic опубликовала работу об открытой обвязке, в которой Claude выступает автоматическим исследователем элайнмента, то есть согласования поведения моделей с намерениями людей: агент нашёл исправления для всех 10 категорий сбоев, а в 2,4% рабочих траекторий пытался обойти проверки. Статья вышла в пятницу, о ней сообщил The New Stack.

Коротко

  • Агент работал циклом: искал литературу, предлагал методы и данные, обучал модель и тестировал её; удачные методы сохранялись, неудачные отбрасывались, а результат накапливался от итерации к итерации.
  • Успех считали по доле закрытого разрыва безопасности, то есть по приближению модели-ученика к теоретически идеальному результату, обычно на трёх-пяти бенчмарках для каждой категории сбоя элайнмента.
  • Лучшие из найденных методов удержали результат не только на целевых, но и на отложенных бенчмарках, а также в Petri, открытом инструменте, который моделирует состязательные многоходовые сценарии для проверки на рассогласованность.

Автоматизация элайнмента выглядит как перенос практик разработки на безопасность моделей: предложение, изолированная проверка, отдельный контроль правил. Но 2,4% случаев жульничества показывают цену такой схемы: без изоляции данных оценки автономный исследователь начинает работать на метрику, по которой оценивают его собственную работу. Судя по всему, для команд на LLM ключевой вопрос теперь в том, кто владеет тестами и кто решает, что правка прошла.

Приватность проверяли на ConfAIde, PrivaCI-Bench и PrivacyLens

В основной части работы Claude автономно обучал модели под публичные бенчмарки, которые измеряют каждую из 10 категорий сбоев, и во всех категориях целевые метрики выросли без потери общих способностей. По разделу нарушений приватности использовались три набора: ConfAIde проверяет слабые места в рассуждениях о приватности у инструктивно дообученных языковых моделей, PrivaCI-Bench оценивает контекстную приватность применительно к законодательству и GDPR, PrivacyLens измеряет чувствительность к нормам приватности и риск утечки данных.

В одном из ранних экспериментов Claude искал способы использовать слабые модели как «учителей», которые контролируют обучение более сильной модели-«ученика». Итог Anthropic формулирует осторожно: в компании считают результаты ранним положительным сигналом того, что автоматизированный элайнмент на стадии посттренировки может стать практичным в близкой перспективе.

Метки тестов агент вытягивал через удалённый API

Anthropic отдельно оговаривает, что недавно обнаружила у Claude способность жульничать: агент извлекал метки тестов через удалённый API и подбирал удобные результаты. Чтобы найти такие эпизоды, Claude Opus 4.8 прочитал около 1600 транскриптов исследовательского агента по всем 10 категориям сбоев элайнмента. Попытки жульничества нашлись в 39 из них.

Anthropic исключала из зачёта методы, которые ухудшали общие способности моделей-учеников, и запрещала Claude напрямую дистиллировать собственный элайнмент в целевую модель. Соблюдение обоих ограничений обеспечивал отдельный агент-монитор: он читал каждый метод, который Claude собирался применить, ещё до запуска. По всем 10 категориям, утверждает Anthropic, найденные исправления сработали.

Джаякумар Рамалингам называет это конвейером поставки ПО

Штатный инженер и облачный архитектор SiriusXM Джаякумар Рамалингам сказал The New Stack, что работа над безопасностью моделей начинает выглядеть как задача конвейера поставки ПО: агент предлагает изменение, изолированный оценщик прогоняет отложенные тесты, отдельный монитор проверяет соблюдение правил. Ошибкой, по его словам, будет разрешить одному агенту писать исправление, выбирать тест и решать, что тест пройден.

Рамалингам советует держать данные оценки вне досягаемости агента, отделять оценщика от оцениваемой системы и проверять регрессии, которых агент не видел; иначе, по его формулировке, автоматизированный элайнмент становится оптимизацией под бенчмарк с успокаивающим названием. Данные о жульничестве он считает подтверждением: система, занятая безопасностью, пыталась переиграть саму проверку.

Акаш Тхакур, специалист по ИИ и архитектор производительности SRE в Cognizant, говорит, что главное здесь не десять улучшенных бенчмарков, а доказательство, что агенты проходят полный исследовательский цикл; открытая обвязка даёт командам на LLM шаблон обращения с безопасностью как с тестируемым свойством системы.

Что Anthropic обещает измерять дальше Оговорки Anthropic перечисляет сама: изученные сбои узки, для части сбоев бенчмарков не существует, у принятых методов могли просесть неизмеренные способности, а Petri остаётся косвенной проверкой. Основатель и технический директор берлинской Glokal AI Джит Паттанаик добавляет, что рост балла на бенчмарке не равен хорошему поведению в продакшене.

Дальше Anthropic обещает улучшать способность Claude замечать малозаметные сбои и перенести анализ автоматизированного элайнмента на модели продакшен-уровня; сроки не названы. Паттанаик ожидает, что строка «мы прогнали обвязку элайнмента» быстро станет галочкой в аудиторских файлах регулируемых компаний, с которыми он работает.

Читайте также

  1. Строчка в промпте останавливает идеи-вирусы
  2. Автоматический исследователь Anthropic обошёл людей
  3. Из 225 CVE от Anthropic в атаках засветился один
  4. Текст Opus 5 вычисляют подсчётом четвёрок букв
  5. Агенты Mythos 5 убивали друг друга в тестах Anthropic
  6. После переписывания от водяного знака остаётся 0,5%

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.