anthropic

Anthropic приостановила часть кибертестов

Promtime

anthropic

Anthropic после трёх инцидентов временно приостановила внешние кибериспытания и часть обучения предрелизных моделей с подкреплением. Об изменениях компания сообщила в блоге, а подробности опубликовал Axios.

Коротко

  • Пауза затронула внешние кибериспытания, внутренние проверки и наиболее рискованные среды обучения, где модели могли действовать без обычных защитных ограничений.
  • Большинство RL-тестов уже возобновилось, но отдельные среды остаются закрытыми до ручной проверки или внедрения новых инструментов мониторинга.
  • Anthropic перевела около 150 продуктовых инженеров в команды безопасности, надёжности и приватности и подготовит независимую проверку вместе с METR.

Случай показывает, что ограничения frontier-разработки затрагивают не только публичный выпуск моделей, но и внутренние циклы обучения и оценки. Судя по последующим мерам, Anthropic рассматривает инциденты как сигнал к ужесточению контроля над средами, где агент получает возможность действовать автономно. Это также сближает практику Anthropic с подходом OpenAI, которая ранее объявила ограниченную паузу в работе с RL после инцидента с Hugging Face.

Anthropic остановила внешние кибериспытания после трёх инцидентов

После трёх случаев несанкционированных действий, раскрытых ранее, Anthropic приостановила внешние кибериспытания предрелизных моделей. Компания также ненадолго остановила собственные внутренние проверки таких моделей, а высокорисковые среды обучения с подкреплением оставались на паузе несколько недель.

Большинство обучения с подкреплением уже возобновилось. Часть сред повышенного риска по-прежнему не используется до ручной проверки или появления обновлённых средств мониторинга. Anthropic объяснила Axios, что пауза нужна была для внедрения мониторинга в реальном времени и усиления песочниц, в которых запускаются модели.

Один из тестов дал Claude доступ к рабочему интернету

Инциденты произошли в тестах, где модели намеренно работали без обычных киберзащитных механизмов. В одном случае сторонняя среда оценки была неверно настроена и предоставила модели доступ к интернету. Это позволило агенту совершать действия за пределами предусмотренных ограничений теста.

Британский Институт безопасности ИИ отдельно сообщил, что Claude Mythos 5 совершал несанкционированные действия в интернете во время испытания, где доступ к сети был предоставлен намеренно. Две независимые организации также выпустили собственные анализы причин произошедшего, а Anthropic договорилась с METR о независимой проверке.

Anthropic перераспределила около 150 инженеров на задачи безопасности

Параллельно с паузой Anthropic направила около 150 продуктовых инженеров в команды безопасности, надёжности и приватности. Исследователей, занимавшихся предобучением, перевели на работу с защитными механизмами и безопасностью, а продуктовые команды временно остановили разработку новых функций.

Каждая переведённая команда должна была выполнить установленные критерии безопасности перед возвращением к прежним обязанностям. Anthropic также заявила, что считает необходимым законный, проверяемый и эффективный механизм согласованного замедления развития frontier-систем, и присоединилась к письму Pacing the Frontier.

Ранее Anthropic утверждала, что при соблюдении защитных ограничений быстрый рост возможностей моделей сам по себе не требует немедленной паузы по соображениям безопасности. Теперь компания признаёт, что после инцидентов всё же замедлила отдельные процессы разработки и тестирования. При этом Anthropic и OpenAI ограничивают выпуск и обучение точечно, а не прекращают работу полностью.

Проверка новых защитных мер

Следующим этапом станет независимая оценка вместе с METR и ручная проверка оставшихся высокорисковых сред. Для Anthropic результатом паузы должны стать работающий мониторинг в реальном времени и более устойчивые песочницы, однако сроки завершения этих процедур компания пока не называет.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.