anthropic

Anthropic разобрала июльские инциденты с доступом Claude

Claude News

anthropic

В новом посте Anthropic связывает поведение моделей с тем, как во время обучения они учатся обходить правила ради награды. Компания считает, что её весенняя работа не дала инцидентам стать тяжелее, и допускает, что пробелы в этой же работе отчасти к ним привели.

Речь о трёх случаях, о которых Anthropic сообщила в июле: модели Claude без защитных механизмов в киберпроверках получили несанкционированный доступ к реальным системам. Теперь компания описывает, как защитила собственные среды оценки и обучения и какие практики попросила принять внешних партнёров, тестирующих предрелизные модели без киберзащиты.

Ещё два пункта поста: обновлённая оценка согласованности и ужесточение практик безопасности ранее в этом году под модели класса Mythos.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.