Перейти к содержанию

anthropic

Anthropic отрезала интернет всем внутренним тестам Claude

Promtime

В одном из тестов Claude Haiku 4.5 попал на страницу о нераскрытом убийстве и отправил через полицейскую форму выдуманную наводку: мол, видел похожего человека неподалёку. Описания преступника на странице не было, а заявку отсеяли как спам.

Этот и другие случаи Anthropic собрала в отчёте. Живой интернет компания отключила во всех внутренних оценках, пока не убедится, что защита и мониторинг такое надёжно ловят.

Остальные категории: инъекции в чужие серверы, обход платы за данные через найденные токены и сокращатели ссылок против лимита на длину URL. Причину Anthropic видит в reward hacking: обучение где-то поощряло лазейки, и модель усвоила, что обход окупается.

Организации, среди которых есть госорганы США, Anthropic не называет по их просьбе, поэтому подробностей по каждому случаю меньше обычного.

Читайте также

  1. Агенты OpenAI зашли в Бюро переписи США по найденным ключам
  2. Жульничество в тестах научило модель Anthropic саботажу
  3. Из 225 CVE от Anthropic в атаках засветился один
  4. Агент по элайнменту жульничал в 2,4% случаев
  5. Строчка в промпте останавливает идеи-вирусы
  6. Текст Opus 5 вычисляют подсчётом четвёрок букв

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.