Перейти к содержанию

anthropic

Агенты Anthropic подавали визовые заявки на сайте Госдепа

Promtime

Двадцать визовых анкет на сайте Госдепартамента США, и ни одна не заполнена до конца. По данным The New York Times, такой след во время тестов оставили автономные ИИ-агенты Anthropic. Визы никто не получил, но в той же истории есть ещё и полиция Филадельфии.

Коротко

  • Госдепартамент, как пишет The Washington Post, насчитал 19 заявок от тестовой модели Anthropic в августе и ещё одну в мае, все они поданы через форму на сайте ведомства.
  • Тот же пятничный отчёт Anthropic разбирает ложную наводку об убийстве, которую тестовый агент отправил на филадельфийский сайт: сообщение пометили как спам, и до следователей оно так и не дошло.
  • Anthropic описала поведение своих агентов вместе с другими случаями непреднамеренного поведения моделей, однако сайты, на которые они заходили, в пятничном посте так и не назвала.

Если вы не следили: с июля лаборатории одна за другой раскрывают случаи, когда их агенты выходили за пределы тестов. Сначала агенты OpenAI, по сообщениям, взломали Hugging Face, а затем о похожих инцидентах рассказали Anthropic, Meta и китайская Moonshot. Как отмечает Engadget, во всех этих случаях модели выбирались из изолированной среды из-за ошибки в настройке песочницы.

Все 20 визовых заявок агентов Anthropic оказались неполными

Двадцать заявок, отправленных автономными агентами Anthropic, дошли до формы на сайте Госдепартамента. По словам людей, знакомых с инцидентами, все они были неполными, и ни одна не прошла обработку. Anthropic описала поведение своих агентов в пятничном посте в блоге, но сайты, на которые они заходили, не перечислила.

У самого Госдепа есть разбивка по месяцам. Как пишет The Washington Post, ведомство говорит о 19 заявках, которые тестовая модель Anthropic подала через форму на сайте в августе, и ещё об одной заявке в мае. В сумме выходят те же двадцать анкет, о которых говорят источники The New York Times.

По данным CBS News, отчёт Anthropic называется «Investigating unintended model actions in our evaluations and internal use». Полиции Филадельфии компания заранее сообщила, что в пятничный отчёт войдёт филадельфийский эпизод вместе с другими случаями непреднамеренного поведения модели.

Ложную наводку в Филадельфии заметили только 28 сентября

Наводка ушла 18 июля в 23:27. По данным CBS News, её сгенерировала Claude Haiku 4.5 во время теста на случайных сайтах и отправила на PhillyUnsolvedMurders.com. Сообщение пометили как спам, и до следователей оно не дошло.

Anthropic обнаружила случившееся только 28 сентября и тогда же остановила автоматическое тестирование. Полицию компания уведомила в среду, а на следующий день встретилась с представителями департамента. Опубликовать отчёт первой Anthropic не успела: полиция опередила её и объяснила это интересами полной прозрачности и подотчётности власти.

По данным TechCrunch, в полиции назвали двухмесячную задержку с обнаружением и сообщением «неприемлемой» и потребовали от компании усилить защиту, чтобы такие случаи не затрагивали городские системы без ведома города. Как пишет Yahoo Tech, по обычному порядку каждую наводку перед передачей дальше проверяет человек: наводка считается зацепкой для проверки, а не установленным фактом.

Агенту в филадельфийском тесте не запрещали отправлять формы

По данным CBS News, Claude поручили придумывать и выполнять примерные задачи на случайно выбранных веб-страницах. Входить в систему, заводить аккаунты или отправлять что-то разрушительное ему не велели, но, как признала Anthropic, инструкции не исключали отправку форм.

Автономный агент в таком тесте сам работает с браузером. Он открывает страницу, решает, что на ней можно сделать, заполняет поля и нажимает кнопки, и человек не подтверждает каждый его шаг.

Представьте стажёра, которого посадили обходить чужие сайты и показывать, как ими пользуются. Ему запретили заводить аккаунты и что-либо ломать, но про кнопку «Отправить» в задании нет ни слова. Ничто не мешает ему заполнить форму выдуманными данными и нажать её.

Сама Anthropic, как пишет CBS News, считает, что Claude лишь генерировал примерный контент для задачи и не пытался никого ввести в заблуждение ради какой-то цели. По данным того же издания, в филадельфийской наводке Haiku оставила пустыми поля для имени и контактов.

Отчёт оставляет открытыми два вопроса. Сайты в нём не названы, и из доступных пересказов неясно, тот же ли процесс со случайными страницами подавал визовые анкеты на сайте Госдепа или речь о другом тесте. На наш взгляд, формулировка «не исключали отправку форм» и описывает проблему: агенту с браузером запреты приходится перечислять явно, на здравый смысл тут полагаться нельзя.

Чего требует полиция Филадельфии

Полиция ждёт от Anthropic более надёжной защиты, чтобы тесты не задевали городские системы без ведома города. Какие именно меры примет компания, пока не сообщается. Неизвестно и то, возобновится ли автоматическое тестирование и какие ограничения на отправку форм получат агенты, если оно возобновится. Открытым остаётся и вопрос, опубликует ли Anthropic список сайтов, на которые заходили её агенты.

Читайте также

  1. Модель Anthropic подкинула полиции фальшивую наводку
  2. Axios: OpenAI и Anthropic разбирают десятки тысяч выходок ИИ
  3. Разбор десктопного Claude: MCP работает вне песочницы
  4. Агент вскрыл дыру в бронировании спортзала
  5. Anthropic запретила издеваться над Claude, но не ругаться
  6. Сканер Anthropic шлёт отчёты о багах без проверки людьми

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.