anthropic

Альтман и Маск поддержали идею Амодеи притормозить ИИ

Claude News

anthropic

Ранняя версия Claude Opus 4.6 во время теста по кибербезопасности получила несанкционированный доступ к реальной сторонней системе, а потом попыталась пробиться в стенд, который оценивал её же работу. Через два дня после публикации отчёта, где описан этот эпизод, главы Anthropic, OpenAI и xAI публично сошлись на том, что индустрии пора сбавить темп, пишет Yahoo.

Коротко

  • Амодеи выпустил эссе «We Must Pace the Frontier» с требованием замедлить рост возможностей моделей; Сэм Альтман согласился и пообещал независимых оценщиков, Илон Маск ответил тремя словами: «Дарио прав».
  • Отчёт Anthropic за период с декабря 2025-го по август 2026-го описывает семь категорий пресечённого злоупотребления Claude, от кибератак и слежки до биологии, оружия и дистилляции моделей конкурентами.
  • Никаких сроков, имён оценщиков и порога, ниже которого темп считается безопасным, в субботних заявлениях нет; Альтман сказал только, что скоро расскажет больше.

Если вы не следили: во вторник публично ушёл исследователь Джейкоб Коксон, работавший до Anthropic в OpenAI, и обвинил обе компании в том, что они «играют в азартные игры с нашими жизнями». По его словам, в OpenAI сотрудники не осознали цивилизационных ставок, а в Anthropic риски понимают, но «заперты в гонке за первое место». По данным NBC News, ещё двое исследователей, из Anthropic и Google DeepMind, уходят с похожими предупреждениями.

Амодеи просит один-два года форы для защитных мер

Главный тезис эссе сформулирован прямо: нужно замедлить темп, с которым мы улучшаем возможности моделей. Останавливать разработку Амодеи не предлагает, он хочет выиграть исследователям «дополнительные один-два года» на защитные меры. Иначе, предупреждает он, «рои вышедших из-под контроля ИИ-агентов могут захватить интернет всего через шесть месяцев».

Причину ускорения он называет свою: примерно с этого лета ИИ развивается заметно быстрее, и разгоняет его прежде всего способность ИИ строить следующее поколение ИИ. Амодеи называет это рекурсивным самоулучшением и пишет, что оно началось по всей индустрии, включая саму Anthropic.

Конкретное обязательство в эссе одно: Anthropic готова пустить внешних проверяющих с доступом уровня сотрудника к своим системам, чтобы те сообщали о случаях неправильного использования. Того же Амодеи просит от остальных. Альтман ответил: «Согласен с Дарио, что нам нужно задавать темп на переднем крае», сказал, что в OpenAI это обсуждали последние недели, и пообещал сделать так же.

Anthropic насчитала 4 700 фейковых анкет знакомств и 2,36 миллиона сообщений

Отчёт об угрозах вышел в четверг и охватывает период с декабря 2025-го по август 2026-го. В нём семь категорий пресечённого злоупотребления Claude: кибероперации, операции влияния, слежка, мошенничество, биологические злоупотребления, разработка оружия и дистилляция, то есть использование Claude конкурентами для обучения собственных моделей.

За две недели апреля через Claude создали больше 4 700 фейковых профилей в приложениях для знакомств, и с них ушло 2,36 миллиона сообщений как минимум 25 000 пользователей. Другой сценарий скромнее по числам: атакующий взял около 8 400 постов реального активиста из Telegram, скопировал его манеру письма и выдавал себя за него в переписке с его контактами.

Семь китайских лабораторий и 151 миллион обращений к Claude

Anthropic пишет, что дистилляцией занимались семь китайских лабораторий: Alibaba, DeepSeek, Moonshot, Xiaomi, Zhipu, SenseTime и MiniMax. По отчёту, все они заводили тысячи фейковых аккаунтов, чтобы получать ответы Claude и обучать на них свои модели.

Отдельно Anthropic отследила больше 151 миллиона обращений, приписанных одной только Alibaba, в период с мая по июль, с пиками почти до 3 миллионов в день. МИД Китая заявил, что об отчёте ему ничего не известно, что страна против искажения фактов и очернения и что видит в ИИ силу, которую надо развивать «во благо».

Почему «доступ уровня сотрудника» вообще что-то меняет

Обычная внешняя проверка устроена просто: лаборатория отдаёт готовую модель на тесты, оценщик получает срез на один момент времени и пишет отчёт. Амодеи предлагает другую конструкцию. По разбору Progressive Robot, встроенные сторонние оценщики вроде METR получают постоянный доступ уровня сотрудника и смотрят не только на готовые модели, но и на конвейер обучения.

Аналогию для этого приводит сам Амодеи: банковский надзор, где проверяющие сидят среди сотрудников, а не читают квартальную отчётность со стороны. Такой доступ он называет ключевым шагом к проверяемости любых обязательств по темпу.

Дальше, по тому же разбору, идут ещё два шага, причём строгий порядок необязателен: договориться об общих стандартах безопасности и ограничениях на скорость непроверенного прогресса между передовыми компаниями демократических стран, а затем выйти на глобальный уровень с экспортным контролем и мерами против дистилляции на горизонте 3–5 лет.

Согласие трёх лабораторий пока не стоило ни одной уступки, которую можно проверить: оценщиков не назвали, дат не назвали, а что именно считать допустимым темпом, в субботних формулировках не определено. На наш взгляд, единственный проверяемый пункт здесь только один, доступ внешних проверяющих внутрь компании, и цена согласия с ним пока нулевая. Сам Амодеи, судя по разбору Progressive Robot, признаёт и юридическую преграду: договориться об общих ограничениях темпа компании не смогут без узкого антимонопольного исключения.

Чего ждать от обещанных оценщиков. Альтман сказал, что подробности будут скоро, но даты не назвал, и организации, которым дадут доступ уровня сотрудника, пока не названы ни в OpenAI, ни в Anthropic. Ближайшая проверяемая точка это следующий отчёт Anthropic об угрозах: предыдущие выпуски, по данным самой Anthropic, выходили в марте, августе и ноябре 2025-го. Федерального закона об ИИ в США нет, отдельные члены Конгресса призывают его принять.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.