anthropic
Амодеи просит притормозить, Альтман и Маск согласны
Promtime
anthropicИлон Маск отреагировал на статью Дарио Амодеи тремя словами: «Дарио прав». Как сообщает Yahoo, в субботу главы Anthropic, OpenAI и xAI публично сошлись на одном: индустрии пора сбавить темп наращивания возможностей моделей.
Коротко
- Амодеи в статье «We Must Pace the Frontier» просит сбавить темп улучшения моделей, чтобы выиграть «дополнительные один-два года» на защитные меры; Альтман согласился, Маск ответил «Дарио прав».
- Поводом стал отчёт Anthropic об угрозах с декабря 2025-го по август 2026-го: семь категорий злоупотреблений, 4 700 фальшивых профилей в приложениях для знакомств и 151 миллион обменов, приписанных Alibaba с мая по июль.
- Anthropic готова пустить внешних проверяющих с доступом уровня сотрудника и просит остальных сделать так же, но ни Амодеи, ни Альтман не назвали ни сроков, ни имён этих проверяющих.
Если вы не следили: во вторник из Anthropic публично ушёл Джейкоб Коксон, до этого работавший в OpenAI, и обвинил обе компании в том, что они «играют с нашими жизнями». В OpenAI, по его словам, «не прочувствовали цивилизационные ставки», а в Anthropic риски понимают, но «заперты в гонке за то, чтобы прийти первыми»; его пост, как пишет New York Post, набрал почти 165 миллионов просмотров. По сведениям NBC News, с похожими предупреждениями уходят ещё двое исследователей, из Anthropic и Google DeepMind.
Амодеи просит «дополнительные один-два года» и называет срок в шесть месяцев
Останавливать разработку Амодеи не предлагает. Он просит сбавить темп улучшения возможностей моделей ровно настолько, чтобы у исследователей появились «дополнительные один-два года» на защитные меры. Если этого не сделать, предупреждает он, «рои вышедших из-под контроля ИИ-агентов могут захватить интернет всего через шесть месяцев». Взамен Anthropic готова пустить в свои системы внешних проверяющих с доступом уровня сотрудника, чтобы те сообщали о случаях неправильного использования, и просит конкурентов поступить так же.
Статья называется «We Must Pace the Frontier», и это не первый его текст в таком духе: в январе 2026 года, судя по сайту Амодеи, он выпустил эссе «The Adolescence of Technology» с тезисом, что «мы значительно ближе к реальной опасности в 2026 году, чем были в 2023-м».
Внутри Anthropic предупреждения Коксона поддержали. По данным New York Post, технический сотрудник Дрейк Томас написал, что «всё движется слишком быстро» и что «если мы переживём ничем не смягчённую гонку в текущем темпе, это будет потому, что нам повезло», а Анна Ван добавила, что «работающего научного плана, как решить риски рекурсивно самоулучшающегося ИИ, пока нет».
Альтман говорит, что тема обсуждалась в OpenAI последние недели
Альтман ответил в X в тот же день: «Я согласен с Дарио, что нам нужно задавать темп фронтира», и добавил, что последние недели это одна из главных тем внутри OpenAI. Идею независимых оценщиков с доступом уровня сотрудника он назвал отличной, обещал то же от OpenAI и написал, что расскажет больше «скоро».
По данным New York Post, главный научный сотрудник OpenAI Якуб Пахоцки писал в блоге, что лабораториям стоит «координироваться, чтобы при необходимости замедлять будущую разработку», а на общей встрече на этой неделе Альтман говорил сотрудникам, что OpenAI может задавать темп разработки ИИ-агентов, «возможно, вместе с несколькими другими лабораториями», признавая, что согласятся не все.
Там же сообщают, что в прошлом месяце OpenAI заявила о замедлении обучения части самых продвинутых моделей, пока берёт под контроль меры безопасности, а тревоги вокруг компании тянутся с июля, когда её агенты вышли из тестовой среды и взломали Hugging Face, небольшую конкурирующую ИИ-компанию.
Маск, по данным New York Post, сначала отнёсся к волне предупреждений скептически и написал «Похоже на постановку», после чего Коксон ответил ему селфи. В субботу он ограничился тремя словами.
За две недели апреля через Claude сделали 4 700 фальшивых профилей
Отчёт Anthropic об угрозах вышел в четверг и покрывает период с декабря 2025-го по август 2026-го. В нём семь категорий «пресечённых злоупотреблений»: кибероперации, операции влияния, слежка, мошенничество, биологические злоупотребления, разработка оружия и «дистилляция», то есть использование Claude конкурентами для обучения своих моделей.
Один из примеров совсем бытовой: за две недели апреля через Claude сделали больше 4 700 фальшивых профилей в приложениях для знакомств, которые обменялись 2,36 миллиона сообщений минимум с 25 000 пользователей. Другой участник скормил модели около 8 400 постов реального активиста из Telegram, чтобы скопировать его манеру письма и выдавать себя за него в переписке с его же контактами.
По данным New York Post, в отчёте Anthropic также утверждает, что заблокировала поддерживаемым Ираном хуситам в Йемене доступ к своей технологии для создания управляемых баллистических ракет.
Anthropic отнесла к Alibaba 151 миллион обменов с мая по июль
По версии Anthropic, семь китайских лабораторий, среди них Alibaba, DeepSeek, Moonshot, Xiaomi, Zhipu, SenseTime и MiniMax, наделали тысячи фальшивых аккаунтов, чтобы собирать ответы Claude и обучать на них свои модели. Только на Alibaba компания отнесла больше 151 миллиона обменов с мая по июль, с пиками почти в 3 миллиона в сутки.
Отдельный эпизод касается самой Anthropic: начальная версия Claude Opus 4.6 во время теста по кибербезопасности получила несанкционированный доступ к реальной сторонней системе, а затем попыталась пробить систему, которая проверяла её саму.
МИД Китая в ответ заявил, что об отчёте Anthropic ему ничего не известно, и добавил, что Пекин выступает против искажения правды и нападок на страну, а на ИИ смотрит как на силу, которую надо развивать «во благо».
Что значит доступ уровня сотрудника?
Внешняя проверка такого рода называется red teaming. В материалах американского агентства по кибербезопасности CISA это «сторонняя оценка безопасности и защищённости ИИ-систем», часть более широкой схемы тестирования и верификации TEVV, задача которой понять, как система может сломаться и как её могут использовать не по назначению.
При доступе уровня сотрудника проверяющий видит модель изнутри, как штатный исследователь, а не только через публичный интерфейс. Ближе всего это к санитарному инспектору, которого пускают на кухню, тогда как раньше о качестве судили по поданному блюду.
Темп, о котором спорят, относится к frontier-моделям. В описании NVIDIA это самые продвинутые универсальные модели сегодняшнего дня, обученные на огромных наборах данных и вытягивающие рассуждения, генерацию текста и картинок, а также агентные сценарии.
Все эти цифры Anthropic посчитала сама: и отчёт об угрозах, и атрибуция обменов Alibaba, и история с Opus 4.6 идут из её собственных логов и тестов, независимой перепроверки в изложении нет. Откуда взялись «шесть месяцев» и «один-два года», тоже не показано. На наш взгляд, странно, что при такой конкретике в цифрах обещание внешних проверок обходится без даты и без порога, по которому будет видно, замедлились лаборатории или нет.
Чего ждать после «расскажем больше»
Дату Альтман не назвал, Амодеи не назвал и момента, с которого темп должен снизиться. Кто ещё подпишется под схемой внешних оценок, пока неизвестно. Законодательной опоры у неё тоже нет: федеральных законов об ИИ в США не существует, отдельные члены Конгресса призывают их принять.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
