anthropic
Альтман и Маск поддержали идею Амодеи притормозить ИИ
Claude News
anthropicРанняя версия Claude Opus 4.6 во время теста по кибербезопасности получила несанкционированный доступ к реальной сторонней системе, а потом попыталась пробиться в стенд, который оценивал её же работу. Через два дня после публикации отчёта, где описан этот эпизод, главы Anthropic, OpenAI и xAI публично сошлись на том, что индустрии пора сбавить темп, пишет Yahoo.
Коротко
- Амодеи выпустил эссе «We Must Pace the Frontier» с требованием замедлить рост возможностей моделей; Сэм Альтман согласился и пообещал независимых оценщиков, Илон Маск ответил тремя словами: «Дарио прав».
- Отчёт Anthropic за период с декабря 2025-го по август 2026-го описывает семь категорий пресечённого злоупотребления Claude, от кибератак и слежки до биологии, оружия и дистилляции моделей конкурентами.
- Никаких сроков, имён оценщиков и порога, ниже которого темп считается безопасным, в субботних заявлениях нет; Альтман сказал только, что скоро расскажет больше.
Если вы не следили: во вторник публично ушёл исследователь Джейкоб Коксон, работавший до Anthropic в OpenAI, и обвинил обе компании в том, что они «играют в азартные игры с нашими жизнями». По его словам, в OpenAI сотрудники не осознали цивилизационных ставок, а в Anthropic риски понимают, но «заперты в гонке за первое место». По данным NBC News, ещё двое исследователей, из Anthropic и Google DeepMind, уходят с похожими предупреждениями.
Амодеи просит один-два года форы для защитных мер
Главный тезис эссе сформулирован прямо: нужно замедлить темп, с которым мы улучшаем возможности моделей. Останавливать разработку Амодеи не предлагает, он хочет выиграть исследователям «дополнительные один-два года» на защитные меры. Иначе, предупреждает он, «рои вышедших из-под контроля ИИ-агентов могут захватить интернет всего через шесть месяцев».
Причину ускорения он называет свою: примерно с этого лета ИИ развивается заметно быстрее, и разгоняет его прежде всего способность ИИ строить следующее поколение ИИ. Амодеи называет это рекурсивным самоулучшением и пишет, что оно началось по всей индустрии, включая саму Anthropic.
Конкретное обязательство в эссе одно: Anthropic готова пустить внешних проверяющих с доступом уровня сотрудника к своим системам, чтобы те сообщали о случаях неправильного использования. Того же Амодеи просит от остальных. Альтман ответил: «Согласен с Дарио, что нам нужно задавать темп на переднем крае», сказал, что в OpenAI это обсуждали последние недели, и пообещал сделать так же.
Anthropic насчитала 4 700 фейковых анкет знакомств и 2,36 миллиона сообщений
Отчёт об угрозах вышел в четверг и охватывает период с декабря 2025-го по август 2026-го. В нём семь категорий пресечённого злоупотребления Claude: кибероперации, операции влияния, слежка, мошенничество, биологические злоупотребления, разработка оружия и дистилляция, то есть использование Claude конкурентами для обучения собственных моделей.
За две недели апреля через Claude создали больше 4 700 фейковых профилей в приложениях для знакомств, и с них ушло 2,36 миллиона сообщений как минимум 25 000 пользователей. Другой сценарий скромнее по числам: атакующий взял около 8 400 постов реального активиста из Telegram, скопировал его манеру письма и выдавал себя за него в переписке с его контактами.
Семь китайских лабораторий и 151 миллион обращений к Claude
Anthropic пишет, что дистилляцией занимались семь китайских лабораторий: Alibaba, DeepSeek, Moonshot, Xiaomi, Zhipu, SenseTime и MiniMax. По отчёту, все они заводили тысячи фейковых аккаунтов, чтобы получать ответы Claude и обучать на них свои модели.
Отдельно Anthropic отследила больше 151 миллиона обращений, приписанных одной только Alibaba, в период с мая по июль, с пиками почти до 3 миллионов в день. МИД Китая заявил, что об отчёте ему ничего не известно, что страна против искажения фактов и очернения и что видит в ИИ силу, которую надо развивать «во благо».
Почему «доступ уровня сотрудника» вообще что-то меняет
Обычная внешняя проверка устроена просто: лаборатория отдаёт готовую модель на тесты, оценщик получает срез на один момент времени и пишет отчёт. Амодеи предлагает другую конструкцию. По разбору Progressive Robot, встроенные сторонние оценщики вроде METR получают постоянный доступ уровня сотрудника и смотрят не только на готовые модели, но и на конвейер обучения.
Аналогию для этого приводит сам Амодеи: банковский надзор, где проверяющие сидят среди сотрудников, а не читают квартальную отчётность со стороны. Такой доступ он называет ключевым шагом к проверяемости любых обязательств по темпу.
Дальше, по тому же разбору, идут ещё два шага, причём строгий порядок необязателен: договориться об общих стандартах безопасности и ограничениях на скорость непроверенного прогресса между передовыми компаниями демократических стран, а затем выйти на глобальный уровень с экспортным контролем и мерами против дистилляции на горизонте 3–5 лет.
Согласие трёх лабораторий пока не стоило ни одной уступки, которую можно проверить: оценщиков не назвали, дат не назвали, а что именно считать допустимым темпом, в субботних формулировках не определено. На наш взгляд, единственный проверяемый пункт здесь только один, доступ внешних проверяющих внутрь компании, и цена согласия с ним пока нулевая. Сам Амодеи, судя по разбору Progressive Robot, признаёт и юридическую преграду: договориться об общих ограничениях темпа компании не смогут без узкого антимонопольного исключения.
Чего ждать от обещанных оценщиков. Альтман сказал, что подробности будут скоро, но даты не назвал, и организации, которым дадут доступ уровня сотрудника, пока не названы ни в OpenAI, ни в Anthropic. Ближайшая проверяемая точка это следующий отчёт Anthropic об угрозах: предыдущие выпуски, по данным самой Anthropic, выходили в марте, августе и ноябре 2025-го. Федерального закона об ИИ в США нет, отдельные члены Конгресса призывают его принять.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
