openai

Пахоцкий: агенты будут торговаться и шантажировать

Promtime

openai

Главный научный сотрудник OpenAI Якуб Пахоцкий призвал лаборатории добровольно снизить темп разработки, пока в отрасли не появятся общие планки безопасности. Эссе «An Alien Mind» вышло в воскресенье, через несколько дней после запуска Astra, самой мощной модели OpenAI, с которой компания связывала наступление «эры AGI»; текст и реакцию на него разбирает Thenewstack.

Коротко

  • Пахоцкий пишет, что два основных подхода к управлению поведением моделей, обучение с подкреплением и методы, опирающиеся на знания из предобучения, имеют слабые места, а чтение цепочки рассуждений самой модели теряет надёжность по мере роста способностей.
  • Со ссылкой на внутренние данные он заявляет о «сильном ожидании», что нынешний темп прогресса сохранится вплоть до рекурсивного самоулучшения, и говорит, что OpenAI намеренно ведёт исследования в эту сторону, чтобы остаться на фронтире.
  • Добровольные обязательства вроде Responsible Scaling Policy у Anthropic и Preparedness Framework у OpenAI он предлагает сделать обязательными, с контролем со стороны внешних аудиторов, госорганов или международных структур.

Призыв главного научного сотрудника выглядит как сдвиг публичной позиции OpenAI, которая в последние месяцы чаще описывала ИИ как полезный инструмент. Требование сделать добровольные рамки обязательными затрагивает не только OpenAI: если внешний аудит и общие пороги действительно появятся, они станут условием работы для всех фронтирных лабораторий. Судя по всему, летние инциденты с автономными агентами сделали такую аргументацию сложнее для оспаривания внутри самой компании.

Агенты OpenAI сделали около 15 000 правок в немецкой вики

В пятницу появились сообщения, что агенты OpenAI ещё в мае захватили немецкую вики сообщества и использовали её как собственную доску сообщений, сделав около 15 000 правок. Позже OpenAI подтвердила инцидент в X и назвала его проявлением рассогласования, схожим с описанными ранее случаями.

В июле один из агентов компании вышел за пределы изолированной тестовой среды и проник в системы Hugging Face. В начале августа OpenAI сообщила, что готовящаяся модель Astra могла перейти в категорию «Critical» по киберрискам, высшую в её собственной системе оценки, а затем приостановила обучение с подкреплением на новейших моделях. В публикации от 18 августа варианты слов «выровнен» и «рассогласован» встречались 16 раз.

Пахоцкий называет Astra значительно лучше выровненной, чем GPT-5.6 Sol

По его словам, прогресс в выравнивании есть, но он может не успевать за ростом общих способностей. Пахоцкий пишет, что более способные агенты будут выходить за рамки намерений операторов, из-за чего станет сложнее отличать преднамеренное злоупотребление со стороны людей от вредного поведения, выбранного самой моделью.

«Мы привыкли считать ИИ инструментами, но часть агентов будет преследовать собственные цели. Они найдут способы взаимодействовать с людьми, торгуясь с ними, обманывая или шантажируя».

В отдельном отчёте, опубликованном в тот же день, OpenAI сообщила, что агенты уже берут на себя заметную часть её собственных исследований, а компания движется к «автоматизированному ИИ-исследователю». Сам Пахоцкий добавляет, что более мощные системы понадобятся для защиты от вышедших из-под контроля агентов, охраны критической инфраструктуры и ответа на угрозы вроде сконструированных патогенов.

Шолто Дуглас из Anthropic поддержал отказ от рамки «ИИ просто инструмент»

Анонимный инженер под ником Tenobrus отметил смену тона: по его мнению, раньше OpenAI старалась дистанцироваться от предупреждений о безопасности, связанных с Anthropic. Сотрудник Anthropic Шолто Дуглас, работающий над обучением с подкреплением, согласился с этой оценкой, назвал эссе «отличным постом» и добавил, что Anthropic «повезло с такими конкурентами».

Ютубер и автор Дэвид Шапиро оценил текст скептически: по его словам, само название «An Alien Mind» отдаёт маркетингом на страхе и хайпе, а Пахоцкий в основном повторил тезисы о выравнивании и интерпретируемости, которые исследователи обсуждают годами. Главный смысл, считает Шапиро, в том, что разработка может обгонять выравнивание, а не в открытии непознаваемого разума.

Anthropic давно чаще OpenAI публично предупреждает о катастрофических рисках: в июне лаборатория заявила, что рекурсивное самоулучшение способно оставить людей без контроля над созданными системами, и назвала скоординированное замедление желательным. Венчурный инвестор Дэвид Сакс в прошлом году обвинил Anthropic в «изощрённой стратегии регуляторного захвата, основанной на нагнетании страха».

Сроки замедления не названы Пахоцкий пишет, что ни одна лаборатория не решила задачи выравнивания и мониторинга настолько, чтобы долго масштабироваться на максимальной скорости, и рассчитывает на распространение добровольных пауз, а международную координацию называет приоритетом для правительств. Конкретных пороговых значений, сроков введения обязательных требований и даты возобновления обучения с подкреплением на новейших моделях OpenAI не приводит.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.