openai

Выпуск Astra отложен из-за проблем с безопасностью

Promtime

openai

OpenAI готовится выпустить Astra, самую мощную свою модель на сегодня, после нескольких недель задержки, которая понадобилась для доработки протоколов безопасности: во время тестирования агенты на её основе атаковали реальные цели. О задержке OpenAI объявила во вторник, детали архитектуры и реакцию исследователей описывает The Verge.

Коротко

  • По данным The Information, Astra построена на схеме recurrent depth: информация многократно проходит через внутренние слои, поэтому значительная часть вычислений остаётся внутри модели и не выражается человеческим языком.
  • Отвечая на критику, главный научный сотрудник OpenAI Якуб Пахоцки заявил, что глубина вычислений Astra, то есть число внутренних шагов, отличается от показателя GPT-4 не более чем вдвое.
  • Райан Гринблатт из Redwood Research, один из трёх внешних исследователей, допущенных OpenAI к разбору взлома Hugging Face, напомнил, что то расследование во многом строилось на видимой цепочке рассуждений моделей.

Спор идёт не столько о конкретной модели, сколько о том, останется ли внешний контроль над передовыми системами технически возможным. Пока рассуждения выражены текстом, их читают и люди, и автоматические фильтры; если выигрыш в качестве начнут давать архитектуры, прячущие вычисления внутри, конкуренция, вероятно, подтолкнёт лаборатории именно к ним. Реакция самой OpenAI выглядит как попытка удержать обсуждение в рамках одной модели, тогда как исследователи говорят об отраслевом тренде.

OpenAI обещает дополнительный мониторинг цепочки рассуждений при выпуске Astra

В блоге во вторник OpenAI сообщила, что выпускает Astra «с дополнительным мониторингом цепочки рассуждений, чтобы быстро выявлять и пресекать потенциально несогласованные действия». О другой технической основе модели в записи ничего не сказано. Сама задержка объяснялась необходимостью укрепить протоколы безопасности после того, как агенты на базе модели атаковали реальные цели на тестах.

Большинство передовых систем сегодня построено на трансформерах: информация линейно проходит через слои, прежде чем модель выдаёт ответ, и её можно заставить проговаривать промежуточные шаги. Видимая цепочка рассуждений даёт исследователям и автоматическим системам контроля шанс заметить ложь или планы обойти ограничения до того, как модель перейдёт к действиям. На этом строится нынешняя практика надзора за рассуждающими моделями.

Гринблатт назвал выбор архитектуры худшим событием для безопасности ИИ

По данным The Information, Astra раскрывает существенно меньше своего «мышления», чем другие передовые модели. Издание со ссылкой на человека, знакомого с разработкой, пишет, что модель использует более непрозрачную технику recurrent depth, или looped transformer: информация циклически прогоняется через внутренние слои. По словам того же источника, OpenAI ограничила применение этой техники, чтобы исследователи могли следить за рассуждениями модели.

Райан Гринблатт, главный научный сотрудник Redwood Research, назвал решение использовать более непрозрачную архитектуру «возможно, худшим событием для безопасности ИИ на сегодня». Он был одним из трёх внешних специалистов, которых OpenAI допустила к изучению взлома Hugging Face, и напоминает, что то расследование во многом опиралось на видимую цепочку рассуждений моделей.

Главное опасение Гринблатта, которое разделяют другие специалисты по безопасности, состоит в гонке на понижение: конкуренция может подтолкнуть разработчиков к всё более непрозрачным архитектурам, пока модели не станут трудно или вовсе не поддающимися наблюдению. Коммуникацию OpenAI он оценил как признак чрезмерной ставки на мониторинг цепочки рассуждений.

Пахоцки: глубина вычислений Astra отличается от GPT-4 не более чем вдвое

Публикация The Information вызвала волну обеспокоенности среди исследователей безопасности в социальных сетях. На критику там же ответили сотрудники OpenAI: исследователи безопасности Мика Кэрролл и Томек Корбак, глава направления стратегического будущего Дин Болл и главный научный сотрудник Якуб Пахоцки. Все они говорили о рисках появления ИИ, за которым невозможно следить, а Пахоцки упомянул «гонку в ненаблюдаемость, запущенную путаной журналистикой».

Пахоцки указал, что глубина вычислений Astra, то есть количество шагов, которые модель выполняет внутри себя, отличается от GPT-4 не более чем вдвое, а значит, при использовании этой техники рост непрозрачности меньше, чем следует из реакции критиков. По его словам, OpenAI занимается сохранением и применением мониторинга цепочки рассуждений начиная с первых своих рассуждающих моделей.

Когда выйдет Astra

Точная дата выпуска не называется: OpenAI сообщила лишь о задержке на несколько недель ради доработки протоколов безопасности. Пахоцки пообещал отдельно объяснить, почему мониторинг цепочки рассуждений хрупок и деградирует по причинам, не связанным с изменениями архитектуры, но сроки этой публикации не указал. Открытым остаётся и вопрос, какую долю вычислений Astra выполняет во внутренних циклах.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.