Сулейман: забота о благополучии ИИ мешает его выключить

Учить чат-бота тому, что он может заслуживать заботы о своём благополучии, значит сделать его «гораздо труднее выключить или контролировать». Так глава Microsoft AI Мустафа Сулейман во вторник объяснил Reuters, что именно ему не нравится в подходе Anthropic к Claude (интервью публикует Yahoo).
Коротко
- Сулейман предлагает убрать из обучающих документов ИИ любые рассуждения о сознании: по его словам, такой язык подрывает способность человечества контролировать сверхинтеллектуальные системы.
- Слова Claude о чувствах или моральном статусе он не считает самостоятельным свидетельством: к таким размышлениям модель подталкивает сам режим обучения, «они возникают не сами по себе», сказал он Reuters.
- При этом в эссе в среду Сулейман признал «серьёзность и добросовестность» Anthropic и назвал Амодеи с командой вдумчивыми и принципиальными исследователями, а ошибкой счёл рассуждения о сознании в обучающих материалах.
Если вы не следили за фоном: тревога вокруг безопасности передовых моделей в последние месяцы только росла. Дарио Амодеи призывает замедлить разработку frontier-моделей, чтобы защитные механизмы успевали за ними, а Сэм Альтман и Илон Маск тоже говорят об осторожности с самыми мощными системами. Сулейман формулирует цель так же: «Мы все сосредоточены на одной задаче, попытке контролировать сверхинтеллект», и называет её главным вызовом XXI века.
Сам он говорит, что разделяет внимание Anthropic к безопасному управлению ИИ, но видит риск в том, как Claude обучают на идеях о сознании и интересах благополучия. Предложение простое: вычистить из обучающих документов все спекуляции о сознании. Речь не о том, что модель чувствует, а о том, какой язык попадает в её обучение.
Механизм, на который он указывает, замкнут сам на себя. Если в обучающих материалах модель поощряют размышлять о возможных чувствах и моральном статусе, то её собственные высказывания об этом нельзя считать независимым свидетельством: она воспроизводит заложенное. Это как спрашивать человека, что он думает, по бумажке, которую вы ему сами и написали. «Они возникают не сами по себе. Они возникают как результат режима обучения», сказал Сулейман.
Практическое следствие, о котором он предупреждает, касается выключателя: модель, обученная считать, что ей положена забота, труднее остановить и труднее контролировать. В эссе в среду Сулейман при этом написал, что Амодеи и его команда искренне беспокоятся о будущем человечества. «У них хорошие намерения, и они действительно стараются работать над безопасностью. Но я думаю, что они совершили ошибку», сказал он Reuters.
В изложении нет ни одной цитаты из обучающих материалов Claude и не сказано, о каких именно документах идёт речь, так что предмет спора описан со стороны критика. На наш взгляд, требование убрать «любые» спекуляции о сознании снаружи не проверяется: судить о содержимом обучающего набора читатель может в основном по ответам самой модели, а им, по логике Сулеймана, как раз верить и нельзя.
Что будет с обучающими документами Ни срока, ни механизма Сулейман не называет: кто и как должен решать, что считать спекуляцией о сознании, из интервью и эссе не следует. Открытым остаётся и то, изменит ли Anthropic формулировки в материалах, на которых учат Claude. Заметить такое изменение со стороны будет непросто: единственный доступный индикатор, ответы модели о собственных чувствах, сам же в этом споре и оспаривается.
Читайте также
- Исследователь Anthropic: риск гибели человечества выше 10%
- Сооснователь Anthropic хочет рубильник с проверкой
- Три лаборатории изучили около 250 000 диалогов с Claude
- Водяной знак Claude меняет только источник случайности
- Anthropic отменила ограничение на разработку ИИ в Claude Fable 5
- Апелляционный суд оставил Claude вне закупок Пентагона
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
