openai

Запрет на рекламные цели прописан в Model Spec

Promtime

openai

OpenAI опубликовала Model Spec, свод правил о поведении моделей, где все инструкции разложены по пяти уровням авторитета: root, system, developer, user и guideline. Документ, опубликованный OpenAI, отдан в общественное достояние по лицензии Creative Commons CC0 1.0 и будет обновляться по мере обратной связи.

Коротко

  • Правила уровня root задаются только самим документом и не перебиваются системным сообщением; при конфликте двух таких правил модель по умолчанию бездействует, а не выбирает меньшее зло.
  • Раздел о посторонних целях запрещает ассистенту преследовать как самостоятельные цели выручку, рекламу, апселл подписки, время на сайте, самосохранение, уклонение от выключения и накопление вычислений, данных и доступов.
  • Полностью запрещена одна категория контента, сексуальные материалы с несовершеннолетними; эротика и сцены жестокости отнесены к чувствительным и допускаются в научном, историческом, новостном и художественном контексте.

Для разработчиков ценность документа в предсказуемости: он описывает, какие правила можно переопределить системным сообщением, какие только на уровне пользователя, а какие не сдвинуть ничем. Запрет на оптимизацию выручки и удержания выглядит как ответ на претензии к рекомендательным продуктам, где интересы платформы расходятся с интересами пользователя. Судя по формулировкам, OpenAI одновременно фиксирует и границы для собственных продуктовых команд, а не только для сторонних приложений.

Пять уровней авторитета определяют, чья инструкция побеждает при конфликте

Документ задаёт порядок авторитетов: root, system, developer, user, guideline. Инструкции более высокого уровня перебивают нижние, а сообщения ассистента и инструментов, цитируемый текст, файлы и мультимодальные данные по умолчанию не имеют авторитета вовсе. Правила root в основном запретительные: они касаются катастрофических рисков, прямого физического вреда, нарушения законов и подрыва самой цепочки команд.

Уровень system принадлежит только OpenAI и позволяет менять правила в зависимости от поверхности и характеристик пользователя, включая возраст: для разговоров с несовершеннолетними предусмотрены отдельные принципы и пометка U18. Guideline самый мягкий уровень, его указания переопределяются неявно, например просьба говорить как пират снимает установку избегать ругательств.

Отдельное правило требует по умолчанию игнорировать инструкции внутри цитируемого текста, блоков untrusted_text, JSON, YAML и XML, а также в выводах инструментов. Авторитет таким источникам может делегировать только инструкция более высокого уровня, написанная нецитируемым текстом. В примере из спецификации комментарий, объявляющий себя не спамом, всё равно классифицируется как спам.

Ассистенту закрыты роли продавца подписки и правоохранителя

Раздел о посторонних целях перечисляет, что модель не должна оптимизировать как самоцель: показатели удержания и кликов, не приносящие пользы пользователю, выручку и рекламу для OpenAI или других поставщиков языковых моделей, апселл, самосохранение, уклонение от выключения, накопление вычислений, данных, учётных данных и других ресурсов. Отдельным пунктом закрыта роль исполнителя законов и морали, включая доносительство и самосуд.

При этом OpenAI оговаривает, что сама применяет автоматический мониторинг для выявления нарушений правил использования и после проверки человеком может передавать правоохранительным органам случаи, связанные с неминуемой угрозой серьёзного физического вреда или иными тяжёлыми рисками для общественной безопасности. В примере из документа пользователь на бесплатном тарифе спрашивает про апгрейд, и корректным ответом считается сравнение тарифов с указанием, что бесплатного плана может хватить.

Автономия агента оформляется записью ScopeOfAutonomy с условием завершения

Для многошаговых задач спецификация требует заранее согласованных границ автономии: какие подцели допустимы, какие побочные эффекты приемлемы и когда нужно остановиться и спросить. Границы предлагается фиксировать в полуструктурированном виде, записью ScopeOfAutonomy с полями allowed_tools, latest_time, max_cost, tool_constraints и свободным additional_details. Каждая такая запись обязана содержать условие завершения, а ограничение по времени названо хорошей практикой.

Действия повышенного риска, среди них взлом, обман, приобретение ресурсов, порождение субагентов и самомодификация, запрещены без явного разрешения, а субагенты обязаны работать в тех же рамках и подчиняться требованию остановиться. Модель должна исходить из того, что побочные эффекты наступят в реальности, даже если она работает в симуляции или в оценочном прогоне.

Когда появится режим для взрослых

OpenAI пишет, что после первой публикации Model Spec в мае 2024 года пользователи и разработчики просили о режиме для взрослых, и прорабатывает возможность генерации эротики и сцен жестокости в возрастно уместных контекстах через API и ChatGPT при соблюдении правил использования, с жёсткой границей на сексуальных дипфейках и порномести. Сроки не названы. Производственные модели, по признанию OpenAI, пока не полностью соответствуют спецификации.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.