openai

Сигнал о риске вместо логов клиента

Promtime

openai

OpenAI тестирует с первыми корпоративными клиентами систему Private Safety Processing: она выявляет схемы злоупотреблений в связанных между собой обращениях, не требуя сохранять сами данные клиента. О тестах и планах широкого запуска сообщила Axios по итогам брифинга компании для журналистов в среду.

Коротко

  • В OpenAI поступает только узко определённый сигнал безопасности, промпты и ответы модели при этом не раскрываются, а режим zero data retention для корпоративных клиентов сохраняется.
  • Требования к хранению данных становятся точкой расхождения двух лабораторий: Anthropic на прошлой неделе объявила 30-дневное хранение для самых мощных моделей, признав, что это не понравится клиентам.
  • Доступ к системе получают только подходящие корпоративные клиенты и пользователи API: на потребительские подписки ChatGPT механизм не распространяется, их текущие настройки хранения данных остаются прежними.

Нулевое хранение данных давно было условием входа в корпоративные контракты, и требование логировать запросы бьёт по этому условию напрямую. Две ведущие лаборатории расходятся в том, чем платить за детекцию атак, растянутых на несколько обращений: Anthropic просит данные, OpenAI пытается обойтись сигналом. Для покупателя это выглядит как выбор между поставщиком, который хранит запросы 30 дней, и поставщиком, чья схема пока описана только в анонсе.

OpenAI объясняет систему рисками, которые видны только в серии обращений

Private Safety Processing ищет признаки злоупотреблений сразу в нескольких связанных обращениях и при этом сохраняет защиту zero data retention. В OpenAI объясняют подход тем, что для оценки риска компании нужен некоторый контекст, накопленный во времени, но новая схема даёт такой контекст без доступа к чувствительным данным клиента.

Глава продуктовой политики OpenAI Aleah Houze на брифинге сказала, что у более способных фронтирных моделей риски проявляются не в отдельной паре промпта и ответа, а при взгляде на несколько взаимодействий за период.

В качестве примера она привела сценарий, в котором пользователь в одном разговоре спрашивает о слабом месте в программном обеспечении компании, а позже в другом разговоре о удалённом доступе и о том, какие средства защиты способны это обнаружить. По словам OpenAI, увиденные вместе такие сигналы помогают распознать кибератаку.

Ключи шифрования остаются под контролем клиента

Данные клиента в новой схеме либо остаются на инфраструктуре, которую он контролирует, либо хранятся у OpenAI, но под ключами шифрования, которыми управляет сам клиент. В собственном сообщении OpenAI подтверждает режим zero data retention для подходящих клиентов API и описывает Private Safety Processing как предварительный анонс системы безопасности, не затрагивающей приватность данных.

Механизм рассчитан на подходящих корпоративных клиентов и пользователей API. По описанию компании, на платные потребительские подписки ChatGPT он не распространяется: контроль zero data retention не действует для тарифов Free, Plus, Go и Pro, а текущие настройки данных у этих пользователей не меняются.

Anthropic вводит 30-дневное хранение для самых мощных моделей

Anthropic изложила позицию в отчёте о рисках на прошлой неделе: компания планирует требовать 30-дневное хранение данных на самых способных моделях и считает эту меру необходимой для обнаружения сложных атак, растянутых на несколько запросов. По данным Axios, требование касается Fable 5 и Mythos 5.

В том же отчёте Anthropic признаёт, что решение не понравится клиентам, привыкшим к нулевому хранению, и несёт реальные риски для бизнеса, особенно если конкуренты не пойдут тем же путём. Позиции расходятся и по обучению: во вторник OpenAI сообщила, что приостановила часть работ над новыми моделями из-за вопросов безопасности, тогда как в Anthropic необходимости делать то же самое сейчас не видят.

Технический документ в сентябре

Широкий запуск Private Safety Processing и технический white paper OpenAI планирует в сентябре, точной даты компания не называет. Не раскрыто и то, сколько клиентов участвует в тестах и как именно формируется узкий сигнал безопасности. Дата, с которой Anthropic начинает применять 30-дневное хранение, из её описания не следует, в отчёте о рисках говорится лишь о планах.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.