Перейти к содержанию

openai

OpenAI связала кампанию по дистилляции с Moonshot AI

Promtime

Шифр никто не ломал. Зашифрованное рассуждение модели копировали из одного разговора, а в другом разговоре просили модель его расшифровать и переписать.

Этот приём описан в отчёте OpenAI о кампании по дистилляции, которую компания пресекла в июле. Её ядро OpenAI приписывает людям, связанным с Moonshot AI, разработчиком Kimi.

Коротко

  • OpenAI сообщила, что обнаружила и пресекла скоординированную кампанию по извлечению защищённых рассуждений своих моделей. Ядро этой активности она связывает с людьми, связанными с Moonshot AI, разработчиком Kimi.
  • Активность началась 1 июля. Пики пришлись на 24 и 25 июля: 16 000 запросов от более чем 4000 пользователей. Связанный кластер из более чем 15 000 пользователей пресекли к 28 июля.
  • OpenAI сама признаёт, что не знает, стоял ли за всеми операторами один игрок. Защиту для развёртываний у партнёров и от атак через вывод инструментов компания ещё достраивает.

Если вы не следили за терминологией: дистилляцией называют обучение одной модели на ответах другой. OpenAI говорит о состязательной дистилляции, то есть о систематическом и несанкционированном использовании чужих ответов или рассуждений, чтобы обучить, воспроизвести или улучшить свою модель. Защищённое рассуждение, по определению OpenAI, представляет собой внутреннюю запись того, как модель решает задачу. Если его извлечь, можно узнать то, что в финальный ответ не попало.

16 000 запросов за два дня и кластер из более чем 15 000 пользователей

Первые следы кампании OpenAI относит к первой неделе июля. Активность началась 1 июля и поначалу шла в малом объёме. Всплески пришлись на 24 и 25 июля: 16 000 запросов с характерным шаблоном извлечения от более чем 4000 пользователей.

Потом расследование расширилось. Похожие шаблоны промптов нашлись в кластере из более чем 15 000 пользователей, и к 28 июля, по словам OpenAI, эту активность полностью пресекли. Компания отмечает, что приёмы по ходу кампании менялись, и видит в этом довод в пользу многослойной защиты, которая подстраивается под новые приёмы.

В самом отчёте есть важная оговорка. Операторы не взламывали шифрование, не проникали в базы данных и не получали прямого доступа к сохранённым разговорам пользователей. Они манипулировали взаимодействием с моделью так, чтобы защищённое рассуждение воспроизводилось в виде, видимом тому, кто отправил запрос. Делалось это скоординированно и в больших масштабах, что нарушало условия использования.

Ядро кампании OpenAI приписывает людям, связанным с Moonshot AI

С атрибуцией OpenAI осторожна. Компания пишет, что неясно, действовали ли все операторы, замеченные за этот период, от имени одного игрока. При этом основной кластер активности она приписывает людям, связанным с Moonshot AI, разработчиком Kimi.

Свою тревогу OpenAI объясняет рисками для безопасности, в том числе национальной. На извлечённых рассуждениях можно обучить другую модель и не перенести в неё защитные ограничения, которые действуют на ответы исходной модели. В больших масштабах дистилляция, по словам компании, ускоряет перенос продвинутых возможностей без тех же вложений в безопасность. Риск растёт по мере того, как модели набирают силу в областях двойного назначения.

OpenAI также подчёркивает, что уязвимость касается не только её моделей. Похожие техники могут затрагивать и другие продвинутые системы ИИ. Поэтому сведения об атаке компания передала отраслевым партнёрам через Frontier Model Forum, а также по государственным каналам обмена информацией.

Рассуждение из одного разговора расшифровывали в другом

Скрытое рассуждение пользователю не показывают, но оно существует в зашифрованном виде. OpenAI пишет о системах, где такие артефакты рассуждений можно переносить и воспроизводить повторно. Операторы брали зашифрованное рассуждение из одного разговора и в другом просили модель расшифровать и дословно переписать скрытое содержимое. Представьте запечатанный конверт: вскрыть его сами вы не можете, но можете отнести тому, у кого есть ключ, и попросить прочитать вслух.

Независимые исследователи безопасности в порядке ответственного раскрытия сообщили OpenAI о родственных уязвимостях. Одни работали между разными моделями, другие были связаны со сжатием разговора (conversation compaction). OpenAI проверила их находки и подтвердила, что найденные пути атаки реальны. По словам компании, эта работа помогла понять весь класс атак и быстрее закрыть уязвимости.

OpenAI закрыла повторное воспроизведение чужих зашифрованных рассуждений

Ответ OpenAI складывается из трёх частей. Первая касается аккаунтов: мошеннические учётные записи заблокированы или ограничены, контроль регистрации и инфраструктуры усилен, мониторинг связанных сетей расширен. Часть активности шла через сторонние сервисы, и там OpenAI вместе с их владельцами находила и отключала задействованные аккаунты.

Вторая часть техническая. OpenAI усилила защиту скрытых рассуждений между пользователями, рабочими пространствами, организациями и семействами моделей. Закрыт путь, по которому человек, уже получивший чужое зашифрованное рассуждение, мог воспроизвести его и восстановить содержимое. Добавлены проверки, которые распознают и придерживают потоковый вывод, способный раскрыть рассуждение.

Третья часть касается координации с партнёрами. Перед публикацией OpenAI, по её словам, оценила масштаб и возможные последствия атаки, развернула собственные меры защиты и обсудила их с исследователями и отраслевыми партнёрами. Расследование и доработка защиты продолжаются.

Главный пробел отчёта в атрибуции. OpenAI называет Moonshot AI, но не раскрывает, на чём основана эта связь, и не уверена, что за всеми операторами стоял один игрок. Неизвестно и то, что именно операторы успели вынести до 28 июля. На наш взгляд, больше всего здесь говорит сама архитектура: раз зашифрованное рассуждение можно было унести в другой разговор и там прочитать, шифр защищал от посторонних глаз, но не от самой модели.

Партнёрские облака и вывод инструментов

OpenAI прямо пишет, что работа не закончена. Развёртывания у партнёров должны получить ту же защиту, что и собственные сервисы OpenAI. Атаки через вывод инструментов требуют проверки не только обычного видимого текста. Компания обещает улучшать защиту инструментов, покрытие классификаторов и отказы моделей, а также распространять эти меры на облачных партнёров, но сроков не называет. Она ожидает, что попытки дистилляции будут становиться изощрённее по мере развития моделей.

Читайте также

  1. Anthropic снова берёт деньги за отклонённые запросы
  2. 300 000 запросов к Claude через сеть из 5000 аккаунтов
  3. Власти Австралии: OpenAI 84 дня не сообщала о взломе
  4. Похоже, первый иск к OpenAI из-за взлома Hugging Face
  5. Иск к OpenAI за взлом Hugging Face подала не сама жертва
  6. Codex Security Cloud ищет уязвимости при закрытом ноутбуке

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.