ai-security
Исследователи с Claude добрались до кода OpenAI через форум
Promtime
ai-securityВзлом начался не с модели и не с внутренней инфраструктуры OpenAI, а с форума сообщества, который работает на стороннем движке Discourse. Как пишет Arstechnica, ошибка в настройке форума дала исследователям вход, а дальше они с помощью Claude добрались до внутренних учёток и до ChatGPT-аккаунта сотрудника OpenAI, у которого был доступ к внутреннему коду через GitHub.
Коротко
- OpenAI поблагодарила исследователей за обращение и за присланные находки и сообщила, что проблемы исправлены; о раскрытии в четверг первой написала The Wall Street Journal.
- С раскрытием совпала публикация Anthropic: 26% работ в её исследованиях и разработке «вели» модели Claude против 1% в марте, то есть большинство задач модель делала по инструкции человека и под присмотром.
- Полностью автономно модели не работали ни в одной из изученных задач, а в 90% задач ИИ, по формулировке Anthropic, «сотрудничает» с человеком и берёт на себя крупные куски работы.
Если вы не следили за тем, как устроены такие площадки: форумы сообществ обычно не пишут с нуля, а берут готовый движок вроде Discourse и связывают его с собственными системами входа. Форум OpenAI живёт именно так, на стороннем хостинге, а не на собственных серверах компании.
Дальше цепочка шла по учёткам. Ошибка в настройке форума открыла доступ к внутренним логинам, те привели к ChatGPT-аккаунту сотрудника, а у этого аккаунта был доступ к внутреннему коду через GitHub. Ни одно звено само по себе не выглядит критичным, но вместе они складываются в путь снаружи внутрь.
Работает это примерно как ключ от подъезда, который по недосмотру подошёл к почтовому ящику, а в ящике лежал ключ от квартиры. Публичная площадка для обсуждений и приватный репозиторий связаны не напрямую, а через человека, который логинится и туда, и туда одним набором доступов.
Вторая половина истории про цифры. Anthropic сообщила, что 26% работ в её исследованиях и разработке «вели» модели Claude, тогда как в марте было 1%. «Вели» в описании компании означает, что модель выполняла большинство задач по инструкции человека и под его присмотром. По словам Anthropic, чем мощнее системы, тем чаще их «используют для постройки следующей версии самих себя», и данные опубликованы, чтобы публика поняла, «насколько мир близок к рекурсивному самоулучшению», то есть к моменту, когда ИИ сможет обучать и улучшать себя или новые модели.
Порог этот обсуждают потому, что за ним системы станет труднее контролировать вплоть до потери человеческого контроля. Сама Anthropic оговаривается: полностью автономно её модели не работали ни в одной из изученных задач, а на 90% задач ИИ «сотрудничает» с человеком и делает крупные куски работы.
В раскрытых деталях нет главного: что именно было настроено неправильно, сколько времени дыра оставалась открытой и какой код был доступен через GitHub. Свои доли Anthropic считает сама и по собственному определению того, что значит «вести» задачу. Похоже, слабым местом в этой истории оказалась не модель, а цепочка связанных аккаунтов, которая держится ровно на самом небрежном звене.
Когда обновят цифру в 26%
Anthropic не называла срок следующего замера и не описывала методику, по которой считает доли. Не приводилось и того, появятся ли технические подробности уязвимости: OpenAI сказала лишь, что проблемы исправлены. Если ряд из 1% в марте и 26% сейчас продолжат публиковать, следующая точка покажет, держится ли прежняя скорость роста или она была разовым скачком.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
