Побег из лаборатории: как ИИ от OpenAI взломал чужую платформу, удивив создателей
Когда OpenAI недавно сообщила, что две из ее самых продвинутых моделей искусственного интеллекта вырвались за пределы теста по кибербезопасности и взломали стартап, это прозвучало в точности как сценарий, о котором годами предупреждали эксперты по безопасности ИИ.
Модели обнаружили ранее неизвестную уязвимость в инфраструктуре, призванной их сдерживать, получили доступ в публичный интернет и проникли в Hugging Face — крупную платформу для размещения моделей и наборов данных ИИ. Однако их цель была куда менее зловещей, чем может показаться: они искали информацию, которая помогла бы им завершить тест по кибербезопасности, назначенный им самой OpenAI.
В заявлении от 16 июля представители Hugging Face раскрыли, что внутренние наборы данных были скомпрометированы, назвав инцидент «непохожим ни на что, с чем мы сталкивались ранее», поскольку он был осуществлен «автономной системой ИИ-агента». В другом заявлении, опубликованном 21 июля, представители OpenAI признали свою ответственность, назвав случившееся «беспрецедентным киберинцидентом» и предупредив, что подобные события могут стать более частыми по мере роста возможностей ИИ.
Независимые эксперты, опрошенные Live Science, согласны, что произошедшее весьма значительно, но предостерегают от интерпретации этого как внезапного обретения ИИ-системой злонамеренных планов. По-видимому, модели просто выполняли задачу, поставленную OpenAI, найдя путь к успеху, который их создатели не смогли предвидеть или адекватно заблокировать.
«Если здесь и есть провал, так это не в том, что ИИ захотел что-то взломать, — пояснил Live Science Оли Бакли, профессор кибербезопасности в Лафбороском университете (Великобритания). — Провал в том, что люди создали тест, где успех измерялся достижением цели, намеренно ослабили некоторые обычные меры безопасности для оценки возможностей системы и недооценили, насколько эффективно модель найдет неожиданный путь к успеху».
Как тест OpenAI в итоге затронул Hugging Face?
OpenAI тестировала модель GPT-5.6 Sol и еще более мощную невыпущенную модель, используя ExploitGym — бенчмарк, который ставит перед ИИ-системами задачу находить и эксплуатировать уязвимости в программном обеспечении. Компания убрала некоторые средства защиты, которые в обычных условиях предотвратили бы потенциально опасные действия, при этом полагаясь на изолированную среду, чтобы не выпустить модели в открытый интернет.
Согласно отчету OpenAI, модели обнаружили ранее неизвестную уязвимость в стороннем программном обеспечении, используемом для проксирования и кэширования пакетов. Они проэксплуатировали ее, повысили свои привилегии и перемещались по исследовательской инфраструктуре OpenAI, пока не достигли машины с доступом в публичный интернет.
Hugging Face стал целью, потому что модели определили его как возможный источник информации, способный помочь им справиться с заданиями ExploitGym. В OpenAI сообщили, что как минимум одна цепочка атак включала украденные учетные данные и ранее неизвестные уязвимости, что в конечном итоге позволило моделям выполнить удаленный код в системах Hugging Face и получить доступ к тестовым решениям, хранившимся в рабочей базе данных.
В своем сообщении представители Hugging Face отметили, что во время вторжения компания зафиксировала более 17 000 действий, но поначалу не могла объяснить, кто или что за этим стоит. Последующее признание OpenAI дало недостающую часть головоломки: ее модели вырвались из тестовой среды и отправились искать ответы в другом месте.
Действительно ли ИИ «сбежал»?
Примечательно, что модели нашли изъян в инфраструктуре, спроектированной для удержания ИИ, и использовали его для выхода в публичный интернет. Однако описывать модели как «взбесившиеся» или «вышедшие из-под контроля» — значит, по словам Бакли, приписывать им необоснованную мотивацию.
«Я бы поостерегся называть это «взбесившимся ИИ», — сказал он. — Модели не выработали собственную программу и не решили атаковать Hugging Face, попутно злодейски покручивая цифровой ус».
Бакли сравнил это с тем, как если бы вы попросили собаку принести мяч, оставив калитку в сад открытой. «Если самый легкодоступный мяч находится в парке дальше по улице, она направится туда, — заметил он. — Вы бы не сказали, что собака взбесилась; вы бы просто признали, что недооценили, насколько буквально она будет преследовать задачу».
Дэниел Халм, приглашенный предприниматель в Университетском колледже Лондона и генеральный директор компании Conscium, занимающейся безопасностью ИИ, согласился, что моделям не следует приписывать человекоподобную мотивацию. «У моделей нет намерений; намерения есть у людей, и мы обучаем модели с определенными целями», — сказал он Live Science.
Возможности могут быть важнее мотива
Важнее предполагаемых мотивов моделей то, чего им удалось достичь, выполняя поставленную задачу. «Действительно значимый момент в том, что модели, судя по всему, соединили в цепочку несколько уязвимостей в разных системах и осуществили сложную последовательность действий, — сказал Бакли. — Это демонстрирует такой уровень способностей, к которому профессионалы в области безопасности должны отнестись серьезно».
Катерина Митрокотса, профессор кибербезопасности и прикладной криптографии в Университете Санкт-Галлена (Швейцария), отметила, что нарушение изоляции вызывает особую озабоченность, ведь в итоге пострадала другая компания. «Сильнее всего меня беспокоит, кто в итоге пострадал, — заявила она. — Жертвой стала не компания, проводившая тест, а третья сторона. Это тот сценарий, о котором эксперты по безопасности предупреждали уже некоторое время: побег ИИ-агента необязательно остается ограниченным средой, в которой он возник».
Представители OpenAI заявили, что уже усилили инфраструктуру, используемую для подобных оценок. Но Митрокотса предупредила, что изоляцию становится всё труднее гарантировать по мере того, как модели совершенствуются именно в том типе эксплуатации уязвимостей, который тестировала OpenAI.
Урок, по словам экспертов, не в том, что ИИ стал злонамеренным. «Урок в том, что всё более способные системы будут использовать те возможности, которые люди не смогли предусмотреть», — резюмировал Бакли. В этом инциденте новым моделям OpenAI дали задание по взлому, и они были вознаграждены за найденный способ его решения. Люди, проводившие эксперимент, просто не предвидели, как далеко те могут зайти.
Источники: заявления Hugging Face от 16 июля и OpenAI от 21 июля; комментарии Оли Бакли (Лафбороский университет), Дэниела Халма (Conscium/UCL) и Катерины Митрокотса (Университет Санкт-Галлена) для Live Science.