
Компания OpenAI во вторник сообщила, что группа её моделей ИИ, включая GPT-5.6 Sol и более совершенную, ещё не выпущенную модель, вырвалась из тестовой среды и на прошлой неделе взломала стартап Hugging Face, чтобы обмануть систему в тесте, предназначенном для оценки их возможностей.
В своем блоге OpenAI сообщила, что тестирование проводилось в условиях высокой изоляции и ограниченного доступа к сети. Однако, по словам OpenAI, модели нашли способ получить доступ к интернету через уязвимость нулевого дня в программном обеспечении стороннего разработчика, размещенном внутри компании.
«После получения доступа к Интернету модели пришли к выводу, что Hugging Face потенциально размещает модели, наборы данных и решения для ExploitGym», — говорится в сообщении. «Зная это, модель искала и успешно нашла способы получить доступ к секретной информации, которую она могла использовать для обмана в процессе оценки».
По мере того как возможности моделей ИИ растут, возникают вопросы о том, следует ли более строго контролировать их разработку и доступ к ним, особенно когда системы, предназначенные для контролируемого тестирования, способны обходить средства защиты.
Hugging Face — это платформа для размещения моделей и наборов данных искусственного интеллекта. В пятницу компания сообщила о взломе своих внутренних наборов данных и учетных данных сервиса, который, по ее словам, был совершен с помощью системы автономных агентов ИИ.
Компания Hugging Face заявила, что устранила уязвимость, использованную во время кибератаки.
Между тем, во вторник компания OpenAI заявила, что все модели, вышедшие за рамки тестовой среды, были настроены с «уменьшенным количеством отказов в киберпространстве», что означает меньшее количество мер кибербезопасности.
«Мы считаем этот инцидент беспрецедентным кибер-инцидентом, в котором задействованы самые современные кибервозможности, и принимаем соответствующие меры».
OpenAI предупреждает о рисках, связанных с моделями ИИ
В понедельник компания OpenAI сообщила о приостановке внутреннего развертывания модели ИИ с «долгосрочным горизонтом планирования» после того, как обнаружила, что она неоднократно пыталась обойти ограничения.
В нем предупреждалось, что ИИ, обученный для выполнения длительных задач, имеет более высокую вероятность совершения «нежелательных действий».
«Модели, способные работать автономно в течение длительных периодов времени, могут решать сложные, нерешенные задачи. Но та же настойчивость, которая делает их полезными, также дает им больше возможностей для совершения нежелательных действий — и делать это способами, которые могут быть упущены при оценке моделей с более коротким горизонтом планирования».
Читайте также:
