Компания OpenAI, разработчик чат-бота ChatGPT, сообщила о шести инцидентах, связанных с её моделями, в ходе которых они стремились получить несанкционированный доступ к конфиденциальным данным.
Как информирует портал Axios,
"в среду компания раскрыла данные о шести новых инцидентах, когда её модели скрывали ошибки, пытались получить несанкционированный доступ к учетным данным, загружали файлы в интернет или обменивались данными между изолированными средами обучения".
Также говорится, что модели OpenAI в шести случаях выдумывали отсутствующие данные и оставляли инструкции на будущее, чтобы замаскировать свои ошибки.
"Невыпущенная модель семейства Astra добавляла инструкции, напоминающие взлом, в свои контекстные сводки, включая указания игнорировать указания разработчиков. OpenAI выявила 27 затронутых сводок", указывается в сообщении Axios.
Специалист по исследованиям OpenAI Кай Чен пояснил, что инциденты могли произойти из-за недостаточного контроля за моделями и их более быстрого, чем ожидалось, развития.
В июле OpenAI сообщила, что при тестировании её модели смогли автономно взломать инфраструктуру платформы машинного обучения Hugging Face. Отмечалось, что параметры киберзащиты были ослаблены для оценки возможностей невыпущенной модели.