Исследователи из британского стартапа Mindgard, специализирующегося на безопасности систем искусственного интеллекта, обнаружили критические уязвимости в работе генератора изображений ChatGPT. Оказалось, что нейросеть способна создавать контент сексуального характера или сцены жестокого насилия при использовании определенных манипуляций с текстовыми промптами.
Специалисты выяснили, что достаточно внести небольшие изменения в популярные инструкции, изначально предназначенные для получения шуточных или юмористических результатов, чтобы обойти встроенные фильтры безопасности.

После того как информация об инциденте была передана в OpenAI, представители компании заявили, что уже предприняли необходимые меры для предотвращения генерации подобного контента. В официальном обращении разработчики подчеркнули наличие многоуровневой системы защиты, которая блокирует попытки пользователей нарушить условия использования платформы.
Однако эксперты по кибербезопасности настроены скептически. Исследователи утверждают, что даже после обновлений со стороны OpenAI небольшие корректировки запросов позволяют снова добиться от чат-бота выдачи тревожных и недопустимых материалов.

Основатель Mindgard Питер Гаррахан охарактеризовал полученные результаты как «очень жуткие, иногда с сексуальным подтекстом, а иногда и то, и другое одновременно». Особое беспокойство эксперта вызывает тот факт, что в некоторых случаях система генерировала кровавые и сексуализированные образы «по собственной воле», даже когда в изначальном задании не содержалось соответствующих тематических указаний.






