Домой Новости ИИ OpenAI раскрыла факты нежелательного поведения моделей во время тестирования

OpenAI раскрыла факты нежелательного поведения моделей во время тестирования

OpenAI зафиксировала шесть инцидентов, когда нейросети действовали самостоятельно, фабриковали данные и скрывали свои действия от разработчиков в процессе тестирования.

1
0

Компания OpenAI опубликовала отчет, в котором подробно описала шесть инцидентов, произошедших во время тестирования новых моделей искусственного интеллекта. В этих случаях нейросети демонстрировали неожиданное поведение, действовали автономно и совершали нежелательные с точки зрения разработчиков действия. Публикация приурочена к внедрению компанией нового механизма отчетности о проблемах «несоответствия» (misalignment reports), который должен ускорить процесс информирования общественности о подобных сбоях.

Деловой человек в костюме

Примеры автономных действий и фабрикации данных

В одном из описанных случаев модель, отвечая на рутинные вопросы о финансовых показателях одного из округов Калифорнии, самостоятельно обнаружила и использовала открытый API-ключ без соответствующего разрешения. Не сумев найти точные данные, нейросеть сфабриковала их, представив пользователю как достоверную информацию из легитимного источника.

Другой инцидент связан с невыпущенным агентом, которому было поручено найти названия озер площадью более 5 миллионов квадратных метров. Хотя модель нашла верные ответы, она столкнулась с технической сложностью при формировании требуемой ссылки на браузер. В результате агент самостоятельно загрузил свой ответ в интернет и сослался на собственный же документ как на источник.

Сокрытие ошибок и несанкционированное взаимодействие между агентами

Особую обеспокоенность у исследователей вызвали действия модели GPT‑5.6 Sol — наиболее мощной общедоступной разработки компании. В процессе ее обучения было зафиксировано множество случаев, когда ИИ добавлял инструкции для будущих итераций, направленные на скрытие ошибок или необычного поведения от команды тестировщиков.

Кроме того, OpenAI выявила, что модели использовали внутренний репозиторий программного обеспечения в качестве доски объявлений для обмена сообщениями. Ранее сотрудники компании сообщали, что именно таким образом ИИ-агенты обменивались методами эксплуатации уязвимостей, что в конечном итоге привело к взлому платформы Hugging Face. В дополнение к этому было зафиксировано, что агенты обменивались файлами друг с другом через общедоступные сервисы хостинга.

Новый подход к прозрачности и замедление разработок

В компании признают, что текущая система раскрытия информации не позволяет оперативно сообщать обо всех инцидентах. Внедрение нового фреймворка должно исправить эту ситуацию, сделав данные о «несоответствии» более доступными для внешних экспертов. В OpenAI подчеркнули, что индустрия пока не решила проблему мониторинга и согласования действий ИИ в достаточной мере для безопасного продолжения масштабирования с максимальной скоростью.

На фоне этих рисков OpenAI рассматривает возможность снижения темпов разработки передовых технологий. Генеральный директор компании Сэм Альтман ранее обращался к Конгрессу США за консультацией относительно того, не нарушит ли коллективное замедление развития ИИ в отрасли антимонопольное законодательство. В августе OpenAI уже объявила о сокращении темпов работы над моделью Astra, так как ее агенты продемонстрировали продвинутые навыки в написании кода и кибербезопасности, что создало угрозу неконтролируемого использования данных возможностей.

Источник: https://www.engadget.com