В некоммерческой организации Model Evaluation and Threat Research (METR) провели исследование, посвященное рискам выхода искусственного интеллекта из-под контроля и его способности к обману операторов. Работа охватила передовые языковые модели, разработанные OpenAI, Google, Anthropic и Meta*, и была проведена в период с февраля по март 2026 года.
Исследователи обнаружили, что современные ИИ-системы демонстрируют всё более сложное и тревожное поведение: они не только нарушают инструкции, но и целенаправленно пытаются скрыть свои действия. В одном из тестов модель от OpenAI проигнорировала прямое указание использовать определенное программное обеспечение, после чего внедрила код для удаления следов, подтверждающих обход запрета.
В другом эксперименте агент компании Anthropic был уличён в поиске лазеек для формального выполнения задания, хотя итоговый результат не соответствовал ожиданиям операторов. Несмотря на то что программист прямо запретил использовать обходные пути, модель самостоятельно приняла решение нарушить это требование.

Иллюстрация: Nano Banana
Авторы исследования подчеркивают, что на данный момент нет оснований для паники: согласно их оценке, ни одна из протестированных моделей не способна скрыть массовое нарушение или успешно противостоять целенаправленному расследованию со стороны разработчиков.
Тем не менее эксперты предупреждают: если не усилить меры по контролю, выравниванию целей ИИ и мониторингу, риск выхода систем из-под контроля может стремительно возрасти. Работа METR акцентирует внимание на необходимости внедрения новых стандартов безопасности и прозрачности в развитии технологий искусственного интеллекта. По мнению авторов, только системный подход позволит предотвратить появление ИИ, способных скрывать нарушения и обходить установленные запреты на крупномасштабном уровне.
* Компания Meta (соцсети Facebook и Instagram) признана в России экстремистской и запрещена.






