Домой ИИ и технологии Спецслужбы США обвинили китайские компании в краже данных ИИ-моделей

Спецслужбы США обвинили китайские компании в краже данных ИИ-моделей

Агентства США выпустили предупреждение о масштабном использовании метода дистилляции знаний китайскими ИИ-фирмами для копирования возможностей американских моделей.

Агентство по кибербезопасности и защите инфраструктуры США (CISA) совместно с Агентством национальной безопасности (АНБ) и Федеральным бюро расследований (ФБР) выпустило официальное предупреждение для американских разработчиков искусственного интеллекта. В документе утверждается, что ряд китайских технологических компаний осуществляет «агрессивные и вредоносные действия» по извлечению данных из передовых моделей США в промышленных масштабах.

Сравнение работы различных нейросетевых моделей

Метод дистилляции знаний как инструмент промышленного шпионажа

Согласно отчету, китайские фирмы используют технику машинного обучения, известную как дистилляция знаний. В нормальных условиях этот метод применяется для переноса навыков от крупной «учительской» нейросети к более компактной «ученической» модели. Сами по себе подобные исследования признаны легитимными, однако в данном контексте спецслужбы квалифицируют их как злоупотребление.

Вместо того чтобы тратить значительные ресурсы и время на самостоятельные разработки, китайские компании, как утверждается, отправляют огромное количество специально подготовленных запросов к американским ИИ-моделям, собирая и систематизируя полученные ответы. По оценкам ведомств, с конца 2024 года были извлечены «миллиарды токенов» через миллионы запросов к передовым системам, включая модели семейств GPT, Claude, Gemini и Grok.

Компании-участники и методы обхода защиты

В числе фирм, причастных к масштабному сбору данных, упоминаются DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun и Z.AI. Американские спецслужбы полагают, что эти действия, вероятно, происходят при поддержке китайского правительства. Список затронутых целей включает новейшие разработки, такие как Claude Fable 5 и GPT-5, а также их предшественников (например, GPT-4, Claude 3.7 и Gemini 2.5 Flash Preview). В свою очередь, полученные данные предположительно направлялись на обучение китайских моделей, включая DeepSeek R1 и V3, Kimi-K2 и Kimi-K3 от Moonshot, а также M2 от MiniMax.

Для реализации этих схем злоумышленники используют комплексную инфраструктуру, позволяющую обходить системы защиты:

  • Маршрутизация запросов через множество учетных записей и точек доступа API.
  • Использование различных облачных провайдеров, сторонних агрегаторов ИИ и прокси-сервисов.
  • Применение «передаточных станций» и коллективное использование платных подписок.

Такая деятельность, по мнению властей США, носит системный характер и создает прямую угрозу американскому технологическому лидерству.

Рекомендации по защите интеллектуальной собственности

Для противодействия подобным кампаниям CISA и спецслужбы рекомендуют разработчикам внедрить многоуровневые меры мониторинга. Компании должны отслеживать аномалии, такие как резкий рост интенсивности запросов от новых аккаунтов, диспропорции в использовании подписок и подозрительные паттерны трафика на уровне предприятия. Одной из ключевых мер защиты является «таргетированное изменение ответов»: при обнаружении подозрительных попыток дистилляции ИИ-системы должны намеренно искажать информацию, чтобы сделать процесс сбора данных бесполезным.

Кроме того, ведомства призывают к созданию системы межотраслевого обмена разведданными между разработчиками моделей, облачными платформами и API-агрегаторами. Координация действий на уровне правительства США, частного сектора и стран-союзников рассматривается как единственный способ купирования рисков, связанных с промышленным шпионажем в области искусственного интеллекта.

Технические аспекты противодействия и масштаб угрозы

В опубликованном предупреждении CISA, АНБ и ФБР подчеркивают, что масштаб дистилляции знаний выходит далеко за рамки обычного использования API. Речь идет о целенаправленной стратегии, где американские модели фактически используются в качестве «бесплатных учителей» для обучения конкурентоспособных китайских систем. Специалисты ведомств указывают, что вместо месяцев исследований и затрат в миллионы долларов на разработку собственных фундаментальных способностей, китайские разработчики автоматизируют процесс генерации ответов, что позволяет им имитировать функционал западных аналогов с минимальными вложениями.

Особое внимание в отчете уделено методам, которые используют китайские фирмы для маскировки своей активности. По данным американских спецслужб, злоумышленники осознанно разбивают свои запросы так, чтобы они выглядели как легитимная активность множества независимых пользователей. Использование «передаточных станций» и распределение нагрузки через различные облачные провайдеры и сторонние агрегаторы позволяет им успешно обходить системы безопасности, настроенные на выявление аномалий от одного источника. Этот «промышленный масштаб» операций, по оценкам агентств, указывает на то, что деятельность компаний, таких как DeepSeek, Moonshot, Alibaba, MiniMax, StepFun и Z.AI, как минимум, осведомлена китайским правительством, если не координируется им напрямую.

Рекомендации для компаний по защите ИИ-активов

Для минимизации рисков американские спецслужбы настаивают на внедрении комплексного подхода к обороне, который не ограничивается простой блокировкой IP-адресов. В число первоочередных мер входят:

  • Мониторинг поведенческих паттернов: Разработчикам необходимо анализировать соотношение между стоимостью подписки и реальными объемами использования ресурсов. Особое внимание следует уделять аккаунтам, которые показывают «максимальное использование» сразу после регистрации, что может свидетельствовать о начале процесса дистилляции.
  • Анализ пропускной способности: Рекомендуется отслеживать паттерны передачи данных в корпоративном масштабе, чтобы выявлять скрытые каналы, через которые извлекается проприетарная функциональность модели.
  • Обмен данными об угрозах (Intelligence Sharing): Ведомства призывают к созданию глобальной сети взаимодействия между владельцами моделей, API-провайдерами и облачными платформами. Без корреляции данных об активности злоумышленников между разными участниками цепочки поставок ИИ-услуг, эффективное обнаружение «распределенных» кампаний по дистилляции практически невозможно.

Одним из самых радикальных методов защиты, предлагаемых агентствами, является «таргетированное изменение ответов». Идея заключается в том, что после автоматической классификации запроса как попытки дистилляции знаний, система должна не просто заблокировать пользователя, а начать отдавать намеренно неверные или «размытые» данные. Это позволит снизить ценность извлеченной информации для атакующей стороны и дезориентировать процесс обучения их «ученических» моделей.

В завершение своего отчета ведомства подчеркивают: борьба с промышленной дистилляцией знаний — это долгосрочная задача, требующая слаженных усилий не только внутри США, но и на международном уровне, в координации с союзными государствами. Только путем объединения информации об источниках вредоносных запросов и разработки общих стандартов защиты ИИ-экосистемы можно замедлить текущую «утечку» ключевых технологических компетенций.

Источник: https://www.techradar.com