Домой ИИ и технологии Интеллект на ватт: новая метрика для оценки LLM на локальных ускорителях

Интеллект на ватт: новая метрика для оценки LLM на локальных ускорителях

Новое исследование предлагает метрику для сравнения эффективности ИИ-моделей и аппаратных ускорителей, позволяя снизить энергопотребление дата-центров.

2
0

С ростом популярности больших языковых моделей (LLM) нагрузка на облачные вычислительные мощности стала критической, что заставляет индустрию искать способы оптимизации обработки запросов. Новое исследование предлагает принципиально иной подход: метрику «интеллект на ватт» (IPW). Она позволяет комплексно оценивать эффективность локальных систем, объединяя показатели точности ответов с реальным энергопотреблением аппаратного обеспечения.

Методология и результаты тестирования

Авторы исследования провели масштабные испытания, охватившие более 20 локальных LLM и 8 различных аппаратных ускорителей, включая решения от Nvidia, AMD и Apple. В качестве тестового полигона использовался массив из одного миллиона реальных пользовательских запросов, которые включали как простые диалоговые задачи, так и сложные логические рассуждения или проверку специализированных знаний.

Согласно полученным данным, локальные модели успешно справляются с 88,7% всех запросов. Более того, общая эффективность систем (IPW) показала впечатляющий рост в 5,3 раза за период с 2023 по 2025 год. Столь существенный скачок стал возможен благодаря одновременному развитию алгоритмической базы и совершенствованию архитектуры самих ускорителей.

Эффективность: локальные решения против облачных

Ключевым выводом работы стало подтверждение того, что современные локальные ускорители, такие как Apple M4 Max, уже способны обеспечивать комфортную интерактивную обработку задач. Несмотря на это, профессиональные облачные решения по-прежнему лидируют в «чистой» производительности. В частности, ускорители Nvidia B200 и SambaNova SN40L превосходят локальные аналоги по уровню эффективности на 40–78%.

Интеллект на ватт: новая метрика для оценки LLM на локальных ускорителях
Интеллект на ватт: новая метрика для оценки LLM на локальных ускорителях — иллюстрация к материалу. Источник: ixbt.com

Тем не менее, даже существующие локальные системы способны существенно разгрузить дата-центры. Исследователи подсчитали, что использование гибридного подхода, при котором часть задач делегируется «на край» (локально), позволяет перераспределить до 71,3% всех запросов. Это дает возможность снизить энергопотребление инфраструктуры на 60–80%.

Перспективы и ограничения

Анализ точности работы моделей выявил интересную закономерность: локальные нейросети демонстрируют высокую эффективность в творческих и гуманитарных задачах, где их результативность превышает 90%. В то же время, при выполнении технических заданий (например, в инженерии или сложной архитектуре) точность падает до 68%. Это указывает на то, что для работы над узкоспециализированными проектами пока целесообразнее использовать облачные вычисления.

Ученые также предложили систему умной маршрутизации запросов. Оптимальное распределение нагрузки между локальными и облачными ресурсами при точности маршрутизации в 80% позволяет добиться снижения энергопотребления на 64% и сократить общие операционные затраты на 59%. Примечательно, что Google может выпустить до 15 млн ИИ-ускорителей TPU v9 за год, что в будущем может еще сильнее изменить ландшафт вычислений, сокращая разрыв между локальными и облачными мощностями.

Для дальнейшего развития индустрии авторы исследования открыли доступ к инструменту для оценки IPW. Это должно стимулировать разработчиков железа и ПО учитывать энергоэффективность как один из приоритетных параметров при создании новых моделей ИИ.

Источник: https://www.ixbt.com