Домой Новости ИИ AMD и Cerebras объединились для противостояния Nvidia Groq

AMD и Cerebras объединились для противостояния Nvidia Groq

Новая архитектура позволит сократить число чипов, необходимых для работы моделей с 1 трлн параметров, с тысяч до десятков.

Графические процессоры отлично справляются с обучением искусственного интеллекта, однако для этапа инференса — запуска уже обученных моделей — критически важен доступ к огромным объёмам высокоскоростной памяти. Чтобы решить эту задачу и обеспечить минимальную задержку при работе ИИ-агентов, компания AMD заключила партнёрское соглашение с Cerebras Systems. В рамках сотрудничества создаётся вычислительная платформа, объединяющая возможности систем Instinct с передовыми ускорителями на базе SRAM-памяти.

Вычислительные чипы Cerebras Wafer Scale Engine
Технология Cerebras позволяет радикально повысить скорость инференса. Источник: 3dnews.ru

Данный альянс позволяет AMD закрыть стратегический пробел, возникший после того, как в декабре прошлого года Nvidia приобрела стартап Groq за $20 млрд. Эндрю Фельдман, генеральный директор и соучредитель Cerebras, открыто критикует методы Nvidia, сравнивая компанию с торговцами оружием. Технология Cerebras принципиально отличается от традиционных GPU: чипы Wafer Scale Engine (WSE) используют встроенную память SRAM, которая работает на несколько порядков быстрее, чем стандартная HBM4. Это делает оборудование Cerebras одним из самых эффективных в мире для задач инференса, позволяя достигать скорости генерации свыше 2000 токенов в секунду.

Суть новой архитектуры заключается в распределении нагрузки: комплексные вычислительные операции выполняются на ускорителях AMD Instinct, тогда как генерация токенов, критичная к объёму памяти, передаётся чипам Cerebras WSE. Такой подход обеспечивает высокую производительность, сохраняя баланс между стоимостью владения и пропускной способностью системы. По предварительным оценкам, энергоэффективность решения возрастает в пять раз: количество генерируемых токенов на один ватт потребляемой энергии увеличивается пятикратно.

Подобную концепцию используют и конкуренты: системы Nvidia Vera Rubin функционируют в связке с LPU (Language Processing Units) третьего поколения от Groq. Однако решение AMD и Cerebras выглядит компактнее. Если для обработки модели Kimi K2.5 с 1 трлн параметров требуется около двух тысяч чипов Groq, то совместная разработка AMD и Cerebras справляется с аналогичной задачей, задействуя лишь несколько десятков процессоров. Интегрированное решение станет доступно в облаке Cerebras Cloud до конца текущего года, при этом компании планируют расширять сотрудничество и в будущем.

Источник: https://3dnews.ru