Графические процессоры отлично справляются с обучением искусственного интеллекта, однако для этапа инференса — запуска уже обученных моделей — критически важен доступ к огромным объёмам высокоскоростной памяти. Чтобы решить эту задачу и обеспечить минимальную задержку при работе ИИ-агентов, компания AMD заключила партнёрское соглашение с Cerebras Systems. В рамках сотрудничества создаётся вычислительная платформа, объединяющая возможности систем Instinct с передовыми ускорителями на базе SRAM-памяти.

Данный альянс позволяет AMD закрыть стратегический пробел, возникший после того, как в декабре прошлого года Nvidia приобрела стартап Groq за $20 млрд. Эндрю Фельдман, генеральный директор и соучредитель Cerebras, открыто критикует методы Nvidia, сравнивая компанию с торговцами оружием. Технология Cerebras принципиально отличается от традиционных GPU: чипы Wafer Scale Engine (WSE) используют встроенную память SRAM, которая работает на несколько порядков быстрее, чем стандартная HBM4. Это делает оборудование Cerebras одним из самых эффективных в мире для задач инференса, позволяя достигать скорости генерации свыше 2000 токенов в секунду.
Суть новой архитектуры заключается в распределении нагрузки: комплексные вычислительные операции выполняются на ускорителях AMD Instinct, тогда как генерация токенов, критичная к объёму памяти, передаётся чипам Cerebras WSE. Такой подход обеспечивает высокую производительность, сохраняя баланс между стоимостью владения и пропускной способностью системы. По предварительным оценкам, энергоэффективность решения возрастает в пять раз: количество генерируемых токенов на один ватт потребляемой энергии увеличивается пятикратно.
Подобную концепцию используют и конкуренты: системы Nvidia Vera Rubin функционируют в связке с LPU (Language Processing Units) третьего поколения от Groq. Однако решение AMD и Cerebras выглядит компактнее. Если для обработки модели Kimi K2.5 с 1 трлн параметров требуется около двух тысяч чипов Groq, то совместная разработка AMD и Cerebras справляется с аналогичной задачей, задействуя лишь несколько десятков процессоров. Интегрированное решение станет доступно в облаке Cerebras Cloud до конца текущего года, при этом компании планируют расширять сотрудничество и в будущем.






