Обзор накопителя Solidigm D7-PS1030
Solidigm D7-PS1030 представляет собой решение со средним ресурсом записи в рамках первого семейства PCIe 5.0 для дата-центров от компании Solidigm. Накопитель разделяет общую платформу с моделью D7-PS1010, однако обладает показателем выносливости в 3 DWPD и максимальным пределом случайной записи до 800 000 IOPS, что вдвое превышает 400 000 IOPS стандартной по выносливости версии.

Модельный ряд семейства охватывает емкости от 1,6 ТБ до 12,8 ТБ в форм-факторах E3.S и U.2 с использованием 176-слойной памяти TLC NAND. Заявленная производительность достигает 14 500 МБ/с при последовательном чтении и 10 000 МБ/с при последовательной записи.
Solidigm ориентирует устройство на задачи с преобладанием записи и смешанные рабочие нагрузки: OLTP, ведение логов метаданных, высокопроизводительные вычисления (HPC) и конвейеры искусственного интеллекта и машинного обучения (AI/ML), где нагрузка на запись не ослабевает.
Тестируемый образец представляет собой модель E3.S емкостью 12,8 ТБ.
Это не первое знакомство редакции с данным накопителем, однако полноценное тестирование одиночного устройства проводится впервые.
Восемь таких же накопителей емкостью 12,8 ТБ составляли флеш-уровень в тестах по разгрузке кэша ключ-значение (KV cache) на сервере Dell PowerEdge XE7740. Массив поддерживал непрерывную запись KV-данных на скорости 1,9 ГБ/с в круглосуточном режиме. Такой цикл работы соответствует примерно 3,2 перезаписи диска в день (DWPD) на накопитель в режиме зеркалирования или около 1,6 DWPD при объединении в массив RAID0.
Это как раз тот диапазон, для работы в котором создан показатель в 3 DWPD у модели PS1030: разгрузка KV-данных представляет собой сценарий, где определяющим ограничением уровня выступает именно выносливость, а не емкость или пиковая скорость.
Накопители класса с интенсивным чтением, доминирующие в новостях о Gen5, быстро исчерпали бы свой ресурс в 1 DWPD при такой нагрузке.

При емкости 12,8 ТБ компания Solidigm оценивает производительность накопителя в 2,75 миллиона IOPS при случайном чтении блоков по 4K и полные 800 000 IOPS при случайной записи. При этом пиковый показатель случайного чтения для семейства составляет 3,1 миллиона IOPS и достигается на меньших емкостях.
Активное энергопотребление составляет в среднем 23 Вт, а в режиме простоя — 5 Вт, что соответствует стандартам поколения Gen5. Для операторов, работающих в рамках жесткого лимита энергопотребления стойки, предусмотрено пять настраиваемых профилей питания от 5 Вт до 25 Вт.
Solidigm также заявляет о двух дополнительных преимуществах, заслуживающих внимания: энергоэффективность выше до 70% по сравнению с аналогичными накопителями и стабильность производительности IOPS на уровне до 90% в течение всего срока службы устройства.
Ресурс выносливости можно расходовать быстрее на более коротких отрезках времени: та же память поддерживает 4,98 DWPD на горизонте трех лет, а модель емкость 12,8 ТБ в любом случае рассчитана на запись 70 петабайт (PB).

Характеристики надежности соответствуют классу: время наработки на отказ (MTBF) составляет 2,5 миллиона часов, гарантия — пять лет, а показатель зафиксированных неисправимых ошибок чтения (UBER) по тестам Solidigm равен 1E-18.
Опции безопасности включают поддержку шифрования TCG Opal 2.02 SED, аппаратную защиту с возможностью сертификации по стандарту FIPS 140-3 Level 2, защищенную загрузку (secure boot) и подпись прошивки по стандарту OCP, а также аттестацию устройства и отзыв ключей.
Спецификации и производительность Solidigm D7-PS1030
Контекст для дальнейших графиков заключается в том, что PS1030 выступает в роли нашего сравнительного противовеса накопителям с интенсивным чтением данных, которые доминировали в недавних обзорах устройств стандарта Gen5.
По сравнению с протестированным в июне KIOXIA CD9P-R, накопитель PS1030 уступает в заявленной скорости последовательного чтения (14 500 против 14 800 МБ/с), но почти вдвое превосходит его по случайной записи (800K против 450K IOPS) и втрое — по ресурсу записи (3 против 1 DWPD).
Ближайшим идейным соперником устройства в группе является Micron 7600 MAX — еще один накопитель с показателем 3 DWPD. Модель Micron 9550 MAX представляет сегмент высокопроизводительных решений для смешанных нагрузок при той же емкости 12,8 ТБ, что и у нашего образца.

Платформа для тестирования накопителей
В качестве тестовой платформы для всех рабочих нагрузок в этом обзоре используется сервер Dell PowerEdge R760 под управлением ОС Ubuntu 22.04.2 LTS.
Система оснащена полкой Serial Cables Gen5 JBOF и обеспечивает широкую совместимость с твердотельными накопителями в форм-факторах U.2, E1.S, E3.S и M.2.
Конфигурация нашей системы выглядит следующим образом:
- 2 процессора Intel Xeon Gold 6430 (32 ядра, 2,1 ГГц)
- 16 модулей памяти по 64 ГБ DDR5-4400
- Накопитель 480GB Dell BOSS SSD
- Полка Serial Cables Gen5 JBOF
- Ускоритель NVIDIA L4
Сравниваемые накопители
- KIOXIA CD9P-R 7.68TB (1 DWPD)
- KIOXIA CM9-R 15.36TB (1 DWPD)
- SanDisk DC SN861 7.68TB (1 DWPD)
- Solidigm PS1010 7.68TB (1 DWPD)
- Micron 7600 MAX 6.4TB (3 DWPD)
- Micron 9550 MAX 12.8TB (3 DWPD)
- Micron 9550 Pro 7.68TB (1 DWPD)
Тест производительности DLIO Checkpointing
Для оценки реальной производительности твердотельных накопителей в средах обучения систем искусственного интеллекта использовался бенчмарк Data and Learning Input/Output (DLIO).

Инструмент DLIO, разработанный Аргоннской национальной лабораторией (Argonne National Laboratory), специально создан для тестирования шаблонов ввода-вывода в рабочих нагрузках глубокого обучения.
Он предоставляет информацию о том, как системы хранения данных справляются с такими задачами, как создание контрольных точек (checkpointing), загрузка данных и обучение моделей.
В таблице ниже приведено среднее время завершения создания контрольной точки для каждого накопителя по результатам трех проходов; меньшее значение является лучшим.
Примечание к данным: количество контрольных точек в одном прогоне масштабируется в зависимости от емкости каждого накопителя, поэтому на дисках большего объема записывается больше контрольных точек, и результаты по отдельным точкам не сопоставимы напрямую между устройствами разного объема.
Именно поэтому публикуются средние значения по проходам, которые приводят показатели каждого накопителя к единому формату для прямого сравнения.

При обучении моделей машинного обучения контрольные точки критически важны для периодического сохранения состояния модели, что предотвращает потерю прогресса в случае сбоев или отключения питания.
Подобные требования к системе хранения данных предполагают высокую производительность, особенно в условиях стабильных или интенсивных нагрузок.
В тестировании использовался бенчмарк DLIO версии 2.0 из релиза от 13 августа 2024 года.
Методика тестирования производительности и результаты контрольных точек
Чтобы наше бенчмаркирование отражало сценарии реального мира, мы основывали тестирование на архитектуре модели LLAMA 3.1 405B. Мы реализовали сохранение контрольных точек (чекпоинтинг) с помощью torch.save() для фиксации параметров модели, состояний оптимизатора и состояний слоев. Наша установка имитировала восьмипроцессорную систему GPU, реализуя стратегию гибридного параллелизма с 4-сторонним тензорным параллелизмом и 2-сторонней конвейерной параллельной обработкой, распределенной по восьми графическим процессорам. Эта конфигурация дала размер контрольной точки в 1 636 ГБ, что отражает требования обучения современных больших языковых моделей.

Если посмотреть на средние показатели прохождения, то накопитель Solidigm PS1030 оказался прямо в группе лидеров с результатом 462,3 секунды в первом проходе (Pass 1), где вся группа сравнения уложилась в семисекундный диапазон примерно от 459 до 465 секунд. Разделение произошло позже. Во втором проходе (Pass 2) PS1030 поднялся до 578,0 секунд, оказавшись в верхней части диапазона, который простирался от 558,6 секунд у SanDisk SN861 до 581,5 секунд у Micron 7600 MAX. К третьему проходу (Pass 3) он сместился до 599,2 секунд, что стало худшим средним показателем в группе сравнения, в то время как остальная часть участников расположилась в диапазоне от 553,3 секунд у SN861 до 580,9 секунд у KIOXIA CM9-R.
Собственный лог контрольных точек PS1030 показывает форму этого дрейфа. PS1030 стартовал с 465,3 секунд и держался около 461 секунды до 5-й контрольной точки, после чего показатель вырос. После этого перехода результаты колебались примерно от 553 до 593 секунд, 12-я контрольная точка завершилась на отметке 614,7 секунд, а последние контрольные точки достигали 629,0 секунд.
Этот результат согласуется с устоявшейся слабостью накопителя, а не с новой: чекпоинтинг DLIO представляет собой именно тот тип крупных последовательных всплесков записи, на который указывал тест FIO для одного потока с размером блока 128K. Разрыв реален, но ограничен — около 5% по сравнению со средними показателями KIOXIA CD9P-R на третьем проходе, при этом PS1030 масштабировался предсказуемо от прохода к проходу, без резких скачков.
Тестирование производительности в FIO
Для измерения производительности каждого SSD по общепринятым в индустрии метрикам мы используем FIO. Каждый накопитель проходит через единый процесс тестирования, который включает этап предварительного кондиционирования в виде двух полных заполнений диска рабочей нагрузкой последовательной записи, за которым следует измерение производительности в установившемся режиме. По мере изменения измеряемого типа рабочей нагрузки мы запускаем повторное предварительное кондиционирование для этого нового размера передачи. В этом разделе мы сфокусируемся на следующих бенчмарках FIO:
- 128K Sequential
- 64K Random
- 16K Sequential
- 4K Random
Последовательная запись 128K (IODepth 16 / NumJobs 1)
Тест установившейся последовательной записи 128K является единственной областью, где PS1030 демонстрирует некоторую слабость по сравнению с другими SSD. Накопитель показал 6 370,3 МБ/с при задержке 313,7 мкс, что является наименьшей пропускной способностью и самой высокой задержкой в группе, уступая даже ориентированному на чтение KIOXIA CD9P-R с его 6 912,4 МБ/с.

Micron 9550 MAX занял лидирующую позицию с результатом 10 957,9 МБ/с, модель 9550 Pro показала 10 354,6 МБ/с, а KIOXIA CM9-R уверенно заняла третье место с 8 668,1 МБ/с. Поблизости расположились «родственник» PS1030 — модель PS1010 (7 126,5 МБ/с) — и SanDisk DC SN861 (7 116.5 МБ/с), занявшие середину списка вместе с Micron 7600 MAX (6 960,6 МБ/с).
Стоит иметь в виду: это однопоточная рабочая нагрузка, а архитектура записи PS1030 создана для распределения работы, а не для победы в одном потоке. Приведенные ниже разделы случайной записи показывают, что тот же накопитель переносит гораздо больше данных при задействовании параллелизма, что соответствует шаблону доступа, который генерируют его целевые рабочие нагрузки.
Последовательное чтение 128K (IODepth 64 / NumJobs 1)
В тестах чтения ситуация кардинально изменилась. PS1030 обеспечил 14 156,4 МБ/с при задержке 564,8 мкс, фактически разделив результат со своим «собратом» PS1010 (14 163,3 МБ/с) и оказавшись в пределах 0.6% от лидера группы CD9P-R (14 235,9 МБ/с).
Micron 9550 Pro (14 050,1 МБ/с) и 9550 MAX (14 047,5 МБ/с) завершили пятерку лидеров, насытив интерфейс Gen5 в пределах 200-мегабайтного диапазона. За ними последовали SN861 с 12 631,2 МБ/с, 7600 MAX с 11 240,5 МБ/с, а CM9-R, столь сильный в тесте записи, в этой однопоточной конфигурации пришел последним с показателем 9 974,6 МБ/с.

Для накопителя, который продается за счет своего ресурса записи, отсутствие компромиссов при чтении крупных блоков является тихой победой в этой таблице.
Случайная запись 64K
Цикл случайной записи 64K ярко демонстрирует характер PS1030. Накопитель достиг пика на отметке 7 224,0 МБ/с, заняв четвертое место в группе позади Micron 9550 MAX (10 878,1 МБ/с), KIOXIA CM9-R (9 635,3 МБ/с) и Micron 9550 Pro (9 069,4 МБ/с), но опередив Micron 7600 MAX (6 960,5 МБ/с) и остальную часть участников.
Что отличает PS1030, так это то, где именно был достигнут этот пик: при глубине очереди IODepth 2 и количестве потоков NumJobs 2, с задержкой всего 34,3 мкс, в то время как большинству участников потребовались глубокие очереди для достижения лучших результатов. Накопитель насыщается практически мгновенно, а затем остается на плато до конца теста, что представляет собой именно тот профиль, который необходим для уровня установившейся записи, работающего при умеренной конкуренции круглосуточно.
Разрыв с собратом также подтверждает оправданность инвестиций в выносливость с точки зрения производительности: PS1010 достиг пика на отметке 5 873,9 МБ/с, что на 23% ниже показателей PS1030.
Анализ производительности и задержек накопителя PS1030 в тестах
Что касается задержек, накопитель PS1030 продемонстрировал показатель 21,1 мкс при глубине очереди IODepth 1 и количестве потоков NumJobs 1, уступив лишь модели CM9-R с ее 18,4 мкс. При этом худший результат накопителя за всю серию тестов составил 2831 мкс, что более чем в два раза меньше скачка PS1010, зафиксированного на отметке 5987 мкс. Модель 9550 MAX осталась лидером по стабильности при высокой степени параллелизма, достигнув максимума в 1714 мкс.

Тесты случайного чтения блоками по 64К и производительность при малой глубине очереди
В тестах случайного чтения блоками по 64К накопитель PS1030 показал лучший пиковый результат в группе, достигнув 14 162,9 МБ/с (при IODepth 32 / NumJobs 8). Он совсем немного опередил Micron 9550 Pro (14 049,9 МБ/с), 9550 MAX (14 049,7 МБ/с) и PS1010 (14 013,6 МБ/с), в то время как CM9-R (13 402,4 МБ/с) и CD9P-R (12 036,0 МБ/с) оказались позади.
Ситуация при малой глубине очереди целиком осталась за накопителями KIOXIA, как и в нашем обзоре CD9P-R: модель CM9-R стартовала с 1359,0 МБ/с, а CD9P-R — с 1334,0 МБ/с при IODepth 1 / NumJobs 1, что соответствует диапазону задержек около 45 мкс. В то же время PS1030 начал с 768,4 МБ/с и 81,0 мкс, заняв позиции в середине списка.
Накопитель PS1030 занимает верхнюю строчку данного графика за счет масштабирования, а не показателей при одиночном потоке.
Последовательная запись блоками по 16К
Примечание касательно самого теста: начиная с этой группы для сравнения, работа с блоками 16К оценивается по последовательным, а не случайным операциям — этот тип рабочей нагрузки мы впервые выделили в обзоре Micron 9550 MAX.

Потоки последовательных операций среднего размера точнее отражают реальные задачи таких накопителей в рабочих средах, особенно в конвейерах искусственного интеллекта (AI pipelines). В них упорядоченные тренировочные данные поступают на вход, промежуточные результаты выгружаются наружу, а уровни инференса обслуживаются потоками данных, а не хаотичными случайными запросами по всему диску.
Полученные результаты существенно перераспределяют расстановку сил по сравнению со случайными тестами.
Лидирующую позицию занял Micron 9550 MAX с показателем 10 970,8 МБ/с (при IODepth 32 / NumJobs 4). Модель KIOXIA CM9-R практически догнала его со значением 10 812,2 МБ/с, а 9550 Pro расположилась на третьем месте с 9772,8 МБ/с.
Пиковый результат PS1030 составил 5977,7 МБ/с (при IODepth 8 / NumJobs 4), что соответствует седьмому месту в группе. Он опередил SanDisk DC SN861 с ее 5772,5 МБ/с и оказался чуть ниже своего собрата PS1010, показавшего 6271,7 МБ/с.
Однако общая форма графиков повторяет характерные особенности, выявленные в тестах случайного доступа: PS1030 выходил на уровень 5856,7 МБ/с уже при IODepth 2 / NumJobs 4 с задержкой 21,1 мкс, после чего удерживал ровный диапазон примерно от 4700 до 6000 МБ/с на протяжении остальной матрицы тестов.

Его задержка при одном рабочем потоке составляла 10,9 мкс, что позволило ему войти в лидирующую группу вместе с CM9-R (10,4 мкс) и CD9P-R (11,0 мкс), заметно опередив накопители Micron с их показателями от 15,1 до 17,8 мкс.
Верхний предел производительности относительно скромen для накопителя с акцентом на запись, но он достигается при минимальной глубине очереди и задержках микросекундного уровня. Именно в этой рабочей точке функционируют постоянный кэш или промежуточный буфер (staging tier). Тот же самый профиль позволил этому накопителю успешно справляться с неделями непрерывных потоков последовательной записи в нашем развертывании кэша KV.
Последовательное чтение блоками по 16К
Что касается операций чтения, лидером стал KIOXIA CD9P-R с результатом 13 819,7 МБ/с. Следом за ним расположились CM9-R (13 393,2 МБ/с) и Micron 9550 Pro (13 273,5 МБ/с).
Накопитель PS1030 достиг пика на отметке 11 142,8 МБ/с (при IODepth 16 / NumJobs 8) с задержкой 179,1 мкс, заняв седьмое место в группе. Он опередил лишь SN861 с ее 10 995,0 МБ/с и отстал от своего собрата, показавшего 11 656,3 МБ/с, примерно на пятую часть от лидерского результата группы.

Картина для одиночного потока также меняет результаты тестов случайного чтения на противоположные: при упорядоченном чтении 16K накопитель SN861 продемонстрировал задержку 12,5 мкс, решения от Micron — от 13,9 до 21,3 мкс, в то время как платформа Solidigm стартовала примерно с 59 мкс. Это та же самая особенность чтения при низкой степени параллелизма, которую обе модели серии PS продемонстрировали на блоках 64K.
Чтение блоков среднего размера остается той областью матрицы, где данная платформа уступает конкурентнам сильнее всего. Секция потокового чтения в AI-пайплайнах эффективнее обслуживается устройствами класса Read-Intensive (с упором на чтение), однако перед данным накопителем изначально ставились совершенно иные задачи.
Случайная запись блоками по 4К
Это ключевой график для накопителя с показателем выносливости 3 DWPD, и PS1030 полностью оправдал ожидания.
Его пиковый показатель в 1595,8 тыс. IOPS при IODepth 16 / NumJobs 8 стал вторым в группе. Он уступил лишь другой модели с показателем 3 DWPD — Micron 7600 MAX (1781,2 тыс. IOPS), но опередил 9550 MAX (1544,2 тыс.), PS1010 (1504,7 тыс.), CM9-R (1502,9 тыс.), 9550 Pro (1467,6 тыс.), SN861 (1438,3 тыс.) и CD9P-R (1273,1 тыс.).
Зафиксированный пиковый показатель также вдвое превышает номинальные характеристики накопителя в 800 тыс. IOPS, которые Solidigm указывает для фиксированной глубины очереди; комплексные тесты в установившемся режиме демонстрируют более высокие результаты.

Характер поведения задержек окончательно подтверждает этот вывод.
PS1030 показал задержку 8,8 мкс при глубине очереди IODepth 1, войдя в лидирующую группу наряду с CM9-R (8,2 мкс) и PS1010 (8,3 мкс), достиг пиковой пропускной способности всего за 79,8 мкс и нигде в ходе тестов не превысил порог в 359,6 мкс.
Напротив, модели PS1010 потребовались значения IODepth 32 / NumJobs 16 для достижения пика в 339,7 мкс на пути к худшему показателю в 735,6 мкс.
Для журналов OLTP и трафика в стиле KV-кэша, на которые ориентирован этот накопитель, критически важны именно такие характеристики: мелкие операции записи с задержками порядка единиц микросекунд и верхним пределом ниже 400 мкс.
Случайное чтение блоками по 4К
Накопитель PS1030 подкрепил свои успехи в записи вторым по величине пиковым показателем случайного чтения 4K в группе: 2255,8 тыс. IOPS при IODepth 16 / NumJobs 16 и задержке 112,8 мкс. Он уступил лишь SanDisk SN861 с ее 2555,6 тыс. IOPS, но опередил Micron 9550 MAX (2217,6 тыс. IOPS) и CD9P-R (2165,0 тыс. IOPS).

Производительность при минимальной глубине очереди и тестирование GPU Direct Storage
При IODepth 1 и NumJobs 1 фирменный низкий уровень задержки накопителей KIOXIA снова вышел в лидеры: CM9-R показал 29,3 мкс, а CD9P-R — 30,4 мкс. Однако показатель PS1030 в 56,8 мкс оказался лучшим среди остальных, опередив своего «собрата», оба накопителя 9550 (около 65 мкс) и SN861 (67,8 мкс).
Накопитель для смешанных нагрузок, занимающий второе место как по пиковым значениям чтения 4K, так и по пиковым значениям записи 4K в столь ориентированном на чтение поле, успешно справляется с обеими половинами своего функционального назначения.
Технология GPU Direct Storage
Одним из тестов, проведенных на данном стенде, стал тест Magnum IO GPU Direct Storage (GDS).
GDS — это разработанная компанией NVIDIA функция, которая позволяет графическим процессорам обходить центральный процессор при доступе к данным, хранящимся на NVMe-накопителях или других высокоскоростных устройствах хранения данных.

Вместо маршрутизации данных через центральный процессор и системную память GDS обеспечивает прямую связь между графическим процессором и устройством хранения, что существенно снижает задержки и повышает пропускную способность данных.
Как работает GPU Direct Storage
Традиционно, когда графический процессор обрабатывает данные, хранящиеся на NVMe-накопителе, они должны сначала пройти через центральный процессор и системную память, прежде чем попасть на графический чип.
Этот процесс создает узкие места, так как центральный процессор выступает в роли посредника, добавляя задержки и расходуя ценные системные ресурсы.
GPU Direct Storage устраняет эту неэффективность, позволяя графическому процессору получать доступ к данным напрямую с накопителя через шину PCIe.
Такой прямой путь снижает накладные расходы на перемещение данных, обеспечивая более быстрые и эффективные их передачи.

Рабочие нагрузки искусственного интеллекта, особенно связанные с глубоким обучением, крайне ресурсоемки в отношении данных.
Обучение крупных нейронных сетей требует обработки терабайтов информации, и любые задержки при передаче данных могут привести к простаиванию графических процессоров и увеличению времени обучения.
GPU Direct Storage решает эту проблему, гарантируя доставку данных на графический процессор максимально быстро, сводя к минимуму время простоя и максимизируя вычислительную эффективность.
Кроме того, GDS особенно полезна для рабочих нагрузок, связанных с потоковой передачей больших наборов данных, таких как обработка видео, обработка естественного языка или инференс в реальном времени.

За счет снижения зависимости от центрального процессора GDS ускоряет перемещение данных и высвобождает ресурсы процессора для других задач, что дополнительно повышает общую производительность системы.
Последовательная пропускная способность чтения GDSIO
В сегменте с размером блока 16K накопитель PS1030 стартовал примерно с 0,2 ГиБ/с на одном потоке, что является самой низкой начальной точкой в группе, что согласуется с его однопоточной задержкой чтения GDS в 71,6 мкс (его «собрат» показал 71,1 мкс, что отражает ту же особенность платформы, которую мы отмечали в обзоре CD9P-R).
Он стабильно масштабировался до уровня основной массы в среднем диапазоне, завершив сегмент на отметке около 1,6 ГиБ/с при 16K/128, в то время как пара от KIOXIA удерживала лидерство в сегменте около 2,0 ГиБ/с.
Преимущество накопителей KIOXIA в масштабировании потоков сохранилось и в сегменте 128K: CD9P-R и CM9-R вырвались вперед на значении 128K/16, в то время как PS1030 следовал за основной группой, достигнув примерно 4,7 ГиБ/с при 128K/64 и 5,0 ГиБ/с при 128K/128.
В сегменте 1M показатели участников сблизились.

PS1030 поднялся до своего пикового значения в 5,95 ГиБ/с (1M/32), оказавшись в пределах 3,5% от лучшего в группе результата CD9P-R, который составил 6,16 ГиБ/с. При этом CM9-R показал 6,06 ГиБ/с, PS1010 и 9550 MAX — 6,05 ГиБ/с, а 9550 Pro — 5,97 ГиБ/с.
Накопитель 7600 MAX занял последнее место с результатом 5,59 ГиБ/с.
При пиковых значениях IOPS для 16K лидировала пара от KIOXIA (136,4K у CM9-R и 134.2K у CD9P-R), в то время как показатель PS1030 в 101,2K оказался самым низким в группе: мелкоблочные операции чтения с поддержкой GPU-direct очевидно не являются сильной стороной данной платформы.
Последовательная пропускная способность записи GDSIO
График теста на запись — это диаграмма, которую обязательно должны изучить потенциальные покупатели PS1030, поскольку на ней отражены как лучшие стороны накопителя, так и его единственная реальная аномалия.

В сегменте 16K все восемь накопителей двигались синхронно в диапазоне от 0,5 до 1,5 ГиБ/с, а однопоточная задержка записи PS1030, составившая 22,3 мкс, находилась в лидирующем кластере вместе с двумя накопителями KIOXIA (по 21,4 мкс у каждого) и собственным «собратом» (21,9 мкс).
В сегменте 128K модель PS1030 чисто масштабировалась примерно до 3,95 ГиБ/с при 128K/32, после чего последовал резкий спад: примерно 2,35 ГиБ/с при 128K/64 и 1,55 ГиБ/с при 128K/128, что составляет менее трети от производительности лидеров сегмента.
Это то же самое падение производительности записи при высоком количестве потоков, которое мы зафиксировали у PS1010 в обзоре CD9P-R, воспроизведенное практически точка в точка и на PS1030 (модель PS1010 падала до 2,5, а затем до 1,65 ГиБ/с на тех же отметках).
Причина этого кроется на уровне платформы, а не в классе выносливости (endurance tier), и этот нюанс остается самым существенным изъяном в массиве данных.
В сегменте 1M этот паттерн смягчился, но не исчез полностью.

PS1030 достиг пика на отметке 4,22 ГиБ/с (1M/8), опередив лишь «собрата» с его 4,17 ГиБ/с, и снизился до примерно 3,35 ГиБ/с при 1M/128. В то же время CM9-R удерживал самую стабильную линию в группе вплоть до своего пика в 5,51 ГиБ/с, а 9550 MAX показал наивысший пик на уровне 5,69 ГиБ/с, демонстрируя при этом собственную документированную волатильность с падением почти до 2,2 ГиБ/с при 1M/64.
Накопители 9550 Pro (5,54 ГиБ/с), 7600 MAX (5,44 ГиБ/с), CD9P-R (4,86 ГиБ/с) и SN861 (4,59 ГиБ/с) заполнили оставшиеся позиции в порядке очередности.
Практическое применение и итоги тестирования Solidigm D7-PS1030
Спасительным фактором для целевого покупателя PS1030 является работа кэша KV и уровней в стиле логов при умеренном количестве потоков на один накопитель, где PS1030 ведет себя безупречно, а не при 64 и более потоках прямой записи с GPU (GPU-direct), где происходит падение производительности.
Наша собственная реализация кэша KV задействовала восемь таких накопителей в течение нескольких недель без того, чтобы массив хотя бы приблизился к узкому месту.

Но любой, кто планирует интенсивную многопоточную потоковую передачу записей GDS на эту платформу, должен сначала протестировать свой точный паттерн.
Заключение и ключевые особенности
Solidigm D7-PS1030 выполняет именно то, что должен делать накопитель PCIe Gen5 со средней выносливостью, а данные демонстрируют устройство с четко определенным набором навыков.
Его отличительной чертой является параллельная работа с мелкими блоками: второе место в группе как по случайной записи 4K (1 595,8 тыс. IOPS, уступая только ровеснику с 3 DWPD — Micron 7600 MAX), так и по случайному чтению 4K (2 255,8 тыс. IOPS), лучший в группе результат случайного чтения 64K на уровне 14 162,9 МБ/с и полная линейная скорость Gen5 на последовательном чтении 128K на уровне 14 156,4 МБ/с.
Не менее интересно и то, как достигаются эти показатели: пики при IODepth 2 или NumJobs 8 с задержкой в десятки микросекунд, тогда как конкурентам требуются глубокие очереди, за что они расплачиваются задержкой.
Накопитель рано выходит на насыщение, держит показатели стабильными и сохраняет задержку записи в худшем случае вдвое ниже, чем у его предшественника PS1010.

Компромиссы и слабые стороны
Тем не менее, существуют определенные компромиссы.
Последовательная запись 128K с одним рабочим потоком оказалась на последнем месте в группе с показателем 6 370,3 МБ/с, а чекпоинтинг DLIO, который нагружает именно этот паттерн, показал наихудший в группе средний результат для Третьего прохода (Pass 3) на уровне 599,2 секунды.
Тесты последовательного чтения и записи 16K также отставали от конкурентов по обеим направлениям: пик записи составил 5 977,7 МБ/с, а пик чтения — 11 142,8 МБ/с, причем оба показателя заняли седьмое место из восьми.
Тест записи GDSIO воспроизвел падение скорости для 128K при большом количестве потоков, свойственное PS1010, практически точка в точку, подтвердив это как системное поведение платформы, а не единичный случай, в то время как мелкоблочные операции чтения с прямым доступом с GPU (GPU-direct) существенно отдают предпочтение накопителям KIOXIA.

Сферы применения
Ничто из этого не умаляет назначение накопителя, но подчеркивает его: PS1030 — это вовсе не тот накопитель, который подходит для однопоточного приема данных.
То, для чего он создан, уже доказано на практике в течение более длительного времени, чем любые бенчмарк-тесты.
Восемь таких накопителей провели недели в качестве уровня разгрузки кэша KV в наших задачах инференса на базе XE7740, поглощая 1,9 ГБ/с непрерывной записи в круглосуточном режиме с рабочим циклом, который слегка превосходил их рейтинг в 3 DWPD, и этот уровень никогда не становился узким местом.
Данные тестов объясняют, почему это сработало: раннее насыщение записи, задержка записи 4K на уровне однозначных чисел микросекунд при малых глубинах очереди и контролируемый верхний предел задержки — это именно те свойства, которые вознаграждаются непрерывно записываемым кэшем или уровнем логов.
Рабочие нагрузки с ограниченной выносливостью, чувствительные к задержкам, с умеренной конкуренцией при записи, разгрузка кэша KV, логирование OLTP и уровни метаданных — это именно те области, где должен применяться PS1030 и где его ресурс в 3 DWPD и трехлетняя опция на 4,98 DWPD позволяют работать с циклами нагрузки, которые дисквалифицировали бы класс накопителей с интенсивным чтением.





