Инженеры предложили принципиально новый подход к компоновке памяти для ИИ-ускорителей и мощных графических процессоров. Вместо традиционной «башни» из кристаллов DRAM, используемой в современных сборках HBM, предлагается устанавливать их на ребро, формируя объёмный блок из кремниевых пластин. Такая вертикальная архитектура обещает одновременно увеличить ёмкость и пропускную способность, а также эффективно решить проблему теплоотвода.

Вертикальное, но не стековое размещение кристаллов памяти заметно улучшит её характеристики. Источник изображения: University of Tokyo
Актуальность поиска новых решений продиктована развитием больших языковых моделей. Текущие GPU уже работают на пределе возможностей, обрастая массивами HBM, однако наращивание количества слоев в стеках неизбежно ведет к перегреву и снижению эффективности. В классической HBM-памяти кристаллы соединены сквозными вертикальными контактами (TSV) и уложены друг на друга. Такая конструкция затрудняет отвод тепла к радиатору, так как кристаллы разделены слоями диэлектрика с низкой теплопроводностью.
На прошедшем в июне симпозиуме IEEE VLSI были представлены концепции, предполагающие установку «куба» памяти на ребро. Это решение фактически отказывается от традиционной базовой подложки HBM. В новой схеме каждый кристалл в 3D-сборке DRAM оснащается собственными интерфейсными и силовыми контактами для прямого подключения к подложке с графическим процессором.
Один из таких проектов, получивший название V-Die, был разработан силами южнокорейских университетов UNIST и Hanbat National University. В этой концепции между кристаллами предусмотрены микрофлюидные каналы для циркуляции жидкого хладагента. Отказ от использования массивных TSV высвобождает полезную площадь под ячейки памяти, а встроенные блоки ввода-вывода (I/O) на каждом кристалле позволяют упростить конструкцию. Контакты для сопряжения с материнской подложкой предлагается располагать вдоль нижней кромки кристалла с шагом около 20 мкм.
Предварительные расчеты показывают впечатляющие результаты: архитектура V-Die способна обеспечить в четыре раза больше соединений, чем стандарт HBM4, при этом сокращая время чтения данных на 37%. При моделировании нагрузки, соответствующей языковой модели уровня GPT-3 на чипе типа Nvidia H100, система V-Die продемонстрировала производительность 540 токенов в секунду, тогда как HBM4 выдает лишь 296 токенов. Задержка до выдачи первого токена снизилась на 24 мс (около 32%), а благодаря микрофлюидному охлаждению рабочая температура удерживалась на отметке 45 °C против 80 °C у традиционных решений.
Несмотря на технические успехи, технология V-Die встретила скепсис специалистов: многие сомневаются в возможности обеспечить идеальную точность позиционирования контактов при массовом производстве. Решение этой проблемы предложила японская исследовательская группа из University of Tokyo, Tohoku University и RIKEN, представившая подход MOSAIC.
В проекте MOSAIC жесткие контакты предлагается использовать только для подачи питания, где требования к точности ниже. Данные и управляющие сигналы передаются индуктивным бесконтактным способом. Для этого на кристаллах памяти формируются вытянутые катушки размером 80 × 240 мкм, а на ответной подложке — аналогичные элементы под прямым углом. Передача данных через магнитное поле снимает жесткие требования к микронной точности сборки. Согласно расчетам, один куб MOSAIC вмещает 98 кристаллов (294 Гбайт), а при уменьшении толщины DRAM до 100 мкм потенциал системы возрастает до 294 кристаллов (882 Гбайт) при пиковой температуре около 81,3 °C.





