В состав Rubin входят до 224 потоковых мультипроцессоров и 896 тензорных ядер с Transformer Engine третьего поколения. Ресурсы распределены между кластерами GPC с централизованным кешем второго уровня, а движок GigaThread координирует выполнение задач и загрузку вычислительных блоков.
Ускоритель также поддерживает разделение на несколько виртуальных GPU через управляющие разделы MIG. Это позволяет одной физической системе обслуживать несколько независимых нагрузок, не выделяя под каждую задачу отдельный ускоритель.
Подсистема памяти включает 288 ГБ HBM4, собранной на 12-слойных модулях. Пиковая пропускная способность достигает 22 ТБ/с. Обновленный Tensor Memory Accelerator должен ускорять перемещение данных внутри чипа, что особенно критично при работе крупных моделей: вычислительные блоки бесполезны, если им приходится ждать очередную порцию данных.
Для связи между ускорителями используется NVLink 6 с пропускной способностью общей шины до 3600 ГБ/с. Интерфейс NVLink-C2C обеспечивает обмен между CPU и GPU на скорости до 1800 ГБ/с. Для внешних устройств предусмотрен коммутатор PCIe 6.0 с пропускной способностью 256 ГБ/с.
Одним из изменений стала связь, которую инициирует сам GPU. В традиционных системах передача данных между ускорителями требует дополнительной координации и может приводить к задержкам. В Rubin каждый GPU способен самостоятельно управлять обменом, сокращая время ожидания и зависимость от внешней оптимизации.
Отдельно NVIDIA занялась энергопотреблением стоек Vera Rubin NVL72, в каждой из которых установлено 72 GPU. Система Intelligent Power Smoothing удерживает компоненты в пределах общего энергетического лимита при резких переходах от простоя к полной нагрузке.

По данным компании, среднее энергопотребление Vera Rubin NVL72 примерно на 10% ниже, чем у Grace Blackwell NVL72. Пиковая мощность на интервале 50 мс снижена примерно на 20%. Для дата-центров такие короткие скачки имеют значение: электросеть и охлаждение приходится рассчитывать именно на максимальную нагрузку, а не на красивую среднюю цифру.
Как считаете, в будущих ускорителях важнее рост вычислительной мощности или снижение энергопотребления всей стойки?








