Американский плацдарм для систем Vera RubinВычислительный потенциал системы Nvidia Vera

В основе нового решения для центров обработки данных лежит монолитный вычислительный кристалл, объединяющий 88 специализированных ядер Olympus. Эта конфигурация обеспечивает 176 аппаратных потоков и опирается на массивный унифицированный кеш L3 объемом 164 Мбайт, что позволяет минимизировать задержки при работе с огромными массивами данных в режиме реального времени.

Каждое ядро Olympus представляет собой высокопроизводительный инструмент с широким конвейером, усиленным нейронным предсказателем ветвлений — технологией, которая позволяет процессору с высокой точностью предугадывать траекторию выполнения кода, сокращая простои. Эффективность управления инструкциями обеспечивается 64-килобайтным четырехканальным кешем L1 и внушительной очередью декодирования на 48 инструкций. Способность считывать до 16 инструкций за такт в сочетании с десятиканальным декодером, поддерживающим объединенные инструкции, превращает ядро в мощный механизм по переработке потоков данных.

Технологический стек Olympus включает продвинутые механизмы переименования памяти, предсказания значений и исключения перемещений. Эти оптимизации критически важны для устранения зависимостей между операциями, которые обычно замедляют выполнение сложных алгоритмов. Исполнительный блок спроектирован как универсальный комбайн: он объединяет модули для целочисленных и векторных вычислений, операции с плавающей запятой, криптографические функции и выделенные ресурсы для максимально быстрого перемещения данных между памятью и регистрами.

Особое внимание уделено иерархии памяти. Каждое ядро оснащено 96-килобайтным шестиканальным кешем данных L1 и 2-мегабайтным восьмиканальным кешем L2. Для работы с современными графовыми структурами данных, которые лежат в основе многих моделей ИИ, внедрены механизмы аппаратной предварительной выборки. Это позволяет процессору заранее подгружать необходимые данные из памяти, даже если они расположены нелинейно, что радикально ускоряет обработку сложных связей и указателей.

Инновационным аспектом Vera стала концепция пространственной многопоточности. В отличие от классического SMT (Simultaneous Multithreading), где потоки часто конкурируют за одни и те же ресурсы, пространственный подход позволяет гибко распределять мощности ядра. Это дает возможность отдавать приоритет критически важному для производительности потоку, оставляя второму выполнение фоновых системных и управляющих задач, что фактически исключает взаимное блокирование ресурсов внутри одного ядра.

Связующим звеном всей системы выступает масштабируемая когерентная структура второго поколения. Она обеспечивает феноменальную пропускную способность между ядрами — до 3,4 Тбайт/с. Память стандарта LPDDR5X SOCAMM2 обеспечивает скорость передачи данных до 1,2 Тбайт/с, при этом поддерживаемый объем оперативной памяти на один процессор может достигать 1,5 Тбайт. Для взаимодействия с внешними устройствами и другими узлами используются интерфейс NVLink-C2C со скоростью 1,8 Тбайт/с, стандарт PCIe 6.0 и протокол CXL 3.1. В двухсокетных конфигурациях система предоставляет 176 линий PCIe и использует двухузловую схему NUMA, оптимизируя доступ к памяти для каждого сокета.

Практический результат такого инженерного подхода проявляется в задачах по созданию автономных ИИ-агентов. Согласно внутренним тестам SPEC CPU 2026, Vera демонстрирует производительность, которая почти в два раза превышает показатели традиционных x86-систем в соответствующих сценариях. Это подтверждает тезис о том, что будущее высокопроизводительных вычислений лежит в плоскости глубокой специализации и оптимизации путей передачи данных.

