Американський плацдарм для систем Vera Rubin
Обчислювальний потенціал системи Nvidia Vera

В основі нового рішення для центрів обробки даних лежить монолітний обчислювальний кристал, що об'єднує 88 спеціалізованих ядер Olympus. Така конфігурація забезпечує 176 апаратних потоків і спирається на масивний уніфікований кеш L3 обсягом 164 Мбайт, що дозволяє мінімізувати затримки при роботі з величезними масивами даних у режимі реального часу.

Кожне ядро Olympus є високопродуктивним інструментом із широким конвеєром, підсиленим нейронним передбачником розгалужень — технологією, що дозволяє процесору з високою точністю прогнозувати траєкторію виконання коду, скорочуючи простої. Ефективність керування інструкціями забезпечується 64-кілобайтним чотириканальним кешем L1 та вражаючою чергою декодування на 48 інструкцій. Здатність зчитувати до 16 інструкцій за такт у поєднанні з десятиканальним декодером, що підтримує об'єднані інструкції, перетворює ядро на потужний механізм обробки потоків даних.

Технологічний стек Olympus включає просунуті механізми перейменування пам'яті, передбачення значень та виключення переміщень. Ці оптимізації є критично важливими для усунення залежностей між операціями, які зазвичай уповільнюють виконання складних алгоритмів. Виконавчий блок спроєктований як універсальний комбайн: він об'єднує модулі для цілочисельних і векторних обчислень, операції з плаваючою комою, криптографічні функції та виділені ресурси для максимально швидкого переміщення даних між пам'яттю та регістрами.

Особлива увага приділена ієрархії пам'яті. Кожне ядро оснащене 96-кілобайтним шестиканальним кешем даних L1 та 2-мегабайтним восьмиканальним кешем L2. Для роботи з сучасними графовими структурами даних, що лежать в основі багатьох моделей ШІ, впроваджено механізми апаратного попереднього вибору (prefetching). Це дозволяє процесору заздалегідь підвантажувати необхідні дані з пам'яті, навіть якщо вони розташовані нелінійно, що радикально прискорює обробку складних зв'язків і покажчиків.

Інноваційним аспектом Vera стала концепція просторової багатопотоковості. На відміну від класичного SMT (Simultaneous Multithreading), де потоки часто конкурують за одні й ті самі ресурси, просторовий підхід дозволяє гнучко розподіляти потужності ядра. Це дає можливість надавати пріоритет критично важливому для продуктивності потоку, залишаючи другому виконання фонових системних і керуючих завдань, що фактично виключає взаємне блокування ресурсів усередині одного ядра.

Сполучною ланкою всієї системи виступає масштабована когерентна структура другого покоління. Вона забезпечує феноменальну пропускну здатність між ядрами — до 3,4 Тбайт/с. Пам'ять стандарту LPDDR5X SOCAMM2 забезпечує швидкість передачі даних до 1,2 Тбайт/с, при цьому підтримуваний обсяг оперативної пам'яті на один процесор може сягати 1,5 Тбайт. Для взаємодії із зовнішніми пристроями та іншими вузлами використовуються інтерфейс NVLink-C2C зі швидкістю 1,8 Тбайт/с, стандарт PCIe 6.0 та протокол CXL 3.1. У двосокетних конфігураціях система надає 176 ліній PCIe і використовує двовузлову схему NUMA, оптимізуючи доступ до пам'яті для кожного сокета.

Практичний результат такого інженерного підходу проявляється в задачах зі створення автономних ШІ-агентів. Згідно з внутрішніми тестами SPEC CPU 2026, Vera демонструє продуктивність, яка майже вдвічі перевищує показники традиційних x86-систем у відповідних сценаріях. Це підтверджує тезу про те, що майбутнє високопродуктивних обчислень лежить у площині глибокої спеціалізації та оптимізації шляхів передачі даних.

