Обчислювальний потенціал системи Nvidia Vera
Cosmos 3 Edge та ера фізичного ШІ

Індустрія еволюціонує від класичного комп'ютерного зору до парадигми Physical AI — систем, що мають глибоке розуміння законів фізики та здатні ефективно взаємодіяти з навколишнім середовищем. У центрі цього зрушення стоїть Cosmos 3 Edge, компактна модель світу з 4 мільярдами параметрів. На відміну від традиційних нейромереж, що обмежуються розпізнаванням об'єктів, ця система об'єднує сприйняття, прогнозування та генерацію дій у єдиному циклі.
Технологічний фундамент моделі ґрунтується на підході Mixture-of-Transformers (MoT). Ця гібридна структура дозволяє ефективно розподіляти когнітивні завдання між двома спеціалізованими блоками. Авторегресійний трансформер бере на себе функції логічного виведення, аналізу сцени та обробки текстових інструкцій. Паралельно з цим дифузійний трансформер відповідає за візуальне моделювання: він генерує майбутні стани середовища та формує конкретні послідовності дій для фізичних агентів. Такий симбіоз дозволяє системі не просто констатувати поточний стан справ, а й прораховувати сценарії «що станеться, якщо...», що є критично важливим для автономних систем.
Особлива увага приділена проблемі інференсу на периферії (Edge Computing). Для робототехніки хмарні обчислення є неприйнятними через високий пінг, який може призвести до аварії або помилки маніпуляції. Cosmos 3 Edge оптимізована для роботи безпосередньо на апаратних платформах NVIDIA, включаючи Jetson Thor та серію RTX. При роздільній здатності керування 640×360 модель забезпечує мінімальну затримку, дозволяючи роботам реагувати на зміни середовища практично миттєво.
Ефективність моделі підтверджується результатами бенчмарка VANTAGE-Bench, де Cosmos 3 Edge демонструє лідерство серед рішень порівнянного розміру в задачах відеоаналітики. Однак NVIDIA не обмежилася універсальним рішенням. Для вузькоспеціалізованих завдань було представлено версію Policy (DROID), донавчену на масиві даних DROID. Ця модифікація перетворює загальні знання про світ на конкретні навички маніпуляції, такі як точне захоплення та переміщення об'єктів.
Паралельно з основною моделлю представлені прискорені генеративні інструменти: Cosmos 3 Super Image2Video та Text2Image. Їхня висока швидкість роботи досягнута завдяки дистиляції DMD2 з більш масивної версії моделі, що дозволяє отримувати якісний візуальний контент за мінімальну кількість кроків.
У загальній ієрархії сімейства Cosmos 3 вибудувана чітка вертикаль масштабування. Найлегша версія Edge (4 млрд параметрів) призначена для локальних пристроїв; Nano (16 млрд) займає проміжне становище, а Super (64 млрд) орієнтована на складні завдання моделювання та генерацію високої роздільної здатності. Усі три рівні переслідують єдину мету — створення універсального когнітивного шару для роботів, який об'єднує сенсорне сприйняття зі здатністю до планування.
Відкритість проєкту підкреслюється ліцензією OpenMDW-1.1, яка відкриває двері як для академічних досліджень, так і для комерційного впровадження. Публікація вихідного коду інструментів донавчання на GitHub та доступ до ваг моделей через Hugging Face створюють необхідну інфраструктуру для розвитку автономних систем нового покоління, перетворюючи складні концепції «моделей світу» на доступний інженерний інструмент.

