Вычислительный потенциал системы Nvidia VeraCosmos 3 Edge и эра физического ИИ

Индустрия переходит от классического компьютерного зрения к парадигме Physical AI — систем, которые обладают глубоким пониманием законов физики и способны взаимодействовать с окружающей средой. В центре этого сдвига стоит Cosmos 3 Edge, компактная модель мира с 4 миллиардами параметров. В отличие от традиционных нейросетей, которые ограничиваются распознаванием объектов, эта система объединяет восприятие, прогнозирование и генерацию действий в едином цикле.
Технологический фундамент модели базируется на подходе Mixture-of-Transformers (MoT). Эта гибридная структура позволяет эффективно распределять когнитивные задачи между двумя специализированльными блоками. Авторегрессионный трансформер берет на себя функции логического вывода, анализа сцены и обработки текстовых инструкций. Параллельно с этим диффузионный трансформер отвечает за визуальное моделирование: он генерирует будущие состояния среды и формирует конкретные последовательности действий для физических агентов. Такой симбиоз позволяет системе не просто констатировать текущее положение дел, но и просчитывать сценарии «что произойдет, если...», что критически важно для автономных систем.
Особое внимание уделено проблеме инференса на границе сети (Edge Computing). Для робототехники облачные вычисления неприемлемы из-за высокого пинга, который может привести к аварии или ошибке манипуляции. Cosmos 3 Edge оптимизирована для работы непосредственно на аппаратных платформах NVIDIA, включая Jetson Thor и серию RTX. При разрешении управления 640×360 модель обеспечивает минимальную задержку, позволяя роботам реагировать на изменения среды практически мгновенно.
Эффективность модели подтверждается результатами бенчмарка VANTAGE-Bench, где Cosmos 3 Edge демонстрирует лидерство среди решений сопоставимого размера в задачах видеоаналитики. Однако NVIDIA не ограничилась универсальным решением. Для узкоспециализированных задач была представлена версия Policy (DROID), дообученная на массиве данных DROID. Эта модификация превращает общие знания о мире в конкретные навыки манипуляции, такие как точный захват и перемещение объектов.
Параллельно с основной моделью представлены ускоренные генеративные инструменты: Cosmos 3 Super Image2Video и Text2Image. Их высокая скорость работы достигнута благодаря дистилляции DMD2 из более массивной версии модели, что позволяет получать качественный визуальный контент за минимальное количество шагов.
В общей иерархии семейства Cosmos 3 выстроена четкая вертикаль масштабирования. Самая легкая версия Edge (4 млрд параметров) предназначена для локальных устройств; Nano (16 млрд) занимает промежуточное положение, а Super (64 млрд) ориентирована на сложные задачи моделирования и генерации высокого разрешения. Все три уровня преследуют единую цель — создание универсального когнитивного слоя для роботов, который объединяет сенсорное восприятие с способностью к планированию.
Открытость проекта подчеркивается лицензией OpenMDW-1.1, которая открывает двери как для академических исследований, так и для коммерческого внедрения. Публикация исходного кода инструментов дообучения на GitHub и доступ к весам моделей через Hugging Face создают необходимую инфраструктуру для развития автономных систем нового поколения, превращая сложные концепции «моделей мира» в доступный инженерный инструмент.

