Cosmos 3 Edge та ера фізичного ШІ

Дата22 лип. 2026 р.
Читати3 хв
Cosmos 3 Edge та ера фізичного ШІ
Сучасний штучний інтелект виривається за межі текстових інтерфейсів та генерації зображень, переходячи на рівень реальної фізичної взаємодії. Критичним бар'єром на цьому шляху протягом довгого часу залишалися латентність передачі даних та обмежені обчислювальні потужності периферійних пристроїв. Випуск Cosmos 3 Edge від NVIDIA знаменує перехід до концепції «моделей світу», що працюють локально та в режимі реального часу. Відтепер ШІ не просто аналізує візуальний ряд, а прогнозує фізичні наслідки дій у тривимірному просторі.

Індустрія еволюціонує від класичного комп'ютерного зору до парадигми Physical AI — систем, що мають глибоке розуміння законів фізики та здатні ефективно взаємодіяти з навколишнім середовищем. У центрі цього зрушення стоїть Cosmos 3 Edge, компактна модель світу з 4 мільярдами параметрів. На відміну від традиційних нейромереж, що обмежуються розпізнаванням об'єктів, ця система об'єднує сприйняття, прогнозування та генерацію дій у єдиному циклі.

Технологічний фундамент моделі ґрунтується на підході Mixture-of-Transformers (MoT). Ця гібридна структура дозволяє ефективно розподіляти когнітивні завдання між двома спеціалізованими блоками. Авторегресійний трансформер бере на себе функції логічного виведення, аналізу сцени та обробки текстових інструкцій. Паралельно з цим дифузійний трансформер відповідає за візуальне моделювання: він генерує майбутні стани середовища та формує конкретні послідовності дій для фізичних агентів. Такий симбіоз дозволяє системі не просто констатувати поточний стан справ, а й прораховувати сценарії «що станеться, якщо...», що є критично важливим для автономних систем.

Особлива увага приділена проблемі інференсу на периферії (Edge Computing). Для робототехніки хмарні обчислення є неприйнятними через високий пінг, який може призвести до аварії або помилки маніпуляції. Cosmos 3 Edge оптимізована для роботи безпосередньо на апаратних платформах NVIDIA, включаючи Jetson Thor та серію RTX. При роздільній здатності керування 640×360 модель забезпечує мінімальну затримку, дозволяючи роботам реагувати на зміни середовища практично миттєво.

Ефективність моделі підтверджується результатами бенчмарка VANTAGE-Bench, де Cosmos 3 Edge демонструє лідерство серед рішень порівнянного розміру в задачах відеоаналітики. Однак NVIDIA не обмежилася універсальним рішенням. Для вузькоспеціалізованих завдань було представлено версію Policy (DROID), донавчену на масиві даних DROID. Ця модифікація перетворює загальні знання про світ на конкретні навички маніпуляції, такі як точне захоплення та переміщення об'єктів.

Паралельно з основною моделлю представлені прискорені генеративні інструменти: Cosmos 3 Super Image2Video та Text2Image. Їхня висока швидкість роботи досягнута завдяки дистиляції DMD2 з більш масивної версії моделі, що дозволяє отримувати якісний візуальний контент за мінімальну кількість кроків.

У загальній ієрархії сімейства Cosmos 3 вибудувана чітка вертикаль масштабування. Найлегша версія Edge (4 млрд параметрів) призначена для локальних пристроїв; Nano (16 млрд) займає проміжне становище, а Super (64 млрд) орієнтована на складні завдання моделювання та генерацію високої роздільної здатності. Усі три рівні переслідують єдину мету — створення універсального когнітивного шару для роботів, який об'єднує сенсорне сприйняття зі здатністю до планування.

Відкритість проєкту підкреслюється ліцензією OpenMDW-1.1, яка відкриває двері як для академічних досліджень, так і для комерційного впровадження. Публікація вихідного коду інструментів донавчання на GitHub та доступ до ваг моделей через Hugging Face створюють необхідну інфраструктуру для розвитку автономних систем нового покоління, перетворюючи складні концепції «моделей світу» на доступний інженерний інструмент.

Тала знає • Використання матеріалів сайту дозволено виключно за умови розміщення активного, прямого і відкритого для пошукових систем гіперпосилання на першоджерело. Посилання має бути клікабельним і розташовуватися безпосередньо в тілі публікації — до або після запозиченого тексту. Будь-яке копіювання, відтворення або цитування контенту без дотримання цієї умови розглядається як порушення авторських прав.