Вівторок, 11 Серпня, 2026
ГоловнаНовиниЧисленні моделі ШІ допомагають роботам виконувати складні плани більш прозоро
ГоловнаНовиниЧисленні моделі ШІ допомагають роботам виконувати складні плани більш прозоро

Численні моделі ШІ допомагають роботам виконувати складні плани більш прозоро

-

Мультимодальна система використовує моделі, навчені на основі мови, зору та даних про дії, щоб допомогти роботам розробляти та виконувати плани для домашніх, будівельних і виробничих завдань.

Ваш щоденний список справ, ймовірно, досить простий: помити посуд, купити продукти та інші дрібниці. Навряд чи ви написали «взяти перший брудний посуд» або «помити тарілку губкою», тому що кожен із цих мініатюрних кроків у рутинній справі здається інтуїтивно зрозумілим. Хоча ми можемо регулярно виконувати кожен крок без особливих роздумів, робот потребує складного плану, який містить більш детальні плани.

Лабораторія Improbable AI Lab Массачусетського технологічного інституту, група в рамках Лабораторії комп’ютерних наук і штучного інтелекту (CSAIL), запропонувала цим машинам руку допомоги з новою мультимодальною структурою: моделі композиційної основи для ієрархічного планування (HiP), яка розробляє детальні здійсненні плани за допомогою експертиза трьох різних моделей фундаменту. Подібно до GPT-4 від OpenAI, базової моделі, на основі якої побудовано ChatGPT і Bing Chat, ці базові моделі навчаються на величезній кількості даних для програм, як-от створення зображень, переклад тексту та роботизація.

На відміну від RT2 та інших мультимодальних моделей, які навчаються на парних даних зору, мови та дій, HiP використовує три різні базові моделі, кожна з яких навчається на різних модальностях даних. Кожна базова модель фіксує різну частину процесу прийняття рішень, а потім працює разом, коли настає час приймати рішення. HiP усуває необхідність доступу до парних даних про зір, мову та дії, які важко отримати. HiP також робить процес міркування більш прозорим.

Те, що вважається щоденною роботою для людини, може бути «далекою ціллю» робота — всеосяжною ціллю, яка передбачає виконання багатьох дрібніших кроків, що вимагає достатньо даних для планування, розуміння та виконання цілей. У той час як дослідники комп’ютерного зору намагалися побудувати монолітні базові моделі для цієї проблеми, об’єднання мовних, візуальних і дійових даних є дорогим. Натомість HiP представляє інший, мультимодальний рецепт: тріо, яке дешево поєднує лінгвістичний, фізичний та екологічний інтелект у робота.

«Основні моделі не обов’язково повинні бути монолітними», — каже дослідник NVIDIA AI Джим Фан, який не брав участі в роботі. «Ця робота розкладає складне завдання втіленого агентського планування на три складові моделі: мовний аргумент, модель візуального світу та планувальник дій. Це робить складну проблему прийняття рішень більш легкою та прозорою».

Команда вважає, що їхня система може допомогти цим машинам виконувати домашні справи, наприклад, прибрати книгу або поставити миску в посудомийну машину. Крім того, HiP може допомогти в багатоетапних завданнях будівництва та виробництва, як-от укладання та розміщення різних матеріалів у певній послідовності.

Оцінка HiP

Команда CSAIL перевірила гостроту HiP на трьох маніпуляційних завданнях, перевершивши порівняльні рамки. Система ґрунтується на розробці інтелектуальних планів, які адаптуються до нової інформації.

Спочатку дослідники попросили, щоб він складав блоки різного кольору один на одного, а потім розміщував інші поруч. Заковика: деякі правильні кольори були відсутні, тому роботу довелося помістити білі блоки в кольорову миску, щоб пофарбувати їх. HiP часто точно пристосовувався до цих змін, особливо в порівнянні з найсучаснішими системами планування завдань, такими як Transformer BC і Action Diffuser, коригуючи свої плани для укладання та розміщення кожного квадрата за потреби.

Ще один тест: розкласти такі предмети, як цукерки та молоток, у коричневій коробці, ігноруючи інші предмети. Деякі об’єкти, які потрібно було перемістити, були брудними, тому HiP скорегував свої плани, помістивши їх у ящик для очищення, а потім у коричневий контейнер. У третій демонстрації бот зміг проігнорувати непотрібні об’єкти, щоб виконати кухонні підцілі, наприклад відкрити мікрохвильову піч, прибрати чайник і ввімкнути світло. Деякі з запропонованих кроків уже було виконано, тому робот адаптувався, пропускаючи ці вказівки.

Тристороння ієрархія

Тристоронній процес планування HiP працює як ієрархія з можливістю попереднього навчання кожного з його компонентів на різних наборах даних, включаючи інформацію поза робототехнікою. У нижній частині цього порядку знаходиться велика мовна модель (LLM), яка починає ідеювати, фіксуючи всю необхідну символічну інформацію та розробляючи абстрактний план завдання. Застосовуючи знання здорового глузду, які вона знаходить в Інтернеті, модель розбиває свою мету на підцілі. Наприклад, «приготування чашки чаю» перетворюється на «наповнення каструлі водою», «кип’ятіння каструлі» та наступні необхідні дії.

«Все, що ми хочемо зробити, — це взяти існуючі попередньо навчені моделі та забезпечити їх успішну взаємодію між собою», — говорить Анураг Аджай, аспірант кафедри електротехніки та комп’ютерних наук Массачусетського технологічного інституту (EECS) і філія CSAIL. «Замість того, щоб наполягати на тому, щоб одна модель робила все, ми об’єднуємо кілька, які використовують різні модальності Інтернет-даних. Коли вони використовуються в тандемі, вони допомагають у робототехнічному прийнятті рішень і потенційно можуть допомогти у виконанні завдань у будинках, на фабриках і на будівельних майданчиках».

Ці моделі також потребують певної форми «очей», щоб зрозуміти середовище, в якому вони працюють, і правильно виконати кожну проміжну ціль. Команда використовувала велику модель розповсюдження відео, щоб розширити початкове планування, завершене LLM, який збирає геометричну та фізичну інформацію про світ із відео в Інтернеті. У свою чергу, відеомодель генерує план траєкторії спостереження, уточнюючи схему LLM для включення нових фізичних знань.

Цей процес, відомий як ітераційне вдосконалення, дозволяє HiP міркувати про свої ідеї, враховуючи відгуки на кожному етапі, щоб створити більш практичний план. Потік відгуків подібний до написання статті, коли автор може надіслати свій чернетку редактору, і видавець перевіряє всі останні зміни та доопрацьовує їх, враховуючи ці зміни.

У цьому випадку вершиною ієрархії є егоцентрична модель дії або послідовність зображень від першої особи, які роблять висновок про те, які дії мають відбутися на основі оточення. Під час цього етапу план спостереження з відеомоделі наноситься на простір, видимий роботом, допомагаючи машині вирішити, як виконати кожне завдання в межах довгострокової цілі. Якщо робот використовує HiP для приготування чаю, це означає, що він точно визначив, де знаходяться каструля, раковина та інші ключові візуальні елементи, і почне виконувати кожну підціль.

Проте мультимодальна робота обмежена відсутністю якісних моделей відеооснови. Коли вони стануть доступними, вони зможуть взаємодіяти з дрібномасштабними відеомоделями HiP для подальшого вдосконалення візуального прогнозування послідовності та генерації дій робота. Версія вищої якості також зменшить поточні вимоги до даних відеомоделей.

З огляду на це, підхід команди CSAIL використовував лише крихітну частину даних. Крім того, HiP був дешевим у навчанні та продемонстрував потенціал використання доступних базових моделей для виконання довгострокових завдань.

«Те, що Anurag продемонстрував, є доказом того, як ми можемо взяти моделі, навчені окремим завданням і модальностям даних, і об’єднати їх у моделі для роботизованого планування. У майбутньому HiP можна буде доповнити попередньо підготовленими моделями, які можуть обробляти дотик і звук, щоб складати кращі плани», — каже старший автор Пулкіт Агравал, доцент EECS Массачусетського технологічного інституту та директор лабораторії Improbable AI Lab. Група також розглядає можливість застосування HiP для вирішення реальних довгострокових завдань у робототехніці.

Аджай і Агравал є провідними авторами статті з описом роботи. До них приєдналися професори Массачусетського технологічного інституту та головні дослідники CSAIL Томмі Яаккола, Джошуа Тененбаум і Леслі Пак Каелблінг; Дослідницький філія CSAIL і керівник досліджень лабораторії штучного інтелекту MIT-IBM Акаш Срівастава; аспіранти Seungwook Han і Yilun Du ’19; колишній постдоктор Абхішек Гупта, який зараз є доцентом Вашингтонського університету; і колишній аспірант Shuang Li PhD ’23.

Робота команди була частково підтримана Національним науковим фондом, Агентством передових оборонних дослідницьких проєктів США, Дослідницьким офісом армії США, Багатопрофільним університетським дослідницьким інститутом Управління військово-морських досліджень США та Лабораторією MIT-IBM Watson AI Lab. Їхні висновки були представлені на Конференції з нейронних систем обробки інформації (NeurIPS) 2023 року.

Схожі публікації

Вам сподобається

situs slot
slot dana
slot777
slot gacor hari ini