Університет штучного інтелекту імені Мохамеда бін Заїда (MBZUAI) представив передову модель LlamaV-o1, здатну вирішувати складні завдання мислення на основі тексту та зображень. Інновація поєднує сучасні навчальні програми та методи оптимізації, такі як Beam Search, що встановлює новий стандарт у мультимодальних системах.
Про це інформує Venturebeat.
За словами розробників, модель виділяється здатністю до покрокових міркувань, які особливо важливі для багатоступеневих завдань у візуальних контекстах. Вона успішно впроваджується у таких напрямках, як інтерпретація медичних зображень чи фінансових діаграм.
Поряд із запуском LlamaV-o1 дослідники представили тест VRC-Bench, створений для оцінки здатності ШІ до покрокових міркувань. Цей тест включає понад 1000 завдань і більше ніж 4000 кроків логічного аналізу. Він уже отримав визнання як новий еталон у мультимодальних дослідженнях. На тестах модель показала значні результати. Наприклад, її рейтинг у VRC-Bench досяг 68,93, що перевершило багатьох конкурентів, таких як LLaVA-CoT (66,21) і Claude 3.5 Sonnet.
Прозорість і швидкість: ключові переваги
LlamaV-o1 вирізняється серед інших моделей своєю здатністю демонструвати кроки, які вона робить для досягнення результату. Ця особливість робить її цінною у сферах, де важлива інтерпретація, наприклад, у медицині та фінансах.

Методика Beam Search забезпечує оптимізацію шляхів міркування, що значно підвищує швидкість обчислень. Наприклад, модель виявилася у 5 разів швидшою за конкурентів при виконанні багатоступеневих завдань, що робить її ідеальною для бізнесу.
Здатність до покрокових міркувань дозволяє LlamaV-o1 успішно застосовуватися у галузях із високими вимогами до прозорості. У медицині вона забезпечує прозорість процесів аналізу даних, наприклад, пояснюючи, як отримано діагноз. У фінансах модель ефективно працює з інтерпретацією графіків, допомагаючи у прийнятті рішень. Також модель демонструє універсальність, працюючи у створенні контенту, аналізі даних та розмовних агентів.
Майбутнє мультимодального ШІ
Попри значні досягнення, розробники застерігають від використання LlamaV-o1 у завданнях із високими ризиками, таких як медичні чи фінансові прогнози. Проте вона демонструє потенціал мультимодальних систем ШІ, здатних обробляти текст, зображення та інші типи даних, наближаючи машинний інтелект до людського.
Випуск моделі LlamaV-o1 та еталонного тесту VRC-Bench відкриває нову еру в розвитку штучного інтелекту, підкреслюючи важливість прозорості та точності у складних процесах мислення.
Раніше редакція сайту AI360 писала про те, що Llama запроваджує інновації ШІ для державних установ США. Розвиток моделей штучного інтелекту відкритого коду, таких як Llama від Meta, активно підтримується компаніями з усього світу.

