Робот під управлінням моделі GEN‑1.5 використовував банан замість щітки

- GEN‑1.5 навчає роботів за однією демонстрацією
- Модель використовує мультимодальні дані для управління
- Робот замінив щітку бананом, зібравши кубики
- Тести підтверджують гнучкість і імпровізацію системи
Компанія Generalist AI, що базується в США, анонсувала розробку мультимодальної фундаментальної моделі під назвою GEN‑1.5. Ця модель призначена для управління роботами і відрізняється здатністю освоювати нові фізичні дії після однієї короткої демонстрації, поміщеної в контекстне вікно, або після невеликої донастройки градієнтним методом за один-єдиний або кілька кроків.
Як працює GEN‑1.5
GEN‑1.5 об'єднує візуальні, текстові та сенсорні дані, дозволяючи системі «бачити» і «розуміти» навколишнє середовище в режимі реального часу. При подачі в контекстне вікно короткої відеодемонстрації нового дії модель формує внутрішнє уявлення задачі і генерує керуючі сигнали для виконавчих механізмів робота. При необхідності модель може бути додатково донастроєна за допомогою градієнтного методу, що вимагає лише кількох ітерацій і невеликого обсягу даних.
Тестування та результати
Під час серії лабораторних випробувань робот, керований GEN‑1.5, продемонстрував здатність до імпровізації. В одному з сценаріїв перед роботом було поставлено завдання зібрати набір кубиків і розмістити їх у чаші. Звичайною щіткою, призначеною для підхоплення дрібних предметів, робот не зміг скористатися, оскільки вона була недоступна. Модель швидко переоцінювала ситуацію і запропонувала альтернативу – використати банан, що лежав поруч, як імпровізований інструмент.
Робот успішно замінив щітку бананом, зібрав усі кубики і переніс їх у чашу, продемонструвавши тим самим гнучкість і адаптивність поведінки, характерні для більш просунутих форм штучного інтелекту. Цей експеримент підтверджує, що GEN‑1.5 може не тільки копіювати продемонстровані дії, але й знаходити творчі рішення в нових умовах.
Подібні можливості відкривають перспективи для застосування в реальних промислових і сервісних завданнях, де умови часто змінюються, а доступні інструменти можуть бути обмежені. Здатність робота швидко адаптуватися без тривалого перенавчання знижує витрати на програмування і підвищує ефективність автоматизації.
Розробники підкреслюють, що модель залишається фундаментальною і може бути інтегрована в різні робототехнічні платформи. Планується подальше розширення можливостей GEN‑1.5, включаючи більш складні маніпуляції та роботу в умовах обмеженої візуальної інформації.
Докладний опис моделі та результатів випробувань опубліковано в офіційному блозі Generalist AI, де також представлені технічні деталі архітектури та приклади застосування в інших сценаріях.
Джерело: N+1



