Прориви в робототехніці зі ШІ не змінять ваше життя найближчим часом
Ця стаття є результатом співпраці MIT Technology Review та Aventine — неприбуткового дослідницького фонду, який створює та підтримує контент про те, як технології й наука змінюють спосіб нашого життя.
Робот, схожий на людину — білий із чорною головою та тулубом, — час від часу з’являється у відеострічках. Можливо, ви бачили, як він танцює або передає попкорн, викидає сміття у відро, пилососить чи натискає кнопку мікрохвильової печі. Або, можливо, спостерігали, як він падає назад, роздаючи пляшки з водою, чи безуспішно намагається попрасувати сорочку.
Це Optimus від Tesla — людиноподібний робот на основі штучного інтелекту, який, на думку генерального директора компанії Ілона Маска, стане «не просто найбільшим продуктом Tesla за всю історію, а ймовірно, найбільшим продуктом за всю історію». Спочатку він працюватиме на заводах, а згодом — у наших домівках. Зрештою він «матиме людську, а потім і надлюдську спритність», сказав Маск акціонерам у липні. На думку Маска, роботи Optimus зможуть автоматизувати майже всю людську працю — від перенесення листового металу до складання білизни — і коштуватимуть лише близько 20 000 доларів кожен. Виступаючи на щорічній зустрічі Всесвітнього економічного форуму в Давосі, Швейцарія, у січні, він спрогнозував, що до кінця 2027 року їх можна буде придбати широкому загалу.
Маск не самотній у своїй пропаганді цієї ідеї. Марк Андріссен, співзасновник і генеральний партнер венчурної компанії Кремнієвої долини Andreessen Horowitz, заявив, що робототехніка може стати «найбільшою індустрією в історії планети». У січні генеральний директор Nvidia Дженсен Хуанг сказав, що людиноподібні роботи досягнуть людського рівня здібностей цього року. За даними Morgan Stanley, кількість роботів, які «схожі на людей і діють як люди», ймовірно, досягне майже 1 мільярда до 2050 року, створивши ринок обсягом понад 5 трильйонів доларів.
Такі заяви значною мірою підживлюються ідеєю, що ті самі досягнення в галузі ШІ, які лежать в основі таких інструментів, як ChatGPT від OpenAI та Claude від Anthropic, дадуть змогу новому поколінню роботів наслідувати людські рухи так само, як чат-боти наслідують людську мову. Але багато дослідників робототехніки ставляться до цього скептично, стверджуючи, що такі припущення применшують складність використання інтелекту, побудованого на мові та зображеннях, для опанування нескінченної мінливості фізичного світу. «Жодна з цих компаній [що створюють людиноподібних роботів] — абсолютно жодна — не має уявлення, як зробити цих роботів достатньо розумними, щоб вони були корисними», — сказав Янн ЛеКун, якого часто називають одним із хрещених батьків ШІ, на іншому заході під час січневої конференції в Давосі.
Дослідники також зазначають, що тенденція ототожнювати людиноподібних роботів, створених за подобою людей, із так званими універсальними машинами, здатними навчатися та виконувати численні завдання, вводить в оману. «Дуже легко зробити робота, який виглядає як людина, — пояснює Джонатан Герст, співзасновник і директор із робототехніки Agility Robotics, а також професор робототехніки в Університеті штату Орегон. — Набагато складніше зробити машину, яка рухається або поводиться динамічно чи фізично як людина».
Ці суперечності — щодо того, чи універсальні людиноподібні роботи вже майже з’явилися або ж їх не видно навіть на горизонті, і щодо того, чи достатньо сучасних форм ШІ для їх удосконалення, — проявляються в робототехнічних лабораторіях по всій країні, де ажіотаж навколо термінів затуляє копіткий, але вагомий прогрес.
Близько десяти років тому низка проривів започаткувала революцію генеративного ШІ, яка перетворила давно уявлювану можливість штучного інтелекту на реальність. Робототехніки — хоча й не погоджуються щодо точних термінів — вважають, що в робототехніці можлива не менш трансформаційна революція, яка наділить машини фізичною інтуїцією та плавністю рухів, що тривалий час залишалися недосяжними. У міру того як робототехніка повільно просувається вперед, постає питання: чи достатньо тих самих методів та інструментів, які спричинили прогрес у ШІ, щоб досягти цієї мети, чи потрібен цілком новий шлях.
Роботи зустрічають передовий ШІ
Щоб побачити один із найрозумніших роботизованих «мозків», які працюють сьогодні, варто поглянути на те, що Google DeepMind може робити за допомогою обладнання під назвою ALOHA 2 — скорочено від «A Low-cost Open-source Hardware System for Bimanual Teleoperation» («Недорога апаратна система з відкритим кодом для бімануального телеуправління»).
Робототехніки давно сперечаються про те, чи потрібна універсальним роботам форма, схожа на людську: прихильники вважають, що це допоможе їм вписатися у світ таким, яким він є, а противники кажуть, що клопіт не вартий результату. ALOHA 2 відображає другий підхід. На вигляд це лише пара рук, кілька захватів і пара камер. Але попри уявну простоту, це робоча конячка дослідників Google DeepMind, які використовують її для тестування своєї найсучаснішої системи ШІ для робототехніки Gemini Robotics у різних лабораторіях.
Коли ALOHA 2 керує Gemini Robotics, вона стає більш універсальним роботом — у тому сенсі, що може виконувати безліч завдань на основі прикладів, на яких її навчали. Попросіть її зібрати ланчбокс — і, як свідчить відео цього вправляння, вона зможе двома щипцевими захватами обережно покласти шматок білого хліба в пакет Ziploc, закрити його, покласти гроно винограду в контейнер Tupperware, закрити кришку, а потім обережно перемістити все в ланчбокс і застебнути його.
Це не найкращий ланч. Але сам факт, що робот може його зібрати, є очевидним кроком уперед порівняно з тим, що було можливим навіть, скажімо, три роки тому.
Значною мірою це стало можливим завдяки ШІ та його впливу на те, що називають роботизованими політиками — системами, які визначають, як універсальний робот має оцінювати й розуміти своє оточення, планувати переміщення в ньому, а потім правильно виконувати завдання.




Робот ALOHA 2 — це лише дві механічні руки на стільниці, але він слугує випробувальним стендом для передових моделей ШІ в робототехніці. Ці анімації створені на основі телеуправління руками робота людиною; отримані дані використовуються для навчання моделей Google DeepMind. (Відео: Google DeepMind / Стенфордський університет / Hoku Labs)
Історично ці політики ґрунтувалися на правилах, розроблених інженерами, які жорстко закодовували їх у програмне забезпечення робота, — тисячах рядків коду, що визначали кожен міліметр рухів робота під час виконання сотень завдань. Протягом останніх кількох років — і саме це значною мірою відповідає за оптимізм щодо універсальних роботів — роботизовані політики передають передовим системам ШІ замість того, щоб кодувати їх у програмному забезпеченні робота. Спочатку це сталося з VLM, або моделями «бачення — мова». Вони схожі на великі мовні моделі, але навчаються не лише на словах, а й на зображеннях. Покажіть VLM зображення розлитої кави та попросіть знайти інструмент для прибирання — і вона зможе визначити найближчу ганчірку. Такого безпосереднього контекстуального розуміння не існувало кілька років тому, коли роботизовані політики задавалися жорстко.
Наступним етапом стали моделі «бачення — мова — дія», які дають роботам змогу оцінювати навколишнє середовище та діяти в ньому. Моделі роблять це, додаючи ще один компонент: команди руху. VLA навчаються на серії зображень або відео, пов’язаних із виконанням певного завдання, разом із відповідними даними про те, як рухається рука робота під час його виконання. Дані про рух зазвичай збирають за допомогою телеуправління, коли людина використовує дистанційне керування, щоб провести робота через певну дію. Таке навчання дає ШІ змогу опанувати команди для руху й роботи робота під час конкретного завдання. Поставте робота на основі VLA перед письмовим столом і скажіть йому «закрий ноутбук» або «згорни дріт від навушників» — і він огляне сцену, визначить потрібний об’єкт, спланує спосіб виконання запиту, а потім приведе руки в дію — принаймні якщо раніше вже бачив виконання цього завдання.
Модель Gemini Robotics є VLA, навченою на багатьох годинах людських демонстрацій, що показують величезний спектр різних дій. У результаті вона може виконувати відносно складні завдання: підбирати сніжний горошок кухонними щипцями, робити орігамі або готувати простий ланч. Це вражає, але має очевидне обмеження: наразі, якщо робота під керуванням VLA попросити виконати завдання, що виходить за межі навчальної вибірки, він із великою ймовірністю зазнає невдачі.
«Якщо подумати про простір усіх завдань, справді універсальна політика могла б виконувати все в цьому спектрі, — каже Едвард Джонс, професор робототехніки в Імперському коледжі Лондона. — Але сьогодні модель Gemini Robotics може робити лише “дещо тут і дещо там”».
Пошук справжньої універсальності
То як зробити так, щоб роботи могли виконувати більше завдань? Звичайна відповідь, мабуть, не здивує: навчати їх на більшій кількості даних.
Більше даних, вважають прихильники цього підходу, означає більше прикладів, а більше прикладів — більшу універсальність. Наприклад, Google DeepMind хоче зібрати «якомога більше даних», каже Паннаг Санкеті, колишній технічний керівник напряму робототехніки в компанії, який нині працює над власним проєктом у галузі робототехнічного ШІ. Але де їх узяти? Великі мовні моделі мали перевагу у вигляді океанів готових текстів для навчання. Відповідного масиву високоякісних фізичних демонстрацій, на яких можна було б навчати роботів, не існує. Дослідники мають кілька способів компенсувати це, але всі вони недосконалі. Один — залучати велику кількість людей для створення та збору даних телеуправління (це дорого й потребує багато часу). Інший — навчати VLA на відео, де люди виконують різні дії (якість отриманих даних низька). Ще один — розгортати роботів у реальному світі й використовувати дані, зібрані під час цих експериментів, для подальшого вдосконалення моделей ШІ (роботи за межами лабораторій не є безпечними чи надійними). Санкеті вважає, що найімовірнішим шляхом уперед є «багатоспрямований» підхід, який використовує дані з усіх цих джерел.
Але переконання, що самих лише навчальних даних достатньо, далеко не є загальноприйнятим. Герст із Agility називає це «фундаментально хибною передумовою».
Проблема в тому, що завдання реального світу швидко вибухають за складністю. Якщо ви намагаєтеся, скажімо, приготувати каву, виникає безліч змінних: жодні дві кухні не однакові; кавові машини працюють по-різному; для різних чашок потрібні різні захвати; кавові зерна, гарячу воду й молоко потрібно обробляти по-різному. Навіть це просте завдання вимагає розуміння мінливого набору можливостей. Досягнення універсальності за допомогою VLA, стверджує Герст, вимагало б «повного охоплення даними всього, що [робот] коли-небудь міг би зробити». Іншими словами, майже нескінченного масиву навчальних даних.
ЛеКун скептично ставиться до всього цього підходу. «Підходи [до ШІ], які були успішними для мови, не працюють із багатовимірними, безперервними, зашумленими даними» — такими, які є звичними в робототехніці, — сказав він у Давосі. «Потрібно використовувати щось інше».
Головним претендентом на роль цього «чогось іншого» є так звана модель світу — форма ШІ, яку навчають не стільки на текстах, скільки на поєднанні відео, тривимірних сканів і даних із сенсорів та яка створена для прогнозування наслідків дій у реальному світі. Мета полягає в тому, щоб створити моделі з внутрішнім представленням реальності, достатньо точним для відтворення принципів роботи фізичного світу — того, як об’єкти рухаються, стикаються, падають і деформуються. Якби робототехніки могли навчати машини в симуляціях, достатньо точно відтворюючи фізику реального світу, розробка стала б швидшою, дешевшою та безпечнішою, а потреба в тестуванні в реальному світі зменшилася б. Ще важливіше, що роботи, оснащені моделями світу, могли б міркувати про своє оточення, а не просто реагувати на нього, допомагаючи передбачати наслідки дії ще до її виконання.
Такі компанії, як Nvidia та Google, працюють над цією технологією, а інвесторські кошти вливаються у відомі стартапи. World Labs, співзаснована дослідницею ШІ зі Стенфорда Фей-Фей Лі, залучила 1 мільярд доларів фінансування в лютому, а наприкінці вересня була придбана AMD за 8,2 мільярда доларів. AMI Labs, співзасновником якої є ЛеКун (колишній головний науковець Meta з питань ШІ), також залучила 1 мільярд доларів у березні. Однак, за їхнім власним визнанням, усе це ще на ранній стадії. Наприкінці минулого року Лі описала цю галузь як «зародкову», додавши, що «фундаментальні підходи все ще формуються». У червневій публікації на Substack вона описала масштабні виклики. Наразі моделі світу є перспективним напрямом досліджень, а не безпосереднім шляхом до універсальної робототехніки, але ми вже починаємо бачити проблиски того, чого вони можуть досягти.
Один із таких проблисків з’явився минулого квітня внаслідок невеликого, але потенційно важливого кроку вперед, зробленого в робототехнічній лабораторії Сан-Франциско.
Прорив?
У самому центрі району Мішн у Сан-Франциско стартап Physical Intelligence — або PI (як π), як його воліють називати, — зосереджений на розробці універсального мозку, який теоретично міг би перетворити будь-якого робота на універсального. Використовуючи підхід «усе, включно з кухонною раковиною», для навчання моделей ШІ роботів, компанія нещодавно помітила натяк на те, на що міг би бути здатен роботизований мозок, оснащений моделлю світу.
У 2024 році PI опублікувала подробиці своєї першої універсальної роботизованої системи під назвою π0 — VLA, яку компанія назвала «найздатнішою та найспритнішою універсальною роботизованою політикою на сьогодні». Спочатку модель навчали на власній 10-тисячній колекції годин людських демонстрацій, зібраних за допомогою телеуправління, а також на кількох наборах даних роботів із відкритим кодом. Версію, випущену навесні 2025 року, π0.5, навчали на ширшому спектрі наборів даних, зокрема на розмічених зображеннях з інтернету, що надало їй більшої універсальності. Оновлення восени 2025 року, π0.6, додало до моделі навчання з підкріпленням.
Кожне оновлення забезпечувало важливі покращення продуктивності моделі, розширюючи перелік її можливостей: від повільного складання білизни до прибирання речей у нових середовищах і виконання таких завдань, як складання коробок, із вищим рівнем успішності. Потім, у квітні 2026 року, π0.7, здавалося, вивела PI на новий рівень. У цій версії використовується менш потужна модель світу, яка генерує зображення кроків, необхідних для виконання завдання. Коли робот виконує роботу, ця «полегшена» модель передає йому знімки того, що потрібно робити далі.




Компанія стверджує, що модель демонструє перші ознаки композиційної генералізації — терміна, що описує здатність систем ШІ виконувати навички, з якими вони ніколи не стикалися, комбінуючи ті, що були засвоєні під час навчання. В одному з тестів модель попросили «покласти батат у аерофритюрницю» — завдання, з яким вона раніше ніколи не стикалася. На демонстраційному відео машина трохи вовтузиться, кілька разів починає невдало й зрештою робить цілком пристойну спробу, хоча повністю завдання не завершує.
Сергій Левін, професор Каліфорнійського університету в Берклі та співзасновник PI, схвильований потенціалом: «Насправді це перший випадок, коли ми переконливо побачили такий тип композиційної генералізації, за якої можемо фактично попросити модель виконати завдання, для яких ми спеціально не збирали дані й не навчали її, і вона справді зробить прийнятну спробу».
Цей успіх змусив команду замислитися, як моделі вдалося досягти такого результату. Після додаткового аналізу вони знайшли в навчальних матеріалах фрагменти відповідних розмічених даних телеуправління, зокрема два приклади того, як оператор-людина використовує робота, щоб проштовхнути кошик аерофритюрниці всередину. Цих уривків даних могло бути достатньо, щоб π0.7 майже змогла приготувати батат в аерофритюрниці.
Наразі залишається незрозумілим, наскільки вражаючою є здатність π0.7 до генералізації. Проте, з огляду на те, наскільки побіжним був контакт моделі з аерофритюрницями, це дає уявлення про те, наскільки далеко передові дослідження наразі можуть просунути роботів.
«70% успішності — це все одно не працює»
Можливо, ви відчуваєте розрив між непевними дитячими кроками, які роботи роблять у лабораторіях, — «Дивіться! Він поклав батат в аерофритюрницю!» — і сліпучою, людиноподібною спритністю, яку демонструють численні демонстрації та відео, де роботи роблять усе: від танців на сцені до чемного подавання напоїв. Такі демонстрації часто не розкривають чітко важливого факту: у багатьох випадках роботом керують люди або його дії ретельно запрограмовані. (Наприклад, роботом, який у березні 2025 року з’явився на сцені разом із генеральним директором Nvidia Дженсеном Хуангом, начебто реагуючи на його інструкції та ходячи за ним, керували дистанційно — за словами його творців, «ляльководом за лаштунками».)
Наразі повністю автономне планування рухів, за якого робот знає, куди йому слід рухатися, — особливо в нових хаотичних середовищах, таких як будівельний майданчик або незнайомий дім, — залишається здебільшого нерозв’язаною проблемою. Ще більший виклик, хоча й часто пов’язаний із цим, — змусити роботів виконувати масштабніші, неоднозначніші завдання, що містять кілька дій і вимагають ухвалення рішень щодо того, як і в якій послідовності їх виконувати. Саме це відрізняє робота, який може покласти тарілку в мікрохвильову піч, від робота, здатного успішно відповісти на команду «Приготуй вечерю», оглянувши холодильник, нарізавши інгредієнти та ввімкнувши плиту. Найкращі спроби Google DeepMind зробити щось подібне — попросити робота оглянути кухню та скласти в кошик усі інгредієнти для грибного різото — досі закінчувалися невдачею.
Складність посилюється тим, що практичний робот фактично має щоразу виконувати завдання правильно. У випадку VLA «люди дуже радіють, коли результат покращується з 50% успішності до 70%», — каже Марк Райберт, засновник Boston Dynamics. «Але 70% успішності — це все одно означає, що воно не працює, правда?»

Нечисленні людиноподібні роботи, яких випробовують у реальних умовах, виконують надзвичайно обмежені завдання в ретельно контрольованому середовищі. Вони далекі від універсальності. За даними компанії, Agility має сотні роботів, задіяних у випробуваннях на об’єктах, що належать GXO Logistics, Amazon і Schaeffler. Але наразі, каже Герст, роботи виконують прості завдання, наприклад переміщують контейнери та ящики. До того ж, додає він, знадобилися роки, щоб розробити роботів, достатньо безпечних для того, аби логістичні компанії взагалі розглядали можливість їх використання. Зі свого боку, Ілон Маск заявив у травні 2025 року, що «тисячі» його роботів Optimus працюватимуть на заводах Tesla до кінця року, але в січні цього року сказав, що компанія має лише «деяких роботів Tesla Optimus, які виконують прості завдання на заводі».
Хоча людиноподібні роботи вже починають виходити на фабричні майданчики, перехід до домашнього використання буде ще складнішим. Наразі, якщо ви цього бажаєте, можна попередньо замовити домашнього робота 1X Neo, поставки якого очікуються пізніше цього року. За 20 000 доларів він обіцяє взяти на себе «нудні й буденні домашні завдання» — прибирати посуд, відчиняти двері, наводити лад у вітальні, — «щоб ви могли зосередитися на тому, що для вас важливо». Ідея полягає в тому, що цей робот заввишки п’ять футів і шість дюймів одного дня виконуватиме всі ці завдання автономно, але наразі для більшості дій йому потрібен віддалений оператор-людина. (Так, людині доведеться отримати дозвіл, щоб заглядати у ваш дім через камери робота.) На запитання, скільки часу мине до готовності повністю автономних роботів до домашньої роботи, Герст відповів: «Якщо мені доведеться назвати цифру, я б сказав, що мине 10 років, перш ніж роботи… справді почнуть виконувати корисні речі в домівках людей».
Коли це станеться, роботи цілком можуть бути китайськими, оскільки Китай значно випереджає Захід за обсягами виробництва. Майже 90% із приблизно 15 000 людиноподібних роботів, поставлених у 2025 році, були виготовлені китайськими компаніями, згідно з даними компанії ринкової аналітики Omdia та китайської робототехнічної фірми Unitree. Одна з моделей Unitree, яка торік поставила більше людиноподібних роботів, ніж будь-яка інша компанія, коштує менш як 6 000 доларів. Така доступна ціна може значно підвищити привабливість роботів для споживачів, хоча компанія очікує, що спочатку її машини використовуватимуться у промисловості. (Якщо вам цікаво, хто купує всіх цих китайських роботів, AP нещодавно повідомило, що замовлення переважно надходять від корпоративних і академічних лабораторій та державних підприємств.)
Ми вже це проходили
Мрія створити людиноподібного робота має глибоке коріння: ще 1495 року Леонардо да Вінчі розробив ескізи механічного лицаря, керованого тросами та шківами. Протягом XX століття машини, породжені науково-фантастичними мріями, з’являлися й зникали.

Семифутова коробка на ногах від Westinghouse, Elektro, з’явилася на Всесвітній виставці в Нью-Йорку 1939 року, курячи сигарету. WABOT-1, створений Університетом Васеда в Японії 1973 року, став першим повнорозмірним програмованим людиноподібним роботом. ASIMO від Honda, представлений у 2000 році, був, імовірно, першою такою машиною, яка виявилася хоч трохи компетентною: він міг, принаймні певною мірою, підійматися сходами, розпізнавати обличчя та автономно пересуватися просторами. Але робота зняли з виробництва у 2018 році, оскільки він не зміг достатньо просунутися за межі того, що міг робити на демонстраціях, аби стати корисним.
Свого часу всі вони були вражаючими — навіть приголомшливими — інженерними досягненнями. Але жоден не був готовий орієнтуватися в реальному світі. Сучасні роботи, навіть із трансформаційною силою передового ШІ, досі стикаються з тією самою екзистенційною проблемою.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.