Įkūnytas dirbtinis intelektas pramoninėje robotikoje: kaip regėjimo, kalbos ir veiksmų modeliai keičia robotų programavimą

Turinys

Paskutinį kartą atnaujinta: 12 m. birželio 2026 d

Įkūnytas dirbtinis intelektas pramoninėje robotikoje: kaip regėjimo, kalbos ir veiksmų modeliai keičia robotų programavimą

Įkūnytasis dirbtinis intelektas (angl. Embodied DI) – tai mašininis intelektas, kuris suvokia savo aplinką per jutiklius, samprotauja apie tai, ką mato, ir generuoja fizinius veiksmus – visa tai viename vieningame modelyje. Gamyklų robotikoje tai svarbu, nes regėjimo-kalbos-veiksmo (angl. VLA) modelis gali interpretuoti žodinę instrukciją, atpažinti nepažįstamą dalį ir vykdyti manipuliavimo seką be eilutė po eilutės programavimo. Nuo 2026 m. kelios tyrimų platformos iš laboratorinių demonstracijų virto ankstyvaisiais pramoniniais bandomaisiais projektais, pakeisdamos inžinierių požiūrį į lanksčią automatizaciją. EVST produktų lygio kryptį, susijusią su humanoidiniais robotais, mikliomis rankomis, keturkojiais robotais ir įkūnyto dirbtinio intelekto duomenų rinkimu, žr. EVST įkūnyti dirbtinio intelekto sprendimai.

Paskutinį kartą atnaujinta: 12 m. birželio 2026 d

-

Robotų programavimo evoliucija: nuo mokymo pultelio iki pamatinių modelių

Gamyklinių robotų programavimas perėjo keturias atpažįstamas kartas, kurių kiekviena apribojo skirtingus apribojimus su skirtingais pajėgumais.

Pirmoji karta veikė su mokymo pulteliu. Inžinierius perkeldavo robotą ašimi po ašies į kiekvieną tašką, užrašydavo pozicijas ir surinkdavo jas į judesio programą, saugomą valdiklyje. Kelio modifikavimas po linijos pakeitimo reiškė, kad kiekvieną tašką reikėjo iš naujo apmokyti rankiniu būdu. Didelio masto, fiksuotos geometrijos gamyboje (pavyzdžiui, automobilių kėbulų suvirinimas) šis metodas veikė gerai. Viskam, kam reikėjo dažnai keisti gaminius, jis buvo brangus.

Dešimtajame dešimtmetyje atsirado neprisijungus programavimo (OLP) įrankiai, tokie kaip „RoboDK“, „KUKA.Sim“ ir „ABB RobotStudio“, kurie leido inžinieriams apibrėžti robotų trajektorijas 3D CAD aplinkoje ir vėliau apdoroti kodą skirtingų gamintojų valdikliams. Sąrankos laikas sutrumpėjo nuo dienų iki valandų, o trajektorijų optimizavimas tapo įmanomas dar prieš pirmąjį fizinį ciklą. Skirtumas tarp modeliuojamo modelio ir fizinio įrengimo (kalibravimo paklaida, kabelio nukrypimas, tvirtinimo detalių tolerancijos) išliko nuolatine problema, tačiau OLP išlieka standartiniu metodu daugumoje gamybos ląstelių šiandien.

Įgūdžių bibliotekos atsirado kaip trečioji banga. Pardavėjai ir integratoriai supakavo daugkartinio naudojimo judesio primityvus, dėžių išrinkimo įgūdį, kaiščių įdėjimo į skylę įgūdį, siūlių suvirinimo įgūdį, kuriuos buvo galima konfigūruoti parametrais, o ne perprogramuoti nuo nulio. Pavyzdžiui, regėjimu valdomas dėžių išrinkimas iš kelis mėnesius trukusio individualaus projekto tapo konfigūruojamu moduliu. Vis dėlto kiekvienas įgūdis turėjo būti aiškiai sukurtas, o įgūdžiai nebuvo apibendrinami: dėžių išrinkimo įgūdis, apmokytas vienai detalės geometrijai, nesuveiktų su žymiai skirtinga detalės forma.

VLA modeliai atstovauja ketvirtajai bangai. Užuot kodavę elgesį kaip aiškius kelio taškus arba parametrizuotus primityvus, VLA modeliai iš didelių robotų demonstracijų ir bendrų vaizdinių duomenų rinkinių mokosi, kaip tiesiogiai susieti (vaizdo, kalbos instrukcijų) poras su (roboto veiksmų) rezultatais. Modelis apibendrina objektus, apšvietimo sąlygas ir instrukcijų formuluotes taip, kaip įgūdžių bibliotekos negali, nes apibendrinimas yra integruotas į svorius, o ne koduojamas rankiniu būdu.

Robotų programavimo metodų palyginimas
dimensija Mokyti pakabuką Programavimas neprisijungus Įgūdžių bibliotekos VLA modeliai
Sąrankos laikas (naujas produktas) Dienos–savaitės Valandos–dienos Valandos (kiekvienam įgūdžiui) Minutės–valandos (jei iš anksto apmokyta)
Lankstumas naujiems objektams Žemas (reikalingas pakartotinis mokymas) Žemas–vidutinis Vidutinis (įgūdžiai turi atitikti) Aukštas (apibendrina objektus)
Duomenų reikalavimai Nėra (rankinis) CAD modeliai Užduočių demonstracijos Dideli demonstraciniai duomenų rinkiniai
Determinizmas aukštas aukštas Vidutinio ūgio Žemas–vidutinis (stochastinis mėginių ėmimas)
Derinimas Aukštas (aiškūs kelio taškai) aukštas vidutinis Žemas (latentiniai vaizdai)
Pramoninė branda (2026 m.) Visiškai subrendęs Visiškai subrendęs brandus Ankstyvieji bandomieji projektai; nepatvirtinti gamybai dideliu mastu

Determinizmo spraga yra svarbi pramonės aplinkoje. Mokymo programa kiekviename cikle vykdo tą patį kelią; VLA modelis kiekviename išvados darymo etape ima veiksmų pasiskirstymo pavyzdžius. Užduotims, kuriose priimtini ciklų skirtumai (atsitiktinai išdėstytų elementų pasirinkimas), tai yra įveikiama. Užduotims, kurioms reikalingas mažesnio nei milimetro pakartojamumas per tūkstančius ciklų, klasikiniai metodai išlaiko struktūrinį pranašumą, kurį VLA kūrėjai aktyviai stengiasi užpildyti.

-

Kas yra VLA modeliai: architektūra paprastais terminais

Regėjimo-kalbos-veiksmo modelis yra neuroninis tinklas, kuris priima vizualinius stebėjimus ir natūralios kalbos instrukcijas kaip įvestį ir sukuria roboto veiksmus kaip išvestį – vieną visapusišką modelį, o ne atskirų regos, planavimo ir valdymo modulių grandinę.

Trys architektūriniai komponentai yra šie:

Regėjimo kodavimo įrenginys. Iš anksto apmokytas vaizdo transformatorius (ViT) arba konvoliucinis magistralė apdoroja kameros vaizdus ir koduoja juos į tankius objektų atvaizdavimus. Daugumoje dabartinių VLA konstrukcijų šis kodavimo įrenginys inicijuojamas iš didelio vaizdo kalbos modelio (VLM) ir tada tiksliai derinamas pagal roboto duomenis. Iš anksto apmokyto magistralės naudojimas yra svarbus, nes jis suteikia modeliui bendruosius vizualinius prioritetus, supratimą apie tai, kas yra dėžė, kaip atrodo rankena, dar prieš jam pamatant roboto demonstraciją.

Kalbos kodavimo įrenginys. Teksto transformatorius koduoja instrukciją („pasirinkite raudoną bloką ir įdėkite jį į dėžę kairėje“) į žetonų seką, kuri vėliau yra kryžmiškai sujungiama su vaizdinėmis funkcijomis. Kryžminis dėmesys čia reiškia, kad modelis gali atkreipti dėmesį į tai, kurios vaizdo dalys yra svarbiausios, atsižvelgiant į tai, ko prašoma instrukcijoje. Jis neapdoroja vaizdo ir kalbos atskirais silosais.

Veiksmo galva. Sujungtas vaizdavimas dekoduojamas į roboto veiksmus. Veiksmai gali būti vaizduojami kaip galinio efektoriaus deltos (perkelkite griebtuvą 2 cm į dešinę, uždarykite griebtuvą), jungčių kampai arba žetonuoti veiksmų fragmentai. Veiksmų žetonizavimas, atskiro veiksmų langelio traktavimas kaip kalbos žetono, leido ankstyviesiems VLA darbams tiksliai suderinti esamas LLM architektūras robotikai, nekuriant naujo veiksmų dekoderio nuo nulio. Naujesniuose projektuose naudojamos difuzijos pagrindu sukurtos veiksmų galvutės, kurios sukuria sklandesnes, tolydesnes trajektorijas ir geriau apdoroja daugiamodalinius veiksmų pasiskirstymus nei gryna žetonų klasifikacija.

Mokymasis vyksta po elgesio klonavimo bazėje: modelis apmokomas imituoti ekspertų demonstracijas prižiūrint mokymuisi (stebėjimo, veiksmo) porose. Kai kurios sistemos modeliavime taiko sustiprintą mokymąsi iš žmonių grįžtamojo ryšio (RLHF) arba internetinio RL, kad padidintų patikimumą labiau nei galima pasiekti vien imitacija. Simuliacinio ir realaus pasaulio atotrūkis, našumo sumažėjimas, kai modeliavime apmokyta politika perkeliama į fizinį robotą, išlieka viena iš aktyviausių tyrimų problemų. Domeno atsitiktinumas (atsitiktinai keičiamos tekstūros, apšvietimas, objektų pozos ir fizikiniai parametrai simuliacinio mokymo metu) yra plačiausiai taikoma mažinimo technika.

-

Pagrindiniai tyrimų etapai

VLA sritis vystėsi sparčiai. Šioje lentelėje pateikiamos platformos, į kurias 2026 m. pradžioje buvo dažniausiai remiamasi diskusijose apie pramoninius robotus.

Viešieji VLA modeliai ir platformos (2023–2026 m.)
Modelis / Platforma Ryškalas Atleiskite Apytiksliai parametrai Užduoties apimtis Atidaryta / Uždaryta
AT-2 „Google DeepMind“ 2023 55B Stalo manipuliavimas; kylantis samprotavimas Uždaryta (svoriai neatleisti)
RT-X / Atviras X įkūnijimas „Google DeepMind“ + 33 laboratorijos 2023 Įvairus Tarprobotinė apibendrinimas; 22 robotų tipai Duomenų rinkinys atidarytas; modeliai daliniai
OpenVLA Stanfordas + Kalifornijos universitetas Berklyje 2024 7B Bendras manipuliavimas; tiksliai derinamas Atidaryti (Apache 2.0)
π0 (pi-nulis) Fizinis intelektas (π) 2024 Neatskleidžiama Miklus manipuliavimas; lankstymas, surinkimas Uždaryta (komercinė)
sraigtas AI paveikslas 2025 Neatskleidžiama Humanoidinis viso kūno valdymas; dvirankės užduotys Uždaryta (nuosavybės teise priklausanti)
GR00T N1 / N1.5 "NVIDIA 2025 Neatskleidžiama Humanoidinio pagrindo modelis; simuliacinis-realinis Atviri svoriai (GR00T N1)
Dvynių robotika „Google DeepMind“ 2025 Neatskleidžiama Miklus manipuliavimas; 3D erdvinis samprotavimas Uždaryta (API prieiga)
RFM-1 / Kovariantas Kovariantas 2024 Neatskleidžiama Logistika ir sandėlio manipuliavimas Uždaryta (komercinė)
Skild AI Skild AI 2024 Neatskleidžiama Universalios roboto smegenys; daugiafunkcinės Uždaryta (komercinė)

Inžinieriai, vertinantys pramoninį pritaikomumą, nusipelno atidžiau atkreipti dėmesį į keletą etapų.

RT-2, aprašytas 2023 m. straipsnyje „RT-2: Regėjimo-kalbos-veiksmo modeliai perduoda žiniatinklio žinias robotų valdymui“ (Brohan ir kt., „Google DeepMind“), parodė, kad modelis, inicijuotas iš iš anksto apmokyto regėjimo kalbos pagrindo (PaLI-X, PaLM-E), gali demonstruoti emergentinį samprotavimą, atlikdamas užduotis, kurioms niekada nebuvo aiškiai apmokytas, derindamas žiniatinklio masto mokymo sąvokas. Straipsnyje parodyta, kad modelio mastelis koreliuoja su apibendrinimu, o tai paskatino pramonės susidomėjimą naudoti didelius pamatinius modelius kaip robotų politikos pagrindus.

„OpenVLA“ (Kim ir kt., 2024) pateikė visiškai atvirą alternatyvą su 7 milijardais parametrų, pagrįstą prizmine VLM, pademonstruodama konkurencingą našumą su RT-2 už daug mažesnę skaičiavimo kainą ir suteikdama akademiniams bei pramonės tyrėjams galimybę tiksliai derinti pasirinktinių užduočių duomenis. Remiantis „OpenVLA“ straipsniu (arxiv:2406.09246), po tikslaus derinimo „OpenVLA“ pranoko RT-2-7B 73 % „BridgeV2“ vertinimo užduočių.

„NVIDIA GR00T N1“, pristatytas GTC 2025 parodoje, yra humanoidinis pamatinis modelis, apmokytas naudojant nuotolinių operacijų duomenų, vaizdo duomenų ir sintetinių duomenų iš „NVIDIA Cosmos“ ir „Isaac Lab“ mišinį. „NVIDIA“ viešai išleido GR00T N1 svorius, todėl tai yra vienas pirmųjų humanoidinių robotų pamatinių modelių, kurį galima tiksliai derinti iš išorės. Kartu esantis „Isaac GR00T Sim2Real“ kanalas sujungia simuliacinį mokymą su fiziniu diegimu per domenų atsitiktinę atranką „Isaac Lab“ sistemoje.

Fizinio intelekto π0 naudoja srauto atitikimo veiksmo galvutę, o ne atskirą žetonų klasifikaciją, kuri sukuria sklandesnes trajektorijas ir atlieka daugiapakopes užduotis, tokias kaip drabužių lankstymas ar objektų surinkimas, atliekant kelis nuoseklius veiksmus. Architektūra sujungia iš anksto apmokytą VLM pagrindą su difuzijos stiliaus veiksmo dekoderiumi, sąlygotu kalbos ir regos žetonais.

„Figure 02“ humanoide dislokuota dirbtinio intelekto sistema „Helix“ taiko dviejų modelių metodą: aukšto lygio VLM tvarko scenos supratimą ir instrukcijų analizę, o žemo lygio sensorinis modelis vykdo variklio komandas valdymo dažniu. Sistema 2025 m. BMW Spartanburgo gamykloje pademonstravo bimanualų manipuliavimą realiuoju laiku, rūšiuojant elementus į kategorijas pagal žodines instrukcijas.

„Tesla“ FSD ir „Optimus“ junginys vertas dėmesio kaip pramonės masto duomenų pranašumo strategija. Esamas „Tesla“ automobilių parkas generuoja milijardus mylių realaus pasaulio vaizdinių duomenų FSD. Vidinė hipotezė yra ta, kad autonominiam vairavimui sukurtos užimtumo tinklo reprezentacijos ir vaizdo prognozavimo architektūros gali būti pritaikytos „Optimus“ robotų mokymuisi, nors vieša techninė informacija lieka ribota.

-

Pramoninio naudojimo atvejų parengtis

Ne visos gamyklos užduotys vienodai tinka VLA metodams. Pagrindiniai kintamieji yra šie: tolerancijos reikalavimai, detalių įvairovė, gedimo kaina ir tai, ar galima surinkti pakankamai demonstracinių duomenų tikslinei užduočiai atlikti.

Konteinerių surinkimas ir mišraus SKU tvarkymas yra stipriausi trumpalaikiai atitikimai. Objektų pozicijos yra atsitiktinės, detalių tipai skiriasi, o praleisto surinkimo ar nedidelio numetimo kaina yra maža. „Covariant“ RFM-1 buvo įdiegtas el. prekybos užsakymų vykdymo centruose būtent šiai užduočiai atlikti. Remiantis pramonės stebėjimais, mišraus SKU dėžių surinkimas naudojant klasikinę 3D viziją paprastai konfigūruojamas pagal SKU tipą, o pakeitimui reikia valandų valandas pakartotinio kalibravimo. Universalus modelis gali apdoroti naujas prekes be atskiros prekės konfigūracijos, o tai turi realią ekonominę vertę esant pakeitimo dažnumui, kuris yra įprastas mažmeninės prekybos užsakymų vykdymo srityje.

Lankstus surinkimas yra labiau ginčytina sritis. Surinkimo užduotims dažnai reikalingas mažesnio nei milimetras įterpimo tikslumas ir nuoseklus jėgos taikymas. Tai sritys, kuriose dabartinio VLA veiksmo mėginių ėmimo stochastinis pobūdis sukuria dispersiją, kuri gali viršyti proceso tolerancijas. Ankstyvieji bandomieji projektai yra orientuoti į mažesnių tolerancijų surinkimo etapus (troselių tiesimas, užspaudžiami spaustukai), išlaikant deterministinį judesį griežtų tolerancijų įterpimams.

Kokybės patikrinimas yra iš dalies išspręsta esamų 2D/3D regos sistemų problema, tačiau ji yra peržiūrėta naudojant VLA stiliaus architektūras, nes kalbos sąlygoti modeliai gali būti nukreipti tikrinti skirtingų tipų defektus keičiant instrukcijas, o ne iš naujo apmokant specialų klasifikatorių.

Perjungimo sumažinimas yra pagrindinis vertės pasiūlymas. Gamybos linijai, kurioje per pamainą dirba 50 SKU, kurių kiekvienam reikalingi skirtingi surinkimo taškai ir išdėstymo taikiniai, šiuo metu reikia arba atskirų robotų kiekvienam SKU, arba daug laiko reikalaujančio perprogramavimo. VLA palaikančią ląstelę teoriškai būtų galima nukreipti pakeitus kalbos instrukcijas. Praktiškai dabartinius modelius reikia tiksliai suderinti su konkrečiomis užduotimis, net jei naudojamas stiprus iš anksto apmokytas magistralinis tinklas. Nulinio kadro apibendrinimas pramoninio tikslumo užduotims išlieka retas.

Praktiškai vertinant VLA bandomuosius projektus, greičiausiai rezultatus pasiekia tie inžinieriai, kurie orientuojasi į užduotis, kurioms būdingas: (a) didelė detalių įvairovė, (b) laisvi tolerancijos nuokrypiai (>0.5 mm), (c) esama duomenų rinkimo infrastruktūra (nuotolinio valdymo platformos arba demonstracinis įrašymas) ir (d) noras VLA komponentą traktuoti kaip užduočių atrankos ir grubaus judesio sluoksnį su klasikiniu valdikliu, kuris tvarko tikslias korekcijas.

-

VLA 2026 m.: kokia iš tikrųjų yra bandomųjų gamybos projektų padėtis?

2026 m. viduryje atotrūkis tarp įtikinamos VLA demonstracijos ir gamybinio diegimo išlieka pagrindiniu šios srities bruožu. Pramoninių bandomųjų projektų modelis yra nuoseklus: regėjimo valdomos užduotys su ribota veiksmų erdve, tokios kaip konteinerių surinkimas, įrangos komplektavimas ir patikrinimas, tampa įprastine praktika, o atviros manipuliacijos nestruktūrizuotoje ląstelėje vis dar yra tyrimų ir bandomoji veikla, o ne linijai paruošta galimybė.

Remiantis pramonės stebėjimais, šią ribą nustato trys praktiniai apribojimai. Pirma, duomenys: VLA politikai vis dar reikia šimtų su užduotimis susijusių demonstracijų iš realių dalių ir įrankių, su kuriais ji susidurs, ir šie duomenys neegzistuoja, kol kas nors jų nesurenka įrenginyje. Antra, patvirtinimas: išmokta politika, kuri sėkmingai veikia 95 % atvejų, laboratorijoje yra įspūdinga ir nepriimtina linijoje, kurioje per pamainą atliekama tūkstančiai ciklų, todėl saugos ir priėmimo kartelė yra daug aukštesnė, nei rodo demonstracinės metrikos. Trečia, integracija: modelis naudingas tik tada, kai jis yra įkūnytas į langelio saugos, tvirtinimo ir klaidų atkūrimo logiką, kurią jau teikia klasikinė automatizacija.

Gamintojui tai reiškia, kad VLA reikia laikyti esamos automatizavimo bazės išplėtimu, o ne jos pakaitalu. Didžiausią grąžą duodantis pirmasis žingsnis 2026 m. yra gamybai paruošta vizija pagrįsta užduotis, kuri taip pat fiksuoja naudojamus užduočių duomenis, todėl galutinis perėjimas prie platesnio VLA pagrįsto lankstumo priklauso nuo jūsų pačių procesų. Šios sekos operacinę versiją žr. Įkūnytas dirbtinis intelektas ir tradiciniai pramoniniai robotai ir kur pirmiausia pilotuoti, Įkūnytasis dirbtinis intelektas pramonės gamintojams: naudojimo atvejai, investicijų grąža ir kur išbandyti.

Duomenų reikalavimai: kodėl duomenys yra kliūtis

Trys pagrindiniai VLA mokymo duomenų šaltiniai yra nuotolinės demonstracijos, sintetiniai duomenys iš modeliavimo ir internetiniai vaizdo įrašai.

Teleoperacijų demonstracijos, kai žmogus valdo robotą per haptinę sąsają arba egzoskeletą, o sistema įrašo jungčių būsenas ir kamerų srautus, yra aukščiausios kokybės duomenų šaltinis, nes jose užfiksuojama reali roboto dinamika, realių objektų sąveika ir realus jutiklių triukšmas. Jos taip pat yra brangios: remiantis pramonės stebėjimais, tinkamo naudoti demonstracinio duomenų rinkinio, skirto naujai manipuliavimo užduočiai, surinkimas kainuoja maždaug 10–100 operatoriaus valandų kiekvienam užduoties variantui, o valandinė kaina apima operatoriaus atlyginimą, roboto laiką ir duomenų apdorojimą. Būtent dėl ​​šios priežasties fizinis intelektas ir figūrinis dirbtinis intelektas subūrė dideles vidines teleoperacijų komandas.

Fizikos simuliatoriuose („NVIDIA Isaac Lab“, „MuJoCo“, „SAPIEN“) generuojami sintetiniai duomenys leidžia lygiagrečiai rinkti duomenis dideliu mastu, šimtams imituojamų robotų vienu metu renkant duomenis, tačiau tai lemia atotrūkį tarp simuliacijos ir realybės. Atvaizduotų scenų vizualinė išvaizda skiriasi nuo realių kamerų vaizdų, o imituojama kontaktinė fizika retai atitinka realaus pasaulio trintį, deformaciją ir slydimą. Domenų atsitiktinė atranka iš dalies panaikina šį atotrūkį, mokant pagal atsitiktinius tekstūrų, apšvietimo, masių ir trinties koeficientų pokyčius, tačiau jo nepašalina. „NVIDIA Cosmos“, pasaulinis pamatinis modelis, išleistas kartu su GR00T, skirtas generuoti fiziškai įtikimus sintetinius mokymo vaizdo įrašus, kurie yra fotorealistiškesni nei tradicinis atvaizdavimas, ir yra vertinamas kaip duomenų papildymo įrankis.

Internetiniai vaizdo įrašai – milijardai valandų žmonių manipuliacijų vaizdo įrašų „YouTube“ ir panašiose platformose – yra duomenų šaltinis, kuris iš pradžių paskatino naudoti VLM magistrales robotikoje. Modelis, iš anksto apmokytas naudojant internetinius vaizdo įrašus, matė rankas, kurios pakėlė daiktus, surenka baldus, gamina maistą ir tvarko įrankius, nors tuose vaizdo įrašuose nebuvo robotų veiksmų etikečių. Hipotezė yra ta, kad šios bendros manipuliavimo žinios perduodamos robotų valdymui tiksliai jas derinant. RT-2 buvo aiškiausias šios hipotezės demonstravimas dideliu mastu.

Remiantis Tarptautinės robotikos federacijos (IFR) 2025 m. pasauline robotikos ataskaita, 2024 m. pasaulinis pramoninių robotų įrengimas pasiekė naują rekordą – buvo įrengta daugiau nei 590 000 vienetų. EVST tenkina didelio masto pramoninio diegimo poreikius, siūlydama platų naudingosios apkrovos portfelį – nuo ​​3 kg XR serijos kobotų iki 800 kg QJAR sunkiosios pramonės rankų, suteikdama integratoriams aparatinės įrangos platformą, galinčią valdyti tiek klasikinius deterministinius valdiklius, tiek, jiems subrendus, VLA generuojamus judesio taikinius įvairiose gamybos aplinkose.

-

Aparatinės įrangos pasekmės

VLA išvados vykdymas gamybos aplinkoje turi techninės įrangos reikalavimus, kurie labai skiriasi nuo klasikinių robotų valdiklių.

Tipiškas pramoninio roboto valdiklis vykdo 1 kHz jungties erdvės valdymo kilpą deterministinėje realaus laiko OS. Skaičiavimo biudžetas yra ribotas, o laikas nustatomas realiuoju laiku. Tuo tarpu VLA išvados atliekamos GPU: RT-2 masto (55B parametrų) modeliui reikia kelių aukštos klasės GPU ir jis atlieka veiksmus 1–3 Hz išvados dažniu. 7B parametrų modelis, pvz., „OpenVLA“, gali veikti viename vartotojams skirtame GPU, kurio dažnis yra 6–10 Hz. Daugeliui manipuliavimo užduočių pakanka 10 Hz veiksmo išvesties; greitam surinkimui ar dinaminiam gaudymui ji netinka.

Dauguma komandų daugiausia dėmesio skiria dviejų lygių hierarchijai: VLA modelis veikia GPU skaičiavimo mazge (AGV, roboto bazėje arba netoliese esančiame kraštiniame serveryje) ir išveda aukšto lygio veiksmų taikinius 5–15 Hz dažniu. Įprastas realaus laiko koprocesorius, esamas roboto jungtinis valdiklis, interpoliuoja šiuos taikinius 1 kHz dažniu ir vykdo sukimo momento ribas, susidūrimų vengimą ir jungčių erdvės apribojimus. Šis atskyrimas išsaugo determinizmą ir saugumą valdymo lygmenyje, tuo pačiu leisdamas VLA sluoksniui apdoroti suvokimą ir užduočių lygio samprotavimus.

Jutiklių reikalavimai taip pat keičiasi. VLA modeliai daugiausia naudoja RGB kamerų srautus, o daugumoje dabartinių tyrimų naudojamos viena ar dvi riešo ir bazinės kameros. Gylio jutikliai pagerina manipuliavimo tikslumą, ypač netvarkingose ​​​​vaizdo vietose, tačiau gylio duomenys turi būti projektuojami į modelio suprantamą vaizdo erdvę. Pramoniniam naudojimui skirtos kameros turi atitikti veikimo aplinkos apsaugos standartus: IP65 – mažiausiai bendrajai gamybai, IP68 – plovimo ar sprogios atmosferos zonoms.

-

Simuliatoriaus pusė

Dauguma VLA kūrimo procesų vyksta modeliavimo būdu, prieš įtraukiant fizinę įrangą. Dabartinėje tyrimų srityje dominuoja keturi simuliatoriai.

„NVIDIA Isaac Lab“ (sukurta naudojant „Isaac Sim“, kuri pati paremta USD ir „PhysX“) yra optimizuota didelio masto lygiagrečiam mokymui naudojant „NVIDIA“ grafikos procesorius. Viename DGX mazge vienu metu gali veikti tūkstančiai modeliuojamų aplinkų, todėl praktiškai galima surinkti milijonus demonstracinių trajektorijų per kelias dienas, o ne mėnesius. „Isaac Lab“ yra pagrindinė GR00T mokymo aplinka.

„MuJoCo“ (dabar atvirojo kodo, prižiūrima „DeepMind“) yra plačiausiai pritaikoma akademinėje aplinkoje. Jos kontaktų sprendiklis yra gerai patikrintas robotų manipuliavimo užduotims, o jį naudoja tokie testavimo įrankiai kaip „RoboSuite“ ir „Adroit“. Daugumoje publikuotų VLA straipsnių pateikiami „MuJoCo“ pagrindu sukurtų testų rezultatai, todėl tai yra faktinis palyginimo standartas.

„NVIDIA Cosmos“ yra naujesnis pasaulio pamatinis modelis, kuris generuoja fiziškai įtikimus vaizdo įrašus iš tekstinių arba vaizdinių raginimų. Užuot buvęs tradiciniu simuliatoriumi, jis tiriamas kaip sintetinių duomenų generavimo įrankis, generuojantis mokomuosius vaizdo įrašus, kuriuose rodomi robotų manipuliavimo scenarijai, kuriuos būtų brangu surinkti fiziškai arba atvaizduoti naudojant klasikinę grafiką.

Kalifornijos universitete San Diege sukurtas SAPIEN ypač gerai tinka sujungtų objektų manipuliavimui: stalčių atidarymui, vožtuvų sukimui, prietaisų valdymui. Jo sujungtų objektų duomenų rinkinys („PartNet-Mobility“) buvo plačiai naudojamas mokant ir vertinant manipuliavimo politiką užduotims, susijusioms su objektų prieinamumu.

-

Kada išbandyti VLA, o kada likti prie klasikinio programavimo

Tai praktinis klausimas, su kuriuo susiduria dauguma gamybos inžinierių 2026 m. Sąžiningas atsakymas yra tas, kad VLA metodai kol kas nėra tinkamas pasirinkimas daugumai gamybos aplinkų, tačiau yra konkrečių scenarijų, kai bandomasis projektas yra pagrįstas.

Apsvarstykite VLA bandomąjį projektą, kai:

  • Dalių įvairovė didelė (>20 skirtingų SKU), o keitimo dažnis viršija savaitę
  • Tolerancijos reikalavimai yra laisvi (priimtinas >0.5 mm padėties tikslumas)
  • Užduotis apima nestruktūrizuotą arba atsitiktinai išdėstytą įvestį (pvz., atsitiktinį dėžės turinį).
  • Operacija apima kalbos lygio instrukcijas, kurios gali keistis (pasirinkimas pagal spalvą, kategoriją arba etiketę)
  • Yra noras parengti duomenų rinkimo etapo instrumentinę versiją (nuotolinio valdymo stendas, 50–200 valandų demonstracijų).
  • Retkarčiais pasitaikančių gedimų kaina yra maža, o sistema gali toleruoti žmogaus atliekamas korekcijas ciklo metu.

Laikykitės klasikinio programavimo, kai:

  • Taikymo sritis: fiksuotos geometrijos, dideliems kiekiams, ilgalaikiams gamybos etapams (automobilių kėbulų suvirinimas, štampavimo presų priežiūra).
  • Tolerancijos reikalavimai yra griežti (<0.1 mm) ir turi būti užtikrinti kiekvieną ciklą
  • Valdiklio aplinka yra saugos požiūriu įvertinta pagal IEC 62061 arba ISO 13849 standartus, o GPU išvados sluoksnio pridėti neįmanoma.
  • Kokybės sertifikavimui reikalingi audito takai ir deterministiniai vykdymo žurnalai (IATF16949, su IATF16949 susiję procesai).
  • Nėra duomenų rinkimo infrastruktūros ir nėra biudžeto jai sukurti

Praktinė hibridinė strategija, kurios laikosi keli pirmieji naudotojai, yra naudoti VLA užduočių pasirinkimui ir grubiam judesiui generuoti, o klasikinį valdiklį – tiksliam judesių vykdymui ir jėgos valdymui. VLA nusprendžia, ką daryti ir apytiksliai kur eiti; klasikinis sluoksnis tvarko tikslumą ir saugai svarbų valdymą.

„EVST“, kaip „iki rakto“ integracijos tiekėjas, tiekiantis pramoninių robotų rankas, kurių naudingoji apkrova yra nuo 3 iki 800 kg, aktyviai vertina VLA vamzdynus konkretiems taikymo segmentams, pirmiausia didelės mišrios talpos konteinerių surinkimui ir lanksčiam surinkimui, kur lankstumo argumentas yra stipriausias. „EVST“ metodas VLA išvadas traktuoja kaip suvokimo ir planavimo sluoksnį, esantį virš deterministinio jungtinio valdiklio, išsaugant pramoninės klasės judesio valdymą, kurio reikalauja CE/SGS/TÜV sertifikuotos sistemos. Ekstremalioms temperatūroms (nuo -30 °C iki 80 °C) ir sprogimui atsparioms ATEX/IECEx sertifikuotoms ląstelėms klasikiniai valdikliai šiame etape išlieka vieninteliu patvirtintu metodu.

-

Saugos ir patvirtinimo iššūkiai

Pramoniniai robotai, veikiantys pagal ISO 10218-1 (robotų projektavimas) ir ISO 10218-2 (sistemų integravimas), turi pademonstruoti deterministinį, audituojamą saugos elgesį. Bendradarbiaujančių robotų taikymams papildomai reikalingas rizikos vertinimas pagal ISO/TS 15066, kuriame nurodytos biomechaninės sąlyčio jėgos ir slėgio ribos pagal kūno sritį.

VLA modeliai kelia patvirtinimo iššūkių, kurių šie standartai nebuvo sukurti spręsti. Neuroninio tinklo politika neturi apriboto, išvardijamo elgesio rinkinio, kurį saugos inžinierius galėtų analizuoti taikydamas tradicinę FMEA. Modelio reakcija į išorinį įvestį, naują objektą, netikėtą apšvietimo sąlygą, dalinį uždengimą gali sklandžiai pablogėti arba staiga sugesti, ir numatyti, kas įvyks, nėra paprasta.

Kuriamas ISO 22166 (besiformuojantis dirbtinio intelekto pagrindu veikiančių robotų sistemų našumo kriterijų standartas) ir tikimasi, kad jis išspręs kai kurias iš šių spragų, tačiau jis dar nėra baigtas. Tuo tarpu atsakingas požiūris atspindi SOTIF (numatytos funkcijos sauga, ISO 21448) samprotavimus iš automobilių pramonės srities: nustatyti sąlygas, kuriomis sistemos numatyta funkcija neveikia, apibrėžti eksploatacinio projektavimo sritį (ODD), kurioje sistema gali veikti, ir apriboti veikimą už tos ODD ribų, kol bus sukaupta papildomų patvirtinimo įrodymų.

Remiantis pramonės stebėjimais apie ankstyvuosius VLA diegimus, labiausiai paplitusi saugos architektūra apjungia VLA išvadų išvestį su klasikiniu saugos monitoriumi, kuris vykdo darbo vietos apribojimus, greičio ribojimus ir jėgos slenksčius, neatsižvelgdamas į tai, ko reikalauja VLA politika. VLA generuoja judesio taikinius; saugos sluoksnis nusprendžia, ar tie taikiniai yra leistini. Ši architektūra leidžia naudoti ISO 10218 reikalavimus atitinkantį saugos valdiklį, net kai išankstinė politika yra neuroninis tinklas.

IATF16949 sertifikuotose gamybos aplinkose, kuriose privalomas procesų atsekamumas ir apibrėžti valdymo planai, VLA pagrįsta automatizacija susiduria su papildoma dokumentacijos našta. Inžinieriai turi apibrėžti optinį duomenų kaupiklį (ODD), registruoti išvadų įvestis ir išvestis bei nustatyti procedūras, skirtas aptikti ir atkurti sutrikimus, susijusius su paskirstymo sistemos gedimais. Tai nėra neįmanoma, tačiau tai padidina patvirtinimo išlaidas, kurių nepatiria klasikinės neprisijungus programuojamos sistemos.

Remiantis IFR 2025 pasauline robotikos ataskaita, saugos standartų laikymasis išlieka viena iš trijų pagrindinių kliūčių, trukdančių sparčiau diegti robotus besivystančiose gamybos rinkose. EVST šią problemą sprendžia į savo robotų gaminių liniją nuo pat projektavimo etapo įtraukdama trečiųjų šalių sertifikatus, susijusius su CE, SGS ir TÜV, kad integratoriai, naudojantys EVST aparatinę įrangą kaip fizinį sluoksnį po VLA išvadų rinkiniu, pradėtų nuo sertifikuotos mechaninės ir elektrinės bazinės linijos, o ne turėtų sertifikuoti individualią sistemą nuo nulio.

-

Dažnai užduodami klausimai

Kuo skiriasi VLA modelis ir tradicinė robotinė regos sistema?

Tradicinė robotų regos sistema (2D kamera + objektų aptikimas arba 3D taškų debesis + pozos įvertinimas) išveda geometrinius duomenis (kur yra objektas, kokia jo orientacija), kurie vėliau pateikiami kaip įvestis į atskirą judesių planuotoją. VLA modelis paima kameros vaizdus ir kalbos instrukcijas kaip įvestį ir tiesiogiai išveda roboto veiksmus, be atskiro planavimo modulio. VLA metodas yra lankstesnis naujiems objektams ir instrukcijų pakeitimams; tradicinis metodas yra labiau deterministinis ir lengviau patvirtinamas pagal saugos standartus.

Ar įkūnytasis dirbtinis intelektas pramoninėje gamyboje bus paruoštas gamybai 2026 m.?

Ankstyvasis daugumos pritaikymų etapas. Kelios platformos („Covariant RFM-1“ el. prekybos vykdyme, „Figure AI Helix“ automobilių surinkimo bandomuosiuose projektuose) jau peržengė vien tik tyrimų ribas, tačiau plataus masto gamybos diegimas tokiu patikimumo lygiu, kokio tikisi pramonės klientai (veiklos laikas virš 99 %, pakartojamumas po milimetro, sertifikuotas saugumas), daugumai užduočių kategorijų vis dar trunka nuo vienerių iki trejų metų. Didelio mišrumo konteinerių surinkimas yra arčiausiai gamybos pasirengimo.

Kiek demonstracijų reikia VLA modeliui, kad išmoktų naują pramoninę užduotį?

Atsakymas labai skiriasi priklausomai nuo modelio ir užduoties. Turint stiprią iš anksto apmokytą magistralę, pvz., „OpenVLA“ ar „GR00T“, vos 50–100 demonstracijų tikslus derinimas gali užtikrinti tinkamą našumą atliekant paprastas stalo manipuliavimo užduotis. Sudėtingoms, sudėtingoms ar tikslioms pramoninėms užduotims gali prireikti 500–2,000 demonstracijų, kad būtų pasiektas priimtinas sėkmės rodiklis. Remiantis pramonės stebėjimais iš ankstyvųjų bandomųjų programų, praktinis komerciškai perspektyvaus konkrečioms užduotims skirto diegimo minimumas paprastai yra 100–300 valandų nuotolinių operacijų duomenų.

Kas yra simuliacinio ir realaus pasaulio atotrūkis ir kaip VLA kūrėjai jį sprendžia?

Simuliacinio ir realaus pasaulio atotrūkis – tai politikos našumo sumažėjimas, kai simuliacijoje apmokytas modelis yra diegiamas fiziniame robote. Šis atotrūkis turi dvi pagrindines priežastis: vizualinį srities poslinkį (atvaizduoti vaizdai atrodo kitaip nei realūs kameros vaizdai) ir fizikos srities poslinkį (imituotos sąlyčio jėgos, trintis ir objekto deformacija skiriasi nuo realaus pasaulio elgesio). Srities atsitiktinumas, atsitiktinai kintančios tekstūros, apšvietimas, masės ir fizikiniai parametrai simuliacinio mokymo metu, yra plačiausiai taikomas mažinimo būdas. „NVIDIA Cosmos“ prideda fotorealistinį vaizdo įrašų generavimą kaip papildomą duomenų šaltinį. Dauguma diegiamų VLA sistemų papildo simuliacinius duomenis realiomis robotų demonstracijomis, kad panaikintų likusį atotrūkį.

Ar įkūnytas dirbtinis intelektas gali veikti su esamomis pramoninių robotų rankomis, ar tam reikia naujos įrangos?

Esamos robotų rankos gali būti fizinis sluoksnis VLA generuojamiems judesio taikiniams, jei valdiklis gali priimti išorines padėties arba greičio komandas pakankamu dažniu (paprastai 10–100 Hz). VLA išvadų rinkinys veikia atskirame GPU skaičiavimo mazge ir siunčia taikinių pozas roboto valdikliui per standartinę sąsają („EtherCAT“, OPC UA arba tiekėjo specifinę API). Pilnos EVST QJAR serijos ir XR kobotų serijos rankos turi standartines lauko magistralės sąsajas, kurios leidžia naudoti šią dviejų sluoksnių architektūrą, todėl gamykloms nereikia keisti esamos įrangos, kad būtų galima vykdyti VLA išvadų bandomuosius projektus.

-

Susiję skaitymai

-

Paskutinį kartą atnaujinta: 2026 m. birželio 12 d. Duomenys apie VLA modelio parametrus ir diegimą paimti iš viešai prieinamų mokslinių straipsnių (Brohan ir kt., 2023, Kim ir kt., 2024) ir gamintojų pranešimų. Rinkos duomenys paimti iš Tarptautinės robotikos federacijos (IFR) 2025 m. pasaulinės robotikos ataskaitos. Kai konkrečių skaičių nėra, vietoj nepateiktų skaičių vartojama frazė „remiantis pramonės stebėjimais“.

Žr mūsų Įkūnyti dirbtinio intelekto sprendimai →

Nuostabu! Bendrinti su:

EVST logotipas
Privatumo apžvalga

Ši svetainė naudoja slapukus, kad galėtume suteikti jums geriausią įmanomą vartotojo patirtį. Slapukio informacija saugoma jūsų naršyklėje ir atliekama tokių funkcijų kaip atpažinimas, kai grįžtate į mūsų svetainę ir padėsi mūsų komandai suprasti, kokius svetainės skiltis rasite labiausiai įdomių ir naudingų svetainių.