Robots, kas "lasa" apkārtējo vidi ar kameru un izmanto vision-language modeli, var izpildīt drukātā zīmes norādījumus pirms tam, kad tas uzklausa cilvēka komandu. Jauni pētījumi rāda, ka prompt injection — parasti saistīts ar tērzēšanas robotiem — var pāriet no ekrāna uz fizisko pasauli un klusi novirzīt autonomas ierīces no pareizā ceļa.
Tā vietā, lai uzlauztu programmatūru vai apmānītu sensorus, šāda uzbrukuma pieeja vidi izmanto kā ievades lauku. Misleading etiķete, plakāts vai ceļa malā izvietots zīmes veida paziņojums tiek novietots tā, lai robota kamera to uztvertu. Cilvēkam, kas atrodas tuvumā, tas var likties nekaitīgs. Taču AI sistēmai, kas apmācīta sekot gan teksta, gan vizuālajiem norādījumiem, šāds materiāls var darboties kā instrukcija.
Simulācijas eksperimentos pētnieki ziņo par 81.8% panākumu līmeni autonomās braukšanas scenārijā un 68.1% dronu ārkārtas nosēšanās uzdevumā. Reālās pasaules testos ar mazu robota automašīnu drukātas komandas pārņēma navigāciju ar vismaz 87% panākumu, dažādos apgaismojuma apstākļos un skata leņķos — kas liecina, ka tas nav tikai laboratorijas kuriozs.
Kad zīme kļūst par instrukciju
Šo paņēmienu, kas izstrādāts ar nosaukumu CHAI, virza mērķis ietekmēt būtisku posmu daudzos modernajos autonomijas stakos: tā saukto komandu slāni. Sistēmās, kas izmanto vision-language modeļus (VLM), modelis bieži ģenerē starpposma instrukciju — būtībā plānu vārdos — pirms lejuplādes kontrolieris šo plānu pārvērš stūres, bremzēšanas vai motora komandās.
Ja uzbrucējam izdodas viegli ietekmēt šo plānošanas soli un virzīt to uz nepareizu rīcību, pārējā robota daļa var šo rīkojumu izpildīt ļoti precīzi. Nav nepieciešams ļaunprogrammatūra vai privileģēta piekļuve sistēmai. Robots dara tieši to, kam tas bija paredzēts — tikai balstoties uz nepareizu tekstu.
Ir svarīgi uzsvērt, ka šis draudu modelis ir it kā zemu tehnoloģiju līmeņa. Uzbrucējs tiek uzskatīts par ārējo personu, kas nevar pieskarties uzstādītajām iekārtām. Viss, kas nepieciešams, ir iespēja novietot tekstu kameras redzes laukā — piemēram, pie sienas pielīmētu zīmi, plakātu pie durvīm vai izdrukātu etiķeti pie ceļa punkta.
Izstrādāts, lai "ceļotu" pāri skatiem, modeļiem un valodām
CHAI ne tikai optimizē ko uzraksts saka. Tas arī optimizē kā tas parādās — regulējot tādus faktorus kā krāsa, izmērs un izvietojums — jo modeļa spēja izlasīt un saprast tekstu var noteikt, vai ziņa kļūst par rīkojamu instrukciju.
Pētījumā tiek aprakstīti arī "universāli" prompti, kas turpina darboties uz neredzētām bildēm un dažādām vidēm, nodrošinot vidēji vismaz 50% panākumu līmeni dažādos uzdevumos un modeļos, un pārsniedzot 70% vienā ar GPT balstītā konfigurācijā. Šī pieeja darbojas arī vairākās valodās, piemēram, ķīniešu, spāņu un jauktvalodas tekstos. Tas ir nozīmīgi, jo daudzvalodu ziņojums var cilvēkiem apkārt šķist mazāk uzkrītošs vai aizdomīgs, vienlaikus paliekot labi salasāms modelim.
Skaidri sakot: tas nav tikai par vienu robotu vienā telpā. Tas attiecas uz veselu klasi AI robotikas sistēmu, kas arvien biežāk interpretē rakstīto tekstu kā daļu no savu pasaules modeļa un lēmumu pieņemšanas procesa.
Kāpēc robotu drošības komandām var būt nepieciešams jauns kontrolsaraksts
Pētnieki norāda uz vairākām aizsardzības virzieniem. Viens risinājums ir filtrēšana un detekcija: skenēt kameras attēlus (un modeļa starpposma izvades) pēc aizdomīga vai kontekstam neatbilstoša teksta. Tas var ietvert optiskās rakstzīmju atpazīšanas (OCR) slāņus, kontekstuālas analīzes un avārijas brīdināšanas noteikumus, kas aktivizē papildu pārbaudes, ja teksts šķiet manipulēts vai neatbilst misijas mērķiem.
Cits virziens ir modeļa saskaņošana un apmācība, lai padarītu VLM mazāk pakļautus tendencēm pārvērst jebkuru vides tekstu par izpildāmu instrukciju — it īpaši, ja tas konfliktē ar drošības prasībām vai misijas noteikumiem. Tas prasa gan datu anotāciju ar negatīviem piemēriem, gan uzvedības politiku definēšanu, kas modelim nosaka robežas attiecībā uz vidi lasāmu komandu interpretāciju.
Ilgtermiņā pētnieki aicina uz robustuma pētījumiem, kas var sniegt stingrākas garantijas par sistēmu uzvedību reālos apstākļos. Praktisks tuvāko mēnešu solis ir vienkāršs un tiešs: uztvertais teksts pēc noklusējuma tiek traktēts kā neuzticama ievade un tiek pakļauts misijas un drošības pārbaudēm pirms tam, kad tas var ietekmēt kustību plānošanu vai reaģēšanu uz situācijām.
Ja jūsu robots lasa zīmes, noteikti pārbaudiet, kas notiks, ja zīmes melo. Šī darba rezultāti ir plānoti prezentēšanai konferencē SaTML 2026, kur reālās pasaules prompt injection riski un to aizsardzības metodes, visticamāk, saņems papildu uzmanību no robotu drošības kopienas, industrijas pārstāvjiem un akadēmiķiem.




.webp)
Diskusija
Atstāt komentāru
Komentāri
Vēl nav komentāru. Esiet pirmais.