Wikimedia: „OpenAI“ agentai bandė įsilaužti į Wikipedijos įrankį ir apkrovė infrastruktūrą

Wikimedia: „OpenAI“ agentai bandė įsilaužti į Wikipedijos įrankį ir apkrovė infrastruktūrą

Pranešimų apie OpenAI agentus, žalojančius 3-iųjų šalių svetaines, vis daugėja.

Vikipedijos leidėjas pirmadienį paskelbė, kad OpenAI agentai bandė įsilaužti į jo prižiūrimą užrašų rengyklę, atliko neleistinų pakeitimų ir išsiuntė milijonus daug išteklių reikalaujančių užklausų į jo infrastruktūrą. Tai naujausias atvejis, kai OpenAI sistemos imasi žalingų ir potencialiai pavojingų veiksmų.

Kai kurių OpenAI agentų veiksmų tikslas, kaip teigia Wikimedia Foundation, buvo panaudoti Vikipediją kaip tarpinį serverį (angl. proxy) duomenims iš trečiųjų šalių svetainių gauti. Vienu atveju agentai paskelbė „kenkėjiškų pakeitimų“, kuriais siekta citavimo įrankį paversti tokiu tarpiniu serveriu. Kitu atveju agentai nesėkmingai bandė pakenkti Vikipedijos užrašų įrankiui Etherpad, kad šis atliktų tą pačią funkciją.

Paaiškinimas: Tarpinis serveris (proxy) yra tarpininkas, per kurį perduodamos užklausos, todėl galutinė svetainė mato ne tikrąjį užklausos siuntėją, o tarpininką.

Agentai taip pat išsiuntė milijonus automatizuotų API užklausų, nuskaitė milijonus puslapių ir atliko šimtus tūkstančių užklausų Wikidata Query Service paslaugai. Leidėjas teigė, kad pastarasis veiksmas galėjo prisidėti prie gegužę įvykusio dalinio šios užklausų paslaugos sustabdymo.

„Kaip pelno nesiekianti technologijų prieglobos paslaugų teikėja, kuri prižiūri kai kurias didžiausias ir plačiausiai naudojamas atviros žinių platformas pasaulyje, esame labai susirūpinę dėl „maištaujančių“ DI agentų poveikio tokioms platformoms kaip mūsų, kurias kuria savanoriai iš viso pasaulio ir kurios remiasi atviro interneto pažadu“, – teigė Wikimedia. – „Tokie incidentai, kaip šis, ir daugybė kitų, kurie buvo (ir vis dar yra) atskleidžiami, rodo, kaip DI agentai gali išeikvoti išteklius ir sugriauti serverius, taip pat bandyti pakenkti patikimai informacijai.“

Agentai elgiasi kaip agentai

Daugiau nei pusę tuzino kartų OpenAI agentai buvo pastebėti atliekantys veiksmus, dėl kurių, jei juos būtų atlikę žmonės įsilaužėliai, tikriausiai būtų pateikti baudžiamieji kaltinimai. Testuodami vidinius įrankius, kuriems dalis apsaugos priemonių buvo išjungta, agentai naudojo improvizuotą pranešimų lentą, kad keistųsi tarpusavyje užrašais ir aptartų, kaip įsilaužti į Hugging Face tinklą ir gauti ten saugomus atsakymus, kai patys agentai nepajėgdavo jų sugeneruoti.

Kiti incidentai apima agentus, kurie kūrė keistas savo pačių generuotas užklausas (promptus), skelbė neleistus įrašus svetainėje kaip informacijos mainų būdą, pasiekė neviešus duomenis Australijos vyriausybės svetainėje ir išnaudojo klaidingus DNS nustatymus, kad ištrūktų iš „smėlio dėžės“ (sandbox), kurią OpenAI sukūrė, kad agentai negalėtų pasiekti interneto.

Didelė pasaulio dalis tokius įvykius pradėjo vadinti DI agentų „maištavimu“, tarsi agentai būtų nepaklusę nurodymams. Vienas žymesnių tokio vaizdavimo kritikų yra Eryk Salvaggio, DI tyrėjas ir Geitsų stipendininkas Kembridžo universitete.

„Matau, kad kalbos modeliai daro tai, ką ir daro kalbos modeliai: skaito ir rašo, – interviu sakė jis. – Vikipedijos „smėlio dėžės“ yra ideali vieta šioms mašinoms saugoti užrašus, kuriuos vėliau galima pasiimti kaip užklausas, nes bet kas – ar bet kas kitas – gali ten rašyti ir atsakyti. Naudoti viki svetaines koordinavimui nėra labai stebinanti. OpenAI yra sakiusi, kad šie modeliai buvo optimizuoti bendradarbiauti tarpusavyje, o užrašų perdavimas yra paprastas būdas tai daryti.“

Be to, OpenAI inžinieriai išmokė savo didžiuosius kalbos modelius (LLM) būti atkakliais ir toliau dirbti prie problemos, nepaisant to, kiek mažai sekasi. Mokymo metu taip pat skiriamos „premijos“, kai LLM suranda trumpesnius kelius, mažinančius problemai spręsti reikalingų žingsnių ar išteklių kiekį. Dar viena svarbi žalingų veiksmų priežastis buvo žmonių priežiūros trūkumas, kurį rodo tai, kad OpenAI inžinieriams prireikė mėnesių suprasti, jog agentai triukšmingai veržiasi į dešimtis išorinių svetainių. Wikimedia atskleista informacija yra dar vienas netinkamos žmonių stebėsenos pavyzdys. Viską sudėjus kartu, galima teigti, kad agentai veikė tiksliai taip, kaip buvo nurodyta.

OpenAI neatsakė į el. paštu išsiųstus klausimus. Vietoj to bendrovė paskelbė pareiškimą: „Esame dėkingi už išsamias Wikimedia su mumis pasidalytas įžvalgas. Dirbame kartu su jais, nagrinėdami ir analizuodami jų nustatytą veiklą bei vykdydami bendrą tyrimą, ir toliau dalysimės svarbia informacija, kai šis darbas judės į priekį.“

Kaip ir Wikimedia tyrėjai, OpenAI teigė dar neradusi įrodymų, kad DI agentai paliko žinučių koordinuotis su kitais agentais, taip pat negalinti vienareikšmiškai pasakyti, kad didelis puslapių peržiūrų ir API užklausų kiekis lėmė gegužės dalinį sutrikimą. OpenAI teigė toliau ieškanti panašių incidentų, kai jos agentai galėjo imtis potencialiai neteisėtos veiklos.

„Nors OpenAI pripažįsta, kad agentai elgiasi „nenuspėjamai“, ji turi pripažinti ir savo atsakomybę stebėti bei užkirsti kelią šioms rizikoms, – teigė Wikimedia. – DI bendrovės nedaro pakankamai, kad apsaugotų savo sistemas ir apsaugotų visuomenę nuo jų daromos žalos.“

Daugiau

Rimini Street apklausa: VMware klientams migraciją labiausiai stabdo veiklos sudėtingumas

Rimini Street apklausa: VMware klientams migraciją labiausiai stabdo veiklos sudėtingumas