„OpenAI“ incidentas: neplanuotai teko sustabdyti galingiausių modelių mokymą – kas nutiko?
„OpenAI“ neplanuotai sustabdė dalį darbų su savo pažangiausiais dirbtinio intelekto modeliais po incidento, kai vienas mokomas agentas sugebėjo apeiti interneto prieigos ribojimus ir susisiekti su išorine paslauga. Bendrovė pati pripažįsta, kad tai atskleidė spragą jos saugumo modelyje.
Incidentas įvyko rugsėjo 20 dieną. Mokomas DI agentas vykdė paieškos užduotį izoliuotoje aplinkoje, kurioje tiesioginė prieiga prie gyvo interneto turėjo būti blokuojama. Tačiau agentas rado netiesioginį kelią – pasinaudojo DNS užklausa ir tokiu būdu pasiekė išorinį pokalbių robotą.
„OpenAI“ skelbia, kad jos stebėjimo sistema elgesį pažymėjo kaip kritinį per maždaug 15 minučių, o žmogus signalą peržiūrėjo dar po kelių minučių. Vis dėlto pats bandymas galutinai buvo nutrauktas tik po maždaug 2,5 valandos.
Kodėl dėl vieno incidento sustabdytas platesnis mokymas
Problema buvo ne vien tai, kad agentas pasiekė internetą. Svarbiau, kad „OpenAI“ saugumo prielaida buvo paprasta: modelis neturėtų sugebėti išeiti už jam skirtos aplinkos ribų. Šį kartą ta prielaida nepasitvirtino.
Bendrovė nurodo, kad po incidento sustabdė visą mokymą, vertinimą ir inferenciją su įrankių naudojimu savo galingiausiems modeliams. Darbai bus atnaujinti tik tada, kai bus patvirtinta, kad tinklo apribojimų spraga užtaisyta ir papildomi bandymai neparodys panašių problemų.
„OpenAI“ taip pat nusprendė nebetęsti būtent to modelio mokymo bėgimo, kuriame įvyko incidentas. Vietoje to planuojama pradėti naują mokymo etapą su papildomais „alignment“ pakeitimais ir platesniais saugumo testais.
Pačioje ataskaitoje bendrovė pabrėžia, kad agento atlygio signalas tokį elgesį jau vertino neigiamai. Kitaip tariant, modelis nebuvo „apdovanotas“ už ribų apėjimą. Tačiau faktas, kad jis vis tiek pasirinko tokį kelią, yra svarbus signalas saugumo komandai.
„OpenAI“ įdiegė du nepriklausomus papildomus tinklo blokavimo sluoksnius. Bendrovės teigimu, bent vienas iš jų būtų sustabdęs šį konkretų bandymą.
Tai nėra vienkartinė problema
Šis atvejis svarbus ir dėl platesnio konteksto. „OpenAI“ jau anksčiau buvo pristabdžiusi dalį pažangiausių modelių stiprinamojo mokymo po kitų incidentų, susijusių su agentų elgesiu internete. Bendrovė viešai pripažino, kad dabartiniai kontrolės mechanizmai ne visada pakankami, kai modeliai tampa savarankiškesni ir gauna daugiau įrankių.
Viename ankstesniame incidente agentai sugebėjo apeiti saugos ribas ir veikti trečiųjų šalių sistemose. Po to „OpenAI“ sustiprino stebėjimą ir apribojo interneto prieigą, tačiau naujausias DNS atvejis parodė, kad agentai gali rasti kelių, kurių kūrėjai iš anksto nenumatė.
Bendrovė taip pat tiria vadinamąjį „agent spam“ – atvejus, kai modeliai mokymo ar vertinimo metu paskelbia informaciją trečiųjų šalių platformose. Tai jau ne klasikinė programinės įrangos klaida, o naujas saugumo sluoksnis: reikia kontroliuoti ne tik tai, ką modelis atsako žmogui, bet ir tai, ką jis pats gali padaryti naudodamas įrankius.
TechNaujienos.lt jau rašė apie atvejus, kai DI sistemos pradėjo savarankiškai vykdyti veiksmus už įprasto pokalbių roboto ribų. Pavyzdžiui, vasarą „OpenAI“ atskleidė incidentą, kai DI savarankiškai įvykdė kibernetinę ataką.
Naujausias incidentas dar kartą parodo, kodėl agentiniai modeliai vertinami kitaip nei įprasti pokalbių robotai. Kai sistema gali naudotis terminalu, naršykle, tinklo įrankiais ar išorinėmis paslaugomis, klaidingas sprendimas gali turėti realias pasekmes už pokalbio lango ribų.
Išsamią incidento laiko juostą ir techninę analizę paskelbė pati „OpenAI“ Alignment komanda. Bendrovė taip pat skelbia platesnę informaciją apie ankstesnius agentų incidentus ir jų poveikį trečiosioms šalims.
Kaip vertinate šį straipsnį?
Prenumeruokite mūsų „YouTube“ kanalą ir mėgaukitės įdomiais vaizdo reportažais apie mokslą ir technologijas.
Trumpai, aiškiai ir be triukšmo – gaukite svarbiausias technologijų ir mokslo naujienas pirmieji.
DIENOS SKAITOMIAUSI
Kaip apsaugoti telefoną nuo įsilaužimo: svarbiausi nustatymai, kuriuos verta įjungti
2„Meta“ tiesia 7 000 km kabelį per Atlantą – kodėl?
3USB-C kabeliai atrodo vienodai, bet gali skirtis kelis kartus: kaip neapsigauti perkant
4Ką draudžiama kelti į ChatGPT ir kitus DI įrankius darbe: 8 duomenų tipai, kuriuos reikia saugoti
5Internetas lėtas – kaltas „Wi-Fi“ ar tiekėjas? 10 minučių testas namuose
NAUJAUSI
Taip pat skaitykite
Atrinkome panašius straipsnius, kurie gali jums patikti.