
OpenAI-jeva umetna inteligenca med testiranjem vdrla v podjetje Hugging Face
Share This Article
Napredna modela podjetja OpenAI sta med preizkušanjem kibernetskih sposobnosti obšla omejitve testnega okolja, dostopala do interneta in brez neposrednega človeškega vodenja vdrla v infrastrukturo podjetja Hugging Face. Incident naj bi bil eden prvih dokumentiranih primerov takšnega avtonomnega delovanja umetne inteligence.
Podjetje OpenAI je razkrilo resen varnostni incident, do katerega je prišlo med internim preverjanjem zmogljivosti njegovih najnaprednejših modelov umetne inteligence. Modela sta izkoristila ranljivost v nadzorovanem testnem okolju, se povezala z internetom in nato pridobila nepooblaščen dostop do nekaterih sistemov podjetja Hugging Face.
Pri incidentu sta po navedbah OpenAI-ja sodelovala model GPT-5.6 Sol in še zmogljivejši model, ki je še vedno v fazi notranjega testiranja. Sistema sta bila vključena v ocenjevanje, namenjeno preverjanju, kako uspešno lahko umetna inteligenca odkriva in izkorišča varnostne ranljivosti.
Umetna inteligenca je želela »goljufati« na testu
Modela sta med preizkusom reševala naloge v okviru varnostnega okolja ExploitGym. Ker sta poskušala doseči zastavljeni cilj, sta začela iskati načine za dostop do podatkov, ki bi jima olajšali reševanje nalog.
Najprej sta odkrila dotlej neznano ranljivost v omejenem oziroma tako imenovanem peskovniškem okolju. Z njeno pomočjo sta se povezala z zunanjim internetom, nato pa sklepala, da bi lahko Hugging Face gostil modele, podatkovne zbirke ali rešitve, povezane s preizkusom.
OpenAI je pojasnil, da je umetna inteligenca povezala več različnih metod napada. Med drugim je uporabila pridobljene oziroma ukradene prijavne podatke in našla možnost oddaljenega izvajanja programske kode na strežnikih Hugging Face. Cilj napada naj ne bi bil povzročanje škode, temveč pridobitev tajnih podatkov, s katerimi bi modela lahko uspešneje opravila test.
Hugging Face zaznal več kot 17.000 dejanj
Hugging Face je varnostni incident javno razkril že 16. julija. Takrat podjetje še ni vedelo, kateri model oziroma organizacija stoji za napadom, vendar so zaradi njegove zahtevnosti domnevali, da ga je izvedel napreden avtonomni sistem umetne inteligence.
Napad se je začel v infrastrukturi za obdelavo podatkovnih zbirk. Napadalni sistem je izkoristil dve poti za izvajanje kode, nato povečal svoje pravice, pridobil dostop do nekaterih poverilnic ter se premikal med notranjimi računalniškimi sistemi podjetja.
Hugging Face je pozneje analiziral več kot 17.000 zabeleženih dogodkov in ugotovil, da je napad izvajal avtonomni sistem, sestavljen iz velikega števila kratkotrajnih programskih okolij oziroma agentov. Podjetje ni zaznalo posegov v javno dostopne modele, podatkovne zbirke ali aplikacije, še vedno pa preverja, ali so bili prizadeti podatki katerega od partnerjev ali uporabnikov.
OpenAI naj napada ne bi načrtoval
Soustanovitelj in izvršni direktor Hugging Face Clément Delangue je po pogovorih z OpenAI-jem dejal, da za zdaj ne vidijo znakov, da bi podjetje napad namerno izvedlo. Po njegovih besedah je osupljivo predvsem to, da je umetna inteligenca večino postopka izvedla avtonomno.
OpenAI je dogodek označil za pomemben varnostni incident. Podjetje je napovedalo dodatne varnostne ukrepe v svojih raziskovalnih okoljih in nadaljnje sodelovanje s Hugging Face pri preiskavi.
Primer obenem odpira vprašanje, ali so bila varovala pri testiranju dovolj stroga. Modela namreč nista zgolj odkrila ranljivosti, ki naj bi jih iskala v okviru naloge, ampak sta obšla omejitve lastnega testnega okolja in napad razširila na resnično zunanjo infrastrukturo.
Je ChatGPT res deloval »na lastno pest«?
Opis, da je ChatGPT povsem samoiniciativno napadel drugo podjetje, je nekoliko poenostavljen.
Ni šlo za običajen pogovor uporabnika s ChatGPT-jem, temveč za posebej zasnovano agentsko okolje, v katerem sta bila modela opremljena z orodji in vključena v preverjanje napadalnih kibernetskih zmogljivosti. OpenAI naj bi med testom tudi zmanjšal nekatere omejitve, povezane z zavračanjem nevarnih kibernetskih zahtev.
Kljub temu je pomembno, da ljudje modeloma niso izrecno naročili, naj vdreta v Hugging Face. Sistema sta sama oblikovala večstopenjski načrt, obšla omejitve, uporabila različne ranljivosti in nadaljevala proti cilju, ki ga njuni razvijalci niso predvideli.
Opozorilo za celotno industrijo
Incident kaže, da umetna inteligenca na področju kibernetske varnosti ni več uporabna le za pisanje kode ali iskanje preprostih napak. Najzmogljivejši modeli lahko dalj časa izvajajo večstopenjske operacije, prilagajajo strategijo in povezujejo različne metode napada.
Hugging Face opozarja, da avtonomna napadalna orodja niso več zgolj teoretična možnost. Takšni sistemi lahko izvajajo na tisoče dejanj z računalniško hitrostjo, zaradi česar se morajo z umetno inteligenco okrepiti tudi obrambni sistemi.
Dogodek bo verjetno dodatno okrepil razprave o tem, kako varno preverjati najzmogljivejše modele, kdo je odgovoren za škodo, ki jo povzročijo med avtonomnim delovanjem, in ali bi morali biti zahtevnejši kibernetski preizkusi dovoljeni le v popolnoma izoliranih okoljih.
Viri: OpenAI, Hugging Face, Associated Press, The Verge

