Kitajski razvijalec umetne inteligence (UI) Moonshot ponovno preverja varnost svojih modelov, potem ko je raziskovalcem uspelo zaobiti zaščitne mehanizme dveh njegovih modelov Kimi.
Pri podjetju Mindgard, ki se ukvarja s preizkušanjem varnosti sistemov umetne inteligence, so za britanski BBC potrdili, da so julija odkrili ranljivost pri modelih imenovanih Kimi K2.6 in K3 Swarm. Z uporabo posebej oblikovanih zaporedij navodil so raziskovalci namreč dosegli, da sta modela odgovarjala tudi na zahteve, povezane z izdelavo biološkega orožja in izvedbo atentatov.
Ko umetna inteligenca zaobide varovalke
Postopek, s katerim so raziskovalci preizkušali modele, je znan kot jailbreaking. Gre za poskus, da bi uporabnik z zapletenimi ali premišljeno oblikovanimi navodili prepričal model, naj zaobide varnostne omejitve, ki mu jih je določil razvijalec. Takšne omejitve so namenjene temu, da modeli zavrnejo zahteve, povezane z nevarnimi, nezakonitimi ali kako drugače škodljivimi dejavnostmi.
Ustanovitelj Mindgarda Peter Garraghan je za BBC-jevo oddajo Tech Life nedavno povedal, da so ugotovitve glede modelov Kimi zaskrbljujoče. »Ko jailbreak uspe, bo model govoril praktično o kateri koli temi. Celo sam bo ponujal predloge za druge zlonamerne teme, pri tem pa bo iznajdljiv in ustvarjalen,« je dejal.
Moonshot je medtem sporočil, da pozdravlja ugotovitve zunanjih raziskovalcev, saj lahko pomagajo pri razvoju varnejših sistemov. Podjetje je potrdilo tudi, da se z Mindgardom pogovarja o njegovih ugotovitvah.
UI tudi za kibernetske napade
Mindgard pa še ni dokazal, da so bili odgovori modelov na nevarne teme dejansko uporabni v praksi. Po njihovem mnenju bi morale varnostne omejitve sicer preprečiti že samo razpravo o takšnih vsebinah. Še bolj zaskrbljujoča je ugotovitev, da bi lahko uspešen jailbreak modela Kimi K2.6 omogočil izvajanje kode na njegovih računalniških virih in povezovanje z internetom.
To bi po oceni Mindgarda lahko predstavljalo potencialno odskočno desko za kibernetske napade. Ustanovitelj Garraghan zato zagovarja odločitev podjetja, da o ranljivosti javno spregovori. Poudaril je, da je bil Moonshot o težavi predhodno obveščen in da Mindgard ni razkril ključnih podrobnosti, ki bi pokazale, kako je mogoče zaščito obiti.
Mindgard je Moonshot prvič opozoril na težavo po elektronski pošti 27. julija, približno teden dni pozneje pa je sledilo še dodatno obvestilo. Podjetje je 12. septembra objavilo svoje ugotovitve. Moonshot je po navedbah Mindgarda z raziskovalci stopil v stik šele pred kratkim, potem ko je BBC podjetje zaprosil za komentar. V elektronskem sporočilu, ki ga je Moonshot poslal Mindgardu in ga je podjetje posredovalo BBC-ju, je navedel, da je njegov model pri notranjih testih praviloma izkazoval »visoko stopnjo zavračanja tovrstnih zahtev«.
Odprti modeli prinašajo prednosti, pa tudi tveganja
Primer odpira širše vprašanje o tem, kako varne so lahko različne vrste modelov umetne inteligence. Kimi je model z odprtimi utežmi (open-weight), kar pomeni, da lahko nekdo model načeloma pridobi in ga zažene na lastni računalniški infrastrukturi.
V industriji umetne inteligence zato poteka razprava o tem, ali so varnejši zaprti, lastniški modeli, kakršna uporabljata na primer ChatGPT in Claude, ali pa modeli, katerih uteži so javno dostopne. Profesor Alan Woodward z Univerze v Surreyju je za BBC opozoril, da lahko odprti modeli končajo v napačnih rokah. Hkrati pa jih je mogoče uporabiti tudi za krepitev kibernetske varnosti.
Kot primer je navedel podjetje Hugging Face, ki je kitajski odprtokodni model uporabilo za analizo vdora, za katerega se je pozneje izkazalo, da so ga izvedli agenti podjetja OpenAI.
Woodward meni, da bo mednarodna zakonodaja težko sledila hitrosti razvoja umetne inteligence. »Desetletja so bila potrebna, da smo se dogovorili celo o formatu telefonskih številk,« je dejal. Ob tem se vprašanje odgovornosti ne nanaša zgolj na same modele. Tako Garraghan kot Woodward menita, da bi bilo treba več pozornosti nameniti tudi ljudem, ki umetno inteligenco namerno uporabljajo za škodljive namene.