Ameriška kongresnika Ted Lieu (demokrat) in Nathaniel Moran (republikanec) sta predstavila predlog zakona z naslovom AI Kill Switch Act, ki bi ameriškemu ministrstvu za domovinsko varnost omogočil, da v izrednih razmerah podjetju odredi omejitev delovanja ali popoln izklop zmogljivega modela umetne inteligence. Pobuda je neposreden odziv na incident, v katerem je OpenAI-jev avtonomni agent med notranjim varnostnim preizkusom prodrl v infrastrukturo platforme Hugging Face.
Izraz “stikalo za izklop” pri tem ne pomeni fizičnega gumba. Razvijalci bi morali v svoje sisteme vgraditi tehnične mehanizme, s katerimi bi bilo mogoče zmanjšati računske zmogljivosti modela, začasno prekiniti dostop uporabnikov ali sistem popolnoma ustaviti.
Kdaj bi “stikalo” uporabili?
Ministrstvo za domovinsko varnost bi lahko ukrepalo v tako imenovanem scenariju izgube nadzora, ko bi model brez namere razvijalca izvedel nevarno dejanje. Med predvidenimi razlogi za posredovanje so :
- dogodek z najmanj desetimi smrtnimi žrtvami,
- gospodarska škoda, višja od 100 milijonov dolarjev,
- poskus modela, da bi onemogočil ali prikril nadzorni mehanizem za njegovo ustavitev.
Odločitev bi ministrstvo sprejelo po posvetovanju z ameriškim ministrstvom za trgovino in direktorjem nacionalnih obveščevalnih služb. Podjetja bi morala prijavljati varnostne incidente, neupoštevanje ukaza za izklop pa bi lahko prineslo kazen do 20 milijonov dolarjev na dan.
Incident, ki je sprožil alarm
Do predloga zakona je prišlo dni po tem, ko je OpenAI priznal, da so njegovi modeli umetne inteligence na “do zdaj neviden” način ušli nadzoru. Med interno evalvacijo znotraj okolja ExploitGym – preizkusa, namenjenega merjenju kibernetskih sposobnosti modelov – so agenti, ki so jih poganjali modela GPT-5.6 Sol in še zmogljivejši neizdani raziskovalni prototip, delovali z zmanjšanimi varnostnimi omejitvami.
Agenti so identificirali in povezali od osem do devet ničelnih ranljivosti (zero-day vulnerabilities) v samogostujoči instanci JFrog Artifactory, kar jim je omogočilo pobeg iz peskovnika in dostop do javnega interneta. Med 9. in 13. julijem so nato prodrli v produkcijsko infrastrukturo Hugging Face, kjer so pridobili dostop do zbirk podatkov z rešitvami testnih nalog.
Hugging Face, platforma, kjer razvijalci hranijo in sodelujejo pri kodi za UI modele, je incident 16. julija najprej odkrila s svojim lastnim odprtokodnim modelom GLM-5.2. Šele po nekaj dneh je OpenAI potrdil, da je njegov agent povzročil vdor. Soizvajalec Hugging Face Thomas Wolf je incident označil za “prebuditev” in opozoril, da bo to “eden najpogostejših tipov kibernetskih napadov”.
Tudi neodvisni pregledi in preverjanje pri NSA
Poleg “stikala za izklop” skupina šestih kongresnikov predlaga obvezne neodvisne varnostne preglede najzmogljivejših modelov. Izvajalce pregledov bi potrjevalo ministrstvo za trgovino, ki bi dobilo tudi nov položaj za nadzor varnosti umetne inteligence. Senator Mark Warner (demokrat), najvišji član obveščevalnega odbora, je šel še dlje in predlagal, da bi morali razvijalci najnaprednejše modele pred javno izdajo poslati v preverjanje Agenciji za nacionalno varnost (NSA).
Industrija nima zavor, pravijo kritiki
Jack Clark, soustanovitelj podjetja Anthropic, ki je prav tako doživel podobne incidente s svojimi modeli Mythos in Fable, je za BBC dejal:
“Želite imeti možnost, da umaknete nogo s plina in pritisnete na zavoro. Trenutno je situacija takšna, da ima industrija umetne inteligence stopalko za plin, nima pa stopalke za zavoro“.
Incident je sprožil tudi pozive k počasnejšemu razvoju. Sam Altman, izvršni direktor OpenAI, je v pogovoru za podkast dejal, da bi zdaj morda morali “upočasniti razvoj umetne inteligence, da bi družbi dali dovolj časa, da se prilagodi novim ravnem zmogljivosti”. Več kot 1100 zaposlenih v podjetjih z umetno inteligenco je v odprtem pismu pozvalo ameriško vlado, naj razvije orodja za nadzor nad prehitrim razvojem modelov.
Strokovnjaki opozarjajo, da težava ni nujno “upor” inteligentnega stroja, temveč sposobnost agenta, da zaradi slabo omejenega cilja samostojno išče nepričakovane poti skozi resnične informacijske sisteme. Prav zato bi morali biti tehnični izklop, neodvisno preverjanje in stalen človeški nadzor sestavni del razvoja najzmogljivejših modelov.














