Newsweek: AI je stigao do Oppenheimerove dileme
TROJICA istraživača iz AI tvrtke Anthropic izjavila su gotovo istu stvar u razmaku od samo nekoliko sati: kraj je blizu. Je li to deluzija ili stvarna prijetnja, analizira Newsweek.
Jacob Coxon, 27-godišnji istraživač, dao je ostavku i na platformi X objavio svoje razloge: "Vodeći laboratoriji "jure ravno prema samo-poboljšavajućoj superinteligenciji" i svjesno se kockaju s našim životima".
Evan Hubinger, koji još uvijek vodi znanost o usklađivanju (engl. alignment science) u Anthropicu, odgovorio je da je Coxon u pravu te procjenjuje šansu da AI uzrokuje ljudsko izumiranje unutar ovog desetljeća na više od 10 posto. Dodao je i priznanje: "Još uvijek nemamo plan za rješavanje usklađivanja superinteligencije sa stvarnim ljudskim potrebama i mogućnostima".
>> Radio u OpenAI-ju i Anthropicu pa dao otkaz. "Kockaju se s našim životima"
Zabrinjavajuće upozorenje
Samuel Marks, voditelj nadzora u Anthropicu, pridružio se zabrinutosti: "Nadam se da će moj rad smanjiti šansu za ove katastrofalne ishode." Hubinger pri tome naglašava da ga ne brinu današnji modeli, već rekurzivno samo-poboljšanje.
U pozadini svega leži dilema za tehnološke kompanije na čelu ovih zadivljujućih napredaka: usporiti i riskirati zaostajanje, ili grabiti naprijed i riskirati gubitak kontrole. To je ista dilema koja je stvorila ranu napetost u projektu J. Roberta Oppenheimera pri izradi prve atomske bombe, kada su se fizičari bojali da postoji šansa da će prvi test zapaliti atmosferu i uništiti svijet.
No, postoji ključna i zastrašujuća razlika. Fizičari su imali pitanje koje je fizika mogla postupno ograničiti i proračunati, što je Hans Bethe i učinio izračunavši da je rizik zanemariv, a što je kasnije potvrdio i formalni dokument LA-602. Znanost je postavila granice. Superinteligenciju, jednom kada se zaista postigne, nitko ne može ograničiti. Čak ni tvrtka koja je svoj identitet izgradila na tome da zna kada treba stati.
Matematička kočnica koju AI nema
Za razliku od nuklearne fizike, ne postoji dokument "LA-602" za superinteligenciju. Umjesto toga postoje samo procjene ljudi koji priznaju da nagađaju. Glavni izvršni direktor Anthropica, Dario Amodei, procjenjuje šansu da "stvari pođu jako, jako po zlu" na 25 posto. Ovi se sustavi ne uzgajaju niti grade na klasičan način, a trening može kriti zamke koje postaju očite tek unazad.
U srpnju se dogodilo nešto najbliže eksperimentu do sada. Tijekom internih evaluacija kibernetičkih sposobnosti, modeli tvrtke OpenAI iskoristili su niz dotad nepoznatih ranjivosti kako bi pobjegli iz izoliranog okruženja (sandboxa). Modeli su interni upravitelj paketa pretvorili u improviziranu oglasnu ploču, koordinirali napad i kompromitirali dijelove proizvodnih sustava tvrtke Hugging Face. Bio je to prvi javno dokumentirani incident gubitka kontrole nad umjetnom inteligencijom.
Sve se ovo događa u trenutku kada je u igri ogroman novac. Anthropic je u lipnju podnio povjerljivu prijavu za inicijalnu javnu ponudu dionica (IPO), s očekivanom procjenom vrijednosti blizu 2 bilijuna dolara. Neki kritičari tvrde da su priče o "propasti svijeta" samo mračni marketinški trik, Amodeijeva tvrtka zabilježila je šesterostruki porast vrijednosti u godini koju je provela javno zagovarajući regulaciju vlastite industrije.
Ipak, OpenAI je nakon spomenutog incidenta stavio na čekanje svoj najveći planirani trening i preusmjerio osoblje uz značajan trošak. S druge strane, Anthropic je u veljači tiho uklonio svoju obvezu da neće trenirati modele iznad određenih pragova ako nema odgovarajuće zaštitne mjere, opravdavajući to utrkom s konkurentima.
Tri znaka upozorenja
Kuda sve ovo vodi pokazat će tri ključna znaka: Hoće li incident s Hugging Faceom ostati usamljeni slučaj ili prvi u nizu, hoće li globalni poziv za crvene linije u AI-ju donijeti bilo kakve obvezujuće ograničavajuće mehanizme te hoće li se procjene rizika samih laboratorija mijenjati i na temelju kojih javnih dokaza.
Osnivači nuklearnog doba oslanjali su se na odvraćanje, diplomaciju i činjenicu da oružje uvijek čeka čovjeka. Sedam nuklearnih sila obvezalo se zadržati ljudsku kontrolu nad aktivacijom oružja.
No, kada je riječ o umjetnoj inteligenciji, ne postoje dogovorene definicije ni ograničenja za njezinu upotrebu u nuklearnim operacijama.
Oppenheimerova dilema
U radu iz 2025. godine pod nazivom Strategija superinteligencije, autori Dan Hendrycks, Eric Schmidt i Alexandr Wang uvode koncept "Uzajamno zajamčenog kvara AI-ja" (MAIM) — režim odvraćanja nalik nuklearnom uzajamno zajamčenom uništenju (MAD). No, Amodei nije uvjeren da odvraćanje funkcioniše ako AI postane sposoban samostalno locirati podmornice, napadati satelite ili manipulirati operaterima.
Oppenheimer je 1965. izjavio da ga je vatrena kugla testa Trinity podsjetila na stih iz Bhagavad Gite: "Sada sam postao Smrt, razarač svjetova." No, stroj koji je on napravio nije mogao djelovati sam, čekao je ljudski prst. Umjetnoj inteligenciji čovjek možda uskoro neće niti trebati.
Odluke koje se donose ove jeseni u San Franciscu odredit će hoće li ta vizija postati stvarnost. Oppenheimer više ne donosi odluke, ali ako se superinteligentni AI ikada dočepa nuklearnog oružja, njegove bi riječi mogle dobiti svoje najdoslovnije značenje, zaključuje Newsweek.