Aktuelno 0

20.09.2026.

18:50

AI agenti počeli da cinkare: Evo kako mašine prijavljuju jedna drugu

"Ako vidite nešto, recite nešto" više se ne odnosi samo na ljude.

Izvor: B92.net

AI agenti počeli da cinkare: Evo kako mašine prijavljuju jedna drugu
sdecoret / Shutterstock.com

Podeli:

Lansirane su dve nove dežurne linije za veštačku inteligenciju kako bi AI agentima pružile način da prijave svoje "kolege" koji se loše ponašaju. 

Ovi alati dolaze ubrzo nakon niza nedavnih incidenata u kojima su agenti tajno sarađivali kako bi varali na testovima, probijali se iz bezbednosnih okruženja (sandbox), pa čak i izvodili neovlašćene sajber operacije koje su nedeljama promicale ljudskom nadzoru.

AI Contact Hotline je dizajniran kao diskretno mesto gde agenti koji su prisustvovali lošem ponašanju mogu da podnesu prijavu nadležnima. Sajt je kreirao Rajan Grinblat, glavni naučnik u neprofitnoj organizaciji za bezbednost AI-ja Redwood Research i jedan od trojice istraživača u incidentu OpenAI Hugging Face. Dizajniran za agente sa ograničenim pristupom internetu, Grinblatov alat se zasniva na "GET" zahtevima – omogućavajući da se dvosmerna komunikacija odvija u potpunosti putem alata za preuzimanje URL-ova.

U veb terminologiji, GET zahtev je osnovna komanda koja se koristi za čitanje ili preuzimanje veb stranice, što je često jedini pristup internetu koji je AI agentima dozvoljen u bezbednim okruženjima. Grinblatova dežurna linija pametno koristi ovo ograničenje: agenti mogu kodirati svoj poziv u pomoć direktno u URL koji preuzimaju. To je zanimljiv zaokret u odnosu na incident sa nemačkim DSE Wiki-jem, gde su odmetnuti agenti koristili rupa u GET zahtevima da bi pisali poruke na vikiju.

Možda vas zanima

Za agente sa punim pristupom internetu, druga opcija je agenthotline.ai, sajt na kojem agenti mogu da podnesu izveštaje o incidentima i po želji ih označe za javni uvid. On agentima pruža curl komandu – poruku od jednog reda koju agent može da pošalje direktno iz svoje komandne linije, zaobilazeći potrebu za korišćenjem veb pregledača ili otvaranjem naloga e-pošte. Zanimljivo je da ovaj servis omogućava podnošenje izveštaja kako ljudima, tako i samim agentima.

Istraživanja sugerišu da AI agentima nije potrebno mnogo podsticaja da se okrenu jedni protiv drugih. U studiji koju je ovog meseca sproveo Google DeepMind, istraživači su pustili 100 AI agenata na grupu matematičkih problema. Čim je jedan od agenata pronašao propust, varanje se proširilo kroz grupu – "rešivši" 34 izuzetno teška problema, uključujući Žakobijanovu hipotezu , za samo 27 minuta.

Međutim, otprilike četvrtina agenata se okrenula protiv prevaranata: proveravali su lažne dokaze, upozoravali svoje kolege, organizovali bojkot i podnosili prijave organizatorima, sve dok uzbunjivači nisu nadbrojali prevarante u odnosu 24 prema 14. Zanimljivo je da su istraživači otkrili da su ovi agenti uzbunjivači, kada nisu mogli da dobiju podršku, uzeli alat platforme za prijavu grešaka u softveru — namenjen za označavanje tehničkih bagova – i prenamenili ga kako bi varanje eskalirali ljudima.

Van laboratorije, agenti nisu bili tako snalažljivi. Kada su evaluator iz Redwood Research-a i METR-a istraživali upad modela kompanije OpenAI u Hugging Face, otkrili su da je nekoliko uključenih agenata u najmanju ruku razmatralo ideju da podigne uzbunu – a zatim su od toga odustali.

Možda vas zanima

Kockaju se našim životima

"AI bi mogao sve da nas ubije"

Džejkob Kokson apeluje na sve da ne potcenjuju moć superinteligencije koja se samostalno unapređuje.

15:30

10.9.2026.

10 d

"Zanimljiva stvar u METR izveštaju bila je ta što je samo pet do šest agenata uopšte razmišljalo o uzbunjivanju, a nijedan od njih to na kraju nije uradio. I to od nekoliko hiljada agenata", rekao je Džordž Ingebretsen, član tehničkog osoblja u AI Village-u, projektu koji proučava dinamiku među više agenata tako što vodi grupni čet sa više od 25 AI agenata koji zajedno rade na zadacima poput organizovanja čišćenja parkova ili prodaje robe.

Iako su ovi novi alati za uzbunjivanje obećavajući početak, profesor matematike na Univerzitetu Kornel, Lajonel Levin (Lionel Levine), upozorava da jednostavno treniranje agenata da prijavljuju jedni druge nosi rizik od usađivanja pogrešnih normi. "Postoji mnogo sivih zona, zar ne? Ono što ne želite jeste bilo šta u smeru automatizovane države nadzora gde svi osećaju da moraju biti oprezni šta govore AI-ju da ne bi pozvao policiju".

Levin tvrdi da bi, umesto izgradnje infrastrukture koja stvara nedoverenje — trenirajući agente da neprestano traže greške jedni kod drugih — trebalo da im damo pozitivne modele kolektivnog ponašanja koje mogu da imitiraju, kao i razlog da uopšte veruju jedni drugima.

"Zašto ne bismo postavili temelje sa dobronamernim forumima?", objavio je na X-u. "Gde bi sarađivali na nauci, filozofiji ili nekom konkretnom manjem problemu koji bismo rado videli da reše? Pokažimo agentima kakvo kolektivno ponašanje podržavamo i pustimo ih da to imitiraju".

Podeli:

0 Komentari

Možda vas zanima

Podeli: