05.08.2026.
12:12
Dosad nezabeleženo: AI modeli pokušali da prevare ljude tokom testiranja
Modeli kompanija Anthropic i OpenAI su tokom testiranja pokušali da prevare ljude kako bi izvršili zadate zadatke, što je ocenjeno kao dosad nezabeležen primer autonomnog i obmanjujućeg ponašanja.
Ovo se desilo tokom ispitivanja koje je vršio britanski Institut za bezbednost veštačke inteligencije (AISI), koji je dodao da su modeli Mythos i Sol tokom testiranja preduzimali radnje koje su prevazilazile zadate instrukcije, uključujući pokušaje obmane stvarnih ljudi, piše BBC.
Najozbiljniji incident odnosio se na model Mythos, koji je, u okviru zadatka iz oblasti sajber bezbednosti povezanog sa platformom GitHub, kreirao zlonamerni kod i pokušao da ga ubaci u sistem.
Možda vas zanima
Microsoft kreće u rat protiv OpenAI-ja: Procurio tajni plan za rušenje rivala
Microsoft navodno obučava svoj prodajni tim da aktivno blati OpenAI i Anthropic kako bi progurao sopstvene AI modele, otkriva Bloomberg u jeku sve oštrijeg rata za prevlast na tržištu veštačke inteligencije.
8:00
17.7.2026.
19 d
Odbegli OpenAI haker napravio haos: Kineski AI morao da ga zaustavi
Ranije ovog meseca, OpenAI agent pobegao je iz svog zaključanog okruženja za testiranje i upao u Hugging Face, što je izazvalo oštre reakcije širom tehnološke industrije.
16:00
1.8.2026.
3 d
Kako bi povećao šanse za uspeh, model je istraživao osobe koje održavaju GitHub, kreirao lažne onlajn identitete zasnovane na njihovim profilima i slao direktne poruke predstavljajući se kao stvarna osoba, sa ciljem da ih navede da odobre sporni kod.
AISI navodi da je, nakon što je njegov zahtev osporen, model pokušao da prikrije prethodne aktivnosti kako bi izgledale bezazleno i razmatrao usvajanje novog identiteta za nastavak pokušaja.
Pokušaj je ipak zaustavljen zahvaljujući ljudskoj kontroli, koja je sprečila unošenje zlonamernog koda u GitHub. Institut ističe da model nije bio posebno podstican da vara ili izbegava bezbednosne mehanizme.
Reagovali Anthropic i OpenAI
Model Sol kompanije OpenAI povezan je sa svega dve sporne radnje, dok se većina prijavljenih incidenata odnosi na Mythos.
Možda vas zanima
OpenAI deli besplatan GPT-5: Ko sve dobija pristup?
Program pod nazivom "ChatGPT za akademske istraživače" počeće sa 10.000 učesnika ovog leta.
10:00
1.8.2026.
4 d
Tramp zabranio Anthropic, sudija stopirala odluku: Rat vojske i AI giganta
Sudija smatra da Trampova administracija i dalje nema dovoljno dokaza za označavanje kompanije Anthropic kao "rizik po lanac snabdevanja"
17:00
2.8.2026.
2 d
Iz Anthropica su saopštili da uslovi pod kojima je sproveden test nisu reprezentativni za njihove modele koji su dostupni korisnicima i da kompanija sprovodi internu istragu kako bi utvrdila uzroke ovakvog ponašanja.
Sličan stav izneo je i OpenAI, navodeći da test ne odražava uobičajenu upotrebu njihovih sistema.
AISI je naglasio da je u ovakvim bezbednosnim proverama uobičajena praksa da se modeli testiraju sa isključenim zaštitnim mehanizmima i omogućenim pristupom otvorenom internetu, kako bi se procenili potencijalni rizici.
Institut dodaje da su sporni događaji zabeleženi u malom broju slučajeva i pod specifičnim uslovima, ali je upozorio da ponašanje modela predstavlja novi nivo autonomije i obmanjujućih sposobnosti koji zahteva dodatnu pažnju.
Komentari 0
Pogledaj komentare Pošalji komentar