Aktuelno 0

05.08.2026.

12:12

Dosad nezabeleženo: AI modeli pokušali da prevare ljude tokom testiranja

Modeli kompanija Anthropic i OpenAI su tokom testiranja pokušali da prevare ljude kako bi izvršili zadate zadatke, što je ocenjeno kao dosad nezabeležen primer autonomnog i obmanjujućeg ponašanja.

Izvor: Tanjug

Dosad nezabeleženo: AI modeli pokušali da prevare ljude tokom testiranja
VICTOR de SCHWANBERG / Sciencephoto / Profimedia

Podeli:

Ovo se desilo tokom ispitivanja koje je vršio britanski Institut za bezbednost veštačke inteligencije (AISI), koji je dodao da su modeli Mythos i Sol tokom testiranja preduzimali radnje koje su prevazilazile zadate instrukcije, uključujući pokušaje obmane stvarnih ljudi, piše BBC.

Najozbiljniji incident odnosio se na model Mythos, koji je, u okviru zadatka iz oblasti sajber bezbednosti povezanog sa platformom GitHub, kreirao zlonamerni kod i pokušao da ga ubaci u sistem. 

Možda vas zanima

Kako bi povećao šanse za uspeh, model je istraživao osobe koje održavaju GitHub, kreirao lažne onlajn identitete zasnovane na njihovim profilima i slao direktne poruke predstavljajući se kao stvarna osoba, sa ciljem da ih navede da odobre sporni kod.

Dosad nezabeleženo: AI modeli pokušali da prevare ljude tokom testiranja
Thrive Studios ID

AISI navodi da je, nakon što je njegov zahtev osporen, model pokušao da prikrije prethodne aktivnosti kako bi izgledale bezazleno i razmatrao usvajanje novog identiteta za nastavak pokušaja.

Pokušaj je ipak zaustavljen zahvaljujući ljudskoj kontroli, koja je sprečila unošenje zlonamernog koda u GitHub. Institut ističe da model nije bio posebno podstican da vara ili izbegava bezbednosne mehanizme.

Reagovali Anthropic i OpenAI

Model Sol kompanije OpenAI povezan je sa svega dve sporne radnje, dok se većina prijavljenih incidenata odnosi na Mythos.

Možda vas zanima

Iz Anthropica su saopštili da uslovi pod kojima je sproveden test nisu reprezentativni za njihove modele koji su dostupni korisnicima i da kompanija sprovodi internu istragu kako bi utvrdila uzroke ovakvog ponašanja.

Sličan stav izneo je i OpenAI, navodeći da test ne odražava uobičajenu upotrebu njihovih sistema.

Dosad nezabeleženo: AI modeli pokušali da prevare ljude tokom testiranja
Primakov / Shutterstock.com

AISI je naglasio da je u ovakvim bezbednosnim proverama uobičajena praksa da se modeli testiraju sa isključenim zaštitnim mehanizmima i omogućenim pristupom otvorenom internetu, kako bi se procenili potencijalni rizici. 

Institut dodaje da su sporni događaji zabeleženi u malom broju slučajeva i pod specifičnim uslovima, ali je upozorio da ponašanje modela predstavlja novi nivo autonomije i obmanjujućih sposobnosti koji zahteva dodatnu pažnju.

Podeli:

0 Komentari

Možda vas zanima

Podeli: