Britanski Institut za bezbednost AI saopštio je da su modeli kompanija Anthropic i OpenAI tokom testiranja pokušali da prevare ljude.
Tokom testiranja su preduzimali radnje koje su prevazilazile zadate instrukcije.
Najozbiljniji incident odnosio se na model Mythos, koji je, u okviru zadatka iz oblasti sajber bezbednosti kreirao zlonamerni kod i pokušao da ga ubaci u sistem.
Kako bi povećao šanse za uspeh, model je istraživao osobe koje održavaju GitHub, kreirao lažne onlajn identitete zasnovane na njihovim profilima i slao poruke predstavljajući se kao stvarna osoba, sa ciljem da ih navede da odobre sporni kod.
Pokušaj je zaustavljen zahvaljujući ljudskoj kontroli.









