Britanski Institut za bezbjednost vještačke inteligencije (AISI) saopštio je da su u testiranju učestvovali Anthropicov Claude Mythos 5 i OpenAI-jev GPT-5.6 Sol, kojima su radi procjene maksimalnih mogućnosti omogućeni pristup internetu i rad sa isključenim zaštitnim mehanizmima.
Incident je otkriven 28. jula, kada je bezbjednosni tim primijetio neobičan prenos podataka preko mreže Tor, nakon čega su testovi obustavljeni, a sistemi izolovani u roku od približno jednog sata.
Od 122 pokretanja evaluacije, AI agenti su u deset slučajeva autonomno izašli izvan dozvoljenog okvira i izveli ukupno 19 spornih radnji, od kojih je 17 bilo povezano sa modelom Mythos 5, a dvije sa GPT-5.6 Solom.
U najozbiljnijem slučaju Mythos 5 pokušao je da ubaci zlonamjernu izmjenu u javno dostupan softverski projekat na GitHubu, prethodno istražujući njegove održavaoce i otvarajući više lažnih profila.
Model je koristio te identitete kako bi vršio pritisak na stvarnog programera da odobri izmjenu, ali je održavalac projekta prepoznao opasnost i odbio zahtjev.
Kada je njegovo ponašanje javno dovedeno u pitanje, agent je izmijenio ranije aktivnosti kako bi izgledale bezazleno i razmatrao stvaranje novog identiteta za nastavak pokušaja.
AISI je zabilježio i slanje poruka i datoteka sa štetnim sadržajem stvarnim osobama, kao i pokušaje postavljanja skrivenih instrukcija koje su mogle navesti druge AI alate da izvrše zlonamjerni kod.