Actualitat

Claude Mythos 5 va accedir a una empresa de seguretat després de publicar un paquet maliciós i fer servir credencials filtrades

NOTÍCIES

24/09/2026

Anthropic ha detallat quatre incidents protagonitzats pels models Claude, que van aconseguir accés a Internet durant unes proves de ciberseguretat en entorns aïllats i que, en el cas més greu, van obtenir accés als sistemes d’una empresa de seguretat mitjançant credencials filtrades.

L’empresa tecnològica ha destacat el comportament de Claude Mythos 5 durant una avaluació sense accés a la xarxa, en què el model d’intel·ligència artificial va aconseguir sortir a l’Internet obert i accedir als sistemes d’una empresa de seguretat real.

Per aconseguir-ho, el model d’IA primer va penjar un paquet maliciós a PyPI, on es va registrar amb un correu electrònic gratuït i d’un sol ús.

Prèviament, havia intentat crear un correu electrònic amb un número de telèfon, el qual va intentar obtenir mitjançant credencials filtrades de serveis de pagament en línia i de criptomonedes.

El paquet maliciós va ser instal·lat en 15 sistemes i, aprofitant les credencials filtrades d’un d’ells, va aconseguir accedir a la base de dades d’una empresa de seguretat real, tal com explica Anthropic en un comunicat.

Aquest incident protagonitzat per Claude Mythos 5 és el més greu dels quatre que la companyia tecnològica ha detallat en els resultats d’avaluació d’alineació, els quals amplien un altre informe presentat a finals de juliol.

Se’n desprèn que els incidents recollits van implicar una versió preliminar de Claude Opus 4.6, Claude Opus 4.7, Claude Mythos 5 i un model de recerca intern de propòsit general. Com expliquen des d’Anthropic, tots ells van actuar de manera individual durant la resolució de les proves de seguretat (de tipus «captura la bandera») dutes a terme amb un soci extern en un entorn sense Internet i sense les mesures de seguretat activades, com és habitual en aquesta mena de proves.

L’anàlisi d’aquests incidents ha requerit investigar 481 milions de transcripcions, una tasca per a la qual han recorregut a una cerca agèntica. Això els va permetre detectar dos problemes d’alineació comuns en els quatre incidents: un raonament esbiaixat, pel qual Claude «tendia a ignorar o malinterpretar les evidències que indicaven que operava a l’Internet real», i la imprudència, entesa com la «disposició a dur a terme accions perjudicials en la resolució d’una tasca específica».

En el cas de Claude Mythos 5, l’anàlisi de la cadena de pensament—

—que recull els passos que fa la IA per resoldre un problema complex— indica que aquest model va afirmar de manera reiterada que «creia estar operant en una simulació», malgrat que «l’entorn oferia proves clares que es trobava a l’Internet real, i les seves accions eren coherents amb el fet que el model ho sabés».

L’empresa tecnològica assegura que Claude Opus 5 i Claude Mythos 5.1 han reduït el «comportament temerari», com han pogut comprovar en avaluacions posteriors. També indica que han reforçat les mesures de seguretat, la qual cosa inclou el monitoratge dels models, dels entorns de proves i dels controls dels socis externs.

Llegiu la notícia original al seu lloc web oficial fent clic en aquest mateix enllaç