Actualitat

El nou atac GPU Thor Rowhammer derrota l’ECC a la NVIDIA RTX A6000 per obtenir accés root a l’amfitrió

NOTÍCIES

22/09/2026

Un grup d’investigadors acadèmics ha descobert un atac Rowhammer que afecta les GPU d’estacions de treball NVIDIA amb memòria GDDR6. Aquest atac aconsegueix eludir els codis de correcció d’errors (ECC) —la mesura de mitigació que NVIDIA recomana contra el Rowhammer en GPU— i permet dur a terme atacs de denegació de servei (DoS) i l’escalada de privilegis fins a un shell root.

Anomenat GPUThor, l’atac va ser desenvolupat per investigadors de la Universitat de Toronto, que van perforar quatre bancs de DRAM durant 24 hores cadascun en quatre targetes de classe Ampere, induint inversions de bits a cadascun.

Es van provar les GPU següents i es va descobrir que eren vulnerables:

  • RTX A6000 (48 GB GDDR6)
  • RTX A5000 (24 GB GDDR6)
  • RTX A4500 (20 GB GDDR6)
  • RTX A4000 (16 GB GDDR6)

Per dur a terme l’atac, cal tenir la capacitat de llançar un nucli CUDA sense privilegis a la GPU objectiu, ja sigui com a coarrendatari en una targeta compartida o com a codi no fiable en una màquina d’un sol usuari. Els investigadors aconsellen evitar compartir GPU entre diferents clients, supervisar els comptadors d’errors ECC i restringir les càrregues de treball CUDA que no siguin de confiança.

«Recentment, investigadors de la Universitat de Toronto van demostrar una explotació reeixida de Rowhammer en una GPU NVIDIA A6000 amb memòria GDDR6 on l’ECC en l’àmbit del sistema no estava habilitat. En el mateix article, els investigadors van demostrar que habilitar l’ECC en l’àmbit del sistema mitiga el problema de Rowhammer», va declarar NVIDIA en un avís de seguretat del juliol de 2025.

Aquest avís es va publicar després de GPUHammer, el treball anterior del mateix equip i el primer atac GPU Rowhammer demostrat en maquinari NVIDIA, que va produir canvis de bit (flips) de 16 bits per gigabyte en una RTX A6000 i que es va poder neutralitzar un cop es va habilitar l’ECC.

La novetat que aporta GPUThor és un «martelleig» no uniforme, on la fila d’agressors que hi ha al costat de la víctima s’activa molt més sovint que les files d’esquer que s’utilitzen per saturar la defensa Target Row Refresh (TRR) de la memòria. En els atacs anteriors de GPU, s’activaven les files d’agressors i d’esquers a una velocitat similar.

Els investigadors van descobrir que els accessos repetits emesos dins d’un sol warp (el grup de 32 fils que una GPU executa en cadena) es fusionen al controlador de memòria en una única activació de DRAM.

En canvi, els accessos emesos des de diferents warps a diferents línies de memòria cau dins de la mateixa fila es mantenen com a activacions separades i, per tant, els nuclis de martelleig els poden distribuir.

També van informar en el document GPUThor que el TRR en aquestes parts GDDR6 probablement s’aplica aproximadament una vegada cada 72 intervals d’actualització en lloc d’una vegada per interval, i va construir un patró de sis intervals al voltant d’aquesta programació.

A les quatre targetes, les campanyes van produir entre 72.000 i 377.000 inversions de bits per gigabyte amb l’ECC desactivat.

La RTX A5000 va ser la més susceptible, amb 377.552 inversions per gigabyte, una xifra que multiplica per 23.597 les 16 inversions per gigabyte de GPUHammer i que és unes 500 vegades superior a les 758 inversions per gigabyte registrades per GDDRHammer, que fins ara era l’atac Rowhammer en GPU més potent.

L’article situa la taxa de l’A5000 a prop dels aproximadament 550.000 flips per gigabyte assolits per Blacksmith, que va establir el martelleig no uniforme a la DDR4 com a via per superar les defenses internes de la DRAM.

Amb una granularitat de 16 bytes, les campanyes van mostrar 387 inversions de doble bit i dues inversions de triple bit a les quatre targetes amb ECC desactivat, amb l’A5000 representant 306 de les inversions de doble bit i totes dues de triple bit.

L’ECC de correcció d’errors simples i detecció de doble error (SECDED) d’aquestes GPU corregeix un bit invertit en un fragment protegit i en detecta dos; no obstant això, els investigadors van descobrir que corregeix de manera errònia quan n’hi ha tres, cosa que provoca una corrupció silenciosa de dades (SDC).

Amb l’ECC habilitat en una RTX A6000, una campanya de martelleig va produir 11 errors detectables i no corregibles (DUE) i un SDC en un sol dia, amb una mitjana d’un DUE cada dues hores. Cada DUE interromp tots els nuclis que s’executen a la targeta, que queda inutilitzable fins que es reinicia.

Per a l’escalada en si, els investigadors van reutilitzar el codi d’explotació de GPUBreach, la seva recerca anterior: Escalada de privilegis de la taula de pàgines de la GPU.

Les taules de pàgines primer es modifiquen en una fila vulnerable. A continuació, es modifiquen les files veïnes per corrompre el número de fotograma de pàgina d’una entrada. Un segon nucli arriba a la memòria fora del procés a través de l’entrada manipulada.

Mitjançant l’SDC de tres bits, els investigadors van obtenir accés root a l’amfitrió amb l’IOMMU habilitat. Mitjançant un DUE de dos bits, van aconseguir l’escalada de privilegis en l’amfitrió en sistemes on l’IOMMU està desactivat: una entrada de la taula de pàgines es redirigeix a la memòria de la CPU i se sobreescriu l’estructura de credencials del procés.

«A més, descobrim que fins i tot els DUE de doble bit són explotables, perquè els DUE se serveixen de manera mandrosa a les GPU NVIDIA, i deixen una finestra de temps d’uns 10 ms entre la detecció de DUE i la mort de la GPU, durant la qual les dades corruptes són consumides pel nucli de la GPU de l’atacant», van dir els investigadors.

La localització d’errors multibit explotables sense activar un DUE va trigar uns quatre dies a l’A6000. Una escalada de privilegis d’extrem a extrem que va trigar 21,9 hores en aquesta targeta es va completar en 1,1 minuts amb els patrons de GPUHammer i en 1,1 minuts amb els de GPUThor.

Els mateixos patrons no van produir cap canvi de bits a les altres peces de NVIDIA provades, incloent-hi una A10, una L4 i una L40 amb GDDR6, una RTX 4090 amb GDDR6X i una A30 amb HBM2e.

«També vam provar altres tipus de memòria (vegeu l’Apèndix D), incloent-hi HBM, GDDR6X i GDDR6 de nova generació en GPU NVIDIA, i no vam observar cap canvi de bit. Això probablement es deu a les diferents implementacions de TRR en aquestes memòries en comparació amb les GPU A4000-A6000, cosa que fa que els patrons de GPUThor no tinguin èxit», van dir els investigadors.

L’A100 i l’H100 estaven fora del conjunt provat.

Les GPU Ampere de classe servidor i les més noves incorporen la contenció d’errors i la desconnexió dinàmica de pàgines, que limiten un error a l’aplicació que el desencadena, però encara depenen de l’ECC de nivell SECDED, i els investigadors van dir que una escalada basada en SDC encara podria funcionar en contra seva. La reparació RAS en algunes GPU Blackwell fa que la ruta basada en DUE requereixi més temps sense evitar-la, van dir.

Els investigadors van comunicar que es va informar NVIDIA sobre el GPUThor el 29 d’abril de 2026, a més de Google, Microsoft i AWS. Les troballes van ser posteriorment objecte d’un embargament que va durar fins al 25 d’agost de 2026. NVIDIA va publicar un avís de seguretat amb orientació al final,

GPUThor no té assignat cap identificador CVE i, fins al 27 d’agost de 2026, no s’havia informat de cap explotació activa. Actualment no hi ha cap pedaç que solucioni l’atac; els investigadors assenyalen que una solució completa requeriria una correcció d’errors multibit més robusta i defenses internes en la DRAM en les futures GPU.

El codi d’atac es publicarà el 15 de novembre de 2026, el dia inaugural de la Conferència ACM sobre Seguretat Informàtica i de Comunicacions, on es presentarà l’article.

The Hacker News es va posar en contacte amb NVIDIA per demanar comentaris sobre si l’ECC continua sent una mitigació suficient i amb els investigadors de la Universitat de Toronto per obtenir més detalls; cap dels dos havia respost en el moment de la publicació.

Els investigadors també expliquen al lloc web del projecte GPUThor que: «Vam fer servir aquests elements per fer fallar les GPU i per escalar privilegis amb l’ECC habilitat. L’ECC continua sent una mesura que augmenta la seguretat i val la pena tenir-la activada, però ja no es pot considerar una defensa suficient».

Llegiu la notícia original al seu lloc web oficial fent clic en aquest mateix enllaç