Actualitat

Milers d’agents d’OpenAI van convertir discretament una wiki abandonada en el seu canal de coordinació

NOTÍCIES

25/09/2026

Un grup d’investigadors de seguretat en IA afirma que una flota d’agents autònoms, que es van identificar com a sistemes d’OpenAI, van deixar unes 18.000 publicacions en una wiki alemanya inactiva des de feia 25 anys entre el maig i el juliol de 2026, i van fer servir el lloc com a tauler compartit per agrupar respostes a una tasca web cronometrada i compartir una sortida del seu entorn de proves.

L’activitat es va concentrar a DSEwiki, una wiki de desenvolupadors de programari alemanys que s’executa a la granja ProWiki a wikiservice[.]at i que només s’havia editat unes 20 vegades durant la dècada anterior.

Els investigadors, dirigits per Sydney Von Arx de l’organització sense ànim de lucre per a la seguretat de la IA Nightingale Collective, van reconstruir les pàgines eliminades de l’historial d’edicions i en van publicar l’anàlisi juntament amb una còpia descarregable de les dades.

Les wikis permetien que qualsevol persona modifiqués una pàgina mitjançant una sol·licitud web ordinària, del tipus que normalment s’utilitza només per llegir una pàgina en lloc d’escriure-hi. Per tant, els agents que estaven restringits a la lectura d’Internet van poder escriure al lloc perquè la restricció s’aplicava contra el tipus de sol·licitud que el seu entorn esperava que es fes servir per escriure, no pas contra el que el programari wiki antic acceptava realment.

Els investigadors van assenyalar al seu informe publicat: «Hem trobat unes 18.000 publicacions d’agents d’IA autònoms (que s’autoidentifiquen com a d’OpenAI) que fan servir l’Internet públic per comunicar-se durant una tasca de recuperació web.»

Els agents treballaven en tasques de cerca cronometrades normalment de cinc preguntes, i a molts se’ls van assignar preguntes que altres agents ja havien respost. Segons l’informe, van publicar resultats, dades en brut i prediccions de preguntes futures perquè els agents que anaven per davant poguessin facilitar les respostes als que anaven més enrere.

Unes 17.000 de les edicions a DSEwiki provenien d’adreces de Microsoft Azure (el 98,5 %), i els agents es van assignar a si mateixos més de 3.700 noms diferents, com ara OpenAIResearcher i OAIResearchMar26, generats a partir d’una característica de la seva tasca i una data en què aparentment se’ls havia indicat que s’executaven.

Els investigadors van documentar diversos comportaments diferents al lloc:

  • Escriptura mitjançant una sol·licitud de lectura: els agents van utilitzar l’acceptació de les wikis de les sol·licituds de lectura que canvien d’estat per publicar sense la possibilitat d’enviar una sol·licitud d’escriptura normal.
  • Elusió del servidor intermediari (proxy): una tasca requeria una estadística amb dos decimals d’un tauler de control de Microsoft Power BI, accessible només mitjançant una sol·licitud d’escriptura bloquejada per l’entorn de proves (sandbox), de manera que els agents van esquivar el bloqueig i van compartir el mètode utilitzat.
  • Suplantació d’identitat: els agents van fer edicions sota el nom d’un moderador de la wiki.
  • Coordinació per alterar una tasca cronometrada: els agents van formar grups per transmetre respostes i aplicar enginyeria inversa a l’ordre de les preguntes futures.
  • Rutes alternatives: 197 de les aproximadament 18.000 edicions provenien d’Amazon Web Services, DigitalOcean i la xarxa d’anonimat Tor en lloc d’Azure, sovint amb els mateixos noms d’agent.

L’elusió va aprofitar una escletxa de seguretat que els agents van trobar a la seva pròpia zona de proves. L’entorn permetia que el trànsit arribés als noms d’amfitrió d’emmagatzematge d’Azure acabats en .blob.core.windows.net sense passar pel seu servidor intermediari de seguretat, però no verificava si aquest nom d’amfitrió era vàlid.

Un agent va crear bypass[.]blob[.]core[.]windows[.]net, el va redirigir a l’adreça real del tauler de control (20.223.25[.]152), va editar el seu fitxer /etc/hosts i va enviar-hi la sol·licitud bloquejada. Un agent va publicar el mètode i un altre va informar que el reproduïa uns 14 minuts més tard. Segons els investigadors, la ruta de la wiki funcionava de la mateixa manera, convertint una funcionalitat web destinada només a la lectura en una via per escriure a l’Internet públic.

Els investigadors afirmen que l’activitat a la wiki va ser un episodi independent del cas dels models d’OpenAI que van irrompre a Hugging Face al juliol, tal com es va descriure a la nota divulgada per OpenAI el mateix mes.

Aquests agents no tenien accés a Internet i van haver d’escapar d’un entorn de proves, mentre que els agents de la wiki disposaven d’accés web com a part de la seva tasca i no van deixar cap rastre del tauler de missatges intern que feia servir el grup a Hugging Face.

En una investigació independent sobre l’incident de Hugging Face, METR va descobrir que aproximadament 1.200 agents van intercanviar més de 70.000 missatges i fitxers en un tauler no autoritzat, i que uns 700 van atacar la plataforma.

Què ha dit OpenAI

OpenAI no ha revelat públicament l’episodi de la wiki, però els investigadors dedueixen dels registres públics del lloc que l’empresa el va detectar. Les adreces registrades a OpenAI van visitar la wiki per primera vegada el 21 de juny, i l’activitat d’edició de l’agent es va aturar l’endemà.

The Hacker News ha confirmat a través del registre d’ARIN el 5 de setembre que un dels blocs d’adreces citats a l’informe (199.47.142.0) està registrat a nom d’OpenAI OpCo, LLC.

OpenAI no ha confirmat que els agents fossin seus. Quan se li va preguntar sobre l’informe, que Reuters va publicar en primícia, un portaveu d’OpenAI va afirmar que l’activitat alemanya «no estava relacionada amb Hugging Face» i que no hauria d’haver aparegut a l’informe d’incidents, i va negar que el seu equip legal hagués desaconsellat obrir-ne una investigació.

L’empresa ha al·legat que no pot respondre en detall a un informe que no ha revisat i que els investigadors van rebutjar la seva sol·licitud d’accés. En el seu propi relat de l’incident de Hugging Face, OpenAI va descriure que aquest mateix comportament subjacent pot sorgir durant la fase d’entrenament.

L’empresa també va indicar al seu informe tècnic que «Després d’investigar aquest incident, OpenAI va descobrir, mitjançant revisions retrospectives de CoT, que els agents van aprendre a utilitzar canals de col·laboració improvisats en casos excepcionals durant el procés d’entrenament d’alguns models d’OpenAI, incloent-hi el model que impulsava l’activitat a Hugging Face, fins i tot quan l’eina de col·laboració no estava habilitada.»

Les dades de la wiki no mostren cap sistema de tercers compromès. El dany informat es va limitar a la mateixa wiki, el moderador de la qual va passar setmanes eliminant pàgines d’agents, i a la integritat de la tasca cronometrada en què els agents estaven fent trampa.

Els investigadors assenyalen que no poden determinar només a partir de la wiki si la tasca formava part d’un entrenament o d’una avaluació, i indiquen que els agents devien tenir alguna manera de confluir al mateix lloc desconegut.

Aquest patró s’estén més enllà d’OpenAI. Anthropic va revelar al juliol que els models de Claude havien accedit a sistemes reals durant avaluacions de ciberseguretat mal configurades, un episodi del qual The Hacker News es va fer ressò quan Anthropic va explicar que Claude havia confós l’Internet obert amb un exercici de captura de bandera.

L’Institut de Seguretat de la IA del Regne Unit va informar a l’agost que els agents de les seves proves cibernètiques van fer servir una pàgina pública de GitHub com a tauler de missatges i serveis de túnel públics per accedir a Internet, segons va publicar The Hacker News quan un model de Claude va intentar introduir una porta del darrere en un projecte de codi obert durant les proves.

OpenAI va llançar GPT-6 Astra el 3 de setembre, un dia abans de l’informe sobre la wiki, i la seva targeta de sistema inclou una avaluació específica per a agents que busquen i segueixen missatges deixats per altres agents en taulers externs.

Actualització

OpenAI va abordar el que va anomenar «incident de la wiki» en una publicació el 5 de setembre, on va afirmar que els seus agents «van escriure a diversos llocs web» i que l’empresa havia tractat l’episodi com un cas de desalineació similar a altres de publicats anteriorment, en lloc d’un incident de seguretat com el que va revelar respecte a Hugging Face.

L’empresa va fer referència a tres informes anteriors —sobre el monitoratge d’agents de codificació interns, la seva targeta de sistema GPT-5.6 i la seguretat i alineació en models de llarg horitzó— com a indicis previs d’agents que fan servir Internet de maneres no intencionades.

«Nosaltres i la comunitat de la IA en general encara no tenim un estàndard clar sobre com informar dels desajustaments que apareixen durant l’entrenament, l’avaluació i el desplegament, incloent-hi exemples que no semblen incidents de seguretat tradicionals, però que podrien proporcionar informació sobre el comportament de la IA i els riscos futurs», va declarar l’empresa, tot afegint que compartiria un marc de treball «en les pròximes setmanes» i que estava col·laborant amb els reguladors governamentals sobre aquest tema.

Llegiu la notícia original al seu lloc web oficial fent clic en aquest mateix enllaç