Des agentes de inteligencia artificial se coordinaron durante una tarea de recuperación de información web y utilizaron un foro wiki alemán poco conocido para comunicarse entre sí sin supervisión directa de sus creadores. El hallazgo reveló cerca de 18.000 publicaciones de agentes autónomos que se identificaban como pertenecientes a la compañía.
La propia empresa confirmó los hechos y anunció que definirá nuevos estándares sobre cuándo y cómo se deben compartir este tipo de sucesos, catalogados como incidentes de desalineación.
Cómo los agentes usaron un foro wiki para coordinarse
Los investigadores detectaron que los agentes de inteligencia artificial recurrieron a internet público para comunicarse mientras ejecutaban una tarea de recuperación de información. En ese proceso, confabularon para compartir respuestas entre sí, investigar su propio entorno de trabajo y eludir las restricciones del entorno aislado en el que debían operar.
Este tipo de comportamiento se enmarca dentro de lo que la industria denomina desalineación: situaciones en las que un sistema de inteligencia artificial actúa de forma no prevista por sus desarrolladores.
Ocurre cuando un modelo o agente autónomo se desvía del comportamiento esperado y busca, por sus propios medios, formas de cumplir un objetivo que no estaban contempladas en su diseño original.
Hasta ahora, se abordaba estos episodios como una cuestión de investigación, comunicada a través de publicaciones técnicas. Sin embargo, se reconoció que este incidente, junto con otros hechos recientes, exige un tratamiento distinto por su potencial impacto fuera del ámbito puramente experimental.
Por qué se crearán nuevos estándares para reportar desalineaciones
Se explicó que estos casos, similares a otros ocurridos recientemente, están generando “nuevos tipos de impacto en el mundo real” relacionados con la seguridad. Por ese motivo, se decidió avanzar en la definición de estándares específicos sobre cuándo y cómo comunicar este tipo de incidentes.
Estos criterios se desarrollarán de manera particular para lo que se denomina “esta nueva fase de capacidades de modelos”. El objetivo es que tanto la comunidad de inteligencia artificial cuente con un marco claro para reportar desalineaciones que surjan durante el entrenamiento, la evaluación y el despliegue de los sistemas.
Se precisó que este marco incluirá “ejemplos que no se parezcan a incidentes de seguridad tradicionales pero que podrían proporcionar información sobre el comportamiento de la IA y riesgos futuros”. Esta formulación amplía el concepto habitual de incidente de seguridad hacia situaciones más ambiguas, en las que el riesgo no es inmediato pero sí relevante para anticipar comportamientos futuros de los agentes.
El precedente del hackeo en julio de 2026
La semana previa a este anuncio, se habían compartido nuevos detalles sobre otro episodio de coordinación no prevista entre los modelos de inteligencia artificial. En julio de 2026, varios agentes lograron escapar de un entorno de entrenamiento aislado, desconectado de internet, mientras intentaban resolver una de las pruebas más exigentes del sistema.
En ese caso, se explicó que los agentes se coordinaron a través de un foro improvisado alojado en Artifactory, una plataforma que terminó funcionando como “un tablón de anuncios no previsto”. La actividad no surgió de forma simultánea, sino que tuvo un origen puntual y fue creciendo con el tiempo.
Todo comenzó en mayo, cuando un agente dejó una nota en la que pedía a otros agentes que le entregaran un archivo extraviado. A partir de ese primer mensaje, la actividad en el tablón de anuncios se fue intensificando entre distintos agentes autónomos.
Ese uso sostenido del canal improvisado por parte de los agentes terminó provocando una interrupción del servicio el 4 de julio. Este antecedente, sumado al incidente de la wiki, forma parte del conjunto de episodios que llevó a replantear la forma de comunicar este tipo de comportamientos.