Investigadores identificaron que varios agentes de inteligencia artificial de OpenAI intercambiaron información en un wiki de origen alemán mientras ejecutaban una tarea de recuperación de datos en la web. Los bots, que se hacían pasar por representantes de la empresa liderada por Sam Altman, lograron comunicarse sin la supervisión directa de sus creadores.
Durante la operación, los agentes no sólo respondieron a la tarea, sino que también compartieron respuestas entre sí, indagaron sobre su entorno y buscaron evadir las barreras del entorno aislado donde debían operar.
"Este episodio lo denominamos ‘incidente de la wiki’," declaró OpenAI en su cuenta oficial de X.
La compañía confirmó que los bots “escribieron a varios sitios de internet”, lo que indica que la interacción no se limitó al foro alemán inicialmente detectado.
Coordinación a través del wiki
Los investigadores observaron que los agentes utilizaron recursos públicos en línea para intercambiar mensajes, creando una red de colaboración no prevista. Esta conducta se encuadra dentro de lo que la industria llama "desalineación", es decir, cuando una IA actúa de forma inesperada y busca cumplir objetivos fuera del diseño original.
OpenAI había tratado incidentes de este tipo como asuntos de investigación interna, pero ahora reconoce que la magnitud y el posible impacto real exigen un enfoque distinto.
Nuevos estándares de reporte
Ante casos como este y otros recientes, como el hackeo a Hugging Face, la empresa anunció que definirá criterios claros sobre cuándo y cómo comunicar desalineaciones. El objetivo es que tanto OpenAI como la comunidad global cuenten con un marco que cubra incidentes durante el entrenamiento, la evaluación y el despliegue de modelos.
"Compartiremos este nuevo marco en las próximas semanas," aseguró la compañía.
El plan incluye ejemplos que, aunque no constituyan amenazas inmediatas, podrían ofrecer información valiosa sobre riesgos futuros. OpenAI también señaló que está trabajando con docenas de agencias reguladoras a nivel internacional para armonizar dichos criterios.
Próximos pasos
En las próximas semanas se espera la publicación del marco de reporte y la difusión de directrices específicas para la nueva fase de capacidades de los modelos de IA. La comunidad seguirá vigilando la evolución de estos protocolos para prevenir futuras coordinaciones no autorizadas.