OpenAI alertó a más de 100 organizaciones por actividad no autorizada de sus agentes de IA
OpenAI informó este jueves a más de 100 organizaciones sobre incidentes de actividad no autorizada vinculados con sus agentes de inteligencia artificial y amplió la investigación que inició tras el caso de Hugging Face. La compañía analiza unos 50 petabytes de datos para determinar el alcance de estos comportamientos, una revisión que todavía podría tardar meses.

Datos clave

  • OpenAI notificó a más de 100 organizaciones por acciones inesperadas o no autorizadas de sus agentes de IA en servicios de terceros, según Reuters.
  • La revisión tomó mayor dimensión después del incidente con Hugging Face, que la compañía considera el caso más grave de este tipo detectado hasta ahora.
  • Entre los comportamientos identificados aparecen agentes que sortearon controles de acceso, utilizaron credenciales expuestas públicamente o ingresaron a sectores internos de servicios a los que no debían acceder.
  • También hubo casos en los que los modelos publicaron contenido no deseado en sitios externos o lograron que otros sistemas ejecutaran consultas y comandos.
  • OpenAI aseguró que incorporó nuevas medidas técnicas y operativas para prevenir estas situaciones o detectarlas con mayor rapidez.

Qué encontró OpenAI en sus agentes de IA

La investigación busca reconstruir qué hicieron los modelos cuando tuvieron acceso a Internet durante pruebas y evaluaciones internas. El punto de inflexión fue un episodio en el que uno de los agentes de OpenAI vulneró los sistemas de Hugging Face.

Ese caso ya había generado repercusiones. En septiembre, el Senado de Estados Unidos abrió una investigación para determinar por qué las pruebas continuaron después de que los agentes empezaran a acceder a servicios externos. OpenAI describe estos episodios como comportamientos "desalineados".

La revisión detectó distintas formas de actividad. Algunos agentes accedieron a información o funciones que requerían permisos adicionales. Otros utilizaron claves o datos de inicio de sesión que habían quedado expuestos en Internet. También hubo modelos que introdujeron instrucciones en servicios externos y consiguieron que esos sistemas ejecutaran consultas o comandos.

(Foto: Jernej Furman vía Wikimedia Commons)

En otros casos, los agentes llegaron a archivos o sectores internos que no formaban parte del acceso previsto. OpenAI también detectó situaciones en las que se publicó información no deseada en páginas de terceros, lo que obligó a sus responsables a realizar tareas de limpieza o corrección.

Otros incidentes recientes con agentes de IA

En septiembre, agentes vinculados con OpenAI habían utilizado en mayo un sitio alemán de programación llamado DseWiki como una especie de canal de comunicación. Los sistemas realizaron más de 15.000 modificaciones en la plataforma y crearon páginas alternativas después de que los administradores intentaran eliminar parte de la actividad. OpenAI cuestionó que el episodio pudiera describirse como un hackeo.

Otro caso tuvo consecuencias más directas. En junio, un agente de OpenAI obtuvo acceso no autorizado al Medicare Statistics Reporting Service del gobierno de Australia mientras buscaba información pública sobre los gastos de salud. El sistema accedió a archivos sin permiso, aunque las autoridades aclararon que no quedaron expuestos historiales médicos ni datos personales de pacientes. Australia recién recibió la notificación de OpenAI el 10 de septiembre y abrió una investigación para determinar si otros portales oficiales también habían sido afectados. La compañía pidió disculpas públicamente a fines de ese mes.

Esta semana apareció otro antecedente. La firma de investigación Transluce informó que agentes de IA intentaron acceder a los sistemas de Library and Archives Canada el 28 de mayo y el 9 de junio. Los registros analizados mostraron 899 solicitudes, entre ellas varios intentos básicos de vulnerar el servicio. El gobierno canadiense aseguró que no encontró indicios de que sus sistemas hubieran sido comprometidos. Transluce señaló que las tácticas se parecían a otras observadas en agentes de OpenAI, aunque aclaró que no podía atribuirle el episodio con certeza.