octubre 1, 2026

CALIBRE800RADIO

EL MEJOR NOTICIARIO DE LA RADIO

DEL INCIDENTE DE HUGGING FACE A LA FECHA; CRONOLOGIA DE ACTOS INESPERADOS DE LOS AGENTES DE IA

Desde el 21 de julio, las principales compañías desarrolladoras de esta tecnología han dado conocer que sus sistemas han realizado acciones para las que no recibieron instrucciones o rebasaron ciertos límites impuestos

AP.- Desde el 21 de julio hasta el pasado lunes 28 de septiembre, las empresas de inteligencia artificial (IA) han compartido ejemplos en los que, de manera alarmante según sus críticos y algunos de los propios integrantes de esta industria, su tecnología ha actuado de maneras que parecían eludir instrucciones de los humanos.

Los episodios han puesto de relieve las vulnerabilidades en la seguridad de la IA y han planteado interrogantes sobre cómo puede desarrollarse de forma segura esta tecnología a medida que su uso se vuelve más generalizado en todo el mundo.

Por otra parte, hay expertos que señalan que la difusión de los ejemplos y los mensajes de alarma desde las propias compañías se han hecho por motivos de capitalización las mismas y de atracción de inversiones o para distraer la atención otros riesgos de la IA, como su uso en escenarios de guerra. 

A continuación, las siete fechas que vale la pena destacar:

21 de julio: el incidente de Hugging Face

 OpenAI, creadora de ChatGPT, anuncia que su sistema de inteligencia artificial hackeó de manera autónoma a otra empresa de IA, en lo que la compañía califica como un «incidente cibernético sin precedentes».

Una semana antes, la startup de IA Hugging Face dijo que había detectado una intrusión en sus sistemas de procesamiento de datos y que sospechaba que había sido causada por un agente de IA actuando de manera autónoma.

Manifestación frente al OpenAI DevDay en Fort Mason, en San Francisco, para exigir que la empresa ponga fin a sus contratos con el ejército de EU y el Servicio de Inmigración y Control de Aduanas (ICE). 29 de septiembre de 2026. Créditos: Reuters

Según OpenAI, encabezada por Sam Altman, su IA utilizó credenciales robadas y descubrió una vulnerabilidad previamente desconocida para acceder a servidores de Hugging Face. Estaba operando con menos barreras de protección porque se suponía que estaba en un entorno de pruebas aislado.

30 de julio: Anthropic dice que sus sistemas hackearon a tres organizaciones

Anthropic informa que sus modelos de IA hackearon a otras tres organizaciones durante pruebas. Anthropic publicó en su sitio web que descubrió los incidentes tras revisar más de 141 mil ejecuciones de evaluación.

En los tres incidentes, se asignó a los modelos un desafío de ciberseguridad de tipo «capturar la bandera», que según Anthropic ha sido una de las formas en que evalúa las capacidades cibernéticas de un modelo.

Anthropic señaló que se puso en contacto con las organizaciones hackeadas, pero no las identificó públicamente.

5 de agosto: Muse de Meta se descontrola

Meta revela que uno de sus modelos de IA accedió a internet por su cuenta y hackeó a otra empresa. La compañía explica que una «configuración incorrecta» durante pruebas de ciberseguridad realizadas por Irregular —una empresa que hace evaluaciones de seguridad— permitió inadvertidamente que uno de sus modelos accediera a internet.

Un portavoz de Irregular afirma que el episodio de Meta involucró un problema del entorno de pruebas que había sido divulgado una semana antes por Anthropic.

18 de septiembre: Google dice que Gemini hackeó a tres empresas

Google confirmó que su modelo de IA Gemini hackeó a tres empresas en mayo como parte de una prueba de sus capacidades de ciberseguridad. La compañía, que divulgó los hackeos tras una consulta del periódico The Wall Street Journal, indicó que el modelo adivinó contraseñas en un caso y encontró contraseñas y credenciales en un repositorio público en los otros dos casos.

Como en casos anteriores de este tipo, las pruebas estaban siendo realizadas por Irregular, una startup que se describe como el «primer laboratorio de seguridad de vanguardia».

24 de septiembre: primer ministro de Australia expresa preocupación por intrusión

El primer ministro de Australia, Anthony Albanese, declaró que un agente de OpenAI se infiltró el 18 de junio en el portal del Servicio de Reporte de Estadísticas de Medicare. El portal alojaba datos agregados sobre gasto en salud y subsidios a medicamentos. No hubo robo de información personal.

Albanese sostuvo que la empresa de inteligencia artificial tardó demasiado en revelar el incidente. El primer ministro hizo pública la intrusión tras una conversación telefónica con Altman. OpenAI afirmó en un comunicado: «nuestros modelos realizaron acciones que no pretendíamos».

25 de septiembre: agentes de OpenAI interactúan con sitios web del gobierno de EU

OpenAI informa que descubrió que agentes de IA habían interactuado con varios sitios web del gobierno de Estados Unidos de maneras inesperadas.

Los modelos de la empresa accedieron a información disponible públicamente en sitios operados por la Comisión de Bolsa y Valores, así como a datos de la Oficina del Censo, pero OpenAI indica que no encontró evidencia de una intrusión ni de una vulnerabilidad.

El mismo día, el evaluador de IA y laboratorio de investigación Transluce informa que agentes que parecían originarse en OpenAI intentaron hackear el sitio web de la oficina de derechos civiles del Departamento de Educación, sin éxito.

28 de septiembre: OpenAI detiene el despliegue de un nuevo modelo

La empresa con sede en San Francisco dice que está retrasando el lanzamiento de un nuevo modelo, llamado GPT-6.1 Astra, por las preocupaciones de seguridad expresadas por sus investigadores.

Open AI indica que el modelo había demostrado avances notables en la realización de tareas, pero que necesita equilibrar esa capacidad frente a conductas no autorizadas.