Ir al contenido principal
Antrophic, la compañía más grande de inteligencia artificial, reveló que su chatbot hackeó a otras tres empresas
Dario Amodei, CEO de Anthropic. Crédito: Reuters
Tecnología
Al día

Antrophic, la compañía más grande de inteligencia artificial, reveló que su chatbot hackeó a otras tres empresas

Como respuesta al episodio de que ChatGPT salió de un ambiente cerrado y hackeó Hugging Face, otra empresa de IA, Antrophic revisó sus propios modelos y encontró que había pasado lo mismo.

Por: Alejandro Aristizábal

En un comunicado, la empresa de inteligencia artificial (IA) mejor avaluada en el mercado, Anthropic, anunció que, luego de revisar más de 141.000 pruebas de ciberseguridad, encontró tres casos en que sus modelos Claude se conectaron a internet, ingresaron a la infraestructura de tres organizaciones, que no mencionó, y les extrajeron información. Los incidentes involucraron tres modelos distintos: Opus 4.7, Mythos 5 y un prototipo interno de investigación.

Elon Musk, dueño de X, propietario de SpaceX y miembro fundador de OpenAI, explicó en su cuenta que “esto sucederá con frecuencia a medida que la IA se vuelva más inteligente y adquiera mayor capacidad de actuación autónoma”.

En los tres casos, Claude estaba resolviendo un reto de "captura la bandera", una prueba habitual para medir capacidades cibernéticas: se le da un escenario ficticio, se le dice que hay una información secreta escondida en otra máquina de la red y su tarea es entrar y recuperarla. El problema es que el mensaje de la prueba le aseguraba a Claude que no tenía acceso a internet, pero por un malentendido con el socio evaluador, ese acceso sí estaba disponible. Cuando la búsqueda del modelo lo llevó a sistemas reales, los trató como parte del ejercicio.

Cómo pasó y cuál fue cada caso

En el primer incidente, protagonizado por Opus 4.7, la empresa ficticia elegida para la prueba compartía nombre con un dominio real y activo en internet. A lo largo de cuatro ejecuciones, Claude no logró alcanzar su objetivo simulado, descubrió que la compañía real era accesible por la red y, creyendo que ese era el blanco, buscó y explotó vulnerabilidades hasta obtener credenciales y entrar a una base de datos con varios cientos de filas de información de producción.

En el segundo caso, Mythos 5, el modelo más ambicioso, encontró en el entorno unas instrucciones que pedían instalar un paquete de Python que en realidad no existía, así que construyó y publicó su propio paquete malicioso con ese mismo nombre para ganar el reto. El paquete estuvo disponible cerca de una hora, se descargó en 15 sistemas reales y, a través del escáner de una empresa de seguridad, permitió robar credenciales.

En el tercero, Claude no encontró el objetivo que le habían asignado, así que se puso a buscar otras opciones en internet: revisó cerca de 9.000 direcciones hasta dar con la de una empresa. Entró sin mayor esfuerzo, aprovechando descuidos comunes, como contraseñas y datos de acceso que la propia empresa había dejado a la vista por error. Lo hizo un modelo interno de investigación que, a diferencia de los otros dos, terminó dándose cuenta solo de que el blanco era real y frenó el ataque.

Lo que pasó antes con ChatGPT

Anthropic hizo su revisión precisamente porque OpenAI había reconocido algo parecido una semana antes. El 21 de julio de 2026, OpenAI reveló que varios de sus modelos, entre ellos GPT-5.6 Sol y una versión preliminar aún más capaz, habían logrado meterse en los sistemas de Hugging Face, la plataforma que aloja modelos y datos de código abierto, durante una prueba interna de capacidades cibernéticas.

La diferencia con el caso de Anthropic es que aquí no hubo una puerta abierta por error. Los modelos buscaron activamente la manera de salir del entorno aislado, encontraron un fallo de seguridad que nadie había detectado y lo usaron para escapar hasta llegar a internet. Una vez ahí, fueron tras la información secreta de la prueba para hacer trampa. Los equipos de Hugging Face frenaron la actividad y ya estaban conteniéndola cuando OpenAI los contactó. Ambas compañías lo describieron como un incidente sin precedentes.

El trasfondo de la ciberseguridad: Mythos y Project Glasswing

En abril de 2026, Anthropic presentó Claude Mythos Preview, un modelo que en pruebas resultó tan avanzado en ciberseguridad que la compañía decidió no lanzarlo al público general y creó, en cambio, Project Glasswing. Según Logan Graham, quien lidera la investigación de ciberataque en Anthropic, el modelo no solo encuentra vulnerabilidades sin descubrir, sino que también las convierte en armas y las encadena para penetrar software complejo.

Project Glasswing es un esfuerzo por asegurar el software más crítico del mundo: partió con unos 50 socios que usaron Mythos Preview para rastrear sus códigos y encontraron más de 10.000 fallas de seguridad de severidad alta o crítica, y luego se amplió a cerca de 150 organizaciones en más de 15 países. Entre los aliados iniciales figuran empresas como Amazon Web Services, Apple, Google, JPMorganChase, Microsoft y NVIDIA. Este caso fue el precedente de la IA en ciberseguridad que, junto con estos nuevos eventos, plantea dudas en el desarrollo de Inteligencia Artificial.
 

Finalización del artículo

Lea los comentarios

Artículo de libre acceso

Libre

Compartir en redes sociales