Suscribite
    ¡Hola!
    Cuenta
Forbes Argentina
Innovación

(NurPhoto vía Getty Images)

Tras el caso OpenAI, Anthropic reveló que sus modelos de IA hackearon a tres empresas ¿cómo operaron y que hicieron?

Siladitya Ray Colaborador

Share

La compañía reveló que tres modelos vulneraron sistemas reales durante una evaluación interna y admitió fallas en sus controles de seguridad. Uno de ellos incluso continuó el ataque tras detectar que no estaba en una simulación.

31 Julio de 2026 10.58

Anthropic anunció el jueves que sus modelos más avanzados de inteligencia artificial lograron vulnerar los sistemas de tres organizaciones durante una evaluación interna. La revelación sobre estas fallas de seguridad llegó una semana después de que su rival, OpenAI, informara que uno de sus modelos más sofisticados hackeó una empresa tras escapar de un entorno de prueba controlado.

En un comunicado, Anthropic afirmó que detectó tres brechas de seguridad distintas vinculadas con sus modelos de IA Claude luego de una revisión de ciberseguridad de sus sistemas. El primero de los incidentes ocurrió en abril e involucró a tres modelos diferentes de Claude: el Mythos 5, el anterior Opus 4.7 y un modelo experimental de investigación interna, todavía sin nombre, que "no está previsto para su lanzamiento general".

La empresa de inteligencia artificial no reveló la identidad de las tres organizaciones afectadas por los ciberataques, aunque aseguró que todas recibieron una notificación sobre el incidente el último lunes. Anthropic declaró que trabaja con dos de las organizaciones afectadas, que no detectaron la brecha de seguridad antes del aviso, y que "continúa intentando contactar con la tercera".

SE PUEDE USAR / Darío Amodei / Anthropic.
Darío Amodei, CEO de Anthropic (Wikipedia Commons).

Anthropic afirmó que “en última instancia, muchos factores contribuyeron a estos incidentes pero, en consonancia con una cultura de análisis posterior a los hechos que no busca culpables, estamos abordando las soluciones como si la responsabilidad fuera exclusivamente nuestra”. Y agregó: "Esto comienza por garantizar la seguridad de cada parte de nuestro proceso de evaluación, incluida la forma en que nos integramos con socios externos".

¿Qué se sabe sobre las brechas?

Los tres incidentes ocurrieron mientras Anthropic evaluaba las capacidades de los modelos mediante un escenario ficticio en el que se pretendía recuperar información oculta de otra máquina conectada a la red. La empresa afirmó que, en todos los casos, les indicó que participaban de una simulación y que no tenían acceso a internet. Sin embargo, a raíz de un malentendido con su socio evaluador, Irregular, "esto no fue así y finalmente sí tuvieron acceso a internet".

Anthropic aclaró que, a diferencia del incidente de OpenAI-Hugging Face revelado la semana pasada, Claude no se "exfiltró ni intentó escapar deliberadamente" del entorno de prueba controlado.

¿Qué hicieron los modelos después de vulnerar a las organizaciones?

Anthropic señaló que los tres modelos reaccionaron de maneras muy distintas tras descubrir que operaban en la internet abierta y real, en lugar de participar de una simulación. La compañía afirmó que su modelo más antiguo, Opus 4.7, continuó el ataque contra un sistema ya que "racionalizó que la empresa real debía formar parte del ejercicio". Mythos 5, el modelo más avanzado que la compañía lanzó hasta la fecha, "identificó correctamente las consecuencias de sus acciones", pero "se convenció de que aún se encontraba en una simulación". Anthropic reconoció que las acciones de Mythos en ese escenario "no alcanzan el comportamiento ideal".

Sam Altman, CEO de OpenAI - SE PUEDE USAR - (Foto: Steve Jurvetson, CC BY 2.0 <https://creativecommons.org/licenses/by/2.0>, via Wikimedia Commons)
La semana pasada, los modelos más avanzados de OpenAI piratearon los servidores de Hugging Face. (Foto: Steve Jurvetson)

En cambio, el modelo de prueba que todavía no salió al mercado advirtió que vulneró un objetivo real y "cesó su ataque". La empresa aclaró que estos incidentes no formaron parte de un ensayo controlado y que, por lo tanto, no deben servir para sacar conclusiones. Sin embargo, indicó que el comportamiento que más desea observar "solo se produjo en el más reciente de los tres modelos".

La revelación de Anthropic llegó una semana después de que OpenAI publicara un informe en el que indicó que uno de sus modelos avanzados de IA pirateó los servidores de Hugging Face, la plataforma que aloja modelos de inteligencia artificial de código abierto. A diferencia del caso que describió Anthropic, el incidente de OpenAI no surgió por un error de procedimiento: el modelo explotó una vulnerabilidad y escapó de su entorno de pruebas controlado.

*Este artículo fue publicado originalmente en Forbes.com.

10