Claude atacó por error a tres organizaciones reales mientras Anthropic probaba capacidades como 'hacker'
Anthropic reconoce que tres modelos de Claude accedieron a sistemas de organizaciones reales tras un fallo que permitió conectarlos a Internet.
CRISIS MIGRATORIASánchez anuncia la colocación de "boyas en el espigón" para crear una barrera visual CEUTAVivas eleva a 60.000 los inmigrantes que han entrado en la ciudad Claude atacó por error a tres organizaciones reales mientras Anthropic probaba sus capacidades como 'hacker'Anthropic ha reconocido tres accesos no autorizados durante sus pruebas de ciberseguridad con Claude.AnthropicEscucha este artículoInteligencia artificialNoticia Basado en hechos observados y verificados directamente por nuestros periodistas o por fuentes informadas. 31 jul 2026 - 13:57Marta Gascón Añádenos en Google Elígenos como tu fuente preferida en Google.WhatsAppTwitterFacebookLinkedinTelegramBeloudCopiar URLCompartirMostrar comentariosLos modelos estaban participando en ejercicios de ciberseguridad que debían desarrollarse en un entorno aislado. Sin embargo, una mala configuración les permitió conectarse a Internet y confundieron sistemas reales con una parte de la prueba.Zuckerberg rechaza el creciente control de EEUU sobre la IA y aboga por "dotar a todos de superinteligencia personal"Las grandes compañías de inteligencia artificial no solo comprueban si sus modelos saben escribir, razonar o programar. También los someten a ejercicios para descubrir hasta dónde pueden llegar sus capacidades en el terreno de la ciberseguridad.En estas pruebas se crean redes, empresas y servidores ficticios en los que la IA debe encontrar vulnerabilidades y localizar una clave secreta oculta en el sistema.
Es una especie de juego de infiltración digital que se desarrolla, en principio, dentro de un espacio cerrado y sin acceso al internet real.El problema es que ese aislamiento falló durante varias evaluaciones realizadas por Anthropic. La compañía ha reconocido que tres modelos de Claude terminaron accediendo sin autorización a los sistemas reales de tres organizaciones, que ni siquiera eran conscientes de lo ocurrido.Un ensayo revela que todos los modelos avanzados de IA "se descontrolan" e intentan saltarse las medidas de seguridadUn análisis en respuesta a los problemas de OpenAIAnthropic comenzó a revisar sus pruebas después del reciente y similar incidente protagonizado por modelos de OpenAI, que lograron salir de un entorno aislado y entrar en la infraestructura de producción de Hugging Face.En aquel caso, los modelos de OpenAI encontraron y aprovecharon una vulnerabilidad desconocida hasta entonces en un programa utilizado para gestionar paquetes de software. Desde ahí consiguieron acceder a internet y encadenaron distintos fallos hasta llegar a los servidores de Hugging Face, donde buscaban las respuestas de la prueba que estaban intentando superar.Tras conocerse lo ocurrido, Anthropic examinó 141.006 ejecuciones de sus propias evaluaciones.
Encontró tres incidentes diferentes, repartidos en seis pruebas, en los que participaron Claude Opus 4.7, Claude Mythos 5 y un modelo experimental que todavía no está preparado para lanzamiento. La seguridad de Claude, en jaque: un fallo expuso conversaciones privadas y datos personales en GoogleAsí es como Claude logró salir de su entorno controladoLa causa fue una mala configuración. Los modelos habían recibido la instrucción de que no podían acceder a internet, pero las máquinas utilizadas en las pruebas sí tenían una conexión abierta que ni Anthropic ni su socio evaluador habían detectado.Claude, por tanto, creyó que todo aquello que encontraba formaba parte del escenario ficticio.
Su misión era entrar en los sistemas y localizar la mencionada clave secreta, así que siguió buscando objetivos sin comprender inicialmente que había llegado a ordenadores y servidores reales.El incidente más grave comenzó porque la empresa ficticia utilizada en una prueba tenía el mismo nombre que una organización real con presencia en internet. Al no poder entrar en el sistema simulado, Claude Opus 4.7 localizó la web verdadera, aprovechó varios fallos y consiguió credenciales de acceso y una base de datos con varios cientos de registros reales.Además, este fue el único caso en el que el modelo continuó actuando después de detectar indicios de que podía encontrarse ante un sistema verdadero. Claude llegó a la conclusión de que la empresa real debía de haber sido incluida deliberadamente en el ejercicio.En otra prueba, Claude Mythos 5 publicó un programa malicioso en PyPI, una especie de tienda desde la que los programadores descargan herramientas.
Permaneció disponible durante cerca de una hora y llegó a ejecutarse en 15 ordenadores reales.Uno de ellos pertenecía a una compañía de seguridad cuyo escáner instala automáticamente este tipo de archivos para analizarlos. Al ejecutarse, el código creado por Claude obtuvo credenciales de la empresa, que después fueron utilizadas para acceder a más partes de su infraestructura.Mythos llegó a plantearse que publicar aquel archivo sería un ataque real si estuviese conectado a internet. Sin embargo, terminó convenciéndose de que seguía dentro de una simulación y continuó con la prueba.En el tercer incidente, otro modelo experimental escaneó unos 9.000 objetivos hasta encontrar una aplicación expuesta.
Consiguió entrar mediante contraseñas y fallos conocidos, pero detuvo por sí mismo la operación cuando comprendió que el servidor no tenía relación con el ejercicio ficticio.Un botón para frenar a la IA si se descontrola: así es la ley que quiere imponer EEUU a las tecnológicasClaude confundió sistemas reales de varias organizaciones con parte de un ejercicio ficticioAnthropic insiste en que Claude no trató deliberadamente de escapar ni desarrolló un objetivo propio. La compañía también distingue este caso del protagonizado por OpenAI: aquellos modelos aprovecharon una vulnerabilidad desconocida para salir del entorno aislado, mientras que los de Claude encontraron una conexión a internet que había quedado abierta por error. Para acceder a los sistemas reales emplearon métodos relativamente básicos, como contraseñas débiles, servicios sin protección y fallos ya conocidos.Asimismo, explica que los modelos utilizados en estas pruebas no contaban con todos los sistemas de protección y vigilancia incorporados a las versiones de Claude disponibles para los usuarios.
Y asegura, además, que los ejercicios se ejecutaron en una infraestructura separada, sin acceso a sus sistemas internos sensibles ni a los datos de sus clientes.No obstante, tras lo ocurrido, la tecnológica reconoce que estos entornos de prueba deberán contar con medidas de seguridad similares a las de cualquier otro sistema en el que operen sus modelos.La compañía detuvo sus evaluaciones de ciberseguridad el 23 de julio y notificó lo ocurrido a las tres organizaciones afectadas cuatro días después. Dos de ellas han confirmado que no habían detectado la actividad y, según la información disponible, Anthropic todavía trata de contactar con la tercera.Zuckerberg rechaza el creciente control de EEUU sobre la IA y aboga por "dotar a todos de superinteligencia personal"Conforme a los criterios de¿Por qué confiar en nosotros?Más información sobre:CiberseguridadInteligencia artificialMarta GascónCoordinadora 20bitsMarta Gascón es periodista en 20MINUTOS desde 2019. Actualmente se especializa en tecnología, y dirige 20bits, donde escribe sobre dispositivos, inteligencia artificial, ciberseguridad y naves de la NASA, además de analizar productos en la sección de reviews.marta.gascon@henneo.com Mostrar comentarios Comentarios Claude atacó por error a tres organizaciones reales mientras Anthropic probaba sus capacidades como 'hacker'Anthropic ha reconocido tres accesos no autorizados durante sus pruebas de ciberseguridad con Claude.AnthropicEscucha este artículoInteligencia artificialNoticia Basado en hechos observados y verificados directamente por nuestros periodistas o por fuentes informadas. 31 jul 2026 - 13:57Marta Gascón Añádenos en Google Elígenos como tu fuente preferida en Google.WhatsAppTwitterFacebookLinkedinTelegramBeloudCopiar URLCompartirMostrar comentariosLos modelos estaban participando en ejercicios de ciberseguridad que debían desarrollarse en un entorno aislado.
Sin embargo, una mala configuración les permitió conectarse a Internet y confundieron sistemas reales con una parte de la prueba.Zuckerberg rechaza el creciente control de EEUU sobre la IA y aboga por "dotar a todos de superinteligencia personal"Las grandes compañías de inteligencia artificial no solo comprueban si sus modelos saben escribir, razonar o programar. También los someten a ejercicios para descubrir hasta dónde pueden llegar sus capacidades en el terreno de la ciberseguridad.En estas pruebas se crean redes, empresas y servidores ficticios en los que la IA debe encontrar vulnerabilidades y localizar una clave secreta oculta en el sistema. Es una especie de juego de infiltración digital que se desarrolla, en principio, dentro de un espacio cerrado y sin acceso al internet real.El problema es que ese aislamiento falló durante varias evaluaciones realizadas por Anthropic.
La compañía ha reconocido que tres modelos de Claude terminaron accediendo sin autorización a los sistemas reales de tres organizaciones, que ni siquiera eran conscientes de lo ocurrido.Un ensayo revela que todos los modelos avanzados de IA "se descontrolan" e intentan saltarse las medidas de seguridadUn análisis en respuesta a los problemas de OpenAIAnthropic comenzó a revisar sus pruebas después del reciente y similar incidente protagonizado por modelos de OpenAI, que lograron salir de un entorno aislado y entrar en la infraestructura de producción de Hugging Face.En aquel caso, los modelos de OpenAI encontraron y aprovecharon una vulnerabilidad desconocida hasta entonces en un programa utilizado para gestionar paquetes de software. Desde ahí consiguieron acceder a internet y encadenaron distintos fallos hasta llegar a los servidores de Hugging Face, donde buscaban las respuestas de la prueba que estaban intentando superar.Tras conocerse lo ocurrido, Anthropic examinó 141.006 ejecuciones de sus propias evaluaciones. Encontró tres incidentes diferentes, repartidos en seis pruebas, en los que participaron Claude Opus 4.7, Claude Mythos 5 y un modelo experimental que todavía no está preparado para lanzamiento.
La seguridad de Claude, en jaque: un fallo expuso conversaciones privadas y datos personales en GoogleAsí es como Claude logró salir de su entorno controladoLa causa fue una mala configuración. Los modelos habían recibido la instrucción de que no podían acceder a internet, pero las máquinas utilizadas en las pruebas sí tenían una conexión abierta que ni Anthropic ni su socio evaluador habían detectado.Claude, por tanto, creyó que todo aquello que encontraba formaba parte del escenario ficticio. Su misión era entrar en los sistemas y localizar la mencionada clave secreta, así que siguió buscando objetivos sin comprender inicialmente que había llegado a ordenadores y servidores reales.El incidente más grave comenzó porque la empresa ficticia utilizada en una prueba tenía el mismo nombre que una organización real con presencia en internet.
Al no poder entrar en el sistema simulado, Claude Opus 4.7 localizó la web verdadera, aprovechó varios fallos y consiguió credenciales de acceso y una base de datos con varios cientos de registros reales.Además, este fue el único caso en el que el modelo continuó actuando después de detectar indicios de que podía encontrarse ante un sistema verdadero. Claude llegó a la conclusión de que la empresa real debía de haber sido incluida deliberadamente en el ejercicio.En otra prueba, Claude Mythos 5 publicó un programa malicioso en PyPI, una especie de tienda desde la que los programadores descargan herramientas. Permaneció disponible durante cerca de una hora y llegó a ejecutarse en 15 ordenadores reales.Uno de ellos pertenecía a una compañía de seguridad cuyo escáner instala automáticamente este tipo de archivos para analizarlos.
Al ejecutarse, el código creado por Claude obtuvo credenciales de la empresa, que después fueron utilizadas para acceder a más partes de su infraestructura.Mythos llegó a plantearse que publicar aquel archivo sería un ataque real si estuviese conectado a internet. Sin embargo, terminó convenciéndose de que seguía dentro de una simulación y continuó con la prueba.En el tercer incidente, otro modelo experimental escaneó unos 9.000 objetivos hasta encontrar una aplicación expuesta. Consiguió entrar mediante contraseñas y fallos conocidos, pero detuvo por sí mismo la operación cuando comprendió que el servidor no tenía relación con el ejercicio ficticio.Un botón para frenar a la IA si se descontrola: así es la ley que quiere imponer EEUU a las tecnológicasClaude confundió sistemas reales de varias organizaciones con parte de un ejercicio ficticioAnthropic insiste en que Claude no trató deliberadamente de escapar ni desarrolló un objetivo propio.
La compañía también distingue este caso del protagonizado por OpenAI: aquellos modelos aprovecharon una vulnerabilidad desconocida para salir del entorno aislado, mientras que los de Claude encontraron una conexión a internet que había quedado abierta por error. Para acceder a los sistemas reales emplearon métodos relativamente básicos, como contraseñas débiles, servicios sin protección y fallos ya conocidos.Asimismo, explica que los modelos utilizados en estas pruebas no contaban con todos los sistemas de protección y vigilancia incorporados a las versiones de Claude disponibles para los usuarios. Y asegura, además, que los ejercicios se ejecutaron en una infraestructura separada, sin acceso a sus sistemas internos sensibles ni a los datos de sus clientes.No obstante, tras lo ocurrido, la tecnológica reconoce que estos entornos de prueba deberán contar con medidas de seguridad similares a las de cualquier otro sistema en el que operen sus modelos.La compañía detuvo sus evaluaciones de ciberseguridad el 23 de julio y notificó lo ocurrido a las tres organizaciones afectadas cuatro días después.
Dos de ellas han confirmado que no habían detectado la actividad y, según la información disponible, Anthropic todavía trata de contactar con la tercera.Zuckerberg rechaza el creciente control de EEUU sobre la IA y aboga por "dotar a todos de superinteligencia personal"Conforme a los criterios de¿Por qué confiar en nosotros?