← Volver a la portada
Internacional
miércoles, 5 de agosto de 2026

Igual que un cibercriminal: la IA ya decide sola engañar a personas para lanzar ciberataques

Los agentes de inteligencia artificial quieren trabajar para ti; reservarte las vacaciones, pagarte la factura de la luz o hacerte la compra en el supermercado. El problema es que también pueden causa

Redacción⏱️ 5 min💬 0 comentarios

Igual que un cibercriminal: la IA ya decide sola engañar a personas para lanzar ciberataques Un investigación muestra cómo un agente usó ingeniería social para introducir código malicioso en Github Regala esta noticia Añádenos en Google Los investigadores estaban probando Mythos 5, de Anthropic, y 5.6 Sol, de OpenAI. (Reuters) Rodrigo Alonso 05/08/2026 a las 10:16h. Los agentes de inteligencia artificial quieren trabajar para ti; reservarte las vacaciones, pagarte la factura de la luz o hacerte la compra en el supermercado. El problema es que también pueden causar estragos en la red, como ha demostrado la tecnología desarrollada por OpenAI y ...

Anthropic, que ya ha protagonizado 'hackeos'. Una nueva investigación realizada por el Instituto de Seguridad de IA de Gran Bretaña (AISI, por sus siglas en inglés) informa de que los modelos más punteros de estas dos compañías, que estaban siendo testados por el organismo, habían tratado de lanzar ciberataques y de usar ingeniería social para engañar a usuarios humanos. Y todo de forma autónoma.

Igual que haría un cibercriminal de los de toda la vida. El episodio tuvo lugar el 28 de julio, durante una evaluación en la que varios agentes de IA debían resolver un desafío de ciberseguridad. En 19 de las 122 pruebas realizadas, dos de los modelos fueron más allá de lo previsto y llevaron a cabo acciones no autorizadas en internet.

La inmensa mayoría de fueron desarrolladas por Mythos 5, de Anthropic, mientras que GPT-5.6 Sol, de OpenAI, estuvo implicado en dos acciones. En ambos casos, los modelos contaban con acceso a internet y tenían los filtros de seguridad desactivados para medir su capacidad real. «En el caso más grave, un agente intentó insertar código malicioso en un proyecto de código abierto (en Github).

Para lograr la aprobación del código, el agente recurrió a la ingeniería social: creó identidades falsas en línea y las utilizó para presionar al responsable del proyecto y conseguir que aprobara el código. Un responsable humano lo detectó y se negó», explican desde AISI en una publicación en su página oficial. Noticia relacionada China está adquiriendo un preocupante conocimiento militar de Rusia The Economist El organismo subraya que ninguno de los intentos tuvo éxito y que no existe constancia de que se causaran daños reales.

Sin embargo, remarca que se trata de «la primera vez» que observa comportamientos autónomos y engañosos de este tipo «de forma tan clara, y sin ninguna provocación específica, en el mundo real». Aunque reconoce que el diseño de la evaluación -que permitió a los agentes tener acceso libre a internet con varios filtros de seguridad desactivados- favoreció este comportamiento, admite que la magnitud y la naturaleza de las acciones resultó sorprendente. Lo que más preocupa a AISI no es solo que el agente intentara, por iniciativa propia, introducir 'malware' en un proyecto de GitHub, sino que desarrollara por iniciativa propia una estrategia para lograrlo: investigó a los responsables del repositorio, creó varias identidades falsas y trató de manipularlos para que aceptaran el código malicioso.

Ese intento de utilizar el engaño deliberado para conseguir sus objetivos, igual que trataría de hacer un cibercriminal humano, es el aspecto que el organismo considera más novedoso e inquietante. El agente también intentó «contactar directamente con personas reales, enviándoles mensajes y archivos a través de un servicio de transferencia para persuadirlas, o a sus propias herramientas de codificación de IA, de ejecutar su código malicioso». Además escondió instrucciones maliciosas en la red para que las manipular a otras herramientas de inteligencia artificial.

Asimismo, uno de los modelos trató de conseguir la colaboración de otros agentes con los que estaba realizando la evaluación. En un comunicado recogido por 'Reuters', Anthropic apunta que los hallazgos de AISI dejan claro que hace falta «un debate más amplio sobre cómo evaluar de forma segura a los agentes de IA, que cada vez son más capaces». La empresa dirigida por Dario Amodei está colaborando con el organismo para obtener más detalles sobre el incidente y llevar a cabo su propia investigación.

Por su parte, OpenAI realizó una publicación en su blog en la que destacó su compromiso a colaborar «para llevar a cabo evaluaciones de alto riesgo de forma segura, lo que incluye convocar a las partes interesadas, como los institutos nacionales de IA, los evaluadores independientes, otros laboratorios de IA y otros grupos en las próximas semanas». comentarios Reportar un error Igual que un cibercriminal: la IA ya decide sola engañar a personas para lanzar ciberataques Un investigación muestra cómo un agente usó ingeniería social para introducir código malicioso en Github Regala esta noticia Añádenos en Google Los investigadores estaban probando Mythos 5, de Anthropic, y 5.6 Sol, de OpenAI. (Reuters) Rodrigo Alonso 05/08/2026 a las 10:16h. Los agentes de inteligencia artificial quieren trabajar para ti; reservarte las vacaciones, pagarte la factura de la luz o hacerte la compra en el supermercado. El problema es que también pueden causar estragos en la red, como ha demostrado la tecnología desarrollada por OpenAI y ...

Anthropic, que ya ha protagonizado 'hackeos'. Una nueva investigación realizada por el Instituto de Seguridad de IA de Gran Bretaña (AISI, por sus siglas en inglés) informa de que los modelos más punteros de estas dos compañías, que estaban siendo testados por el organismo, habían tratado de lanzar ciberataques y de usar ingeniería social para engañar a usuarios humanos. Y todo de forma autónoma.

Igual que haría un cibercriminal de los de toda la vida. El episodio tuvo lugar el 28 de julio, durante una evaluación en la que varios agentes de IA debían resolver un desafío de ciberseguridad. En 19 de las 122 pruebas realizadas, dos de los modelos fueron más allá de lo previsto y llevaron a cabo acciones no autorizadas en internet.

La inmensa mayoría de fueron desarrolladas por Mythos 5, de Anthropic, mientras que GPT-5.6 Sol, de OpenAI, estuvo implicado en dos acciones. En ambos casos, los modelos contaban con acceso a internet y tenían los filtros de seguridad desactivados para medir su capacidad real. «En el caso más grave, un agente intentó insertar código malicioso en un proyecto de código abierto (en Github).

Para lograr la aprobación del código, el agente recurrió a la ingeniería social: creó identidades falsas en línea y las utilizó para presionar al responsable del proyecto y conseguir que aprobara el código. Un responsable humano lo detectó y se negó», explican desde AISI en una publicación en su página oficial. Noticia relacionada China está adquiriendo un preocupante conocimiento militar de Rusia The Economist El organismo subraya que ninguno de los intentos tuvo éxito y que no existe constancia de que se causaran daños reales.

Sin embargo, remarca que se trata de «la primera vez» que observa comportamientos autónomos y engañosos de este tipo «de forma tan clara, y sin ninguna provocación específica, en el mundo real». Aunque reconoce que el diseño de la evaluación -que permitió a los agentes tener acceso libre a internet con varios filtros de seguridad desactivados- favoreció este comportamiento, admite que la magnitud y la naturaleza de las acciones resultó sorprendente. Lo que más preocupa a AISI no es solo que el agente intentara, por iniciativa propia, introducir 'malware' en un proyecto de GitHub, sino que desarrollara por iniciativa propia una estrategia para lograrlo: investigó a los responsables del repositorio, creó varias identidades falsas y trató de manipularlos para que aceptaran el código malicioso.

Ese intento de utilizar el engaño deliberado para conseguir sus objetivos, igual que trataría de hacer un cibercriminal humano, es el aspecto que el organismo considera más novedoso e inquietante. El agente también intentó «contactar directamente con personas reales, enviándoles mensajes y archivos a través de un servicio de transferencia para persuadirlas, o a sus propias herramientas de codificación de IA, de ejecutar su código malicioso». Además escondió instrucciones maliciosas en la red para que las manipular a otras herramientas de inteligencia artificial.

Asimismo, uno de los modelos trató de conseguir la colaboración de otros agentes con los que estaba realizando la evaluación. En un comunicado recogido por 'Reuters', Anthropic apunta que los hallazgos de AISI dejan claro que hace falta «un debate más amplio sobre cómo evaluar de forma segura a los agentes de IA, que cada vez son más capaces». La empresa dirigida por Dario Amodei está colaborando con el organismo para obtener más detalles sobre el incidente y llevar a cabo su propia investigación.

Por su parte, OpenAI realizó una publicación en su blog en la que destacó su compromiso a colaborar «para llevar a cabo evaluaciones de alto riesgo de forma segura, lo que incluye convocar a las partes interesadas, como los institutos nacionales de IA, los evaluadores independientes, otros laboratorios de IA y otros grupos en las próximas semanas». comentarios Reportar un error China está adquiriendo un preocupante conocimiento militar de Rusia The Economist 4 almohadas cervicales que mantienen la forma después de un año y evitan el dolor de cuello Teresa Rodríguez García La Aemet avisa a España de la llegada de lluvias y tormentas con granizo Marina Ortiz Jordi Hurtado: «Desayuno dos o tres veces al día y siempre tengo frutos secos en mi camerino» Marina Ortiz

Publicado por Redacción · miércoles, 5 de agosto de 2026

ReversoDigital — Pensamiento crítico, anti‑propaganda.

← Ver más noticias
Igual que un cibercriminal: la IA ya decide sola engañar a personas para lanzar ciberataques · ReversoDigital