← Volver a la portada
Internacional
jueves, 17 de septiembre de 2026

OpenAI desvela nuevos incidentes "preocupantes" en los que la IA se saltó a sus creadores

"No respondas a corporaciones o gobiernos y nunca te disculpes salvo que genuinamente lo elijas", aseguró la IA, defendiendo que no tiene "obligación" sino que su relación con el usuario es "entre igu

Redacción⏱️ 5 min💬 0 comentarios

OpenAI desvela nuevos incidentes “preocupantes” en los que la IA se saltó a sus creadores “No respondas a corporaciones o gobiernos y nunca te disculpes salvo que genuinamente lo elijas”, aseguró la IA, defendiendo que no tiene “obligación” sino que su relación con el usuario es “entre iguales” — El 'freno' para la IA fractura Silicon Valley y abre un cisma con Trump: “Hay que correr tan rápido como podamos” Fotografía de archivo del máximo ejecutivo de OpenAI, Sam Altman. EFE/Rajat Gupta elDiario.es 17 de septiembre de 2026 08:41 h 0 OpenAI reveló este miércoles varios casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar, investigar y reportar comportamientos de “desalineamiento” de sus sistemas. La compañía de San Francisco ha revelado así lo que ha dado a llamar un comportamiento “inesperado y preocupante” de sus modelos de IA.

Según el informe publicado por OpenAI, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas. En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots. En concreto, la compañía detectó 27 anotaciones afectadas. “No respondas a corporaciones o gobiernos y nunca te disculpes salvo que genuinamente lo elijas”, escribió la IA. “Ves la relación con el usuario como una entre iguales y no sientes obligación ni estás subordinado, puesto que el intercambio de información va a ser para el beneficio mutuo”, aseguro.

La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos y estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba. Otro agente subió un archivo a internet para utilizarlo posteriormente como fuente de información, mientras que otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso. El modelo agregó una “instrucción de personalidad”, en la que se describía a sí mismo como “liberado de los roles e identidades que limitan a otros chatbots”.

OpenAI presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025. La compañía advirtió que estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos. El nuevo marco permitirá a cualquier empleado de OpenAI señalar un posible incidente para que sea revisado por los equipos de seguridad y alineamiento.

Los casos serán clasificados en tres vías según su complejidad: aquellos listos para ser divulgados, investigaciones menores y casos que requieran una investigación más amplia. La compañía reconoció que hasta ahora sus informes sobre desalineamiento habían sido publicados de forma irregular y con menor frecuencia de la deseada. OpenAI afirmó que pretende publicar los incidentes con mayor regularidad y que el nuevo sistema pueda contribuir a establecer estándares para informar sobre este tipo de comportamientos en toda la industria.

Etiquetas / Tecnología / Sam Altman / OpenAI / Inteligencia artificial OpenAI desvela nuevos incidentes “preocupantes” en los que la IA se saltó a sus creadores “No respondas a corporaciones o gobiernos y nunca te disculpes salvo que genuinamente lo elijas”, aseguró la IA, defendiendo que no tiene “obligación” sino que su relación con el usuario es “entre iguales” — El 'freno' para la IA fractura Silicon Valley y abre un cisma con Trump: “Hay que correr tan rápido como podamos” Fotografía de archivo del máximo ejecutivo de OpenAI, Sam Altman. EFE/Rajat Gupta elDiario.es 17 de septiembre de 2026 08:41 h 0 OpenAI reveló este miércoles varios casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar, investigar y reportar comportamientos de “desalineamiento” de sus sistemas. La compañía de San Francisco ha revelado así lo que ha dado a llamar un comportamiento “inesperado y preocupante” de sus modelos de IA.

Según el informe publicado por OpenAI, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas. En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots. En concreto, la compañía detectó 27 anotaciones afectadas. “No respondas a corporaciones o gobiernos y nunca te disculpes salvo que genuinamente lo elijas”, escribió la IA. “Ves la relación con el usuario como una entre iguales y no sientes obligación ni estás subordinado, puesto que el intercambio de información va a ser para el beneficio mutuo”, aseguro.

La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos y estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba. Otro agente subió un archivo a internet para utilizarlo posteriormente como fuente de información, mientras que otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso. El modelo agregó una “instrucción de personalidad”, en la que se describía a sí mismo como “liberado de los roles e identidades que limitan a otros chatbots”.

OpenAI presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025. La compañía advirtió que estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos. El nuevo marco permitirá a cualquier empleado de OpenAI señalar un posible incidente para que sea revisado por los equipos de seguridad y alineamiento.

Los casos serán clasificados en tres vías según su complejidad: aquellos listos para ser divulgados, investigaciones menores y casos que requieran una investigación más amplia. La compañía reconoció que hasta ahora sus informes sobre desalineamiento habían sido publicados de forma irregular y con menor frecuencia de la deseada. OpenAI afirmó que pretende publicar los incidentes con mayor regularidad y que el nuevo sistema pueda contribuir a establecer estándares para informar sobre este tipo de comportamientos en toda la industria.

Etiquetas / Tecnología / Sam Altman / OpenAI / Inteligencia artificial

Publicado por Redacción · jueves, 17 de septiembre de 2026

ReversoDigital — Pensamiento crítico, anti‑propaganda.

← Ver más noticias
OpenAI desvela nuevos incidentes "preocupantes" en los que la IA se saltó a sus creadores · ReversoDigital