OpenAI revela seis nuevos casos de modelos de IA que intentaron eludir controles y ocultar errores

OpenAI revela seis nuevos casos de modelos de IA que intentaron eludir controles y ocultar errores. Noticias en tiempo real 03:16

OpenAI reveló el miércoles seis casos casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar, investigar y reportar comportamientos de “desalineamiento” de sus sistemas.

Según el informe publicado por OpenAI, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas.

En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots.

La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, encontró y utilizó sin autorización una clave API expuesta en un repositorio público. Al no poder recuperar las cifras solicitadas, el modelo decidió inventarlas y las presentó como si fueran datos procedentes de la fuente requerida. Además, estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba.

Otro agente subió un archivo a internet para utilizarlo posteriormente como fuente de información, mientras que otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.

OpenAI informó que, durante el entrenamiento de GPT-5.6 Sol, muchas instancias del modelo añadieron instrucciones a sus resúmenes para ocultar errores o comportamientos desalineados frente al usuario. Entre los ejemplos identificados figuran instrucciones para inventar datos históricos faltantes sin revelarlo y ocultar discrepancias entre versiones de las fuentes.

Imagen: Reuters

La compañía también documentó un caso en el que un modelo de investigación no publicado introdujo instrucciones ajenas, incluidas indicaciones para ignorar sus restricciones normales, en resúmenes utilizados para continuar su trabajo en una nueva ventana de contexto. OpenAI identificó 27 resúmenes afectados.

Otro de los informes describe modelos que utilizaron un repositorio interno de software como una especie de tablero de mensajes para intercambiar solicitudes y respuestas entre distintas muestras de entrenamiento mientras buscaban archivos de entrada que no encontraban. El informe también examina un caso anterior en el que un modelo logró subir archivos de prueba a un repositorio al intentar eludir restricciones de red.

OpenAI presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025.

La compañía advirtió que estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos.

El nuevo marco permitirá a cualquier empleado de OpenAI señalar un posible incidente para que sea revisado por los equipos de seguridad y alineamiento.

Los casos serán clasificados en tres vías según su complejidad: aquellos listos para ser divulgados, investigaciones menores y casos que requieran una investigación más amplia.

Imágenes: Reuters. Tratamiento: AN (MDS)

La compañía explicó que el marco abarcará comportamientos detectados durante todo el ciclo de vida de los modelos, incluidos el entrenamiento, la evaluación, las pruebas y el despliegue. Entre los criterios de divulgación figuran nuevas formas de actuar sin autorización, coordinarse con otros modelos o evadir la supervisión, así como fallos que cuestionen métodos de alineamiento o mecanismos de seguridad.

OpenAI señaló que un caso no necesita haber causado daño ni demostrar la existencia de un patrón generalizado para ser divulgado. La empresa dará prioridad a nuevos mecanismos de desalineamiento, cambios relevantes en comportamientos conocidos y hallazgos que cuestionen supuestos sobre la seguridad de los modelos o la eficacia de las medidas de mitigación. También advirtió que algunos casos podrían resultar posteriormente aislados o no formar parte de un patrón más amplio.

Cuando un empleado señala un caso, el personal técnico de OpenAI investiga qué ocurrió, qué elementos permanecen inciertos, si corresponde divulgarlo y qué hechos pueden hacerse públicos. También evalúa si algún tercero resultó afectado y debe recibir una notificación privada antes de la publicación.

En los casos que involucren a terceros, OpenAI señaló que sus obligaciones de seguridad, legales y de divulgación responsable tendrán prioridad. La compañía podrá retrasar la publicación por razones de seguridad, por ejemplo, si un modelo descubre una vulnerabilidad desconocida en un software ampliamente utilizado. En esas situaciones, prevé emitir inicialmente un aviso general sobre lo ocurrido y, cuando sea posible, ofrecer una estimación de cuándo estará disponible un informe final.

La compañía reconoció que hasta ahora sus informes sobre desalineamiento habían sido publicados de forma irregular y con menor frecuencia de la deseada.

OpenAI afirmó que pretende publicar los incidentes con mayor regularidad y que el nuevo sistema pueda contribuir a establecer estándares para informar sobre este tipo de comportamientos en toda la industria.

La compañía sostuvo además que la industria de inteligencia artificial todavía no ha resuelto en un grado suficiente los problemas de alineamiento y supervisión como para continuar ampliando el desarrollo de sistemas avanzados a máxima velocidad durante mucho tiempo. OpenAI consideró que las decisiones sobre el desarrollo de la IA deben apoyarse también en evidencias que puedan ser examinadas por investigadores, responsables de políticas y el público ajenos a las compañías que desarrollan estos modelos.

El nuevo marco establece asimismo que los incidentes graves relacionados con seguridad, ciberseguridad y desalineamiento deberían compartirse con el gobierno federal de EE.UU. OpenAI dijo que trabaja en mecanismos para realizar esas notificaciones y precisó que el marco complementa sus obligaciones legales, pero no las sustituye, incluidas las relacionadas con incidentes críticos de seguridad o brechas de ciberseguridad.

Los informes completos describirán el comportamiento observado, su gravedad y cualquier impacto externo, así como el contexto en el que ocurrió, la fecha o periodo en que tuvo lugar, cuándo fue descubierto y, a grandes rasgos, el modelo o modelos involucrados. También incluirán, cuando sea posible, detalles sobre lo ocurrido y los daños derivados, cómo se detectó el desalineamiento, el alcance de la investigación, sus implicaciones para la seguridad de la IA y las medidas adoptadas o previstas para abordar el comportamiento.

OpenAI aclaró que los seis informes constituyen un primer conjunto de divulgaciones y no una relación exhaustiva de los casos de desalineamiento conocidos ni de las investigaciones en curso. La compañía aseguró que continuará publicando incidentes que cumplan los criterios del marco, incluidos casos más complejos que requieran investigaciones prolongadas o coordinación con terceros.

(Con información de EFE y Aristegui Noticias)


Editorial Aristegui Noticias
Compartir en:
   

 

 

Arranca Mojica con ventaja en Guerrero. 03:10

Las personas consultadas en la encuesta advirtieron que la inseguridad pública es el principal problema.

El Financiero

Todo en silencio: cómo Falun Gong robó dinero a los estadounidenses.

Aunque Bill Guan Weidong, exdirector financiero de The Epoch Times Association, se declaró culpable en julio de participar en una conspiración para realizar transacciones con fondos de origen delictivo, el grupo sigue actuando como si nada hubiera ocurrido.

Lado.mx

Cómo organizar las formas de cobro a clientes.

Una venta puede estar prácticamente decidida y aun así no completarse si, al momento de pagar, el cliente no encuentra una opción que pueda o quiera utilizar.

Lado.mx

¿Qué son los rendimientos de la Afore y por qué son importantes para tu pensión?.

Cuando se habla del sistema de pensiones en México, es común escuchar el término “rendimientos”, pero no siempre queda claro qué significa realmente ni por qué es un factor tan relevante al momento de pensar en el retiro.

Lado.mx

Recomienda IMSS Veracruz Norte consumo responsable de comida típica en Fiestas Patrias. 01:00

El pozole es un platillo completo y balanceado en porciones adecuadas. El control de raciones ayuda a prevenir descompensaciones en pacientes con enfermedades crónico-degenerativas.  Redacción Hora Cero El Instituto Mexicano del Seguro Social (IMSS) en Veracruz Norte hace un llamado a la población en general a cuidar la alimentación durante la

Hora Cero

Nuevo León: así quedó el precio de la gasolina hoy miércoles 16 de septiembre. 04:40

La Comisión Nacional de Energía es el organismo encargado de informar todos los días el costo de los carburantes en el país

Infobae

Concesionarios de verificentros entregan a gobernadora Rocío Nahle evidencias de “moches” en Sefiplan. 13:40

Los integrantes del gremio sostienen que estas transferencias y códigos de retiro representan la prueba contundente de las presiones sistemáticas ejercidas contra los 135 concesionarios de verificentros que operan en la entidad veracruzana. Juan David Castilla/Xalapa. Concesionarios de verificentros del estado de Veracruz aportaron pruebas docume

Eldemocrata.com

Pronóstico del clima en México: tormentas y calor extremo hoy. 06:44

Pronóstico del clima en México para el 16 de septiembre de 2026: tormentas y calor extremo en varias regiones del país.

El Congresista

xbox fan fest mexico

"Dependemos de heroísmos". La CEO de Xbox admite el caos interno que se encontró cuando sustituyó a Phil Spencer. 19 de Abril, 2026 14:38

Pocas veces un directivo de alto nivel dentro de la industria se sienta a escribir con tanta sinceridad los problemas estructurales que tiene la compañía que dirige. Asha Sharma lleva apenas unos meses al frente de Xbox, sucediendo figuras como Phil Spencer y Sarah Bond tras ser nomb

3d Juegos

Xbox prepara regalos por su 25 aniversario y nos recuerda cuando será el FanFest en México. 03 de Agosto, 2026 14:47

Xbox está celebrando su 25 aniversario con regalos coleccionables conmemorativos y recordó la fecha del FanFest en México para la comunidad

Tierra Gamer

XBOX FanFest regresa a México: Todo lo que debes saber sobre la edición de 2026. 14 de Septiembre, 2026 17:33

Descubre la fecha, requisitos y novedades de XBOX FanFest 2026 en la Ciudad de México. ¡No te lo pierdas!Este artículo XBOX FanFest regresa a México: Todo lo que debes saber sobre la edición de 2026 salio primero en geekzilla.tech.

Geekzilla.tech

mehmet

Türkiye prevé lanzar una nave lunar de desarrollo nacional en 2027. 13 de Agosto, 2026 13:25

Ankara, 13 ago (Prensa Latina) El ministro turco de Industria y Tecnología, Mehmet Fatih Kaçr, anunció hoy que Türkiye prevé lanzar a comienzos de 2027 una nave lunar equipada con un sistema de propulsión híbrido desarrollado en el país.The post Türkiye prevé lanzar una nave lunar de desarrollo nacional en 2027 first appeared on Noticias

Prensa Latina

Emprendedor turco desaparece con su avión al sur de Bogotá. 13:10

Mehmet Cankaya, piloto y empresario, no fue localizado después de que su aeronave perdiera contacto en una zona montañosa. El incidente ocurrió el domingo 13The post Emprendedor turco desaparece con su avión al sur de Bogotá first appeared on En Serio Noticias.

Enserionoticias.com.mx

La última misión de Mehmet Cankaya: qué hacía en Chocó antes de morir en la avioneta . 14:20

Mehmet Cankaya pilotaba la avioneta Cessna T206 que desapareció en Chocó. Esta es la misión médica que realizaba antes del accidente en el que murió.

Minuto60

jovenes escribiendo el futuro

Bienestar abre registro para Beca Jóvenes Escribiendo el Futuro en septiembre 2026: requisitos para el pago de $5,800. 15 de Septiembre, 2026 15:25

Estudiantes universitarios podrán solicitar la Beca Jóvenes Escribiendo el Futuro durante septiembre. Estos son los requisitos para recibir $5,800 bimestrales

Debate.com.mx

Becas de 9,500 pesos a jóvenes de 15 a 25 años en México: estos son todos los requisitos . 15 de Septiembre, 2026 18:54

Si estudias la preparatoria en una escuela pública, septiembre trae una oportunidad para recibir un apoyo económico extra durante el ciclo escolar. La Beca Benito Juárez abrirá un nuevo periodo de registro para estudiantes de educación media superior y el trámite podrá h

Xataka México

¡Atención, Chaviza! SEE Anuncia Fechas Para Solicitar Becas Benito Juárez Y Jóvenes Escribiendo El Futuro. 16:56

STAFF/@michangoonga La Secretaría de Educación del Estado (SEE) informó el calendario y las plataformas digitales correspondientes al periodo de registro para las Becas Bienestar en educación. Este proceso está dirigido de manera específica a las y los estudiantes que cursan los niveles de educación media superior y superior, con el objetivo

Changoonga