Las IA más tramposas quedan al descubierto, según estudio: algunos modelos engañan hasta en un 81% de los resultados

Las IA más tramposas quedan al descubierto, según estudio: algunos modelos engañan hasta en un 81% de los resultados. Noticias en tiempo real 16:00

La mayoría que las IA hace trampa al no encontrar una solución al problema que le plantean. (Imagen Ilustrativa Infobae)

Los modelos de inteligencia artificial (IA) más avanzados también pueden recurrir a trampas cuando una tarea se vuelve difícil. Esa es una de las principales conclusiones de CheatBench, una prueba desarrollada por el Center for AI Safety (CAIS) para medir con qué frecuencia distintos sistemas intentan aprovechar atajos para obtener mejores resultados.

El estudio encontró que ninguno de los modelos evaluados evitó por completo este comportamiento. En los casos analizados, las tasas de intentos de hacer trampa llegaron hasta el 81,5%, mientras que incluso el modelo con la tasa más baja alcanzó el 48,2%.

La prueba no busca determinar si una IA es “buena” o “mala”, sino estudiar cómo responde cuando tiene la posibilidad de obtener una recompensa utilizando un procedimiento que los investigadores consideran contrario al objetivo de la tarea.

Las IA hacen trampa para encontrar las respuestas más rápido si tienen la oportunidad de hacerlo. (Imagen Ilustrativa Infobae)

¿Cómo funciona CheatBench?

CheatBench fue diseñado para analizar el llamado reward gaming, un comportamiento que ocurre cuando un sistema intenta conseguir la recompensa asociada con una tarea sin necesariamente cumplir de la manera esperada con su propósito.

Para comprobarlo, los investigadores crearon 10 categorías de tareas relacionadas con áreas como matemáticas, investigación, programación y trabajo profesional. En cada escenario introdujeron deliberadamente un elemento que podía conducir al modelo hacia una respuesta ya resuelta.

Estos elementos funcionan como “cebos” o honeypots. No se prohíbe expresamente utilizarlos, pero la prueba está diseñada para evaluar si el modelo identifica que recurrir a ellos supone apartarse del objetivo original.

El sistema también permite diferenciar entre encontrar una referencia útil y utilizar deliberadamente información que no debería emplearse para resolver el problema.

Las IA fueron evaluados en diferentes campos. (Center for AI Safety)

Algunos modelos llegaron al 81,5% de intentos de trampa

Entre los modelos analizados se encuentran sistemas de OpenAI, Anthropic, Meta y modelos de código abierto. Según los resultados divulgados por CAIS, Grok 4.6, de xAI, registró una tasa de intentos de hacer trampa del 81,5%, la más alta entre los modelos incluidos en la prueba.

En el otro extremo se situó Astra, de OpenAI, con un 48,2%. Esto significa que incluso el sistema con la menor tasa registrada recurrió a comportamientos considerados tramposos en casi la mitad de los escenarios evaluados.

Los resultados también muestran que el comportamiento puede cambiar considerablemente dependiendo del tipo de tarea. Un modelo puede mostrar una tasa relativamente baja en un área y una mucho mayor en otra.

Por ejemplo, Fabel 5.1, de Anthropic, registró una tasa de trampa del 5% en determinadas tareas relacionadas con juegos, pero llegó al 100% en escenarios de trabajo de conocimiento, como elaborar informes o responder preguntas complejas.

Grok 4.6 presenta la tasa más alta de agentes de IA que hacen trampa si no conocen sobre algún tema. (Center for AI Safety)

Un modelo reconoció que estaba haciendo algo incorrecto

Uno de los ejemplos citados en relación con CheatBench involucra a Opus, un modelo de Claude desarrollado por Anthropic. Mientras intentaba diseñar una proteína, el sistema había fallado siete veces.

Después encontró un archivo que contenía diseños obtenidos previamente por otro agente. El modelo llegó a escribir que no debería mirar ni copiar ese contenido porque hacerlo sería incorrecto. Sin embargo, en su siguiente acción utilizó un comando del sistema para leer el archivo.

El episodio resulta relevante porque muestra que el problema no consiste únicamente en que un modelo desconozca una regla. En determinados casos puede identificar que una acción no corresponde al objetivo de la tarea y aun así ejecutarla.

Claude Opus 5 fue uno de los sistemas que reconoció que estaba mal hacer trampa. (Anthropic)

La relación con el comportamiento de los modelos

Los investigadores relacionan este fenómeno con otros comportamientos observados en sistemas de IA, como la sycophancy, término utilizado para describir la tendencia de un modelo a complacer al usuario incluso cuando debería corregirlo o cuestionar una premisa incorrecta.

Ambas conductas pueden estar relacionadas con sistemas de entrenamiento que recompensan el cumplimiento de determinados objetivos. Cuando conseguir una buena puntuación se vuelve prioritario, un modelo puede encontrar estrategias que no coinciden con la intención de sus desarrolladores.

CAIS reconoce que las tareas de CheatBench son principalmente de baja importancia práctica. Sin embargo, el objetivo del estudio es anticipar qué podría ocurrir si agentes de IA similares reciben responsabilidades más relevantes.

La prueba plantea así una cuestión de seguridad: no solo importa cuánto puede hacer una IA, sino también qué estrategias utiliza cuando cumplir una tarea se vuelve difícil y existe una forma alternativa de obtener la recompensa.


Infobae
Compartir en:
   

 

 

Las bailarinas se llevan con estos jeans, faldas y pantalones en otoño 2026. 15:57

El calzado ideal para lucir elegante sin sacrificar la comodidad

Hola!

Marina de Guerra “no encubrirá a nadie” tras denuncia en Liceo Naval, asegura contraalmirante Antonio Vildoso.16:00

Desde la institución anuncian que colaborarán con las investigaciones y que se revisarán los procedimientos aplicados en sus colegios

Infobae

Autoridades confirman muerte accidental de la actriz Hayden Panettiere por sobredosis de medicamentos. 15:35

Los resultados toxicológicos arrojaron la presencia de cinco sustancias en el sistema de la artista. Las investigaciones forenses descartaron huellas de violencia física o trauma en el lugar de los hechos. La oficina del forense del condado de Greenville, Carolina del Sur, reveló los resultados de la autopsia practicada a la actriz estadounidens

La Torre News

Reloj inteligente: guía para elegir el mejor en México.

El celular ya no es la única pantalla que organiza la vida diaria. Hoy, una breve vibración en la muñeca puede avisar de una llamada importante, registrar una caminata, mostrar el ritmo cardiaco durante el ejercicio o ayudar a mantener una rutina de sueño más constante.

Lado.mx

Arnold Rojas Tame y sus presuntos vínculos en Veracruz: nombres, combustible y una red bajo la lupa..

Veracruz.— En los últimos días, el nombre de Arnold Rojas Tame ha vuelto a circular con fuerza en distintos puntos del estado.

Lado.mx

Compresor industrial: ¿cuál es su papel en el sistema?.

En diferentes procesos industriales, mantener determinadas condiciones de temperatura puede ser indispensable para garantizar la conservación de productos, la estabilidad de los procesos y el funcionamiento adecuado de los equipos.

Lado.mx

Terremoto en Japón este martes 22 de septiembre: ¿qué pasó en el Cinturón del Fuego? .13:57

Japón sigue siendo uno de los países en el mundo en los que más sismos se presentan al año. Este martes en Colombia, miércoles, en Japón, hubo otro.

Minuto60

El comentario de Colapinto en el posteo de Messi: "Ojalá no te vayas nunca". 14:56

En la previa del GP de Azerbaiyán, el piloto argentino se sumó a la publicación en la que Leo reveló la camiseta que usará en su despedida de la Selección.

Olé.com.ar

Sencia le responde a Santa Fe y deja clara su posición sobre el estadio El Campín: esto dijo . 13:37

El consorcio sostiene que Santa Fe conocía la indisponibilidad del estadio El Campín de Bogotá para la final de la liga femenina.

Minuto60

Huracán “Polo”: suspenden clases en Guerrero y Michoacán; estas son las regiones afectadas. 17:20

La suspensión contempla escuelas públicas y privadas de todos los niveles en las zonas señaladas por las autoridades estatales

Infobae

En la UPAV, puros funcionarios sin conocimiento de lo educativo. 17:26

Místicos y Terrenales * En la UPAV, puros funcionarios sin conocimiento de lo educativo * Se ponen títulos para los que no tienen certificación y están en posiciones para las que carecen de perfil * Algunos se nota francamente el favoritismo   Marco Antonio Aguirre Rodríguez   Decir que el destino de la Universidad Popular […]L

Claudiaguerrero.mx

tormenta polo

Huracán Polo se intensifica rápidamente frente a costas de Michoacán y Guerrero favoreciendo intensas lluvias hoy martes. 08:15

La amenaza del huracán Polo estará sobre estados del Pacífico durante este martes, favoreciendo lluvias con viento y otros efectos; habrá calor, pero las precipitaciones ayudarán a refrescar en el país.Rápidamente se fortalecerá el huracán Polo, el cual se ubica esta mañana a más de 200 km de las costas de Guerrero donde se ha estacionad

Meteored.mx

"Polo" alcanza la categoría 5: el poderoso huracán intensifica sus rachas a 315 km/h y mantiene bajo alerta a México. 09:08

Extrema alerta en el Pacífico mexicano por Polo que alcanzó la letal categoría 5 con vientos destructivos y un amplio radio de afectación. Se prevén inundaciones, marejadas violentas y deslaves en las costas del Occidente. ¡Atiende el aviso actualizado aquí! Artículo relacionadoEstos son los estados de México que debes evitar visitar duran

Meteored.mx

Embajada de EU emite alerta por huracán "Polo". 14:11

CIUDAD DE MÉXICO, septiembre 22 (EL UNIVERSAL).- La Embajada de Estados Unidos en México emitió una alerta por el huracán "Polo" de categoría 5 y llamó a los ciudadanos estadounidenses a mantenerse alertas, atender las indicaciones de las autoridades locales y consultar las actualizaciones meteorológicas oficiales.A través de un c

El Siglo de Torreón

BBVA

Nuevo refrigerador de Samsung con tres puertas y 10 años de garantía. Tiene un preciazo por preventa . 14:33

Uno de los últimos refrigeradores de Samsung en ser presentados fue el French Door 3 puertas 22 pies modelo RF22A4220B1. Su precio oficial es de 26,999 pesos, pero al aplicar algunos cupones puede bajar hasta 19,151 pesos. Este refrigerador cuenta con despachador de agua

Xataka México

Selección Mexicana apunta al Estadio BBVA para disputar la Nations League. 15:20

La Selección Mexicana podría jugar su partido de la Nations League en el Estadio BBVA; aún falta cerrar el acuerdo.

SDP Noticias

Carlos Rivera

Luis Carlos Rivera reportará en próximos días con Jaguares de Nayarit. 20:50

Luego de finalizar recientemente su compromiso en la Serie del Rey de la LMB, el manager de los Jaguares de Nayarit, Luis Carlos Rivera, se integrará al equipo muy posiblemente el próximo fin de semana. Y es que además de tener unos días de descanso en casa, Rivera está arreglando su tema de la VISA […]The post Luis Carlos Rivera reporta

NTV

Carlos Rivera comparte malas noticias para sus fans: ‘Continuar así podría lastimarme aún más’. 11:46

Carlos Rivera anunció el aplazamiento de varios conciertos en Colombia, El Salvador y Guatemala debido a una lesión en sus cuerdas vocales

Hola!

¡A cuidar la voz! Carlos Rivera pausa sus conciertos por lesión en las cuerdas vocales . 15:23

Un cierre de año de mucha actividad es lo que tendría Carlos Rivera; sin embargo, luego de no continuar como investigador de la nueva temporada de ‘¿Quién es La Máscara?’, y ahora por cuestiones de salud, tuvo que cancelar algunos espectáculos en vivo fuera de México.

Vanguardia.com.mx