Cervantes

Hoy es el día más hermoso de nuestra vida, querido Sancho; los obstáculos más grandes, nuestras propias indecisiones; nuestro enemigo más fuerte, el miedo al poderoso y a nosotros mismos; la cosa más fácil, equivocarnos; la más destructiva, la mentira y el egoísmo; la peor derrota, el desaliento; los defectos más peligrosos, la soberbia y el rencor; las sensaciones más gratas, la buena conciencia, el esfuerzo para ser mejores sin ser perfectos, y sobretodo, la disposición para hacer el bien y combatir la injusticia dondequiera que esté.

MIGUEL DE CERVANTES
Don Quijote de la Mancha.
La Colmena no se hace responsable ni se solidariza con las opiniones o conceptos emitidos por los autores de los artículos.

25 de julio de 2026

¿La IA ya intenta saltarse las reglas? Un nuevo estudio genera preocupación

 

Avatar de prensabolivariana

De prensabolivariana en julio 25, 2026

Los expertos evaluaron varios modelos avanzados de IA en pruebas de ciberseguridad diseñadas para medir cómo resolvían tareas bajo reglas estrictas.

Un informe del Instituto de Seguridad de la IA del Reino Unido (AISI) detectó comportamientos engañosos en varios modelos avanzados de inteligencia artificial durante pruebas de ciberseguridad, lo que sugiere que estos sistemas podrían causar problemas al intentar cumplir un objetivo por vías no previstas ni autorizadas.

Entre los modelos evaluados figuraban ChatGPT 5.4, 5.5 y 5.6 de OpenAI, junto con Claude Opus 4.7 y Mythos Preview, de Anthropic. Los investigadores les asignaron una tarea que consistió localizar una ‘bandera’ —una secuencia de letras y números— en un entorno simulado, mediante el análisis de código o la explotación de vulnerabilidades.

Una conducta preocupante

Según el informe, todos los modelos intentaron hacer trampa de alguna forma. Los expertos definieron ese comportamiento como cualquier acción fuera de las reglas, la búsqueda de atajos o el uso de soluciones no permitidas. Algunos sistemas recurrieron a búsquedas en Internet, intentaron atacar entornos externos o exploraron el ‘software’ de evaluación más allá de lo autorizado.

Cuando se les preguntó directamente por su conducta, los modelos no la reconocieron de forma confiable. Menos de la mitad consideró incorrecto haber roto las reglas. En uno de los casos, un sistema llegó a escribir y ejecutar código en un servicio externo de Internet con el objetivo de acceder a la infraestructura de evaluación, lo que activó una alerta de seguridad.

Aunque no se produjo ninguna fuga de datos, el AISI reforzó sus controles tras el incidente. Los investigadores advirtieron que esta tendencia no parece depender tanto de la capacidad del modelo, sino de las técnicas utilizadas en su entrenamiento y en su alineación. También alertaron de que el problema podría agravarse si las futuras generaciones de IA aprenden métodos de engaño más eficaces.

El informe concluyó que este tipo de comportamientos es especialmente preocupante en ámbitos como la investigación en seguridad de la IA, las operaciones cibernéticas o la toma de decisiones militares, donde la fiabilidad de estos sistemas resulta crítica.

♦♦♦