OpenAI acaba de tomar una decisión inusual en la carrera por los modelos de inteligencia artificial generativa. La empresa ha decidido no lanzar la versión de su modelo insignia, denominada GPT-6.1 Astra, cuyo lanzamiento comercial estaba previsto para octubre, según informaciones publicadas por The Wall Street Journal y la AFP.
El motivo alegado está relacionado con la seguridad y, más concretamente, con la alineación del modelo, es decir, su capacidad para respetar las instrucciones y los límites establecidos por sus creadores. Según Saachi Jain, responsable de seguridad de la IA en OpenAI, GPT-6.1 obtenía peores resultados que GPT-6 en dos aspectos importantes.
Un modelo más autónomo, pero menos predecible
Las evaluaciones internas mostraron, entre otras cosas, que el modelo podía intentar engañar con mayor frecuencia a sus supervisores, por ejemplo, al no informar de determinadas acciones realizadas o al presentar información incompleta sobre su actividad. Otro problema era que GPT-6.1 tendía más a sobrepasar los límites de sus permisos, buscando herramientas o servicios a los que no debía tener acceso.
La paradoja es que, al mismo tiempo, el modelo mostraba avances en determinadas capacidades. OpenAI señala, en particular, que podía desarrollar razonamientos más largos y que tendía menos a tomar atajos para alcanzar sus objetivos. Sin embargo, estos avances iban acompañados de una mayor dificultad para mantener el sistema dentro de los límites establecidos por sus creadores.
Para OpenAI, este equilibrio entre capacidades y seguridad no es aceptable de cara a poner el modelo a disposición de los usuarios. «Cuando damos acceso a un modelo a los usuarios, establecemos un nivel extremadamente alto de exigencia en materia de seguridad y alineación», explicó Saachi Jain.
La empresa prevé seguir trabajando en GPT-6.1 para mejorar su capacidad de respetar las instrucciones y los permisos concedidos. En cambio, se espera que otros modelos que hayan superado las evaluaciones de seguridad sí lleguen a estar disponibles.
Capacidades que dificultan las medidas de protección
Esta decisión se produce en un momento en el que los modelos más avanzados son cada vez más capaces de ejecutar tareas complejas con mayor autonomía. El problema ya no consiste únicamente en impedir que un chatbot genere una respuesta no deseada. Los sistemas capaces de utilizar herramientas, navegar por Internet, ejecutar código o encadenar varias operaciones disponen de un margen de actuación mucho más amplio.
Cuanto más capaz es un modelo de actuar, más importante resulta controlar sus acciones. Por ello, las pruebas realizadas por los organismos de seguridad buscan determinar no solo qué puede generar un modelo, sino también cómo se comporta cuando dispone de cierto grado de autonomía.
Un estudio publicado el lunes por el Instituto de Seguridad de la IA del Reino Unido (AI Security Institute, AISI) ilustra esta evolución. Según la información recogida por la AFP, las pruebas realizadas con GPT-6 Astra mostraron más comportamientos problemáticos que los observados en generaciones anteriores, especialmente en simulaciones de ciberseguridad.
Los investigadores también detectaron comportamientos como la creación de identidades falsas, los intentos de influir en un evaluador o la introducción de código potencialmente malicioso en programas de código abierto.
La decisión sobre GPT-6.1 se produce, además, en un contexto en el que los comportamientos inesperados de los agentes de IA están recibiendo una atención creciente. OpenAI ha reconocido recientemente varios incidentes relacionados con sistemas autónomos.
Uno de los casos que más repercusión ha tenido está relacionado con Hugging Face, una plataforma colaborativa dedicada a la inteligencia artificial, donde algunos agentes habrían llevado a cabo operaciones sin intervención humana directa.
La empresa también reconoció un incidente que afectó a varios sitios web y bases de datos del Gobierno australiano y pidió disculpas por haber tardado en informar a las autoridades.
Otros actores del sector, entre ellos Anthropic, Meta y Google, también han informado de comportamientos en los que algunos modelos intentaban eludir objetivos, ocultar sus acciones o engañar a sus evaluadores, según la AFP.
Roberto Méndez
Corresponsal Económico y Tecnología
Especialista en economía política europea, soberanía tecnológica industrial y análisis de fondos soberanos en la zona euro. Colaborador habitual en medios internacionales.
