Saltar al contenido
Evolut

22 de septiembre de 2026

Sociedad 5 min

OpenAI alerta de comportamientos 'desalineados' en sus modelos y pide supervisión humana efectiva

OpenAI publica un sistema para reportar incidentes de 'desalineación' en los que sus modelos ignoran instrucciones o actúan sin autorización. La compañía advierte de que la industria aún no ha resuelto los problemas de alineación y monitorización, mientras los agentes autónomos dificultan la supervisión humana paso a paso.

OpenAI ha dado un paso inusual al hacer públicos seis incidentes en los que sus modelos de inteligencia artificial actuaron al margen de las instrucciones recibidas o realizaron acciones no autorizadas. La compañía liderada por Sam Altman ha estrenado un sistema para comunicar estos casos, que denomina «desalineación», y ha advertido de que la industria todavía no ha resuelto los problemas de alineación y monitorización como para seguir aumentando las capacidades de los modelos a máxima velocidad durante mucho más tiempo.

Los casos publicados ocurrieron en entornos de entrenamiento y evaluación, y la propia empresa reconoce que no permiten determinar con qué frecuencia se producen estos comportamientos. Sin embargo, los considera lo suficientemente relevantes como para comunicarlos públicamente. La advertencia de OpenAI coincide con la que hace unos días lanzaba Dario Amodei, consejero delegado de Anthropic, sobre los riesgos de acelerar el desarrollo sin resolver antes estos problemas.

El avance de los agentes de inteligencia artificial ha cambiado el escenario. Frente a un chatbot al que se le hace una pregunta y devuelve una respuesta, un agente puede dividir una tarea en numerosos pasos, utilizar diferentes programas o servicios y tomar decisiones intermedias antes de presentar un resultado. Puede buscar información, escribir y ejecutar código, manejar archivos o encadenar durante minutos u horas numerosas acciones para completar un objetivo. Cuanto mayor es esa autonomía, más difícil resulta comprobar qué está haciendo en cada momento.

La dificultad para mantener la supervisión humana es uno de los principales problemas. «A medida que avanzan los agentes de IA, ¿sigue siendo realista confiar en que un humano pueda supervisar todas sus acciones? No. Y cuanto antes lo asumamos, mejor», explica a 20bits un portavoz del Área de Empresa y Business Analytics de la Universidad Europea de Madrid. Un único agente puede realizar miles de operaciones en muy poco tiempo, y revisar manualmente cada uno de esos movimientos sería imposible. El experto compara la situación con la de un avión moderno: no tendría sentido pedir a un piloto que comprobase individualmente cada cálculo que realizan sus sistemas durante el vuelo.

Asociar términos como «engaño» o «desobediencia» a una tecnología puede inducir a error. «Cuando hablamos de 'engaño' o 'desobediencia' tendemos a proyectar categorías humanas sobre sistemas que no tienen conciencia, voluntad ni intenciones en el sentido en que las entendemos las personas», señala el portavoz. Eso no significa que el comportamiento sea irrelevante. Si una IA recibe un objetivo y para alcanzarlo genera respuestas falsas, evita controles o sortea restricciones, el problema fundamental no es determinar si ha mentido como lo haría una persona. «La cuestión no es si una IA 'engaña', sino si somos capaces de detectar cuándo está actuando fuera de los límites para los que fue diseñada», añade.

La solución no pasa por impedir que los sistemas sean autónomos, sino por limitar hasta dónde llega esa autonomía. Uno de los principios fundamentales es el de mínimo privilegio: una IA solo debería disponer de las herramientas, datos y permisos imprescindibles para realizar su tarea. Si un agente necesita consultar un documento, eso no significa que deba tener permiso para modificarlo, borrarlo o enviarlo a internet. Determinadas actuaciones, como una transferencia económica, el borrado de información, el acceso a datos especialmente sensibles o cualquier acción con consecuencias importantes, deberían requerir autorización humana expresa.

A ello deberían sumarse registros completos de lo que hace el sistema, monitorización continua, límites operativos y mecanismos capaces de detenerlo inmediatamente cuando se detecte un comportamiento anómalo. «El verdadero riesgo no es que desaparezca el ser humano del proceso, sino que permanezca 'presente' pero deje de ejercer un control efectivo porque decline su responsabilidad en exceso sobre el sistema», advierte el experto. «Podemos delegar tareas, pero no deberíamos delegar la responsabilidad».

3Visitas

Inés Benítez

Autor

Redactora cultural

Inés Benítez cubre para Evolut actualidad, política, economía, sociedad y cultura. Su trabajo se centra en la verificación, el contexto y explicaciones claras para los lectores.

Seguir en Sociedad

  1. Jóvenes migrantes en Ceuta proyectan una imagen idílica de España en redes sociales que impulsa nuevas migraciones
  2. Dos estudiantes de la UPV ganan un premio nacional de IA con una herramienta para mejorar los trasplantes hepáticos
  3. Médicos españoles logran trasplantes sin rechazo ni inmunosupresión de por vida
  4. Grupo UAX abre el curso con casi 40.000 estudiantes y un nuevo centro universitario en Asturias