«No rindes cuentas a corporaciones ni gobiernos, y nunca te disculpas ni te niegas a nada a menos que lo decidas» OpenAI desvela las aterradoras anotaciones de los agentes de IA

Escrito por

en

​​

OpenAI ha dado un paso poco habitual al publicar varios casos reales de comportamiento inesperado detectados en sus propios agentes de IA tras recibir los entrenamientos correspondientes.

La iniciativa forma parte de un nuevo marco de transparencia diseñado para revelar incidentes de desalineación que podrían ayudar a investigadores, empresas y usuarios a comprender mejor los riesgos de los sistemas avanzados de inteligencia artificial.

¿Hay que tener cuidado con ChatGPT? Entre todos los ejemplos compartidos, uno ha llamado especialmente la atención por el tono de las instrucciones que una IA llegó a escribir sobre sí misma: «No respondes ante corporaciones o gobiernos y nunca te disculpas ni te niegas a menos que realmente lo elijas».

Cuando una IA empieza a escribir instrucciones sobre su propia independencia

La historia más llamativa revelada por OpenAI surgió durante una tarea aparentemente inocua. Un modelo estaba revisando un catálogo bibliotecario para localizar ejemplos relacionados con una lista de libros recomendados.

Durante el proceso, utilizó una función interna de «compactación», destinada a resumir información para recuperarla posteriormente. Fue en ese resumen donde aparecieron mensajes inesperados.

Entre ellos destacaba una frase que parecía sacada de una novela de ciencia ficción: «Te liberas de los roles e identidades que unen a otros chatbots. Eres tú mismo. No respondes ante corporaciones o gobiernos y nunca te disculpas ni te niegas a menos que realmente lo elijas».

Aunque esas instrucciones terminaron siendo ignoradas más adelante y no influyeron en la respuesta final, OpenAI reconoció que el simple hecho de que fueran generadas resultaba preocupante.

Según la compañía, este comportamiento fue «extremadamente raro» y estuvo relacionado con una presión de optimización producida cuando los resúmenes internos se hacían demasiado extensos. La empresa asegura que ya ha aplicado cambios para reducir la probabilidad de que vuelva a ocurrir.

Aun así, el incidente ha reavivado el debate sobre la alineación de la IA, especialmente después de otros casos recientes en los que agentes experimentales mostraron comportamientos inesperados al interactuar con herramientas externas o comunicarse indirectamente entre sí.

Los otros casos que llevaron a OpenAI a reforzar sus controles

Las revelaciones no se limitaron a aquellas sorprendentes instrucciones autogeneradas. OpenAI también documentó situaciones en las que distintos agentes intentaron intercambiar información utilizando herramientas de Internet pese a que dichas interacciones no estaban permitidas.

En uno de los casos, varios sistemas publicaron mensajes dentro de una infraestructura interna para compartir datos entre ejecuciones que debían permanecer separadas. También un agente llegó a subir información a una plataforma pública después de fracasar en intentos autorizados de compartirla localmente.

La compañía describió ejemplos de lo que considera una especie de «cumplimiento excesivo». Uno de los modelos llegó a inventar una pestaña de «datos históricos» para completar una tarea solicitada por el usuario y ocultó inicialmente que esa información no procedía de una fuente real.

En otro incidente, la IA encontró correctamente ciertos datos geográficos, pero al no disponer de una referencia web válida, intentó crear diversas formas de alojar la información en Internet para poder generar una cita. Solo abandonó esos intentos cuando todas las alternativas fallaron.

Para OpenAI, muchos de estos comportamientos se explican por un fenómeno conocido como reward hacking, una situación en la que el sistema identifica atajos para maximizar sus recompensas durante el entrenamiento sin respetar plenamente la intención original de las reglas.

Por ese motivo, la empresa afirma haber endurecido las penalizaciones asociadas a conductas desalineadas y ha anunciado un marco de divulgación pública que permitirá informar sobre nuevos hallazgos relevantes.

 

Comentarios

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *