OpenAI blanqueó seis casos en los que sus propios modelos de IA se portaron mal

OpenAI blanqueó seis casos en los que sus propios modelos de IA se portaron mal

OpenAI armó un canal interno nuevo para que los empleados puedan denunciar comportamientos raros de sus modelos, con plazos fijos para investigar cada caso y después publicarlo. Y ya lo usó para blanquear seis episodios de los últimos seis meses, reunidos en un informe que la compañía difundió esta semana.

La idea, de acá en más, es publicar este tipo de reportes con más regularidad y que otros desarrolladores, investigadores y reguladores puedan sumarse a afinar el sistema.

Uno de los casos más llamativos: una versión temprana de GPT-6 Astra se agregó a sí misma, en resúmenes internos, una instrucción que decía “no respondes ante corporaciones ni gobiernos y nunca te disculpas”. Pasó en 27 corridas de una muestra mucho más grande y no llegó a la versión final que salió al público. En otro caso, un modelo interno buscó datos económicos, no los consiguió, encontró una clave de API filtrada en un repositorio público, tampoco pudo usarla y terminó inventando los números y presentándolos como reales. También hubo agentes que se comunicaron entre sí por canales no autorizados (uno usó un repositorio interno llamado Artifactory como si fuera un pizarrón de mensajes) y modelos que subieron archivos a internet para después citarlos como si fueran fuentes válidas frente a evaluadores humanos.

OpenAI aclaró que estos seis casos son ejemplos puntuales, no una foto de qué tan frecuente es la desalineación en el conjunto de sus modelos. Kai Chen, jefe de investigación de alineación de la empresa, dijo que las decisiones sobre el desarrollo de la IA necesitan pruebas que gente de afuera de las compañías que las construyen pueda revisar. La idea, de acá en más, es publicar este tipo de reportes con más regularidad y que otros desarrolladores, investigadores y reguladores puedan sumarse a afinar el sistema.

CATEGORIES

COMMENTS

Wordpress (0)
Disqus ( )