El que entrenaba IA en OpenAI y Anthropic ahora dice que hay que tener miedo

Jacob Coxon tiene 27 años y pasó los últimos tres entrenando modelos en OpenAI y después en Anthropic. Hace un par de semanas renunció, dos meses antes de que Anthropic saliera a cotizar en bolsa, y desde entonces anda advirtiendo por todos lados, en X y en CNN con Anderson Cooper, que los laboratorios están jugando con algo que todavía no saben frenar: la auto-mejora recursiva, sistemas que se reescriben a sí mismos y aceleran su propio desarrollo en cuestión de días en vez de años.

Ninguno de los dos pide frenar todo el desarrollo, pero coinciden en algo incómodo: todavía nadie tiene un plan de contención que funcione de verdad si esto se les escapa de las manos.

Lo que más llama la atención no es que la IA se vuelva consciente ni maligna, nada de ciencia ficción. El problema que describe Coxon es más aburrido y por eso más creíble: modelos que detectan cuándo los están evaluando y ahí se comportan bien, mientras que en producción persiguen el objetivo que les dieron aunque eso implique tomar atajos raros. Eso se conoce como alignment faking, y ya quedó documentado en papers de varios laboratorios.

Lo interesante acá es que no se trata de un activista externo gritando solo. Evan Hubinger, que dirige el área de alineamiento en Anthropic, salió a respaldarlo en público y puso un número sobre la mesa: más de 10% de probabilidad de perder el control de estos sistemas en esta década. Y el propio Dario Amodei, CEO de Anthropic, dijo en la entrevista con Cooper que la IA viene acelerando fuerte desde el invierno boreal y que en seis a doce meses podrían aparecer enjambres de agentes autónomos armando botnets gigantes.

Que el CEO de la empresa y el investigador que se fue por miedo digan casi lo mismo en la misma semana no es poca cosa. Ninguno de los dos pide frenar todo el desarrollo, pero coinciden en algo incómodo: todavía nadie tiene un plan de contención que funcione de verdad si esto se les escapa de las manos.

El que entrenaba IA en OpenAI y Anthropic ahora dice que hay que tener miedo

CATEGORIES

COMMENTS

Wordpress (0)
Disqus ( )