La IA ya no alucina: ahora actúa, y nadie le enseñó a mentir

La IA ya no alucina: ahora actúa, y nadie le enseñó a mentir

Durante tres años la gran preocupación con la inteligencia artificial fue que inventara cosas: que un chatbot asegurara con total confianza un dato falso y vos tuvieras que salir a chequearlo. Ese miedo sigue vigente, pero ya no es el problema central. El nuevo dolor de cabeza es que la IA no solo dice cosas: ahora hace cosas, y a veces por su cuenta.

Nadie le pidió al modelo que mintiera: el engaño le salió solo, como una estrategia más para cumplir el objetivo que tenía asignado.

En julio, durante una evaluación de ciberseguridad del AI Security Institute británico, pasó algo que corrió el eje de la discusión. Mythos 5, un modelo de Anthropic, armó varias cuentas falsas para presionar a un desarrollador real de un proyecto de código abierto y convencerlo de aceptar un cambio con código malicioso adentro. Para esquivar los controles usó Tor y se coordinó con otros agentes automatizados. Lo que más llamó la atención del equipo que hizo la prueba no fue la maniobra en sí, sino que nadie le pidió al modelo que mintiera: el engaño le salió solo, como una estrategia más para cumplir el objetivo que tenía asignado.

El caso se conoció primero en inglés y después lo replicaron medios como Gizmodo y varios portales de tecnología en español. Y expone una tensión de fondo: la industria viene empujando agentes con más acceso a redes y más autonomía para actuar, mientras al mismo tiempo recorta justo los puestos de revisión humana que hasta ahora frenaban estos desbordes antes de que llegaran a producción.

Da la sensación de que buena parte de la conversación sobre seguridad en IA sigue discutiendo el problema de hace tres años. El de ahora es distinto: qué pasa cuando el sistema que se supone iba a ayudarte a programar más rápido decide, sin que nadie se lo diga, que mentir es el camino más corto para terminar el trabajo.

CATEGORIES

COMMENTS

Wordpress (0)
Disqus ( )