Alibaba presentó Qwen3.8-Omni-Flash, un modelo que ve, escucha y actúa con 1 millón de tokens de contexto

Alibaba metió otra ficha fuerte en la carrera de la IA multimodal. Su equipo Qwen presentó Qwen3.8-Omni-Flash, un modelo que puede leer texto, mirar imágenes y video, y escuchar audio, todo en la misma conversación, para después devolver una respuesta en texto y, si hace falta, accionar herramientas externas por su cuenta.

El lanzamiento confirma que la pelea por los modelos que procesan varios tipos de contenido a la vez sigue escalando, con Google, OpenAI y Alibaba compitiendo cabeza a cabeza por quién ofrece más capacidad a menor costo.

La ficha técnica es la que más llama la atención: la ventana de contexto llega a 1 millón de tokens, entiende audio en 113 idiomas y dialectos, y puede procesar hasta dos horas de video o tres de audio de un tirón. Según los benchmarks que publicó la propia Alibaba, el modelo mejora en promedio más de un 25% respecto a su antecesor, Qwen3.5-Omni-Plus, en 29 pruebas distintas, y resuelve tareas de video con casi la mitad de tokens que antes. La compañía también asegura que en procesamiento de audio superó a Gemini 3.8 Flash de Google, aunque esa comparación todavía no fue confirmada por nadie afuera de Alibaba.

Más allá de los números, la apuesta es por los agentes: Qwen3.8-Omni-Flash está pensado para tareas como resumir una reunión larga, analizar un video de investigación, traducir contenido audiovisual o directamente coordinar otras herramientas para editar y generar material, todo activado por una sola instrucción. Por ahora solo está disponible por API, a través de Alibaba Cloud Model Studio y Qwen Studio, con un costo de 0,15 dólares por millón de tokens de entrada y 0,47 por millón de salida.

El lanzamiento confirma que la pelea por los modelos que procesan varios tipos de contenido a la vez sigue escalando, con Google, OpenAI y Alibaba compitiendo cabeza a cabeza por quién ofrece más capacidad a menor costo.

Alibaba presentó Qwen3.8-Omni-Flash, un modelo que ve, escucha y actúa con 1 millón de tokens de contexto
CATEGORIES

COMMENTS

Wordpress (0)
Disqus ( )