Alibaba lanza Qwen3.5, un modelo avanzado para agentes multimodales

Alibaba ha presentado la nueva serie de código abierto Qwen3.5, diseñada para agentes multimodales nativos. Este modelo, con aproximadamente 400B de parámetros, es un modelo de visión-lenguaje (VLM) que incorpora razonamiento y utiliza una arquitectura híbrida de mezcla de expertos (MoE) y Redes Delta Gated. Qwen3.5 tiene la capacidad de comprender y navegar interfaces de usuario, superando así a la generación anterior de VLMs.

Este modelo es ideal para una variedad de aplicaciones, que incluyen:

  • Programación, incluyendo desarrollo web
  • Razonamiento visual, aplicable a interfaces móviles y web
  • Aplicaciones de chat
  • Búsquedas complejas
Qwen3.5
Modalidades Visión, lenguaje
Total de parámetros 397B
Parámetros activos 17B
Tasa de activación 4.28%
Longitud del contexto de entrada 256K ampliable a 1M tokens
Idiomas soportados Más de 200
Información adicional de configuración
Expertos 512
Expertos compartidos 1
Expertos por token 11 (10 enrutados + 1 compartido)
Capas 60
Palabras (vocabulario) 248,320
Tabla 1. Especificaciones y detalles de configuración del modelo Qwen3.5

Construcción con endpoints de NVIDIA

Hoy puedes comenzar a construir con Qwen3.5 mediante el acceso gratuito a endpoints acelerados por GPU en build.nvidia.com, impulsados por GPUs NVIDIA Blackwell. Como parte del Programa para Desarrolladores de NVIDIA, puedes explorar rápidamente en el navegador, experimentar con prompts y probar el modelo con tus propios datos para evaluar su rendimiento en situaciones reales.

Además, puedes utilizar el modelo alojado por NVIDIA a través de la API, que es gratuita con la registración en el Programa para Desarrolladores de NVIDIA. 

 import requests invoke_url = "https://integrate.api.nvidia.com/v1/chat/completions" headers = { "Authorization": "Bearer $NVIDIA_API_KEY", "Accept": "application/json", } payload = { "messages": [ { "role": "user", "content": "" } ], "model": "qwen/qwen3.5-397b-a17b", "chat_template_kwargs": { "thinking": True }, "frequency_penalty": 0, "max_tokens": 16384, "presence_penalty": 0, "stream": True, "temperature": 1, "top_p": 1 } # reutilizar conexiones session = requests.Session() response = session.post(invoke_url, headers=headers, json=payload) response.raise_for_status() response_body = response.json() print(response_body) 

Para aprovechar la llamada a herramientas, simplemente define un array de herramientas compatibles con OpenAI para añadir al parámetro tools de chat completions.

Personaliza con NVIDIA NeMo  

Aunque Qwen3.5 ofrece capacidades multimodales impresionantes de manera “listo para usar”, el framework NVIDIA NeMo proporciona herramientas esenciales para adaptarlo a necesidades específicas de dominio. Utilizando la biblioteca NeMo Automodel, los desarrolladores pueden ajustar la arquitectura de 397B parámetros de Qwen3.5 con alta eficiencia de rendimiento.

NeMo Automodel es una biblioteca de entrenamiento nativa de PyTorch que ofrece soporte inmediato de Hugging Face, permitiendo el entrenamiento directo en checkpoints existentes sin conversiones tediosas. Esto facilita la experimentación rápida, ya sea realizando un ajuste fino supervisado completo (SFT) o utilizando métodos eficientes en memoria como LoRA.

Comienza con Qwen3.5 

Desde implementaciones en centros de datos en NVIDIA Blackwell hasta servicios microservicios NVIDIA NIM para implementaciones en cualquier lugar, NVIDIA ofrece soluciones para integrar Qwen3.5. Para comenzar, visita la página del modelo Qwen3.5 en Hugging Face y prueba Qwen3.5 en build.nvidia.com.

Ilustración de un hombre mayor con auriculares y chaqueta