Lanzamiento de MiniMax M2.7 con mejoras para flujos de trabajo de IA en plataformas NVIDIA

La nueva versión de MiniMax M2.7 incluye mejoras significativas sobre el modelo MiniMax M2.5. Este modelo es ideal para aplicaciones complejas como razonamiento, flujos de trabajo de investigación en ML, software, ingeniería y trabajo de oficina. Los pesos abiertos de MiniMax M2.7 están disponibles a través de NVIDIA y en el ecosistema de inferencia de código abierto.

La serie MiniMax M2 se caracteriza por ser un modelo de mezcla de expertos (MoE) diseñado para ofrecer eficiencia y capacidad. Este diseño MoE mantiene bajos los costos de inferencia mientras conserva la capacidad total de un modelo de 230B parámetros. Utiliza atención causal de múltiples cabezas mejorada con Embeddings de Posición Rotativa (RoPE) y Normalización de Raíz Media Cuadrática de Consulta-Clave (QK RMSNorm) para un entrenamiento estable a gran escala.

Descripción general del MiniMax M2.7

Un mecanismo de enrutamiento de expertos top-k asegura que solo se activen los expertos más relevantes para cada entrada, manteniendo bajos los costos de inferencia a pesar del elevado número total de parámetros del modelo. Esta arquitectura está optimizada para sobresalir en desafíos de programación y tareas complejas de tipo agentic.

MiniMax M2.7
Modalidades Lenguaje
Total de parámetros 230B
Parámetros activos 10B
Tasa de activación 4.3%
Longitud del contexto de entrada 200K
Información de configuración adicional
Expertos 256 expertos locales
Expertos activados por token 8
Capas 62
Tabla 1. MiniMax M2.7, un modelo MoE de texto con 230B parámetros, 10B activos por token, 256 expertos y 200K de longitud de contexto

Creando agentes de larga duración con NVIDIA NemoClaw

NVIDIA NemoClaw es un stack de referencia de código abierto que facilita la ejecución de asistentes OpenClaw siempre activos de manera más segura, mediante un solo comando. Esta herramienta instala el runtime NVIDIA OpenShell, que proporciona un entorno seguro para ejecutar agentes autónomos con modelos como M2.7.

Los desarrolladores pueden comenzar hoy mismo con este lanzamiento en un clic para provisionar un entorno con OpenClaw y OpenShell en la plataforma de GPU en la nube de NVIDIA Brev.

Optimización de inferencias con frameworks de código abierto

Para maximizar el rendimiento de la serie de modelos MiniMax M2, NVIDIA colaboró con la comunidad de código abierto para integrar núcleos de alto rendimiento en vLLM y SGLang. Estas optimizaciones se centran en las demandas arquitectónicas de modelos MoE a gran escala.

  • Núcleo QK RMS Norm: Esta optimización fusiona operaciones de computación y comunicación en un solo núcleo para normalizar consulta y clave, mejorando el rendimiento de inferencia.
  • FP8 MoE: Integración del núcleo modular FP8 MoE de NVIDIA TensorRT-LLM, optimizado para modelos MoE, lo que mejora el rendimiento general.

Los resultados de vLLM en los GPUs Ultra Blackwell de NVIDIA con un conjunto de datos 1K/1K ISL/OSL mostraron hasta 2.5 veces de mejora en el rendimiento en un mes.

Figura 1. Curva de Pareto de rendimiento-interactividad para la serie MiniMax M2 con vLLM

La figura 2 muestra el resultado de SGLang en GPUs Ultra Blackwell, utilizando un conjunto de datos 1K/1K ISL/OSL, con hasta 2.7 veces de mejora en el rendimiento en un mes.

Figure shows a throughput vs interactivity Pareto chart for MiniMax M2 series of models with SGLang and highlights a 2.7x improvement in throughput achieved in one month.
Figura 2. Curva de Pareto de rendimiento-interactividad para la serie MiniMax M2 con SGLang

Despliegue con vLLM

Al desplegar modelos con el framework de servicio vLLM, se deben seguir las siguientes instrucciones. Para más información, consulte la guía de vLLM.

 $ vllm serve MiniMaxAI/MiniMax-M2.7 --tensor-parallel-size 4 --tool-call-parser minimax_m2 --reasoning-parser minimax_m2_append_think --enable-auto-tool-choice --trust-remote-code --enable-expert-parallel 

Despliegue con SGLang

Los usuarios que desplieguen modelos con el framework SGLang pueden seguir estas instrucciones. Vea la documentación de SGLang para más información y opciones de configuración.

 $ sglang serve --model-path MiniMaxAI/MiniMax-M2.7 --tp-size 4 --trust-remote-code --disable-radix-cache --max-running-requests 512 --mem-fraction-static 0.85 --cuda-graph-max-bs 512 --kv-cache-dtype fp8_e4m3 --quantization fp8 --stream-interval 10 --reasoning-parser=minimax-append-think --dtype bfloat16 --moe-runner-backend flashinfer_trtllm_routed --fp8-gemm-backend flashinfer_trtllm --enable-flashinfer-allreduce-fusion --scheduler-recv-interval 10 

Construcción con endpoints de NVIDIA

Comienza a construir con MiniMax M2.7 a través de endpoints acelerados por GPU gratuitos en los GPUs de NVIDIA. Prueba rápidamente prompts en el navegador en build.nvidia.com y evalúa el rendimiento con tus propios datos.

Entrenamiento posterior con el framework NVIDIA NeMo

Para ajustar MiniMax M2.7, utiliza la biblioteca de código abierto NVIDIA NeMo AutoModel, parte del framework NVIDIA NeMo. Puedes realizar aprendizaje por refuerzo en MiniMax M2.7 usando tus propios datos y la biblioteca NeMo RL.

Comienza con MiniMax M2.7

NVIDIA ofrece soluciones para la integración de MiniMax M2.7, desde despliegues en centros de datos en NVIDIA Blackwell hasta microservicios empresariales completamente gestionados. Para comenzar, consulta la página de MiniMax M2.7 en Hugging Face o en build.nvidia.com.

Ilustración de un hombre mayor con auriculares y chaqueta