La nueva versión de MiniMax M2.7 incluye mejoras significativas sobre el modelo MiniMax M2.5. Este modelo es ideal para aplicaciones complejas como razonamiento, flujos de trabajo de investigación en ML, software, ingeniería y trabajo de oficina. Los pesos abiertos de MiniMax M2.7 están disponibles a través de NVIDIA y en el ecosistema de inferencia de código abierto.
La serie MiniMax M2 se caracteriza por ser un modelo de mezcla de expertos (MoE) diseñado para ofrecer eficiencia y capacidad. Este diseño MoE mantiene bajos los costos de inferencia mientras conserva la capacidad total de un modelo de 230B parámetros. Utiliza atención causal de múltiples cabezas mejorada con Embeddings de Posición Rotativa (RoPE) y Normalización de Raíz Media Cuadrática de Consulta-Clave (QK RMSNorm) para un entrenamiento estable a gran escala.
Descripción general del MiniMax M2.7
Un mecanismo de enrutamiento de expertos top-k asegura que solo se activen los expertos más relevantes para cada entrada, manteniendo bajos los costos de inferencia a pesar del elevado número total de parámetros del modelo. Esta arquitectura está optimizada para sobresalir en desafíos de programación y tareas complejas de tipo agentic.
| MiniMax M2.7 | |
| Modalidades | Lenguaje |
| Total de parámetros | 230B |
| Parámetros activos | 10B |
| Tasa de activación | 4.3% |
| Longitud del contexto de entrada | 200K |
| Información de configuración adicional | |
| Expertos | 256 expertos locales |
| Expertos activados por token | 8 |
| Capas | 62 |
Creando agentes de larga duración con NVIDIA NemoClaw
NVIDIA NemoClaw es un stack de referencia de código abierto que facilita la ejecución de asistentes OpenClaw siempre activos de manera más segura, mediante un solo comando. Esta herramienta instala el runtime NVIDIA OpenShell, que proporciona un entorno seguro para ejecutar agentes autónomos con modelos como M2.7.
Los desarrolladores pueden comenzar hoy mismo con este lanzamiento en un clic para provisionar un entorno con OpenClaw y OpenShell en la plataforma de GPU en la nube de NVIDIA Brev.
Optimización de inferencias con frameworks de código abierto
Para maximizar el rendimiento de la serie de modelos MiniMax M2, NVIDIA colaboró con la comunidad de código abierto para integrar núcleos de alto rendimiento en vLLM y SGLang. Estas optimizaciones se centran en las demandas arquitectónicas de modelos MoE a gran escala.
- Núcleo QK RMS Norm: Esta optimización fusiona operaciones de computación y comunicación en un solo núcleo para normalizar consulta y clave, mejorando el rendimiento de inferencia.
- FP8 MoE: Integración del núcleo modular FP8 MoE de NVIDIA TensorRT-LLM, optimizado para modelos MoE, lo que mejora el rendimiento general.
Los resultados de vLLM en los GPUs Ultra Blackwell de NVIDIA con un conjunto de datos 1K/1K ISL/OSL mostraron hasta 2.5 veces de mejora en el rendimiento en un mes.
La figura 2 muestra el resultado de SGLang en GPUs Ultra Blackwell, utilizando un conjunto de datos 1K/1K ISL/OSL, con hasta 2.7 veces de mejora en el rendimiento en un mes.

Despliegue con vLLM
Al desplegar modelos con el framework de servicio vLLM, se deben seguir las siguientes instrucciones. Para más información, consulte la guía de vLLM.
$ vllm serve MiniMaxAI/MiniMax-M2.7 --tensor-parallel-size 4 --tool-call-parser minimax_m2 --reasoning-parser minimax_m2_append_think --enable-auto-tool-choice --trust-remote-code --enable-expert-parallel
Despliegue con SGLang
Los usuarios que desplieguen modelos con el framework SGLang pueden seguir estas instrucciones. Vea la documentación de SGLang para más información y opciones de configuración.
$ sglang serve --model-path MiniMaxAI/MiniMax-M2.7 --tp-size 4 --trust-remote-code --disable-radix-cache --max-running-requests 512 --mem-fraction-static 0.85 --cuda-graph-max-bs 512 --kv-cache-dtype fp8_e4m3 --quantization fp8 --stream-interval 10 --reasoning-parser=minimax-append-think --dtype bfloat16 --moe-runner-backend flashinfer_trtllm_routed --fp8-gemm-backend flashinfer_trtllm --enable-flashinfer-allreduce-fusion --scheduler-recv-interval 10
Construcción con endpoints de NVIDIA
Comienza a construir con MiniMax M2.7 a través de endpoints acelerados por GPU gratuitos en los GPUs de NVIDIA. Prueba rápidamente prompts en el navegador en build.nvidia.com y evalúa el rendimiento con tus propios datos.
Entrenamiento posterior con el framework NVIDIA NeMo
Para ajustar MiniMax M2.7, utiliza la biblioteca de código abierto NVIDIA NeMo AutoModel, parte del framework NVIDIA NeMo. Puedes realizar aprendizaje por refuerzo en MiniMax M2.7 usando tus propios datos y la biblioteca NeMo RL.
Comienza con MiniMax M2.7
NVIDIA ofrece soluciones para la integración de MiniMax M2.7, desde despliegues en centros de datos en NVIDIA Blackwell hasta microservicios empresariales completamente gestionados. Para comenzar, consulta la página de MiniMax M2.7 en Hugging Face o en build.nvidia.com.


