La familia de modelos multimodales Gemma 4 de Google DeepMind ha sido lanzada en Hugging Face, ofreciendo soporte para diversos agentes y bibliotecas de ajuste fino. Estos modelos destacan por ser completamente abiertos bajo licencias Apache 2, con puntuaciones de calidad elevadas y capacidades multimodales, incluyendo audio.
Gemma 4 se basa en avances de versiones anteriores y ha mostrado un rendimiento impresionante en pruebas, haciendo que encontrar ejemplos de ajuste fino adecuados sea un desafío, ya que funcionan excepcionalmente bien desde el inicio.
Características y Arquitectura
Gemma 4 admite entradas de imagen, texto y audio, generando respuestas de texto. La arquitectura incluye un decodificador de texto basado en el modelo Gemma, con soporte para ventanas de contexto largas. Las mejoras en el codificador de imágenes permiten manejar relaciones de aspecto variables y una cantidad configurable de entradas de tokens de imagen.
Los modelos de Gemma 4 están disponibles en cuatro tamaños, todos ajustados para tareas específicas:
| Modelo | Tamaño de Parámetro | Ventana de Contexto | Puntos de Control |
|---|---|---|---|
| Gemma 4 E2B | 2.3B efectivos, 5.1B con embeddings | 128k | base, IT |
| Gemma 4 E4B | 4.5B efectivos, 8B con embeddings | 128k | base, IT |
| Gemma 4 31B | 31B modelo denso | 256K | base, IT |
| Gemma 4 26B A4B | mezcla de expertos con 4B activados/26B totales | 256K | base, IT |
Capacidades Multimodales
Gemma 4 ofrece capacidades multimodales completas, destacándose en tareas como OCR, reconocimiento de voz y detección de objetos. También es capaz de realizar funciones de razonamiento y completar o corregir código.
Los ejemplos de inferencia demuestran el rendimiento de diferentes tamaños de modelo. Puedes ejecutarlos fácilmente con este cuaderno. Se invita a los usuarios a probar las demostraciones y compartir sus opiniones.


