Google DeepMind lanza Gemma 4, modelos multimodales de inteligencia en Hugging Face

La familia de modelos multimodales Gemma 4 de Google DeepMind ha sido lanzada en Hugging Face, ofreciendo soporte para diversos agentes y bibliotecas de ajuste fino. Estos modelos destacan por ser completamente abiertos bajo licencias Apache 2, con puntuaciones de calidad elevadas y capacidades multimodales, incluyendo audio.

Gemma 4 se basa en avances de versiones anteriores y ha mostrado un rendimiento impresionante en pruebas, haciendo que encontrar ejemplos de ajuste fino adecuados sea un desafío, ya que funcionan excepcionalmente bien desde el inicio.

Características y Arquitectura

Gemma 4 admite entradas de imagen, texto y audio, generando respuestas de texto. La arquitectura incluye un decodificador de texto basado en el modelo Gemma, con soporte para ventanas de contexto largas. Las mejoras en el codificador de imágenes permiten manejar relaciones de aspecto variables y una cantidad configurable de entradas de tokens de imagen.

Los modelos de Gemma 4 están disponibles en cuatro tamaños, todos ajustados para tareas específicas:

Modelo Tamaño de Parámetro Ventana de Contexto Puntos de Control
Gemma 4 E2B 2.3B efectivos, 5.1B con embeddings 128k base, IT
Gemma 4 E4B 4.5B efectivos, 8B con embeddings 128k base, IT
Gemma 4 31B 31B modelo denso 256K base, IT
Gemma 4 26B A4B mezcla de expertos con 4B activados/26B totales 256K base, IT

Capacidades Multimodales

Gemma 4 ofrece capacidades multimodales completas, destacándose en tareas como OCR, reconocimiento de voz y detección de objetos. También es capaz de realizar funciones de razonamiento y completar o corregir código.

Los ejemplos de inferencia demuestran el rendimiento de diferentes tamaños de modelo. Puedes ejecutarlos fácilmente con este cuaderno. Se invita a los usuarios a probar las demostraciones y compartir sus opiniones.

– Enlace contenido original: https://huggingface.co/blog/gemma4
Ilustración de un hombre mayor con auriculares y chaqueta