El gigante tecnológico Google ha presentado Gemma 4, una nueva familia de modelos de IA que representa un avance significativo dentro de su estrategia de código abierto. Esta nueva generación, a diferencia de su línea propietaria Gemini 3, se lanza bajo la licencia de software Apache 2.0 totalmente permisiva, lo que permite que se utilice con fines comerciales sin limitaciones.
La nueva familia Gemma 4 llega en cuatro tamaños distintos, diseñados para adaptarse a una variedad de entornos, desde estaciones de trabajo hasta dispositivos móviles. Todos los modelos son multimodales y pueden procesar texto, imágenes y video de manera nativa. Además, se han entrenado en más de 140 idiomas. Asimismo, Google ha centrado su atención en la eficiencia, mejorando estos modelos para que operen en una extensa gama de hardware, desde dispositivos Android hasta GPUs sofisticadas.
Uno de los aspectos más diferenciales es su enfoque en flujos de trabajo basados en agentes. Los modelos incluyen soporte nativo para llamadas a funciones, salida estructurada en JSON e instrucciones de sistema. Esto permite a los desarrolladores crear agentes de IA autónomos capaces de realizar tareas complejas e interactuar localmente con APIs externas.
En términos de rendimiento, los modelos más avanzados de esta familia se encuentran entre los más destacados en el ecosistema de código abierto. Las versiones de mayor tamaño pueden ejecutarse en hardware de alto nivel como la NVIDIA H100. Por su lado, el modelo 26B, basado en la arquitectura Mixture of Experts, está optimizado para usar solo la parte de sus capacidades necesarias en cada momento. Esto permite generar respuestas de forma mucho más rápida y eficiente, incluso en hardware limitado.
La multimodalidad es otro de los fundamentos esenciales. Los nuevos modelos, siguiendo el desarrollo de versiones previas como Gemma 3n, mejoran las capacidades al incluir procesamiento de video e imagen más sofisticado. En el caso de los modelos de borde, además añaden entrada de audio nativa para reconocer la voz en tiempo real. Las versiones más grandes de estos modelos, además, ofrecen ventanas de contexto que alcanzan hasta 256 KB.
Además, Gemma 4 es compatible con herramientas fundamentales del ecosistema de desarrollo como Ollama, Hugging Face y vLLM. Asimismo, se ha optimizado para utilizar hardware de empresas como MediaTek, NVIDIA, Qualcomm y AMD. Además, está capacitado para integrarse en contextos móviles mediante AICore, en línea con los futuros avances del ecosistema Gemini.


