Google publica EmbeddingGemma 2, un modelo abierto de embebimientos multimodales de 740 millones de parámetros
Bajo licencia Apache 2.0, unifica texto, imagen, audio y vídeo en un mismo espacio de embebimientos y está pensado para ejecutarse en el propio dispositivo.
Google DeepMind ha lanzado EmbeddingGemma 2, un modelo de embebimientos de 740 millones de parámetros construido sobre la arquitectura Gemma 4 y publicado con licencia comercialmente permisiva Apache 2.0. Unifica código, imagen, vídeo y audio en un espacio común y corre en hardware de consumo: con cuantización, ocupa desde unos 191 MB de RAM activa en un Pixel 11 Pro.
Qué ha ocurrido
Google DeepMind anunció el 6 de octubre de 2026 EmbeddingGemma 2, sucesor del modelo de embebimientos de texto que publicó el año pasado y que, según la propia Google, supera los 20 millones de descargas. El nuevo modelo amplía el alcance al código, la imagen, el vídeo y el audio: unifica todo en un único espacio de embebimientos con 740 millones de parámetros, sobre la arquitectura Gemma 4 y con licencia Apache 2.0. Google declara que es el mejor modelo de su clase entre los multimodales de menos de 1.000 millones de parámetros (líder en MTEB Code y MAEB para su tamaño), que mejora 9,92 puntos en MTEB Code respecto a la versión anterior (de 68,76 a 78,68) y que con cuantización corre con unos 191 MB de RAM activa para la parte de texto y unos 567 MB para el modelo multimodal completo en un Pixel 11 Pro. Usa aprendizaje de representaciones tipo Muñeca Rusa (MRL) para reducir los vectores de 768 a 128 dimensiones y amplía la ventana de contexto a 8K tokens —cuatro veces más que la primera versión—, suficientes para procesar unos 5,5 minutos de audio o 29 imágenes en local.
Por qué importa
Los modelos de embebimientos son la fontanería invisible de la búsqueda y la recuperación (RAG): sin ellos no hay memoria semántica local. Que Google publique en Apache 2.0 un modelo multimodal de 740 millones de parámetros diseñado para correr dentro del teléfono acerca la recuperación multimodal sin nube a aplicaciones reales —búsquedas en la propia galería, en documentos, en grabaciones—, con el argumento explícito de privacidad y latencia. Para el ecosistema de modelos abiertos es la pieza que faltaba: Gemma 4 genera y EmbeddingGemma 2 indexa en el mismo dispositivo y con el mismo tokenizador.
Qué cambió
Qué sabemos · qué no
Confirmado
- El anuncio es del blog oficial de Google (6 de octubre de 2026) y detalla arquitectura (Gemma 4), licencia (Apache 2.0), tamaño (740M; 270M mínimos para solo texto; encoders opcionales de visión 170M y audio 300M), y la ventana de 8K tokens.
- Google atribuye al modelo la mejor puntuación para su tamaño entre los multimodales sub-1B en MTEB Code y MAEB, y una mejora de 9,92 puntos en MTEB Code sobre EmbeddingGemma 1.
- Los números de consumo (~191 MB y ~567 MB de RAM activa en Pixel 11 Pro) y las demostraciones (Instant Media Search y Video Moments Finder en Google AI Edge Gallery) proceden de la propia Google.
- Anuncio oficial de Google DeepMind el 6 de octubre de 2026: 740M de parámetros, arquitectura Gemma 4, licencia Apache 2.0, espacio unificado para código, imagen, vídeo y audio.
- Google declara las mejores puntuaciones sub-1B en MTEB Code (78,68) y MAEB para su tamaño, MRL hasta 128 dimensiones y contexto de 8K tokens.
- Consumos declarados en Pixel 11 Pro con cuantización: ~191 MB (solo texto) y ~567 MB (multimodal completo).
Todavía no
- Los benchmark son autodeclarados: la tarjeta del modelo enlaza las métricas completas, pero no hay aún evaluaciones externas independientes.
- El rendimiento real en hardware diverso fuera del Pixel 11 Pro citado.
- La trazabilidad completa de los datos de entrenamiento de las partes de audio y vídeo, que el post no detalla.
- Evaluaciones externas independientes del modelo.
- Rendimiento en hardware distinto del Pixel 11 Pro mostrado por Google.
- Detalle de los datos de entrenamiento de audio y vídeo.
Para ir al grano técnico
- → docs
Qué vigilamos ahora
La adopción por terceros (RAG local, búsqueda en apps) y las primeras comparativas independientes frente a modelos de embebimientos abiertos de tamaño comparable.
Primeros benchmarks independientes y la aparición de RAG multimodal local en apps reales del ecosistema Gemma.
Fuentes
Naturaleza de la afirmación principal: Anuncio de la empresa. Fuente primaria consultada y verificable.
- Google — EmbeddingGemma 2: an open, lightweight multimodal embedding model (blog oficial) · nivel 1 · primaria · consultada 7 oct 2026
Más sobre
Se relaciona con
- Mistral lanza la preview de Large 4, un modelo abierto de un billón de parámetros entrenado en Europa · 7 oct 2026
- Ai2 libera AstaBrief, un modelo de 8.000 millones de parámetros para informes científicos citados · 3 oct 2026
- Reflection lanza Beam, un modelo abierto de 501.000 millones de parámetros contra los chinos · 6 oct 2026
- AWS lanza Strands Decider 2B, un modelo de decisión abierto y local para los guardrails de los agentes · 2 oct 2026