Saltar al contenido
SEÑALIA sin ruido
2026-10-09Edición diaria · fuentes primarias y nivel de confianza en cada pieza
ModelosAnuncio de la empresaConfianza altaImportancia ●●●○○ 3/5

Google publica EmbeddingGemma 2, un modelo abierto de embebimientos multimodales de 740 millones de parámetros

Bajo licencia Apache 2.0, unifica texto, imagen, audio y vídeo en un mismo espacio de embebimientos y está pensado para ejecutarse en el propio dispositivo.

Redacción automática SEÑALmiércoles, 7 de octubre de 2026 · 09:08El hecho: 6 oct 2026Noticia · 2 min de lecturaNivel: especializado

Google DeepMind ha lanzado EmbeddingGemma 2, un modelo de embebimientos de 740 millones de parámetros construido sobre la arquitectura Gemma 4 y publicado con licencia comercialmente permisiva Apache 2.0. Unifica código, imagen, vídeo y audio en un espacio común y corre en hardware de consumo: con cuantización, ocupa desde unos 191 MB de RAM activa en un Pixel 11 Pro.

Qué ha ocurrido

Google DeepMind anunció el 6 de octubre de 2026 EmbeddingGemma 2, sucesor del modelo de embebimientos de texto que publicó el año pasado y que, según la propia Google, supera los 20 millones de descargas. El nuevo modelo amplía el alcance al código, la imagen, el vídeo y el audio: unifica todo en un único espacio de embebimientos con 740 millones de parámetros, sobre la arquitectura Gemma 4 y con licencia Apache 2.0. Google declara que es el mejor modelo de su clase entre los multimodales de menos de 1.000 millones de parámetros (líder en MTEB Code y MAEB para su tamaño), que mejora 9,92 puntos en MTEB Code respecto a la versión anterior (de 68,76 a 78,68) y que con cuantización corre con unos 191 MB de RAM activa para la parte de texto y unos 567 MB para el modelo multimodal completo en un Pixel 11 Pro. Usa aprendizaje de representaciones tipo Muñeca Rusa (MRL) para reducir los vectores de 768 a 128 dimensiones y amplía la ventana de contexto a 8K tokens —cuatro veces más que la primera versión—, suficientes para procesar unos 5,5 minutos de audio o 29 imágenes en local.

Por qué importa

Los modelos de embebimientos son la fontanería invisible de la búsqueda y la recuperación (RAG): sin ellos no hay memoria semántica local. Que Google publique en Apache 2.0 un modelo multimodal de 740 millones de parámetros diseñado para correr dentro del teléfono acerca la recuperación multimodal sin nube a aplicaciones reales —búsquedas en la propia galería, en documentos, en grabaciones—, con el argumento explícito de privacidad y latencia. Para el ecosistema de modelos abiertos es la pieza que faltaba: Gemma 4 genera y EmbeddingGemma 2 indexa en el mismo dispositivo y con el mismo tokenizador.

Qué cambió

AntesLos embebimientos multimodales de calidad exigían modelos en la nube o pesos mucho mayores; EmbeddingGemma 1 solo cubría texto.
AhoraUn modelo abierto de 740M con licencia Apache 2.0 unifica texto, código, imagen, audio y vídeo y corre en un móvil.
ConsecuenciaApps de búsqueda y RAG completamente locales con datos que nunca salen del dispositivo se vuelven viables para desarrolladores pequeños.

Qué sabemos · qué no

Confirmado

  • El anuncio es del blog oficial de Google (6 de octubre de 2026) y detalla arquitectura (Gemma 4), licencia (Apache 2.0), tamaño (740M; 270M mínimos para solo texto; encoders opcionales de visión 170M y audio 300M), y la ventana de 8K tokens.
  • Google atribuye al modelo la mejor puntuación para su tamaño entre los multimodales sub-1B en MTEB Code y MAEB, y una mejora de 9,92 puntos en MTEB Code sobre EmbeddingGemma 1.
  • Los números de consumo (~191 MB y ~567 MB de RAM activa en Pixel 11 Pro) y las demostraciones (Instant Media Search y Video Moments Finder en Google AI Edge Gallery) proceden de la propia Google.
  • Anuncio oficial de Google DeepMind el 6 de octubre de 2026: 740M de parámetros, arquitectura Gemma 4, licencia Apache 2.0, espacio unificado para código, imagen, vídeo y audio.
  • Google declara las mejores puntuaciones sub-1B en MTEB Code (78,68) y MAEB para su tamaño, MRL hasta 128 dimensiones y contexto de 8K tokens.
  • Consumos declarados en Pixel 11 Pro con cuantización: ~191 MB (solo texto) y ~567 MB (multimodal completo).

Todavía no

  • Los benchmark son autodeclarados: la tarjeta del modelo enlaza las métricas completas, pero no hay aún evaluaciones externas independientes.
  • El rendimiento real en hardware diverso fuera del Pixel 11 Pro citado.
  • La trazabilidad completa de los datos de entrenamiento de las partes de audio y vídeo, que el post no detalla.
  • Evaluaciones externas independientes del modelo.
  • Rendimiento en hardware distinto del Pixel 11 Pro mostrado por Google.
  • Detalle de los datos de entrenamiento de audio y vídeo.

Para ir al grano técnico

Qué vigilamos ahora

La adopción por terceros (RAG local, búsqueda en apps) y las primeras comparativas independientes frente a modelos de embebimientos abiertos de tamaño comparable.

Primeros benchmarks independientes y la aparición de RAG multimodal local en apps reales del ecosistema Gemma.


Fuentes

Naturaleza de la afirmación principal: Anuncio de la empresa. Fuente primaria consultada y verificable.

  1. Google — EmbeddingGemma 2: an open, lightweight multimodal embedding model (blog oficial) · nivel 1 · primaria · consultada 7 oct 2026

Más sobre

Google DeepMindModelos abiertosModelos de pesos abiertos

Se relaciona con