EmbeddingGemma 2: An open, lightweight multimodal embedding model
EmbeddingGemma 2 est un modèle multimodal conçu pour générer des embeddings unifiés de texte, images, audio, vidéo et code directement sur les appareils locaux. Construit sur l'architecture Gemma 4 avec 740 millions de paramètres et publié sous licence Apache 2.0, il est optimisé pour l'inférence sur appareil et propose des modules plus petits pour les charges textuelles, vision et audio. Il utilise la Matryoshka Representation Learning pour tronquer dynamiquement les vecteurs d'embedding (768 → 512/256/128 dimensions), ce qui permet jusqu'à 6x de réduction de stockage et de mémoire. Le modèle offre une fenêtre de contexte de 8 000 tokens, améliore significativement les performances sur le code (+9,92 points MTEB Code) et obtient des résultats de référence parmi les modèles sub-1B pour texte, vision et audio. Les poids sont disponibles sur Hugging Face et Kaggle et le modèle est compatible avec des outils et pipelines sur appareil comme LiteRT, Google AI Edge MediaPipe, transformers.js et solutions d'indexation pour construire des recherches et RAG locales et privées.