La discussion Reddit renvoie à la nouvelle version EmbeddingGemma 2 de Google. Les commentateurs décrivent un modèle de 740 M doté d’une multimodalité native. Le texte, les images, la vidéo et l’audio sont projetés dans un même espace d’embeddings de 768 dimensions. La licence indiquée est Apache 2.

Les usages évoqués concernent l’indexation multimodale, la recherche dans des médias et les systèmes RAG. Un utilisateur affirme que le modèle fonctionne sur un Raspberry Pi. Un autre demande si les task-steered representations constituent une nouveauté du modèle. Des utilisateurs mentionnent aussi les endpoints de Google, MRL, HQ-CLIP, EmbeddingGemma 1 et nomic-embed-text dans leurs flux de travail existants.

Les données les plus détaillées viennent d’une comparaison publiée par un utilisateur, générée avec Claude, sur des images de cartes MTG. Elle donne un score nDCG@20 pour la recherche textuelle, un score nDCG@10 pour la similarité d’image et l’encombrement indiqué pour chaque modèle. HQ-CLIP obtient 0.715 et 0.834 avec environ 1,6 Go de RAM en fp32. EmbeddingGemma 1 en Q4 sur des légendes obtient 0.743 et 0.741 pour environ 0,3 Go. EmbeddingGemma 2 en BF16 sur des légendes atteint 0.775 et 0.797 pour 0,56 Go. Sa version 4 bits pour les légendes atteint 0.771 et 0.801 pour 0,18 Go.

La version vision en BF16 obtient 0.740 et 0.884. Son encombrement est de 0,56 Go, auxquels s’ajoutent 0,98 Go pour le mmproj. La version texte 4 bits avec un mmproj Q8 pour la vision obtient 0.738 et 0.879. Elle utilise 0,18 Go plus 0,55 Go de mmproj. La comparaison indique une baisse d’environ 0.004 nDCG après quantification et une similarité cosinus moyenne de 0.996 entre les deux ensembles de vecteurs.

L’auteur de cette comparaison calcule un avantage de +0.061 nDCG@20 sur HQ-CLIP pour la recherche à partir de légendes. L’intervalle de confiance à 95 % va de +0.028 à +0.095. La recherche texte-image affiche +0.025, avec un intervalle qui inclut zéro. Pour la similarité image-image, le score atteint 0.884 contre 0.834 pour HQ-CLIP. Les lignes de similarité des modèles entraînés sur des légendes comparent des légendes entre elles. Ces chiffres proviennent d’un test communautaire. L’extrait ne fournit aucun benchmark publié par l’équipe du modèle.