Die Reddit-Diskussion verweist auf die neue Veröffentlichung EmbeddingGemma 2 von Google. Kommentare beschreiben das Modell als 740-M-Modell mit nativer Multimodalität. Text, Bilder, Videos und Audio werden in einem gemeinsamen 768-dimensionalen Embedding-Raum abgebildet. Als Lizenz wird Apache 2 genannt.

Als mögliche Anwendungen nennen die Beiträge multimodale Indizierung, die Suche in Medienbeständen und RAG. Ein Nutzer berichtet, dass das Modell auf einem Raspberry Pi läuft. Ein anderer fragt, ob task-steered representations ein neues Merkmal des Modells sind. In bestehenden Workflows werden außerdem Google-Endpunkte, MRL, HQ-CLIP, EmbeddingGemma 1 und nomic-embed-text erwähnt.

Die ausführlichsten Werte stammen aus einem von einem Nutzer veröffentlichten Claude-Vergleich mit MTG-Kartenbildern. Er nennt nDCG@20 für die Textsuche, nDCG@10 für die Bildähnlichkeit und die jeweilige Modellgröße. HQ-CLIP erreichte 0.715 und 0.834 bei rund 1,6 GB fp32-RAM. EmbeddingGemma 1 mit Q4 auf Bildbeschreibungen kam auf 0.743 und 0.741 bei rund 0,3 GB. EmbeddingGemma 2 mit BF16 auf Bildbeschreibungen erzielte 0.775 und 0.797 bei 0,56 GB. Die 4-Bit-Version für Bildbeschreibungen erreichte 0.771 und 0.801 bei 0,18 GB.

Die BF16-Vision-Version kam auf 0.740 und 0.884. Ihr Bedarf lag bei 0,56 GB plus einem 0,98 GB großen mmproj. Die 4-Bit-Textversion mit einem Q8-mmproj für Vision erzielte 0.738 und 0.879 bei 0,18 GB plus 0,55 GB mmproj. Der Vergleich meldet durch die Quantisierung einen Rückgang von etwa 0.004 nDCG sowie eine mittlere Kosinusähnlichkeit von 0.996 zwischen beiden Vektorsätzen.

Für die Suche mit Bildbeschreibungen berechnete der Verfasser gegenüber HQ-CLIP einen Vorsprung von +0.061 nDCG@20. Das 95-%-KI reicht von +0.028 bis +0.095. Bei Text-zu-Bild-Suchen wurden +0.025 gemeldet, das Konfidenzintervall schließt null ein. Bei Bild-zu-Bild-Ähnlichkeit lag der Wert bei 0.884 gegenüber 0.834 für HQ-CLIP. Die Bildzeilen der Caption-Modelle vergleichen Bildbeschreibung mit Bildbeschreibung. Die Zahlen stammen aus einem Community-Test. Der Auszug enthält keinen veröffentlichten Modell-Benchmark.