Google a lancé EmbeddingGemma 2, un modèle multimodal léger capable d’exécuter plusieurs tâches tout en surpassant des modèles plus volumineux. Le modèle précédent contenait 308 millions de paramètres et fonctionnait avec moins de 200 Mo de RAM grâce à un entraînement conscient de la quantification. Le modèle a dominé les classements MTEB dans les catégories Multilingual v2, English v2 et Code parmi les modèles ouverts de moins de 500 millions de paramètres. Il prenait en charge plus de 100 langues et offrait une fenêtre de contexte de 2 000 jetons. L’inférence s’effectuait en 15 à 22 millisecondes sur matériel EdgeTPU, ce qui le rendait adapté aux applications sensibles à la vie privée fonctionnant hors ligne.
Source: Lire l’article original

