Perplexity AI a lancé deux modèles d’embedding multimodaux, pplx-embed-v2-late, disponibles en versions 0,6 milliard et 9 milliards de paramètres sur Hugging Face. Ces modèles utilisent une architecture d’interaction tardive de type ColBERT avec des vecteurs de 128 dimensions par token et un scoring MaxSim. La fonction de requête intermodèles permet au modèle léger de 0,6 milliard d’interroger un corpus indexé par le modèle de 9 milliards, optimisant les coûts d’inférence. Les modèles, entraînés par distillation à partir d’un enseignant de 18 milliards de paramètres sur 186 millions de paires requête-document en 46 langues, atteignent un score nDCG@10 de 81,3 % sur certaines tâches de retrieval. Ils traitent directement les documents visuels riches comme les PDF et présentations sans recourir à la reconnaissance optique de caractères.
Source: Lire l’article original

