Une étude Amazon révèle que la politique KV-cache influence l’inférence et l’entraînement des modèles à long contexte

Share

Des chercheurs d’Amazon AGI ont démontré qu’une technique d’optimisation par renforcement appelée GRPO peut améliorer de 20 points les performances des modèles à long contexte. L’étude, publiée sur arXiv, introduit la méthode RetrievalAttention permettant aux modèles de conserver les informations critiques malgré la compression du cache KV. Les modèles entraînés sur des contextes de 32 000 jetons ont réussi à généraliser jusqu’à 1 million de jetons. Sur les benchmarks HotpotQA et 2WikiMultihopQA, les améliorationsatteignent jusqu’à 20 points en domaine et 9 points hors domaine par rapport aux systèmes RAG. Les auteurs ont rendu leur code publicly available sur GitHub.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles