Des chercheurs d’Amazon AGI ont démontré qu’une technique d’optimisation par renforcement appelée GRPO peut améliorer de 20 points les performances des modèles à long contexte. L’étude, publiée sur arXiv, introduit la méthode RetrievalAttention permettant aux modèles de conserver les informations critiques malgré la compression du cache KV. Les modèles entraînés sur des contextes de 32 000 jetons ont réussi à généraliser jusqu’à 1 million de jetons. Sur les benchmarks HotpotQA et 2WikiMultihopQA, les améliorationsatteignent jusqu’à 20 points en domaine et 9 points hors domaine par rapport aux systèmes RAG. Les auteurs ont rendu leur code publicly available sur GitHub.
Source: Lire l’article original

