Microsoft et l’universite Cornell devoilent la methode Free Pause Tokens pour un entrainement plus efficace des modeles de langage

Share

Des chercheurs de Microsoft et de l’universite Cornell ont publie une nouvelle technique d’entrainement appelee Free Pause Tokens qui ameliore la capacite des grands modeles de langage a predire le prochain token. Cette methode cree un flux de prediction parallele leger qui partage les poids avec le flux principal du modele via des reseaux feedforward a porte partagee, ajoutant un calcul minimal en fin d’entrainement. Les tests sur un modele de 1 milliard de parametres montrent une amelioration de 2 a 3 centinats dans la prediction du prochain token, pour un temps d’entrainement ne depassant pas 1,14 fois le temps standard. L’inference n’est pas ralentie car le flux de prediction peut etre ignore a l’execution, et la methode est compatible avec l’algorithme FlashAttention sans necessiter de modification de l’infrastructure existante.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles