Plus de 21 chercheurs de Google DeepMind, Harvard et d’autres institutions ont publie un livre blanc arguant que les images et videos pourraient etre aussi importantes que le texte pour developper une intelligence artificielle generale. Le document, intitule Visual General Intelligence : A White Paper et publie sur arXiv sous la reference 2608.25924, propose un programme de recherche pour ce que les auteurs nomment la visual general intelligence, ou VGI. Les contributeurs incluent Robert Geirhos de Google DeepMind et Yilun Du de Harvard. Les chercheurs affirment que les modeles generatifs video et l’apprentissage auto-supervise pourraient constituer une base pour l’AGI que le langage seul ne peut offrir. Ce travail s’inscrit dans la lignee des publications precedentes de DeepMind, notamment Levels of AGI (2024) et From AGI to ASI (2026).
Source: Lire l’article original

