La start-up américaine Tavus a annoncé que son modèle Griffin a été pris pour un humain par 48 % des participants lors d’appels vidéo d’une minute, soit 26 personnes sur 54, contre seulement 2,4 % pour la génération précédente Phoenix-4.5. Griffin analyse simultanément la voix, l’image, les expressions faciales, les pauses et le rythme de la conversation. Le modèle obtient un score de 3,83 sur 5 sur le benchmark VideoFDB de Nvidia, proche des 3,92 enregistrés pour les interactions humaines. Cette avancée survient alors que les arnaques par deepfake se multiplient, comme l’illustrent des cas de fraude spectaculaires involving des montants dépassant les 90 millions d’euros. Tavus, fondée en 2020 à San Francisco, a levé environ 64 millions de dollars pour développer cette technologie.
Source: Lire l’article original

