Gemini 3.5 Transcribe apporte la détection des émotions et l’identification des locuteurs à la transcription vocale

Share

Google a lancé Gemini 3.5 Transcribe lors de la conférence Google I/O le 19 mai 2026, un modèle capable de traiter des fichiers audio dans une fenêtre de contexte de 96 000 tokens. Au-delà de la transcription classique, le modèle propose l’identification des locuteurs, la détection des émotions, la traduction et le résumé automatique. L’application macOS Gemini intègre ces fonctionnalités depuis mi-2026, tandis que Google oriente les utilisateurs vers son Cloud Speech-to-Text API pour la transcription en temps réel. Cette solution s’adresse aux professionnels générant de grands volumes de contenu parlé : journalistes, juristes, universitaires et praticiens médicaux. Les implications concurrentielles sont réelles pour des acteurs comme OpenAI et ses outils Whisper, ainsi que pour les plateformes de transcription dédiées.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles