Google a dégainé mercredi dernier Gemini 3.1 Flash Live, présenté comme son "modèle audio et vocal de la plus haute qualité à ce jour". Derrière la formule marketing habituelle, il y a toutefois du concret, le modèle a moins de latence, une meilleure reconnaissance des nuances acoustiques, tonalité, rythme, intention et surtout un filtrage du bruit ambiant qui progresse significativement. L'idée, c'est de tuer l'arrêt des conversations où l'IA de google décroche parce qu'une télé tourne en fond ou qu'un bus passe sous la fenêtre.
Mais surtout, google fait la promesse de la mémoire conversationnelle. Le mastodonte américain annonce que Gemini Live peut désormais "suivre le fil de votre conversation deux fois plus longtemps" qu'avant. Concrètement, sur Android et iOS, les réponses arrivent plus vite, avec moins de silences un gênants qui donnaient l'impression de parler à un répondeur. L'IA ajuste aussi la longueur et le ton de ses réponses au contexte de l'échange, un détail assez humanisant.
Search Live débarque partout

L'autre annonce à retenir, c'est l'expansion de Search Live dans plus de 200 pays. Google utilise justement Gemini 3.1 Flash Live pour alimenter ce service qui permet d'avoir une vraie conversation vocale avec le moteur de recherche, y compris en vidéo via Google Lens. On pointe la caméra, on pose une question, et l'IA répond en temps réel. Le tout dans plus de 90 langues. Quand on se souvient que Gemini comptait déjà 750 millions d'utilisateurs en début d'année, on mesure l'ampleur du déploiement et l'évolution du bijou de Google.
Côté technique, le modèle améliore aussi le "function calling", en somme sa capacité à déclencher des outils externes en pleine conversation et le suivi d'instructions complexes. Google insiste sur le fait que 3.1 Flash Live maintient mieux ses garde-fous même quand la conversation prend des tournants inattendus. Un élément notable quand on sait que les modèles vocaux ont tendance à se montrer plus permissifs que leurs équivalents textuels.

Ce lancement s'inscrit dans une séquence dense pour Google, qui avait déjà dévoilé Gemini 3.1 Pro en février pour reprendre la main sur le raisonnement, et un mode Crayon pour la génération d'images début mars. La stratégie est d'occuper tous les fronts, que cela soit texte, image et maintenant voix avant que la concurrence ne s'installe trop confortablement dans ce secteur.
Gemini 3.1 Flash Live est déjà disponible en preview pour les développeurs via l'API Gemini Live sur Google AI Studio. Pour le grand public, le déploiement dans Gemini Live et Search Live est en cours, step by step comme chaque déploiement. On attend de voir si la fluidité promise tient la route sur des conversations de 20 minutes avec du bruit de fond, c'est généralement là que les assistants vocaux craquent.




