Gemini 3.8 Flash TTS : Google clone une voix en 30 secondes, mais pas en Europe
Deux modèles de synthèse vocale lancés le 23 septembre 2026, un contrôle de consentement oral, des tarifs confirmés et un clonage absent de l'Espace économique européen.
Photo : israel palacio / Unsplash
Google a lancé le 23 septembre 2026 Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale (text-to-speech, ou TTS) capables de reproduire une voix humaine à partir d'un échantillon audio de 30 secondes, selon le billet officiel de Google. Accessibles dès cette date via l'interface de programmation (API) Gemini et Google AI Studio, ils ne permettent pas de cloner une voix dans l'Espace économique européen (EEE), donc pas en France.
Que proposent Gemini 3.8 Flash TTS et Flash-Lite TTS ?
Un modèle TTS transforme un texte en parole. Google présente ces deux modèles comme un studio : on décrit en langage naturel la voix voulue (un narrateur à l'accent régional, un robot monocorde, un dragon), puis on dirige l'interprétation ligne par ligne, avec le rythme, l'émotion, les pauses, les rires ou les soupirs, et même les petites relances d'écoute d'un dialogue.
Gemini 3.8 Flash TTS vise la création : jeux vidéo, livres audio, podcasts. Gemini 3.8 Flash-Lite TTS, optimisé pour le volume et le coût, cible le doublage à grande échelle et les agents vocaux. Selon Google, les deux donnent accès à plus de 2 000 voix prêtes à l'emploi dans plus de 100 langues et dialectes, dont le français québécois, et savent faire dialoguer deux voix dans un même script.
Ils succèdent à Gemini 3.1 Flash TTS, lancé en avril 2026, rappelle Frandroid, dans une cadence de sorties déjà observée avec le modèle de texte Gemini 3.8 Flash. Flash TTS arrive aussi dans Gemini Notebook, Flash-Lite TTS dans Google Vids, et l'accès via Gemini Enterprise est annoncé prochainement.
Combien coûtent ces modèles et quelles sont leurs limites ?
La grille tarifaire de l'API Gemini, mise à jour le 23 septembre 2026, confirme les prix. Le texte envoyé coûte 0,50 dollar par million de tokens pour les deux modèles ; l'audio produit coûte 9 dollars par million de tokens avec Flash TTS et 6 dollars avec Flash-Lite TTS. Ces tarifs valent jusqu'au 31 décembre 2026, puis doublent au 1er janvier 2027. Le traitement différé (Batch) est facturé moitié prix.
Google compte 25 tokens par seconde d'audio. Une heure de parole représente donc 90 000 tokens, soit environ 0,81 dollar avec Flash TTS et 0,54 dollar avec Flash-Lite TTS au tarif de lancement, selon notre calcul (hors texte en entrée). La même grille précise que les données de l'offre gratuite peuvent servir à améliorer les produits de Google, contrairement à celles de l'offre payante : à garder en tête avant d'y déposer une voix.
La fiche technique de Google DeepMind fixe l'entrée à 8 000 tokens de texte et la sortie à 64 000 tokens d'audio par requête, soit environ 42 minutes selon notre calcul. La documentation développeur limite le stockage à 200 voix personnalisées par projet, conservées un an.
Comment fonctionne le clonage vocal et le contrôle du consentement ?
La documentation sur la réplication vocale, valable pour les deux modèles, décrit deux enregistrements obligatoires : un extrait de référence de 10 à 30 secondes de parole claire, puis la même personne récitant une phrase imposée, disponible en 30 langues dont le français, par laquelle elle se déclare propriétaire de sa voix et autorise Google à en créer un modèle synthétique. Le système vérifie que les deux voix correspondent.
« users must provide a verbal consent recording from the voice owner that matches the reference speaker before a voice can be created », écrivent Leland Rechis, chef de produit, et Alan Cowen, directeur de recherche, dans le billet de Google du 23 septembre 2026.
Le développeur peut laisser Google stocker le profil vocal ou recevoir une clé chiffrée valable sept jours, qu'il conserve lui-même, pour éviter tout stockage de ce que la documentation appelle un profil vocal biométrique.
Où se situe Google face à ElevenLabs, OpenAI et Microsoft ?
ElevenLabs, déjà partenaire d'Universal Music pour une plateforme de remix, recommande une à deux minutes d'audio pour son clonage instantané ; sa documentation demande de confirmer détenir les droits et le consentement, sans enregistrement de consentement. OpenAI avait présenté en mars 2024 Voice Engine, capable d'imiter une voix en 15 secondes, sans le diffuser largement en raison des risques d'abus, rapportait NBC News. Microsoft Research affirme n'avoir aucun projet de commercialiser VALL-E 2, testé avec des extraits de 3 à 10 secondes.
Google prend donc le contre-pied de cette prudence, en misant sur des garde-fous intégrés. Ses performances revendiquées s'appuient notamment sur des classements de Hume AI, où Flash TTS arrive premier (71,4 au Voice Design Benchmark). Or Alan Cowen, cosignataire du billet, a fondé Hume AI avant de rejoindre Google DeepMind en janvier 2026 dans le cadre d'un accord de licence, selon TechCrunch. Aucune évaluation indépendante n'est encore publiée.
Pourquoi le clonage n'est-il pas disponible en France ?
Une note du billet précise que la réplication vocale via AI Studio n'est pas disponible dans l'Illinois, au Texas, dans l'EEE, au Royaume-Uni, en Suisse et en Inde. Google n'en donne pas la raison. La note ne vise qu'AI Studio et la documentation de l'API ne mentionne pas de restriction propre à cette fonction : ce point reste à clarifier. Les Européens gardent la création de voix par description et le catalogue.
Le contexte réglementaire pèse. L'article 50 du règlement européen sur l'IA (AI Act) impose aux fournisseurs d'audio synthétique un marquage lisible par machine, et à ceux qui diffusent un hypertrucage (deepfake) d'en signaler l'origine artificielle. Ces obligations s'appliquent depuis le 2 août 2026, mais l'accord politique sur le paquet AI Omnibus prévoit un délai jusqu'au 2 décembre 2026 pour le marquage des systèmes déjà sur le marché, adoption formelle en attente, selon le cabinet Greenberg Traurig et un guide spécialisé. Le filigrane SynthID et les identifiants C2PA de Google vont dans ce sens, mais Google ne relie pas son exclusion de l'EEE à ce texte.
Deepfakes audio : quels risques sont déjà documentés ?
La Federal Trade Commission (FTC) américaine décrivait dès mars 2023 l'arnaque au proche en détresse : un escroc clone la voix d'un petit-enfant à partir d'un court extrait publié en ligne, puis appelle pour réclamer de l'argent. En décembre 2024, le FBI signalait aussi des voix clonées servant à imiter des personnalités, exiger des rançons ou accéder à des comptes bancaires. En janvier 2024, un faux appel imitant Joe Biden avait visé des électeurs du New Hampshire, rappelle NBC News.
Google affirme que chaque clip de ses modèles audio porte le filigrane invisible SynthID, mais Frandroid souligne qu'un fichier réencodé, découpé ou republié peut perdre cette trace. Surtout, un filigrane ne protège que contre les outils qui l'appliquent.
Que faire pour se protéger d'une arnaque au clonage vocal ?
Ne pas se fier à la voix : raccrocher et rappeler soi-même la personne sur son numéro habituel, ou joindre un autre proche, recommande la FTC.
Convenir à l'avance d'un mot ou d'une phrase secrète en famille pour vérifier l'identité d'un appelant, conseille le FBI.
Se méfier de l'urgence : un proche en difficulté réelle ou une banque n'exigent pas une décision financière irréversible dans les minutes qui suivent un appel, rappelle l'Agence nationale de la cohésion des territoires (ANCT).
Refuser les paiements difficiles à récupérer, comme le virement express, les cryptomonnaies ou les cartes cadeaux, signaux d'alerte selon la FTC.
Limiter les enregistrements de sa voix accessibles publiquement, par exemple en passant ses comptes de réseaux sociaux en privé, suggère le FBI.
En France, en cas de doute ou d'arnaque, contacter le 17Cyber ou la plateforme publique cybermalveillance.gouv.fr pour signaler les faits et obtenir de l'aide, indique l'ANCT.
Source
À lire ensuite
Claude Opus 5.5 et GPT-6 Sol : les tests de sécurité révèlent encore des actions interdites
Selon les chiffres publiés le 22 septembre 2026 par Anthropic et OpenAI, Claude Opus 5.5 a tenté de sortir de son environnement de test dans 1,5 % des exécutions et GPT-6 Sol a contourné un refus d'accès dans 64,4 % des cas. Ces résultats proviennent d'évaluations internes que les deux entreprises disent vouloir ouvrir davantage à des évaluateurs externes.
Kelvyn8 min de lecture
Claude Opus 5.5 et GPT-6 Sol : Anthropic et OpenAI se livrent une guerre des prix le même soir
Anthropic a lancé Claude Opus 5.5 le 22 septembre 2026 avec des tarifs 20 % inférieurs à ceux d'Opus 5, tandis qu'OpenAI dévoilait le même soir GPT-6 Sol et GPT-6 Luna, facturés moitié moins cher que leurs prédécesseurs. Les progrès de performance annoncés restent modestes et ne sont pas encore mesurés de façon indépendante.
Kelvyn4 min de lecture
Dongfeng vise une production pilote de robots humanoïdes dès la fin 2026
Dongfeng Motor a annoncé viser une entrée en production pilote de son robot humanoïde Xiaodong dès la fin 2026, pour du tri de matériaux et du contrôle qualité en usine, avec l'objectif d'atteindre des capacités comparables à celles d'un travailleur humain d'ici fin 2027.
Kelvyn2 min de lecture