# Gemini 3.8 Flash TTS : Google clone une voix en 30 secondes, mais pas en Europe

> Deux modèles de synthèse vocale lancés le 23 septembre 2026, un contrôle de consentement oral, des tarifs confirmés et un clonage absent de l'Espace économique européen.

- Source : KLYNLABS (https://klynlabs.eu)
- URL : https://klynlabs.eu/articles/google-gemini-3-8-flash-tts-clone-voix-30-secondes
- Auteur : Kelvyn
- Publié le : 24 septembre 2026 (2026-09-24T05:29:54.529Z)
- Rubrique : IA
- Sujets : Google, Cybersécurité, Microsoft, OpenAI, Intelligence artificielle, Gemini, ElevenLabs, Synthèse vocale, Deepfake, AI Act, Clonage vocal, Arnaque
- Langue : français

Google a lancé le 23 septembre 2026 Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale (text-to-speech, ou TTS) capables de reproduire une voix humaine à partir d'un échantillon audio de 30 secondes, selon le [billet officiel de Google](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/). Accessibles dès cette date via l'interface de programmation (API) Gemini et Google AI Studio, ils ne permettent pas de cloner une voix dans l'Espace économique européen (EEE), donc pas en France.

## Que proposent Gemini 3.8 Flash TTS et Flash-Lite TTS ?

Un modèle TTS transforme un texte en parole. Google présente ces deux modèles comme un studio : on décrit en langage naturel la voix voulue (un narrateur à l'accent régional, un robot monocorde, un dragon), puis on dirige l'interprétation ligne par ligne, avec le rythme, l'émotion, les pauses, les rires ou les soupirs, et même les petites relances d'écoute d'un dialogue.

**Gemini 3.8 Flash TTS** vise la création : jeux vidéo, livres audio, podcasts. **Gemini 3.8 Flash-Lite TTS**, optimisé pour le volume et le coût, cible le doublage à grande échelle et les agents vocaux. Selon Google, les deux donnent accès à plus de 2 000 voix prêtes à l'emploi dans plus de 100 langues et dialectes, dont le français québécois, et savent faire dialoguer deux voix dans un même script.

Ils succèdent à Gemini 3.1 Flash TTS, lancé en avril 2026, rappelle [Frandroid](https://www.frandroid.com/marques/google/3258509_google-lance-gemini-3-8-flash-tts-une-ia-capable-de-cloner-une-voix-en-30-secondes), dans une cadence de sorties déjà observée avec le [modèle de texte Gemini 3.8 Flash](https://klynlabs.eu/articles/gemini-3-8-flash-troisieme-modele-en-six-semaines). Flash TTS arrive aussi dans Gemini Notebook, Flash-Lite TTS dans Google Vids, et l'accès via Gemini Enterprise est annoncé prochainement.

## Combien coûtent ces modèles et quelles sont leurs limites ?

La [grille tarifaire de l'API Gemini](https://ai.google.dev/gemini-api/docs/pricing), mise à jour le 23 septembre 2026, confirme les prix. Le texte envoyé coûte 0,50 dollar par million de tokens pour les deux modèles ; l'audio produit coûte 9 dollars par million de tokens avec Flash TTS et 6 dollars avec Flash-Lite TTS. Ces tarifs valent jusqu'au 31 décembre 2026, puis doublent au 1er janvier 2027. Le traitement différé (Batch) est facturé moitié prix.

Google compte 25 tokens par seconde d'audio. Une heure de parole représente donc 90 000 tokens, soit environ 0,81 dollar avec Flash TTS et 0,54 dollar avec Flash-Lite TTS au tarif de lancement, selon notre calcul (hors texte en entrée). La même grille précise que les données de l'offre gratuite peuvent servir à améliorer les produits de Google, contrairement à celles de l'offre payante : à garder en tête avant d'y déposer une voix.

La [fiche technique](https://deepmind.google/models/model-cards/gemini-3-8-audio/) de Google DeepMind fixe l'entrée à 8 000 tokens de texte et la sortie à 64 000 tokens d'audio par requête, soit environ 42 minutes selon notre calcul. La [documentation développeur](https://ai.google.dev/gemini-api/docs/speech-generation) limite le stockage à 200 voix personnalisées par projet, conservées un an.

## Comment fonctionne le clonage vocal et le contrôle du consentement ?

La [documentation sur la réplication vocale](https://ai.google.dev/gemini-api/docs/voice-replication), valable pour les deux modèles, décrit deux enregistrements obligatoires : un extrait de référence de 10 à 30 secondes de parole claire, puis la même personne récitant une phrase imposée, disponible en 30 langues dont le français, par laquelle elle se déclare propriétaire de sa voix et autorise Google à en créer un modèle synthétique. Le système vérifie que les deux voix correspondent.

« users must provide a verbal consent recording from the voice owner that matches the reference speaker before a voice can be created », écrivent Leland Rechis, chef de produit, et Alan Cowen, directeur de recherche, dans le [billet de Google du 23 septembre 2026](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/).

Le développeur peut laisser Google stocker le profil vocal ou recevoir une clé chiffrée valable sept jours, qu'il conserve lui-même, pour éviter tout stockage de ce que la documentation appelle un profil vocal biométrique.

> Google ne publie ni taux d'erreur ni test indépendant de ce contrôle. On ignore comment il réagit à une phrase de consentement elle-même synthétique ou prononcée sous la contrainte, et comment un consentement contesté est traité.

## Où se situe Google face à ElevenLabs, OpenAI et Microsoft ?

ElevenLabs, déjà partenaire d'[Universal Music](https://klynlabs.eu/articles/universal-music-elevenlabs-plateforme-ia-remix) pour une plateforme de remix, recommande une à deux minutes d'audio pour son clonage instantané ; sa [documentation](https://elevenlabs.io/docs/eleven-creative/voices/voice-cloning/instant-voice-cloning) demande de confirmer détenir les droits et le consentement, sans enregistrement de consentement. OpenAI avait présenté en mars 2024 Voice Engine, capable d'imiter une voix en 15 secondes, sans le diffuser largement en raison des risques d'abus, [rapportait NBC News](https://www.nbcnews.com/tech/innovation/openai-previews-voice-engine-generator-acknowledging-risks-rcna145663). Microsoft Research affirme n'avoir aucun projet de commercialiser [VALL-E 2](https://www.microsoft.com/en-us/research/project/vall-e-x/vall-e-2/), testé avec des extraits de 3 à 10 secondes.

Google prend donc le contre-pied de cette prudence, en misant sur des garde-fous intégrés. Ses performances revendiquées s'appuient notamment sur des classements de Hume AI, où Flash TTS arrive premier (71,4 au Voice Design Benchmark). Or Alan Cowen, cosignataire du billet, a fondé Hume AI avant de rejoindre Google DeepMind en janvier 2026 dans le cadre d'un accord de licence, selon [TechCrunch](https://techcrunch.com/2026/01/22/google-reportedly-snags-up-team-behind-ai-voice-startup-hume-ai/). Aucune évaluation indépendante n'est encore publiée.

## Pourquoi le clonage n'est-il pas disponible en France ?

Une note du billet précise que la réplication vocale via AI Studio n'est pas disponible dans l'Illinois, au Texas, dans l'EEE, au Royaume-Uni, en Suisse et en Inde. Google n'en donne pas la raison. La note ne vise qu'AI Studio et la documentation de l'API ne mentionne pas de restriction propre à cette fonction : ce point reste à clarifier. Les Européens gardent la création de voix par description et le catalogue.

Le contexte réglementaire pèse. L'[article 50 du règlement européen sur l'IA](https://artificialintelligenceact.eu/article/50/) (AI Act) impose aux fournisseurs d'audio synthétique un marquage lisible par machine, et à ceux qui diffusent un hypertrucage (deepfake) d'en signaler l'origine artificielle. Ces obligations s'appliquent depuis le 2 août 2026, mais l'accord politique sur le paquet AI Omnibus prévoit un délai jusqu'au 2 décembre 2026 pour le marquage des systèmes déjà sur le marché, adoption formelle en attente, selon le [cabinet Greenberg Traurig](https://www.gtlaw.com/en/insights/2026/6/deepfakes-chatbots-ai-generated-text-european-commission-details-transparency-obligations-under-the-ai-act) et un [guide spécialisé](https://artificialintelligenceact.eu/transparency-rules-article-50/). Le filigrane SynthID et les identifiants C2PA de Google vont dans ce sens, mais Google ne relie pas son exclusion de l'EEE à ce texte.

## Deepfakes audio : quels risques sont déjà documentés ?

La Federal Trade Commission (FTC) américaine décrivait dès mars 2023 [l'arnaque au proche en détresse](https://consumer.ftc.gov/consumer-alerts/2023/03/scammers-use-ai-enhance-their-family-emergency-schemes) : un escroc clone la voix d'un petit-enfant à partir d'un court extrait publié en ligne, puis appelle pour réclamer de l'argent. En décembre 2024, le [FBI](https://www.ic3.gov/PSA/2024/PSA241203) signalait aussi des voix clonées servant à imiter des personnalités, exiger des rançons ou accéder à des comptes bancaires. En janvier 2024, un faux appel imitant Joe Biden avait visé des électeurs du New Hampshire, rappelle NBC News.

Google affirme que chaque clip de ses modèles audio porte le filigrane invisible SynthID, mais [Frandroid](https://www.frandroid.com/marques/google/3258509_google-lance-gemini-3-8-flash-tts-une-ia-capable-de-cloner-une-voix-en-30-secondes) souligne qu'un fichier réencodé, découpé ou republié peut perdre cette trace. Surtout, un filigrane ne protège que contre les outils qui l'appliquent.

## Que faire pour se protéger d'une arnaque au clonage vocal ?

- Ne pas se fier à la voix : raccrocher et rappeler soi-même la personne sur son numéro habituel, ou joindre un autre proche, recommande la [FTC](https://consumer.ftc.gov/consumer-alerts/2023/03/scammers-use-ai-enhance-their-family-emergency-schemes).
- Convenir à l'avance d'un mot ou d'une phrase secrète en famille pour vérifier l'identité d'un appelant, conseille le [FBI](https://www.ic3.gov/PSA/2024/PSA241203).
- Se méfier de l'urgence : un proche en difficulté réelle ou une banque n'exigent pas une décision financière irréversible dans les minutes qui suivent un appel, rappelle l'[Agence nationale de la cohésion des territoires](https://lesbases.anct.gouv.fr/ressources/les-arnaques-a-l-ere-de-l-ia-ce-qu-il-faut-savoir-pour-ne-pas-se-faire-pieger) (ANCT).
- Refuser les paiements difficiles à récupérer, comme le virement express, les cryptomonnaies ou les cartes cadeaux, signaux d'alerte selon la FTC.
- Limiter les enregistrements de sa voix accessibles publiquement, par exemple en passant ses comptes de réseaux sociaux en privé, suggère le FBI.
- En France, en cas de doute ou d'arnaque, contacter le 17Cyber ou la plateforme publique cybermalveillance.gouv.fr pour signaler les faits et obtenir de l'aide, indique l'ANCT.

## À retenir

- Google a lancé le 23 septembre 2026 Gemini 3.8 Flash TTS et Flash-Lite TTS, deux modèles de synthèse vocale accessibles via l'API Gemini et Google AI Studio.
- Google facture l'audio produit 9 dollars (Flash TTS) et 6 dollars (Flash-Lite TTS) par million de tokens jusqu'à fin 2026, puis le double en 2027.
- Le clonage vocal de Google exige un extrait de 10 à 30 secondes et un consentement oral du propriétaire de la voix, contrôle non vérifié de façon indépendante.
- Google ne propose pas le clonage via AI Studio dans l'Espace économique européen, au Royaume-Uni, en Suisse, en Inde, dans l'Illinois et au Texas, sans dire pourquoi.
- L'AI Act impose depuis le 2 août 2026 un marquage détectable de l'audio synthétique, avec un délai envisagé jusqu'au 2 décembre 2026 pour les systèmes existants.
- Face à un appel suspect d'un proche, la FTC et le FBI conseillent de raccrocher, de rappeler sur un numéro connu et de convenir d'un mot secret en famille.

## Source

- [Google, billet officiel, 23 septembre 2026](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)
- [Frandroid, 23 septembre 2026](https://www.frandroid.com/marques/google/3258509_google-lance-gemini-3-8-flash-tts-une-ia-capable-de-cloner-une-voix-en-30-secondes)
- [Google AI for Developers, tarifs de l'API Gemini](https://ai.google.dev/gemini-api/docs/pricing)
- [Google AI for Developers, génération de parole](https://ai.google.dev/gemini-api/docs/speech-generation)
- [Google AI for Developers, réplication vocale](https://ai.google.dev/gemini-api/docs/voice-replication)
- [Google DeepMind, fiche technique Gemini 3.8 Audio](https://deepmind.google/models/model-cards/gemini-3-8-audio/)
- [ElevenLabs, documentation du clonage instantané](https://elevenlabs.io/docs/eleven-creative/voices/voice-cloning/instant-voice-cloning)
- [NBC News, 29 mars 2024](https://www.nbcnews.com/tech/innovation/openai-previews-voice-engine-generator-acknowledging-risks-rcna145663)
- [Microsoft Research, VALL-E 2](https://www.microsoft.com/en-us/research/project/vall-e-x/vall-e-2/)
- [TechCrunch, 22 janvier 2026](https://techcrunch.com/2026/01/22/google-reportedly-snags-up-team-behind-ai-voice-startup-hume-ai/)
- [AI Act, article 50](https://artificialintelligenceact.eu/article/50/)
- [EU Artificial Intelligence Act, guide de l'article 50](https://artificialintelligenceact.eu/transparency-rules-article-50/)
- [Greenberg Traurig, juin 2026](https://www.gtlaw.com/en/insights/2026/6/deepfakes-chatbots-ai-generated-text-european-commission-details-transparency-obligations-under-the-ai-act)
- [FTC, alerte de mars 2023](https://consumer.ftc.gov/consumer-alerts/2023/03/scammers-use-ai-enhance-their-family-emergency-schemes)
- [FBI IC3, avis du 3 décembre 2024](https://www.ic3.gov/PSA/2024/PSA241203)
- [ANCT, Les arnaques à l'ère de l'IA](https://lesbases.anct.gouv.fr/ressources/les-arnaques-a-l-ere-de-l-ia-ce-qu-il-faut-savoir-pour-ne-pas-se-faire-pieger)

---

Article publié par KLYNLABS, signé Kelvyn. À citer avec son lien : https://klynlabs.eu/articles/google-gemini-3-8-flash-tts-clone-voix-30-secondes