30 segundos: así clona tu voz Gemini 3.8
Google lanzó Gemini 3.8 Flash TTS con voice replication: Gemini clona tu voz desde una muestra corta, con verificación de consentimiento, en más de 100 idiomas.
El 24 de septiembre de 2026, Google lanzó Gemini 3.8 Flash TTS y Flash-Lite TTS, sus modelos de voz más expresivos hasta ahora. La función que más llama la atención es que Gemini clona tu voz a partir de una muestra corta de audio, de apenas 30 segundos.
Cómo clona tu voz Gemini
El proceso se llama voice replication: se sube una muestra de audio de unos 30 segundos, y el modelo genera un perfil de voz a partir de ella. Antes de crear ese perfil, Gemini pide verificación de consentimiento — un paso pensado para que no cualquiera pueda clonar una voz ajena sin autorización explícita de quien habla.
Más de 100 idiomas, incluido español de México
La voz clonada no queda encerrada en un solo idioma: el sistema soporta más de 100 idiomas y dialectos, incluido el español de México. Además, permite dirigir la actuación línea por línea — ritmo, acento y hasta las pausas al hablar — en vez de generar un audio plano de principio a fin.
El caveat honesto: es una API, no un botón
Esto es una capacidad de la API de Gemini, pensada para creadores y desarrolladores, no un botón dentro de la app de Gemini para el usuario final. Y como toda clonación de voz, el consentimiento verificado es el límite real entre una herramienta útil para producir contenido y un riesgo de suplantación de identidad.
¿Cómo aplicarlo en tu empresa?
Si tu equipo produce video o audio de forma constante — capacitaciones, anuncios, contenido en varios idiomas — grabar 30 segundos una vez y reutilizar esa voz clonada puede reemplazar la necesidad de contratar un locutor para cada proyecto nuevo. Antes de implementarlo, vale la pena definir internamente quién autoriza clonar una voz (la propia o la de un colaborador) y dejar ese consentimiento documentado, ya que es justo el paso que Gemini exige antes de generar el perfil.
Conclusión
Que Gemini clona tu voz en 30 segundos no significa que cualquiera pueda hacerlo sin permiso: el consentimiento verificado sigue siendo el filtro. Pero para quien produce contenido en varios idiomas o necesita una voz consistente en cada video, esta capacidad de la API cambia el costo de producción de forma real.