Volver al blog

Cómo grabar tu voz para clonarla con IA: guía y errores de pronunciación

Graba una muestra limpia sin estudio: evita el eco y el ruido, y corrige errores de pronunciación al generar una voz clonada con IA.

19 sept 2026Equipo de audio de VoiceCloner

Una buena muestra de voz cambia el resultado

El modelo aprende de todo lo que capta el micrófono. Si grabas en una habitación con eco, el eco acaba mezclado con tu voz. Si se oye el ventilador o el ruido del tráfico, ese fondo puede aparecer después en las frases generadas.

Para usar VoiceCloner no necesitas un estudio. Una grabación directa, con poco ruido y un volumen estable suele ser suficiente. La calidad importa más que acumular minutos de audio: una muestra limpia de una sola voz ayuda más que una sesión larga en la que cambias de posición o de volumen.

1. Encuentra un espacio con poco eco

Las paredes lisas, los cristales y los suelos duros devuelven la voz al micrófono. Por eso una habitación vacía suele sonar peor que un espacio pequeño con muebles y telas.

Un armario con ropa

Un armario abierto y lleno de chaquetas, jerséis o mantas absorbe parte de las reflexiones. Ponte de frente a la ropa, no a la puerta del armario. No hace falta montar una cabina: el objetivo es que la voz llegue al micrófono antes de rebotar en las paredes.

Alfombra, cortinas y cojines

Si grabas junto al escritorio, una alfombra y unas cortinas gruesas ya ayudan. También puedes colocar un par de cojines detrás del micrófono para reducir el rebote de la pared. Si tienes una superficie desnuda detrás de ti, una manta puede suavizar ese reflejo.

Apaga los aparatos que hagan ruido

Durante la grabación apaga el ventilador, el aire acondicionado y cualquier purificador que esté cerca. Si el portátil empieza a girar a toda velocidad, sepáralo del micrófono todo lo que permita el cable. El ruido se puede reducir después, pero no siempre desaparece sin afectar a la voz.

2. Elige el micrófono y colócalo bien

Puedes empezar con un micrófono dinámico, uno de condensador o el micrófono integrado del móvil. El modelo exacto importa menos que la distancia, la dirección y la estabilidad del volumen.

EquipoLo buenoVigila estoDistancia
Micrófono dinámicoCapta menos ruido de la habitaciónA veces necesita más gananciaunos 5–10 cm
Micrófono de condensadorRecoge muchos detallesTambién recoge el eco y los ventiladoresunos 15–20 cm
MóvilLo tienes a manoEl procesamiento automático puede cambiar la vozunos 15 cm, ligeramente de lado

Tres ajustes que te ahorran tiempo

Habla un poco de lado. Apunta el micrófono hacia la comisura de la boca, con un ángulo aproximado de 30 a 45 grados. Así reduces los golpes de aire de las consonantes P, B y T.

Desactiva los filtros agresivos. Si el móvil ofrece un modo de aislamiento de voz, prueba con el modo estándar. Algunos filtros recortan armónicos naturales y dejan una voz demasiado procesada.

Deja margen en el nivel. Intenta que los picos se queden entre −12 dB y −6 dB. Si llegan a 0 dB, la grabación se distorsiona y esa parte ya no se puede recuperar bien.

3. ¿Cuánto debe durar la grabación?

VoiceCloner acepta muestras claras a partir de 10 segundos. Para conseguir un perfil más estable, entre 30 y 120 segundos de una sola voz suele ser un buen punto de partida. El límite de subida es de 300 segundos, pero grabar más no arregla una muestra con eco, ruido o cambios de volumen.

Habla como lo haces normalmente. No susurres durante una frase y leas la siguiente con voz de anuncio. El perfil necesita reconocer tu forma habitual de hablar, con sus pausas y su ritmo.

Un texto breve para leer

Elige un texto con vocales, consonantes y pausas naturales. Por ejemplo:

El tren de la mañana llegaba hoy diez minutos tarde. Compré un café, me senté en un banco junto a la entrada sur y repasé las notas del día anterior. Cuando se abrieron las puertas, la lluvia empezó a golpear el techo de cristal.

Respira entre frases y mantén una distancia parecida respecto al micrófono. Las pausas normales ayudan al modelo a reproducir un ritmo menos artificial.

Cuando tengas la muestra lista, puedes probar VoiceCloner.

4. Corrige los errores de pronunciación del texto generado

El modelo no interpreta solo el sonido de las palabras. También tiene en cuenta cómo están escritas, dónde aparecen las tildes, cómo se separan las cifras y qué signos de puntuación las rodean. Antes de volver a grabar, prueba a cambiar el texto.

Tildes que cambian el significado

En español una tilde puede cambiar la pronunciación y el significado. No es lo mismo clono que clonó, práctico que practico o depósito que deposito. Si el modelo lee una palabra con el acento equivocado, revisa la tilde y el contexto de toda la frase.

Préstamos del inglés

Software, streaming, podcast y otras palabras importadas no siempre se pronuncian igual en todos los países. Si el resultado no suena como quieres, escribe la palabra de una forma más fácil de leer o sustitúyela por una expresión en español. Con marcas y nombres propios conviene mantener la grafía oficial y simplificar el resto de la frase.

Cifras, precios y abreviaturas

Las cifras largas suelen sonar poco naturales. Escribe un año con palabras cuando el ritmo lo necesite. Para un precio como 49,99, conserva la coma decimal que usaría tu público y comprueba cómo lo lee el modelo. Los teléfonos funcionan mejor separados en grupos que como una única cadena de números.

Las abreviaturas también pueden dar problemas. Si IA se pronuncia como una palabra cuando quieres oír las letras, escribe I-A o reformula la frase. Haz lo mismo con siglas que el modelo no reconozca.

Controla las pausas con la puntuación

Una coma marca una pausa breve. Un punto cierra la frase y suele bajar la entonación. Los puntos suspensivos alargan la pausa, pero si aparecen todo el rato el texto suena teatral. Úsalos solo cuando esa pausa forme parte de la lectura.

5. Lista de comprobación antes de subir el audio

  • Escucha la grabación con auriculares. En los silencios no deberían destacar el frigorífico, el tráfico ni el ventilador.
  • Comprueba las consonantes P, B y T para detectar golpes de aire.
  • Mantén una sola voz, un volumen parecido y una distancia estable.
  • Usa al menos 10 segundos de habla clara. Entre 30 y 120 segundos suele ser un rango práctico.
  • Sube un formato compatible con VoiceCloner y evita convertir el archivo varias veces.
  • Reescribe las cifras, las siglas y los nombres difíciles antes de generar el audio.

Cuando termines, puedes probar tu voz en la página de VoiceCloner en español. Si necesitas ayuda, visita la página de contacto. Para volver a las guías, entra en el blog.

Preguntas frecuentes

¿Cuánto debe durar una muestra de voz?

VoiceCloner necesita al menos 10 segundos de habla clara. Para conseguir un perfil más estable, recomendamos entre 30 y 120 segundos con una sola persona. Una grabación corta y limpia suele funcionar mejor que varios minutos con eco o ruido.

¿Puedo grabar con el móvil?

Sí. Un teléfono actual sirve para hacer una prueba útil. Colócalo aproximadamente a un palmo de la boca, habla ligeramente de lado respecto al micrófono y graba en una habitación tranquila. Los formatos habituales M4A, MP3 y WAV son compatibles con la subida.

¿Puedo usar comercialmente la voz clonada?

Solo debes clonar voces para las que tengas los derechos o el consentimiento expreso de la persona. El uso comercial del audio generado depende de tu plan y de las condiciones aplicables. Antes de publicar, revisa la información de precios y los términos de servicio. Esta información no sustituye el asesoramiento jurídico.

¿Cómo evito los errores de pronunciación en español?

Escribe con cuidado las tildes, las abreviaturas, las cifras y los nombres propios. Para controlar el ritmo, separa los grupos de números y usa comas donde quieras que el modelo haga una pausa. Si trabajas para varios países, decide si prefieres términos como móvil o celular y mantén la misma variante en todo el texto.