Como Gravar Amostras de Voz para Clonagem com IA (e Corrigir Erros de Pronúncia)
Passo a passo prático para gravar áudio de referência limpo em casa, evitar eco de sala e corrigir falhas de pronúncia em português brasileiro.
O que realmente importa na amostra de voz
Modelos neurais de voz aprendem tudo o que o microfone capta. Se você grava num quarto com piso de cerâmica e paredes vazias, o modelo clona a reverberação da sala junto com a sua voz. Se o ventilador estiver ligado ao fundo, cada frase gerada terá aquele zumbido contínuo.
Você não precisa de um estúdio profissional. Só precisa de um áudio seco, sem ruído de fundo e sem eco.
1. Escolhendo o lugar da gravação
A maioria dos quartos de casa tem paredes lisas e móveis espalhados que refletem o som. A onda sonora bate na parede e chega ao microfone frações de segundo depois da sua voz direta, gerando aquele som característico de banheiro.
Algumas soluções simples para quem grava em casa:
- O guarda-roupa. Ficar de frente para um guarda-roupa aberto e cheio de casacos ou cobertores funciona melhor do que espumas acústicas baratas. O tecido denso absorve médios e agudos e entrega um som seco.
- Almofadas e edredom. Se você precisa gravar na mesa do computador, coloque almofadas grossas atrás do microfone e jogue um cobertor nas costas para barrar o reflexo da parede atrás de você.
- Desligue aparelhos barulhentos. Desative o ventilador e o ar-condicionado durante o minuto da gravação. Se o cooler do computador fizer barulho, afaste o microfone da máquina.
2. Microfone e posicionamento
Dá para conseguir um clone limpo usando um microfone dinâmico comum, um microfone USB de entrada ou o próprio celular.
| Microfone | Vantagem | Ponto de atenção | Distância recomendada |
|---|---|---|---|
| Dinâmico (Shure SM58, Samson Q2U) | Rejeita bem o ruído do quarto | Pede mais ganho na interface | 5 a 10 cm da boca |
| Condensador (Audio-Technica AT2020, Blue Yeti) | Capta agudos detalhados | Pega qualquer eco ou barulho da rua | 15 a 20 cm da boca |
| Celular (iPhone ou Android recente) | Sempre à mão | Processamento nativo pode estragar o timbre | 15 cm, inclinado a 45 graus |
Três cuidados com o posicionamento
- Fale ligeiramente de lado. Letras como p e b soltam rajadas de ar que batem direto na cápsula e criam aquele estalo grave (puff). Aponte o microfone a cerca de 30 a 45 graus em relação ao canto da sua boca.
- Desative o isolamento de voz no celular. No iPhone, abra a Central de Controle durante a gravação e mude o Modo do Microfone para Padrão, tirando do Isolamento de Voz. O isolamento aplica filtros digitais agressivos que cortam harmônicos naturais da sua voz, deixando o clone com som abafado ou metálico.
- Mantenha o ganho sob controle. A voz não pode encostar no limite de 0 dB. Deixe o sinal modulando entre -12 dB e -6 dB para evitar qualquer distorção digital.
3. Quanto tempo você precisa gravar?
Gravar mais tempo não melhora o resultado por si só. Vinte a trinta segundos de fala limpa e estável são suficientes para modelos modernos. Um áudio de cinco minutos gravado com mudanças de postura, pigarros ou variações no volume da voz só gera inconsistência no modelo.
Fale com o seu tom de voz natural, no mesmo volume em que você conversaria com alguém sentado à sua frente.
Texto de exemplo para leitura
Evite textos corporativos ou termos técnicos complicados. Leia uma narrativa comum, com pontuação natural:
O café da manhã na padaria estava mais movimentado que o normal nesta terça-feira. Pedi um pingado com pão na chapa e fiquei observando o movimento na esquina da avenida. Quando o relógio marcou oito horas, peguei minha mochila e segui a pé até o escritório.
Respire normalmente entre as frases. Não segure a respiração para tentar deixar o áudio mais quieto; as pausas naturais ajudam o modelo a entender o ritmo da sua fala.
4. Corrigindo erros comuns de pronúncia no texto gerado
Depois de criar sua voz no VoiceCloner, a forma como você digita o texto de entrada define se a fala gerada soará natural ou travada. O motor de síntese segue regras de normalização que às vezes se perdem com números, siglas e abreviações.
Números, datas e valores em reais
Muitos modelos leem algarismos soltos como números grandes ou erram o padrão brasileiro:
- Anos: Em vez de digitar
2026, digitedois mil e vinte e seis. Isso evita hesitações ou leituras formais demais. - Datas: Em vez de
15/09/2026, escreva por extenso:quinze de setembro de dois mil e vinte e seis. - Valores em reais: Se você colar
R$ 1.500,50, o motor pode ler ponto e vírgula como palavras avulsas. Digitemil e quinhentos reais e cinquenta centavos. - Intervalos: Em vez de
3-5 dias, escrevatrês a cinco dias. - Porcentagens: Escreva
dez por centoounoventa por centoem vez de usar o símbolo%.
Siglas e nomes próprios
Alguns motores tentam ler siglas como se fossem palavras comuns:
- Para siglas com letras separadas, use hifens: escreva
C-P-F,I-P-V-A,A-P-IouT-T-S. - Para o Pix, digite
Pixcom maiúscula e minúscula normal. - Para nomes de marcas compostos, separe os termos com espaço para que as sílabas não fiquem coladas na fala.
Acentuação e sons nasais
No português do Brasil, um acento esquecido muda o significado e o timbre da vogal:
- Diferencie
avô(som fechado) deavó(som aberto). - Palavras terminadas em
ãoeões(comoinformaçãoouconclusões): se o modelo soar atropelado no final da palavra, coloque uma vírgula logo após para dar o tempo exato da ressonância nasal.
Controlando o ritmo com a pontuação
A pontuação funciona como instrução de tempo para o modelo:
- Vírgulas geram uma pausa curta de respiração. Se uma frase parecer longa demais ou acelerada, quebre com uma vírgula onde você normalmente respiraria.
- Pontos finais fecham a ideia e reduzem o pitch ao final da frase.
- Reticências (
...) criam uma pausa reflexiva mais longa antes da frase seguinte.
5. Checklist rápido antes de enviar seu áudio
Antes de fazer o upload:
- Ouça a gravação no fone de ouvido em volume alto. Dá para ouvir a rua ou o barulho da geladeira no fundo? Se sim, grave de novo.
- Observe se não há estalos fortes nas letras p e b.
- Mantenha o arquivo entre 20 e 40 segundos.
- Salve em formato WAV ou MP3 de boa qualidade (pelo menos 192 kbps).
Com o áudio pronto, você já pode acessar o VoiceCloner e gerar o seu modelo de voz. Se tiver dúvidas sobre pronúncia ou geração em lote, fale conosco pela página de Contato.