Voltar ao blog

Como Gravar Amostras de Voz para Clonagem com IA (e Corrigir Erros de Pronúncia)

Passo a passo prático para gravar áudio de referência limpo em casa, evitar eco de sala e corrigir falhas de pronúncia em português brasileiro.

15 de set. de 2026Equipe de Áudio VoiceCloner

O que realmente importa na amostra de voz

Modelos neurais de voz aprendem tudo o que o microfone capta. Se você grava num quarto com piso de cerâmica e paredes vazias, o modelo clona a reverberação da sala junto com a sua voz. Se o ventilador estiver ligado ao fundo, cada frase gerada terá aquele zumbido contínuo.

Você não precisa de um estúdio profissional. Só precisa de um áudio seco, sem ruído de fundo e sem eco.


1. Escolhendo o lugar da gravação

A maioria dos quartos de casa tem paredes lisas e móveis espalhados que refletem o som. A onda sonora bate na parede e chega ao microfone frações de segundo depois da sua voz direta, gerando aquele som característico de banheiro.

Algumas soluções simples para quem grava em casa:

  • O guarda-roupa. Ficar de frente para um guarda-roupa aberto e cheio de casacos ou cobertores funciona melhor do que espumas acústicas baratas. O tecido denso absorve médios e agudos e entrega um som seco.
  • Almofadas e edredom. Se você precisa gravar na mesa do computador, coloque almofadas grossas atrás do microfone e jogue um cobertor nas costas para barrar o reflexo da parede atrás de você.
  • Desligue aparelhos barulhentos. Desative o ventilador e o ar-condicionado durante o minuto da gravação. Se o cooler do computador fizer barulho, afaste o microfone da máquina.

2. Microfone e posicionamento

Dá para conseguir um clone limpo usando um microfone dinâmico comum, um microfone USB de entrada ou o próprio celular.

MicrofoneVantagemPonto de atençãoDistância recomendada
Dinâmico (Shure SM58, Samson Q2U)Rejeita bem o ruído do quartoPede mais ganho na interface5 a 10 cm da boca
Condensador (Audio-Technica AT2020, Blue Yeti)Capta agudos detalhadosPega qualquer eco ou barulho da rua15 a 20 cm da boca
Celular (iPhone ou Android recente)Sempre à mãoProcessamento nativo pode estragar o timbre15 cm, inclinado a 45 graus

Três cuidados com o posicionamento

  1. Fale ligeiramente de lado. Letras como p e b soltam rajadas de ar que batem direto na cápsula e criam aquele estalo grave (puff). Aponte o microfone a cerca de 30 a 45 graus em relação ao canto da sua boca.
  2. Desative o isolamento de voz no celular. No iPhone, abra a Central de Controle durante a gravação e mude o Modo do Microfone para Padrão, tirando do Isolamento de Voz. O isolamento aplica filtros digitais agressivos que cortam harmônicos naturais da sua voz, deixando o clone com som abafado ou metálico.
  3. Mantenha o ganho sob controle. A voz não pode encostar no limite de 0 dB. Deixe o sinal modulando entre -12 dB e -6 dB para evitar qualquer distorção digital.

3. Quanto tempo você precisa gravar?

Gravar mais tempo não melhora o resultado por si só. Vinte a trinta segundos de fala limpa e estável são suficientes para modelos modernos. Um áudio de cinco minutos gravado com mudanças de postura, pigarros ou variações no volume da voz só gera inconsistência no modelo.

Fale com o seu tom de voz natural, no mesmo volume em que você conversaria com alguém sentado à sua frente.

Texto de exemplo para leitura

Evite textos corporativos ou termos técnicos complicados. Leia uma narrativa comum, com pontuação natural:

O café da manhã na padaria estava mais movimentado que o normal nesta terça-feira. Pedi um pingado com pão na chapa e fiquei observando o movimento na esquina da avenida. Quando o relógio marcou oito horas, peguei minha mochila e segui a pé até o escritório.

Respire normalmente entre as frases. Não segure a respiração para tentar deixar o áudio mais quieto; as pausas naturais ajudam o modelo a entender o ritmo da sua fala.


4. Corrigindo erros comuns de pronúncia no texto gerado

Depois de criar sua voz no VoiceCloner, a forma como você digita o texto de entrada define se a fala gerada soará natural ou travada. O motor de síntese segue regras de normalização que às vezes se perdem com números, siglas e abreviações.

Números, datas e valores em reais

Muitos modelos leem algarismos soltos como números grandes ou erram o padrão brasileiro:

  • Anos: Em vez de digitar 2026, digite dois mil e vinte e seis. Isso evita hesitações ou leituras formais demais.
  • Datas: Em vez de 15/09/2026, escreva por extenso: quinze de setembro de dois mil e vinte e seis.
  • Valores em reais: Se você colar R$ 1.500,50, o motor pode ler ponto e vírgula como palavras avulsas. Digite mil e quinhentos reais e cinquenta centavos.
  • Intervalos: Em vez de 3-5 dias, escreva três a cinco dias.
  • Porcentagens: Escreva dez por cento ou noventa por cento em vez de usar o símbolo %.

Siglas e nomes próprios

Alguns motores tentam ler siglas como se fossem palavras comuns:

  • Para siglas com letras separadas, use hifens: escreva C-P-F, I-P-V-A, A-P-I ou T-T-S.
  • Para o Pix, digite Pix com maiúscula e minúscula normal.
  • Para nomes de marcas compostos, separe os termos com espaço para que as sílabas não fiquem coladas na fala.

Acentuação e sons nasais

No português do Brasil, um acento esquecido muda o significado e o timbre da vogal:

  • Diferencie avô (som fechado) de avó (som aberto).
  • Palavras terminadas em ão e ões (como informação ou conclusões): se o modelo soar atropelado no final da palavra, coloque uma vírgula logo após para dar o tempo exato da ressonância nasal.

Controlando o ritmo com a pontuação

A pontuação funciona como instrução de tempo para o modelo:

  • Vírgulas geram uma pausa curta de respiração. Se uma frase parecer longa demais ou acelerada, quebre com uma vírgula onde você normalmente respiraria.
  • Pontos finais fecham a ideia e reduzem o pitch ao final da frase.
  • Reticências (...) criam uma pausa reflexiva mais longa antes da frase seguinte.

5. Checklist rápido antes de enviar seu áudio

Antes de fazer o upload:

  1. Ouça a gravação no fone de ouvido em volume alto. Dá para ouvir a rua ou o barulho da geladeira no fundo? Se sim, grave de novo.
  2. Observe se não há estalos fortes nas letras p e b.
  3. Mantenha o arquivo entre 20 e 40 segundos.
  4. Salve em formato WAV ou MP3 de boa qualidade (pelo menos 192 kbps).

Com o áudio pronto, você já pode acessar o VoiceCloner e gerar o seu modelo de voz. Se tiver dúvidas sobre pronúncia ou geração em lote, fale conosco pela página de Contato.