Três etapas, e a segunda é a que consome o tempo de todo mundo.
Todo karaokê caseiro passa pelos mesmos três passos, e eles têm dificuldades muito diferentes:
Esqueça o truque antigo de inverter a fase de um canal. Ele só funciona quando a voz está exatamente no centro e mais nada está — o que praticamente nunca acontece numa mixagem moderna. O resultado sai abafado porque, junto com a voz, você cancelou metade do que estava no centro: bumbo, caixa e baixo.
O padrão gratuito hoje é o Ultimate Vocal Remover (UVR), que roda na sua própria máquina.
O limite que ninguém contorna: separação não inventa qualidade que não existe no arquivo. Se a origem é ruim, o instrumental sai ruim e com artefatos. Gravação ao vivo, com plateia e reverberação de sala, é o pior caso.
Existe um abismo entre "letra na tela" e "letra sincronizada". A primeira é um bloco de texto; a segunda destaca a sílaba certa no momento certo, que é o que faz alguém conseguir cantar sem conhecer a música de cor.
Na mão, a ferramenta clássica é o Karaoke Builder Studio (Windows, pagamento único). Automático, um sistema de transcrição escuta a voz original e devolve as marcações. Ganha em tempo e perde em precisão: voz gritada, distorcida ou com muito efeito derruba qualquer transcrição automática.
Se é pra você mesmo cantar no computador, um formato de karaokê resolve. Se é pra tocar numa máquina de karaokê ou numa TV, aí você precisa de CDG ou de um vídeo com a letra queimada na imagem.
Na mão, conte cerca de uma hora por música depois que você pegar o jeito. Automatizado, o gargalo vira o processamento — separar e transcrever custa tempo de máquina, e é normal levar bem mais que a duração da música.
Tecnicamente sim, desde que você tenha o arquivo de áudio. Na prática o resultado depende da gravação: mixagem limpa de estúdio sai bem, gravação ao vivo com plateia sai com artefatos, e voz gritada ou muito distorcida derruba a transcrição automática da letra.
O Ultimate Vocal Remover (UVR) é o padrão gratuito e roda na sua própria máquina. Evite o método de inversão de fase do Audacity: ele só funciona quando a voz está exatamente no centro da mixagem e deixa o instrumental abafado.
Fazendo na mão, cerca de uma hora por música depois de pegar o jeito — a sincronização da letra é o que consome quase todo esse tempo. Automatizado, o tempo vira processamento de máquina.
O StarSinger faz esses três passos sozinho. Você sobe um arquivo que já tem, ele separa a voz, transcreve a letra com tempo por sílaba e devolve um karaokê que toca no navegador, com pontuação de afinação. É grátis hoje.
Ressalvas, porque elas são reais: a transcrição erra em voz gritada ou muito distorcida, e o processamento leva bem mais que a duração da música.
Testar de graça