← Guias

Como colocar a letra sincronizada na tela

Tirar a voz é a metade fácil. Esta é a outra metade.

Letra na tela ≠ letra sincronizada

Colocar o texto da música numa tela é fácil — qualquer editor de vídeo faz. O que serve pra cantar é outra coisa: a sílaba certa destacando no momento certo. Sem isso, quem não conhece a música de cor não acompanha.

Os formatos

Na mão

O Karaoke Builder Studio (Windows, pagamento único) é o clássico pra CDG. Você toca a música e vai marcando. Conte cerca de uma hora por música depois de pegar o jeito.

Automático

Um sistema de reconhecimento de fala escuta a voz separada e devolve as marcações. É rápido, e erra de forma previsível:

Em gravação de estúdio com dicção clara, o resultado costuma ser bom o suficiente pra você só ajustar detalhes.

Um detalhe que assusta quem gera a primeira vez: trechos longos sem letra nenhuma são normais. Introdução, solo e ponte são instrumentais de verdade — comparando com letras sincronizadas oficiais, é comum 25% a 40% de uma música ser instrumental.

Perguntas frequentes

Qual a diferença entre LRC, CDG e UltraStar?

LRC sincroniza por linha e é só texto. CDG é o formato gráfico das máquinas de karaokê, um par mp3 mais cdg. UltraStar marca cada sílaba com tempo, duração e altura da nota — é o único que permite pontuar afinação.

Como sincronizar a letra com a música automaticamente?

Um sistema de reconhecimento de fala escuta a voz separada e gera as marcações de tempo. Funciona bem em gravação de estúdio com dicção clara, e erra bastante em voz gritada, distorcida ou gravada ao vivo.

É normal a letra sumir em partes da música?

Sim. Introdução, solo e ponte são instrumentais. Comparando com letras sincronizadas oficiais, é comum que 25% a 40% da duração de uma música não tenha canto nenhum.

O StarSinger faz esses três passos sozinho. Você sobe um arquivo que já tem, ele separa a voz, transcreve a letra com tempo por sílaba e devolve um karaokê que toca no navegador, com pontuação de afinação. É grátis hoje.

Ressalvas, porque elas são reais: a transcrição erra em voz gritada ou muito distorcida, e o processamento leva bem mais que a duração da música.

Testar de graça