VALL-E, IA da Microsoft, pode reproduzir voz humana de qualquer amostra de áudio

Renê Fraga
1 min de leitura

A Microsoft exibiu sua mais recente pesquisa em Inteligência Artificial de conversão de texto em fala com um modelo chamado VALL-E.

Ele pode gerar áudio a partir de uma entrada de texto e de uma pequena amostra de áudio de alguém, de três segundos apenas.

O VALL-E foi treinado com 60.000 horas de fala em inglês de mais de 7.000 falantes para imitar o seu timbre, tom emocional e acústica da sala, desde que a amostra seja suficientemente longa.

Embora possa ser usado para aplicativos personalizados ou sofisticados de conversão de texto em fala, ele também traz riscos de uso indevido, como os deepfakes.

A Microsoft agora planeja ampliar os dados de treinamento e explorar maneiras de reduzir palavras que não são claras ou perdidas.

No entanto, a gigante de Redmond optou por não tornar o código aberto, para evitar riscos potenciais de uso indevido do modelo.

“Como o VALL-E pode sintetizar a fala que mantém a identidade do locutor, pode acarretar riscos potenciais no uso indevido do modelo, como falsificação de identificação de voz ou personificação”, escreveu a empresa.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir:
Renê Fraga é fundador do Google Discovery (GD) e editor-chefe do Eurisko. Profissional de marketing digital, com pós-graduação pela ESPM, acompanha o Google desde os anos 2000 e escreve há mais de duas décadas sobre tecnologia, produtos digitais e o ecossistema da empresa. Criador do Google Discovery em 2006, tornou-se referência na cobertura do Google no Brasil e foi colunista do TechTudo (Globo.com), compartilhando análises e conhecimento com um grande público.
Nenhum comentário