Google aposta em vozes de IA mais expressivas com novos modelos Gemini 3.8

Renê Fraga
8 min de leitura

Principais destaques

  • Dois novos modelos: Gemini 3.8 Flash TTS e Flash-Lite TTS chegam à API Gemini e ao Google AI Studio para geração de voz.
  • Vozes sob medida: o Flash TTS permite criar perfis vocais por prompt, reproduzir vozes com autorização e trabalhar com mais de 100 idiomas e dialetos.
  • Áudio em escala: os modelos apostam em podcasts, dublagem, localização e agentes de voz, com suporte a falas longas e performances com múltiplos personagens.

O Google quer que a síntese de voz deixe de parecer apenas uma máquina lendo texto.

A empresa apresentou o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS, dois modelos voltados à conversão de texto em fala que chegam com uma proposta mais ambiciosa: controlar não apenas o que uma voz diz, mas também como ela diz.

Os dois modelos já começaram a ser disponibilizados pela API Gemini e no Google AI Studio.

Create your own voices with Gemini 3.8 text-to-speech

Um modelo para criar. Outro para escalar. 🎙️

A divisão de tarefas é relativamente simples.

O Gemini 3.8 Flash TTS foi projetado para situações em que a direção criativa importa mais. Já o Flash-Lite TTS mira aplicações de alto volume, nas quais custo e escala têm peso maior.

Na prática, o Google está tentando atender desde uma produção audiovisual que precisa de uma voz bastante específica até aplicações que precisam gerar enormes quantidades de áudio.

🎭 A ideia central: transformar instruções em performance.

Com o Flash TTS, desenvolvedores podem usar linguagem natural para descrever uma voz, especificando elementos como papel, sotaque e características vocais.

O sistema suporta mais de 100 idiomas e dialetos, ampliando também as possibilidades de localização de conteúdo.

De 30 vozes para mais de 2.000

Uma das mudanças mais visíveis está na quantidade de vozes disponíveis.

A biblioteca do Google, que tinha cerca de 30 vozes originais, passa a oferecer mais de 2.000 opções prontas para produção.

Entre as variedades citadas estão:

• espanhol mexicano
• francês quebequense
• inglês escocês

Isso é particularmente relevante para conteúdos internacionais. Uma mesma produção pode precisar não apenas de tradução, mas de uma voz que soe natural para cada mercado.

E o Google está indo além das vozes pré-configuradas.

Quer uma voz específica? Você pode descrevê-la

O Gemini 3.8 Flash TTS permite criar vozes originais a partir de prompts em linguagem natural.

Em vez de escolher simplesmente entre “voz masculina” e “voz feminina”, por exemplo, o desenvolvedor pode orientar características de interpretação e identidade vocal.

Há também um recurso de replicação de voz capaz de recriar um perfil vocal a partir de uma amostra de aproximadamente 30 segundos.

Mas existe uma condição importante: o usuário precisa ter os direitos sobre aquela voz.

🔐 Consentimento entra no processo: o Google informa que o sistema exige uma gravação de consentimento verbal do proprietário da voz antes da replicação.

Os áudios gerados também recebem marca d’água SynthID e credenciais C2PA, mecanismos destinados a ajudar na identificação da origem e autenticidade do conteúdo.

A função de replicação de voz pelo AI Studio, porém, possui restrições geográficas e não está disponível em Illinois, Texas, na Área Econômica Europeia, Reino Unido, Suíça e Índia.

Não é só uma voz lendo um roteiro

Talvez a mudança mais interessante esteja na forma como o modelo interpreta o texto.

Os dois modelos suportam direção de performance linha por linha, permitindo controlar melhor a maneira como cada trecho deve ser interpretado.

Isso abre espaço para uma diferença importante entre TTS tradicional e geração de voz orientada por IA.

Uma frase pode ser escrita para transmitir determinada emoção. Outra pode exigir uma pausa. Uma terceira pode pedir uma reação espontânea.

💡 O objetivo é fazer a voz interpretar a cena, e não simplesmente pronunciar as palavras.

O sistema também consegue lidar com áudio de longa duração, incluindo horas de geração, algo especialmente relevante para podcasts, audiolivros, narrativas e conteúdos extensos.

Até risada e suspiro entram em cena

Os modelos também incorporam sinais não verbais à performance.

Entre os exemplos estão:

• risadas
• suspiros
• interjeições
• sinais de escuta ativa

Há ainda encenação nativa de cenas com dois locutores, permitindo produzir diálogos para podcasts e narrativas dramáticas sem necessariamente tratar cada personagem como uma gravação completamente separada.

Isso aproxima a tecnologia de uma espécie de direção de áudio automatizada.

E os benchmarks?

O Google afirma que o Gemini 3.8 Flash TTS alcançou a primeira posição no Voice Design Benchmark, da Hume AI, com pontuação de 71,4.

No benchmark de modelagem de sotaques, o modelo chegou a 60,8.

Segundo a empresa, os dois novos modelos também ficaram nas duas primeiras posições do Índice de Qualidade Geral da Hume AI.

Em avaliações cegas de preferência humana realizadas no Voice Arena, os modelos ficaram no topo em idiomas que incluem japonês, português brasileiro, vietnamita e hindi.

Esses resultados são apresentados pelo Google como evidência de que a melhoria não está restrita ao inglês.

O português brasileiro aparece entre os destaques 🇧🇷

Esse detalhe chama atenção especialmente para o mercado brasileiro.

O português brasileiro aparece entre os idiomas nos quais os modelos tiveram desempenho de destaque nas avaliações de preferência humana.

Para empresas que trabalham com localização, publicidade, educação, atendimento automatizado e produção audiovisual, uma voz natural em português pode ser tão importante quanto a capacidade de gerar o áudio rapidamente.

🌎 A disputa agora é pela naturalidade: não basta uma IA conseguir falar português. Ela precisa soar como alguém falando português.

Quem já está usando?

O ecossistema ao redor da API Gemini também começa a incorporar os modelos.

Plataformas como Agora, LiveKit, Pipecat e Vercel oferecem suporte aos novos modelos por meio da API Gemini.

Entre as empresas citadas como integradoras estão Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang.

Os casos de uso incluem principalmente:

• dublagem
• localização de mídia
• agentes de voz
• produção de conteúdo
• aplicações conversacionais

O acesso empresarial por meio do Gemini Enterprise está previsto para chegar posteriormente.

A corrida agora é pela voz que parece humana

A evolução do TTS está mudando o foco da simples inteligibilidade para algo mais difícil de medir: presença.

Uma voz pode pronunciar perfeitamente cada palavra e ainda soar artificial. O desafio é reproduzir ritmo, pausa, sotaque, emoção, reação e contexto.

Com os Gemini 3.8 Flash TTS e Flash-Lite TTS, o Google tenta colocar esses elementos dentro do próprio processo de geração.

E, à medida que vozes sintéticas começam a aparecer em podcasts, vídeos, agentes de atendimento e dublagens, a pergunta deixa de ser apenas se a máquina consegue falar.

Passa a ser: quanto tempo ainda levaremos para perceber quando ela está falando por nós?

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador do Google Discovery (GD) e editor-chefe do Eurisko. Profissional de marketing digital, com pós-graduação pela ESPM, acompanha o Google desde os anos 2000 e escreve há mais de duas décadas sobre tecnologia, produtos digitais e o ecossistema da empresa. Criador do Google Discovery em 2006, tornou-se referência na cobertura do Google no Brasil e foi colunista do TechTudo (Globo.com), compartilhando análises e conhecimento com um grande público.
Nenhum comentário