Google cria uma IA que entende texto, imagem, áudio e vídeo ao mesmo tempo

Renê Fraga
10 min de leitura

Principais destaques

  • Um embedding multimodal: o modelo transforma texto, código, imagens, vídeo e áudio em vetores de 768 dimensões dentro de um espaço compartilhado.
  • Cabe em dispositivos menores: com 740 milhões de parâmetros, pode funcionar em celulares e notebooks, com a versão completa ocupando cerca de 567 MB de memória ativa em um Pixel 11 Pro.
  • Busca multimídia sem nuvem: a tecnologia pode encontrar uma cena específica de vídeo a partir de uma descrição em texto ou de uma gravação de voz.

O Google DeepMind apresentou nesta terça-feira, 6 de outubro, o EmbeddingGemma 2, um modelo de pesos abertos criado para uma tarefa menos chamativa que gerar textos e imagens, mas fundamental para a inteligência artificial atual: entender a relação entre diferentes tipos de informação.

Em vez de produzir uma resposta diretamente, o modelo transforma conteúdos em representações numéricas chamadas embeddings. A diferença agora é que texto, código, imagem, áudio e vídeo podem ocupar o mesmo espaço matemático.

Na prática, isso permite que uma frase seja usada para procurar uma imagem, uma gravação de voz encontre um trecho de vídeo ou uma descrição em texto localize um momento específico em horas de áudio.

A ideia parece abstrata. O resultado não é 🎯

Imagine uma biblioteca gigantesca sem títulos, categorias ou etiquetas.

Para encontrar alguma coisa, seria preciso abrir arquivo por arquivo.

Um sistema de embeddings funciona de maneira diferente. Ele transforma cada conteúdo em uma espécie de coordenada matemática que representa seu significado. Conteúdos semanticamente parecidos ficam próximos nesse espaço.

É justamente essa lógica que está por trás de mecanismos modernos de busca e de sistemas de RAG, ou geração aumentada por recuperação, nos quais a IA primeiro encontra informações relevantes e só depois produz uma resposta.

O EmbeddingGemma 2 leva essa ideia para além do texto.

💡 O salto importante não é apenas entender mais formatos. É fazer com que formatos diferentes possam ser comparados diretamente.

Um modelo modular, não um bloco único 🧩

Os 740 milhões de parâmetros do EmbeddingGemma 2 não precisam necessariamente ser carregados de uma vez.

O Google estruturou o modelo em componentes que podem ser combinados conforme a necessidade:

ComponenteParâmetros
Texto e código270 milhões
Visão170 milhões
Áudio300 milhões
Modelo completo740 milhões

Isso cria uma característica interessante.

Uma aplicação pode usar apenas o núcleo de texto e código para determinadas tarefas e recorrer aos módulos de visão ou áudio quando precisar pesquisar conteúdo multimídia.

E tudo continua conversando no mesmo espaço de embeddings.

Isso significa, por exemplo, que uma consulta transformada em embedding pelo componente textual pode ser comparada diretamente com conteúdos processados pelo modelo multimodal completo.

Cabe bastante coisa na janela de contexto 📦

O EmbeddingGemma 2 trabalha com uma janela de contexto de 8.192 tokens, quatro vezes maior que a do primeiro EmbeddingGemma.

Segundo o material do Google, uma única entrada pode comportar aproximadamente:

• até 29 imagens;
• até 58 quadros de vídeo;
• até 5,5 minutos de áudio.

Não significa que o modelo esteja simplesmente “assistindo” a um vídeo inteiro como uma pessoa faria.

A proposta é converter essas diferentes modalidades em representações que possam ser comparadas para tarefas de recuperação e busca.

E os vetores podem ficar menores 📉

Outro recurso importante é o Matryoshka Representation Learning.

A técnica permite reduzir os embeddings de 768 para dimensões menores, chegando a 128 dimensões.

Isso pode diminuir o espaço necessário para armazenar os vetores em até seis vezes.

Segundo o guia de desenvolvimento do Google, embeddings de 256 dimensões preservam cerca de 95% da qualidade na recuperação de imagens, vídeos e fala.

Com 128 dimensões, a qualidade multimodal cai para aproximadamente 75%.

Para sistemas que precisam armazenar milhões ou bilhões de embeddings, essa diferença de tamanho pode deixar de ser detalhe técnico e virar uma questão importante de infraestrutura.

O celular começa a virar o banco de dados 🔎

Um dos pontos mais interessantes do lançamento é justamente onde o Google pretende colocar o modelo: no dispositivo.

Em um Pixel 11 Pro com quantização, os pesos somente de texto utilizam cerca de 191 MB de memória ativa.

A configuração multimodal completa fica em aproximadamente 567 MB.

É uma diferença enorme em relação à ideia tradicional de enviar todo o conteúdo para um servidor, processá-lo na nuvem e receber o resultado de volta.

O modelo também está sendo integrado a demonstrações do Google AI Edge Gallery.

Uma delas, chamada Instant Media Search, permite pesquisar fotos e vídeos armazenados localmente usando descrições.

Outra, o Video Moments Finder, consegue localizar cenas específicas, como um cachorro pegando um frisbee.

E isso pode funcionar sem transcrever tudo 🎙️

O exemplo mais interessante talvez seja a possibilidade de usar uma gravação de voz para encontrar um trecho específico de vídeo.

Pense em alguém dizendo algo como “encontre aquele momento em que o cachorro corre atrás do frisbee”.

Em vez de depender exclusivamente de uma transcrição do áudio, o sistema pode comparar a representação semântica da consulta com as representações visuais e multimodais dos conteúdos.

É uma mudança sutil, mas importante: a busca deixa de depender tanto das palavras que aparecem em um arquivo e passa a considerar o que o conteúdo representa.

O desempenho também melhorou

O EmbeddingGemma 2 sucede o primeiro EmbeddingGemma, lançado em setembro de 2025.

A primeira versão tinha 308 milhões de parâmetros, era exclusivamente textual e baseada no Gemma 3.

Segundo o Google, ela já ultrapassou 20 milhões de downloads.

No benchmark de código do Massive Text Embedding Benchmark, o novo modelo teria alcançado 78,68, contra 68,76 da geração anterior, uma diferença de 9,92 pontos.

Isso mostra que o projeto não está sendo tratado apenas como uma extensão multimodal. O Google também está tentando melhorar o desempenho nas tarefas tradicionais de embeddings.

Apache 2.0 abre a porta para aplicações comerciais 🚪

O EmbeddingGemma 2 é distribuído sob a licença Apache 2.0, que permite uso comercial.

Os pesos já estão disponíveis no Hugging Face e no Kaggle.

O Google também afirma que pretende levar o modelo ao ML Kit para Android nas próximas semanas, com suporte à aceleração de hardware em dispositivos compatíveis.

A chegada ao Model Garden da Gemini Enterprise Agent Platform está prevista para depois.

Há, porém, uma responsabilidade importante

O model card informa que o EmbeddingGemma 2 não passou por ajuste de segurança pós-treinamento.

Isso não significa que o modelo seja necessariamente inseguro para qualquer aplicação. Significa que boa parte das proteções e decisões de segurança precisa ser implementada no próprio sistema criado pelo desenvolvedor.

Para quem pretende colocar a tecnologia dentro de um produto, esse detalhe é bem mais importante do que parece.

A aposta do Google é maior que um modelo de busca

O ponto central do EmbeddingGemma 2 não é simplesmente fazer uma busca melhor em fotos ou vídeos.

É criar uma espécie de idioma matemático comum para diferentes formatos de informação.

Texto, áudio, imagem e vídeo deixam de ser compartimentos completamente separados. Para uma aplicação, todos podem virar pontos comparáveis dentro do mesmo espaço.

Isso abre caminho para sistemas locais capazes de pesquisar grandes coleções de mídia, organizar arquivos automaticamente, encontrar momentos específicos em gravações e alimentar sistemas RAG sem necessariamente enviar todo o conteúdo para a nuvem.

E existe uma ironia interessante nisso tudo.

Durante anos, a evolução da IA foi apresentada principalmente como uma corrida para construir modelos cada vez maiores. O EmbeddingGemma 2 aponta para outra direção: um modelo relativamente compacto, instalado no aparelho, pode ser extremamente útil justamente porque sabe onde procurar.

Se essa estratégia funcionar bem, talvez o próximo salto da IA no celular não seja apenas conversar com o aparelho. Pode ser simplesmente encontrar qualquer coisa nele, independentemente de onde aquela informação esteja escondida.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador do Google Discovery (GD) e editor-chefe do Eurisko. Profissional de marketing digital, com pós-graduação pela ESPM, acompanha o Google desde os anos 2000 e escreve há mais de duas décadas sobre tecnologia, produtos digitais e o ecossistema da empresa. Criador do Google Discovery em 2006, tornou-se referência na cobertura do Google no Brasil e foi colunista do TechTudo (Globo.com), compartilhando análises e conhecimento com um grande público.
Nenhum comentário