Funcionários do Google questionam a capacidade de programação real do Gemini 4

Renê Fraga
8 min de leitura

Principais destaques

  • Dúvida dentro do Google: funcionários questionam se o Gemini 4 entrega, no mundo real, o mesmo desempenho mostrado nos benchmarks.
  • Programação virou o teste crítico: relatos apontam dificuldades em tarefas práticas de desenvolvimento, justamente uma das aplicações mais valiosas dos modelos de IA.
  • A corrida ficou mais apertada: parte dos funcionários avalia que Anthropic e OpenAI estão avançando mais rapidamente, enquanto o Google rejeita a ideia de que o modelo esteja abaixo do esperado.

O próximo grande modelo de IA do Google pode estar diante de um problema que não aparece facilmente em uma tabela de benchmarks.

Segundo uma reportagem da Bloomberg, funcionários da Alphabet levantaram dúvidas internamente sobre o desempenho real do Gemini 4. A preocupação não seria exatamente com as pontuações obtidas em testes padronizados, mas com aquilo que acontece quando o modelo precisa trabalhar em tarefas concretas.

E programação aparece no centro dessa discussão.

Quando o benchmark encontra o mundo real 🧪

Os modelos de linguagem são frequentemente avaliados por benchmarks que tentam medir raciocínio, matemática, conhecimento e capacidade de programação.

O problema é que uma boa nota nesses testes não significa necessariamente que um modelo consiga resolver, de ponta a ponta, um problema complexo encontrado por um desenvolvedor.

🔎 É aí que surgiu o incômodo: pessoas com acesso direto ao projeto disseram à Bloomberg que o Gemini 4 apresenta resultados fortes nos benchmarks, mas pode ter desempenho inferior em determinadas tarefas de programação realizadas em situações reais.

É uma diferença importante.

Um teste pode avaliar se a IA consegue produzir determinado trecho de código. Um ambiente de desenvolvimento real exige muito mais: entender uma base de código existente, identificar dependências, corrigir erros, lidar com requisitos pouco claros e fazer várias alterações sem quebrar aquilo que já funcionava.

É justamente nesse tipo de trabalho que os funcionários estariam observando dificuldades.

Programar virou uma espécie de prova de fogo 💻

A questão ganha peso porque programação está entre as aplicações comercialmente mais importantes dos grandes modelos de IA.

Ferramentas de desenvolvimento assistido por IA já fazem parte da estratégia de empresas como Google, OpenAI e Anthropic. Quanto mais capazes esses modelos se tornam, maior é a expectativa de que consigam atuar não apenas como geradores de código, mas como agentes capazes de executar tarefas completas de engenharia de software.

💡 O ponto mais delicado não é simplesmente “qual modelo tem a maior nota”. É saber se ele consegue transformar essa capacidade em trabalho útil fora do laboratório.

Para o Google, a discussão é particularmente relevante.

O Gemini está integrado a uma enorme quantidade de produtos da empresa, incluindo Search, Maps, Gmail e Chrome. Esses serviços alcançam mais de 1 bilhão de usuários cada, segundo o material fornecido.

Um modelo central para essa estratégia precisa funcionar em uma escala muito maior do que uma demonstração ou um benchmark.

E os concorrentes? 👀

Dentro do Google, segundo a Bloomberg, alguns funcionários acreditam que Anthropic e OpenAI estejam aprimorando seus modelos em ritmo mais acelerado.

A reportagem cita os codinomes internos Fable, associado à Anthropic, e Astra, associado à OpenAI.

Também há um detalhe curioso no histórico recente do projeto: o Google teria planejado lançar o Gemini 3.5 Pro em junho, mas acabou abandonando esse plano.

Isso ajuda a explicar por que cada novo ciclo de desenvolvimento passou a ser observado com atenção dentro da empresa.

Gemini 4 x expectativa

PontoSituação relatada
BenchmarksResultados considerados fortes
Programação práticaHá relatos internos de dificuldades
Visão de parte dos funcionáriosPreocupação com o ritmo dos concorrentes
Posição oficial do GoogleEmpresa contesta a caracterização negativa

O Google diz que a história é outra 🗣️

A Alphabet não concordou com a caracterização apresentada pela reportagem.

O Google citou declarações recentes de Koray Kavukcuoglu, chefe do Google DeepMind, que afirmou estar satisfeito com o desempenho do Gemini 4.

Um funcionário familiarizado com o desenvolvimento também disse à Bloomberg que existe um “grande consenso” interno de que o Gemini 4 está na fronteira tecnológica.

A mesma fonte negou que os modelos estejam enfrentando dificuldades com tarefas de programação do mundo real.

Ou seja, existem duas leituras dentro da própria história: uma baseada nos relatos de funcionários que expressaram preocupação e outra apresentada pelo Google, que afirma que o modelo está no nível esperado.

O mercado reagiu rápido 📉

A reportagem da Bloomberg também teve reflexo imediato nas ações da Alphabet.

Os papéis chegaram a subir mais de 2% antes da publicação. Depois que a notícia foi divulgada, os ganhos diminuíram, e as ações encerraram o dia com alta de aproximadamente 0,5%, segundo o texto-base.

A reação mostra como o desempenho dos modelos de IA passou a ser tratado pelos investidores como parte importante da avaliação das grandes empresas de tecnologia.

Não se trata apenas de lançar um novo chatbot.

Google, OpenAI e Anthropic estão tentando construir modelos capazes de executar tarefas cada vez mais complexas, e a capacidade de programação se tornou um dos campos em que essa disputa pode ser mais facilmente percebida.

A pergunta que o benchmark não responde 🤔

O caso do Gemini 4 coloca uma questão maior para toda a indústria.

📊 Uma pontuação elevada prova capacidade ou apenas capacidade de obter uma pontuação elevada?

Benchmarks continuam sendo importantes. Eles permitem comparar modelos sob condições controladas e acompanhar a evolução técnica.

Mas tarefas reais introduzem variáveis difíceis de reproduzir em uma tabela: contexto, erros inesperados, sistemas legados, múltiplas etapas e necessidade de manter consistência durante uma execução longa.

É possível, portanto, que os dois lados estejam descrevendo partes diferentes da realidade. Um modelo pode atingir resultados de fronteira em avaliações padronizadas e ainda apresentar limitações em determinados fluxos de trabalho.

No caso do Gemini 4, o que vai resolver essa dúvida não será apenas a próxima tabela de benchmarks.

Será o uso.

E, quando o modelo chegar às mãos de desenvolvedores e usuários em escala, o Google terá uma espécie de teste muito mais difícil pela frente: provar que aquilo que funciona no laboratório também funciona quando o código começa a quebrar.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador do Google Discovery (GD) e editor-chefe do Eurisko. Profissional de marketing digital, com pós-graduação pela ESPM, acompanha o Google desde os anos 2000 e escreve há mais de duas décadas sobre tecnologia, produtos digitais e o ecossistema da empresa. Criador do Google Discovery em 2006, tornou-se referência na cobertura do Google no Brasil e foi colunista do TechTudo (Globo.com), compartilhando análises e conhecimento com um grande público.
Nenhum comentário