Principais destaques
- Dúvida dentro do Google: funcionários questionam se o Gemini 4 entrega, no mundo real, o mesmo desempenho mostrado nos benchmarks.
- Programação virou o teste crítico: relatos apontam dificuldades em tarefas práticas de desenvolvimento, justamente uma das aplicações mais valiosas dos modelos de IA.
- A corrida ficou mais apertada: parte dos funcionários avalia que Anthropic e OpenAI estão avançando mais rapidamente, enquanto o Google rejeita a ideia de que o modelo esteja abaixo do esperado.
O próximo grande modelo de IA do Google pode estar diante de um problema que não aparece facilmente em uma tabela de benchmarks.
Segundo uma reportagem da Bloomberg, funcionários da Alphabet levantaram dúvidas internamente sobre o desempenho real do Gemini 4. A preocupação não seria exatamente com as pontuações obtidas em testes padronizados, mas com aquilo que acontece quando o modelo precisa trabalhar em tarefas concretas.
E programação aparece no centro dessa discussão.
Quando o benchmark encontra o mundo real 🧪
Os modelos de linguagem são frequentemente avaliados por benchmarks que tentam medir raciocínio, matemática, conhecimento e capacidade de programação.
O problema é que uma boa nota nesses testes não significa necessariamente que um modelo consiga resolver, de ponta a ponta, um problema complexo encontrado por um desenvolvedor.
🔎 É aí que surgiu o incômodo: pessoas com acesso direto ao projeto disseram à Bloomberg que o Gemini 4 apresenta resultados fortes nos benchmarks, mas pode ter desempenho inferior em determinadas tarefas de programação realizadas em situações reais.
É uma diferença importante.
Um teste pode avaliar se a IA consegue produzir determinado trecho de código. Um ambiente de desenvolvimento real exige muito mais: entender uma base de código existente, identificar dependências, corrigir erros, lidar com requisitos pouco claros e fazer várias alterações sem quebrar aquilo que já funcionava.
É justamente nesse tipo de trabalho que os funcionários estariam observando dificuldades.
Programar virou uma espécie de prova de fogo 💻
A questão ganha peso porque programação está entre as aplicações comercialmente mais importantes dos grandes modelos de IA.
Ferramentas de desenvolvimento assistido por IA já fazem parte da estratégia de empresas como Google, OpenAI e Anthropic. Quanto mais capazes esses modelos se tornam, maior é a expectativa de que consigam atuar não apenas como geradores de código, mas como agentes capazes de executar tarefas completas de engenharia de software.
💡 O ponto mais delicado não é simplesmente “qual modelo tem a maior nota”. É saber se ele consegue transformar essa capacidade em trabalho útil fora do laboratório.
Para o Google, a discussão é particularmente relevante.
O Gemini está integrado a uma enorme quantidade de produtos da empresa, incluindo Search, Maps, Gmail e Chrome. Esses serviços alcançam mais de 1 bilhão de usuários cada, segundo o material fornecido.
Um modelo central para essa estratégia precisa funcionar em uma escala muito maior do que uma demonstração ou um benchmark.
E os concorrentes? 👀
Dentro do Google, segundo a Bloomberg, alguns funcionários acreditam que Anthropic e OpenAI estejam aprimorando seus modelos em ritmo mais acelerado.
A reportagem cita os codinomes internos Fable, associado à Anthropic, e Astra, associado à OpenAI.
Também há um detalhe curioso no histórico recente do projeto: o Google teria planejado lançar o Gemini 3.5 Pro em junho, mas acabou abandonando esse plano.
Isso ajuda a explicar por que cada novo ciclo de desenvolvimento passou a ser observado com atenção dentro da empresa.
Gemini 4 x expectativa
| Ponto | Situação relatada |
|---|---|
| Benchmarks | Resultados considerados fortes |
| Programação prática | Há relatos internos de dificuldades |
| Visão de parte dos funcionários | Preocupação com o ritmo dos concorrentes |
| Posição oficial do Google | Empresa contesta a caracterização negativa |
O Google diz que a história é outra 🗣️
A Alphabet não concordou com a caracterização apresentada pela reportagem.
O Google citou declarações recentes de Koray Kavukcuoglu, chefe do Google DeepMind, que afirmou estar satisfeito com o desempenho do Gemini 4.
Um funcionário familiarizado com o desenvolvimento também disse à Bloomberg que existe um “grande consenso” interno de que o Gemini 4 está na fronteira tecnológica.
A mesma fonte negou que os modelos estejam enfrentando dificuldades com tarefas de programação do mundo real.
Ou seja, existem duas leituras dentro da própria história: uma baseada nos relatos de funcionários que expressaram preocupação e outra apresentada pelo Google, que afirma que o modelo está no nível esperado.
O mercado reagiu rápido 📉
A reportagem da Bloomberg também teve reflexo imediato nas ações da Alphabet.
Os papéis chegaram a subir mais de 2% antes da publicação. Depois que a notícia foi divulgada, os ganhos diminuíram, e as ações encerraram o dia com alta de aproximadamente 0,5%, segundo o texto-base.
A reação mostra como o desempenho dos modelos de IA passou a ser tratado pelos investidores como parte importante da avaliação das grandes empresas de tecnologia.
Não se trata apenas de lançar um novo chatbot.
Google, OpenAI e Anthropic estão tentando construir modelos capazes de executar tarefas cada vez mais complexas, e a capacidade de programação se tornou um dos campos em que essa disputa pode ser mais facilmente percebida.
A pergunta que o benchmark não responde 🤔
O caso do Gemini 4 coloca uma questão maior para toda a indústria.
📊 Uma pontuação elevada prova capacidade ou apenas capacidade de obter uma pontuação elevada?
Benchmarks continuam sendo importantes. Eles permitem comparar modelos sob condições controladas e acompanhar a evolução técnica.
Mas tarefas reais introduzem variáveis difíceis de reproduzir em uma tabela: contexto, erros inesperados, sistemas legados, múltiplas etapas e necessidade de manter consistência durante uma execução longa.
É possível, portanto, que os dois lados estejam descrevendo partes diferentes da realidade. Um modelo pode atingir resultados de fronteira em avaliações padronizadas e ainda apresentar limitações em determinados fluxos de trabalho.
No caso do Gemini 4, o que vai resolver essa dúvida não será apenas a próxima tabela de benchmarks.
Será o uso.
E, quando o modelo chegar às mãos de desenvolvedores e usuários em escala, o Google terá uma espécie de teste muito mais difícil pela frente: provar que aquilo que funciona no laboratório também funciona quando o código começa a quebrar.