Google sobe a régua para medir o que a IA realmente consegue programar no Android

Renê Fraga
8 min de leitura

Principais destaques

  • Benchmark ficou mais difícil O Android Bench 2.0 troca tarefas rápidas por trabalhos de engenharia que podem levar dias.
  • A nota agora é contínua O Google passou a medir grau de conclusão, fidelidade visual e regressões, em vez de apenas aprovar ou reprovar.
  • Arquitetura continua sendo o gargalo Modelos avançam em conversões e transformações previsíveis, mas ainda tropeçam em migrações e portabilidade.

O teste de uma IA programadora costumava caber em uma espécie de prova de múltipla escolha para desenvolvedores: corrigiu o bug, passou. Não corrigiu, reprovou.

O Google decidiu que esse modelo já não diz o suficiente.

Com o Android Bench 2.0, a empresa passou a testar uma situação bem mais próxima da rotina de um engenheiro Android: tarefas extensas, cheias de decisões intermediárias e que podem consumir vários dias, ou até uma semana, de trabalho.

A mudança foi anunciada no Android Developers Blog e mexe não apenas nas tarefas, mas também na forma como os resultados são calculados.

Adeus, nota binária 👋

O Android Bench original, lançado no início deste ano, concentrava-se em alterações incrementais em repositórios existentes.

Eram correções de bugs e pequenas solicitações de funcionalidades. Nesse cenário, os modelos conseguiam resultados superiores a 90% com frequência.

O problema aparecia quando a tarefa deixava de ser pequena.

🔎 O detalhe que muda a conta: imagine uma IA responsável por uma migração gigantesca. Se ela concluísse 90% do trabalho, mas deixasse uma parte importante incompleta, o sistema antigo ainda poderia registrar simplesmente um zero.

Para o Google, isso não representava adequadamente o trabalho realizado.

O Android Bench 2.0 substitui esse tudo ou nada por uma pontuação contínua. Assim, diferentes graus de sucesso podem ser reconhecidos em tarefas que não terminam com um simples “funciona” ou “não funciona”.

💡 A mudança é menos sobre dar uma nota maior ou menor e mais sobre medir quanto trabalho a IA realmente conseguiu concluir.

Agora o teste parece trabalho de verdade 🛠️

A nova versão introduz as chamadas “tarefas de longo horizonte”.

Elas incluem desafios como:

• criar aplicativos do zero;
• migrar bibliotecas;
• transformar aplicativos multiplataforma em versões nativas para Android.

São problemas diferentes daqueles em que basta localizar uma linha de código e aplicar uma correção.

🧩 A diferença está nas decisões: quanto maior a tarefa, maior a necessidade de manter contexto, respeitar a arquitetura existente e evitar que uma alteração resolva um problema enquanto cria outro.

Por isso, o novo sistema considera três dimensões importantes: funcionalidade, fidelidade visual e regressões. Também há penalizações quando o modelo se desvia das instruções estruturais da tarefa.

E os modelos? A régua caiu bastante 📉

Os primeiros resultados ajudam a dimensionar o salto de dificuldade.

Nos testes divulgados pelo Google, o GPT-6 Astra, da OpenAI, aparece com taxa de aprovação de 28%. O Gemini 3.8 Flash ficou em 8%.

A comparação com o benchmark anterior é significativa. Nas tarefas mais simples do Android Bench original, os modelos chegavam a resultados em torno de 91%.

Não significa que as IAs tenham ficado subitamente piores.

Significa que a prova passou a perguntar outra coisa.

Em vez de “a IA consegue fazer esta alteração?”, a questão agora se aproxima mais de “a IA consegue conduzir uma tarefa de engenharia complexa até um resultado funcional e consistente?”.

O que elas fazem bem? 🔄

Os resultados apontam uma divisão bastante clara.

Transformações determinísticas continuam entre os trabalhos mais acessíveis para os modelos. Converter Java para Kotlin, por exemplo, é uma tarefa com regras relativamente bem estabelecidas.

Trocar bibliotecas de rede também se encaixa nesse grupo.

Escrever código novo do zero aparece como outro ponto relativamente forte.

⚙️ Quando o caminho é conhecido: quanto mais previsível é a transformação, menor tende a ser o espaço para decisões arquiteturais ambíguas.

O problema começa quando o código exige uma sequência de escolhas que não pode ser resolvida apenas seguindo padrões conhecidos.

É aí que a arquitetura cobra a conta 🧱

Validação em tempo de execução, migrações de frameworks e portabilidade entre plataformas continuam entre os desafios mais difíceis.

Nas tarefas de portabilidade entre plataformas, mesmo os modelos de melhor desempenho chegaram a no máximo 80% de conclusão. Nenhum alcançou 100%.

Esse número é particularmente interessante porque mostra onde a diferença entre gerar código e fazer engenharia começa a aparecer.

Um aplicativo pode compilar e ainda assim estar longe de cumprir completamente os requisitos.

Uma migração pode avançar bastante e ainda deixar decisões estruturais pendentes. Uma conversão pode funcionar em um cenário e introduzir regressões em outro.

O agente também entra na prova 🤖

O Android Bench 2.0 não olha apenas para o modelo isoladamente.

O Google também passou a avaliar configurações agênticas, nas quais o modelo trabalha dentro de um ambiente de desenvolvimento específico.

Entre os exemplos estão o Gemini 3.8 Flash executado no Google Antigravity e o GPT-5.6 Sol trabalhando com o Codex.

Essa escolha é importante porque, na prática, uma IA programadora não opera apenas como uma caixa de texto.

Ela pode receber acesso a arquivos, ferramentas, terminal, ambiente de desenvolvimento e mecanismos para testar o próprio trabalho.

🧪 O ambiente conta: segundo o Google, o desenho do harness em torno do modelo pode influenciar bastante os resultados obtidos em situações próximas do mundo real.

Isso significa que comparar somente “modelo A contra modelo B” pode deixar de ser suficiente.

Uma espécie de teste de resistência ⏱️

A proposta do Android Bench 2.0 aproxima a avaliação daquilo que interessa a uma equipe de desenvolvimento: não apenas se a IA consegue produzir uma resposta correta, mas se consegue sustentar uma tarefa complexa por tempo suficiente para chegar a um resultado utilizável.

O ranking atualizado já está disponível no site do Android Developers.

E o Google pretende ampliar a lista com outras combinações entre modelos e agentes.

No fim, a metáfora da prova simples deixa de funcionar. A nova avaliação parece mais com entregar uma obra para a IA e voltar alguns dias depois para descobrir o que realmente ficou de pé.

A pergunta agora é outra: quanto mais longa e estrutural for a tarefa, quanto tempo ainda falta para esses agentes conseguirem levar um projeto Android inteiro até a linha de chegada?

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador do Google Discovery (GD) e editor-chefe do Eurisko. Profissional de marketing digital, com pós-graduação pela ESPM, acompanha o Google desde os anos 2000 e escreve há mais de duas décadas sobre tecnologia, produtos digitais e o ecossistema da empresa. Criador do Google Discovery em 2006, tornou-se referência na cobertura do Google no Brasil e foi colunista do TechTudo (Globo.com), compartilhando análises e conhecimento com um grande público.
Nenhum comentário