Principais destaques
- Programação em outro nível: funcionários do Google comparam o Gemini 4 Carbon ao Opus 5.5, apontado como o modelo mais avançado da Anthropic para tarefas complexas de programação.
- Codinomes sob teste: documentos internos mencionam três variantes do Gemini 4, Argon, Barium e Carbon, mas ainda não está claro qual será o destino comercial do Carbon.
- Lançamento cercado de dúvidas: o Gemini 4 Argon continua com acesso restrito, enquanto relatos internos apontam diferenças entre os resultados dos benchmarks e o desempenho em tarefas reais.
O Google pode ter uma nova carta na manga para disputar a liderança em inteligência artificial. Enquanto o Gemini 4 Argon ainda está longe de chegar à maioria dos usuários, funcionários da empresa já testam internamente uma versão chamada Carbon, com resultados que chamaram a atenção principalmente na programação.
Segundo informações publicadas pelo Business Insider, o modelo foi adicionado recentemente ao Jetski, uma plataforma interna de programação utilizada pelo Google. Funcionários começaram a compartilhar impressões positivas sobre sua capacidade de executar tarefas complexas de desenvolvimento de software.
A comparação que mais chama a atenção envolve a Anthropic, concorrente que vem ganhando espaço justamente entre desenvolvedores que utilizam agentes de IA para trabalhar em projetos de software.
🧑💻 O Carbon entrou na conversa dos desenvolvedores
Um funcionário do Google descreveu o desempenho do Carbon em programação como semelhante ao do Opus 5.5, modelo da Anthropic citado na reportagem como referência para tarefas prolongadas de desenvolvimento com agentes de IA.
A avaliação, porém, veio acompanhada de uma ressalva: o modelo ainda precisa passar por mais testes.
Outras mensagens em canais internos também demonstraram entusiasmo. Entre os comentários relatados pelo Business Insider, funcionários afirmaram que o Carbon é muito bom e que a próxima versão do Gemini Pro parece promissora.
💡 O sinal mais importante não é apenas o entusiasmo interno, mas o tipo de comparação: o Carbon estaria sendo avaliado em relação a modelos voltados para programação complexa, uma das áreas mais competitivas do mercado de IA.
O Google não quis comentar as informações.
🔎 Argon, Barium e Carbon: afinal, qual modelo será lançado?
A história fica mais interessante quando entram em cena os codinomes.
De acordo com documentos internos citados pelo Business Insider, o Google vem testando diferentes versões do Gemini 4 com os nomes Argon, Barium e Carbon. Esses rótulos não correspondem necessariamente aos nomes que os modelos recebem quando chegam ao público.
O Gemini 4 Argon, por exemplo, teria sido conhecido internamente como Barium-B antes de sua apresentação pública.
Isso significa que o Carbon pode representar uma evolução interna da família Gemini 4 sem necessariamente chegar ao mercado com esse nome.
Ainda não há confirmação de que ele será lançado como uma atualização do Argon, como um modelo separado ou mesmo de que chegará ao público.
⚠️ A diferença entre teste e lançamento importa: resultados promissores em ferramentas internas não garantem que o modelo esteja pronto para distribuição ampla, especialmente quando há exigências de segurança, confiabilidade e custo operacional.
🚧 O Argon chegou, mas quase ninguém pode usá-lo
Anunciado em 30 de setembro, o Gemini 4 Argon começou sua trajetória com uma estratégia de distribuição bastante restrita.
Inicialmente, o acesso foi destinado a participantes selecionados do Fairwind Program, iniciativa voltada a defensores cibernéticos de confiança. A proposta do Google é coletar feedback e aprimorar as proteções de segurança antes de ampliar a disponibilidade.
A expectativa apresentada é que clientes pagantes da API e assinantes do Google AI Ultra estejam entre os próximos grupos contemplados. Até o momento descrito na reportagem, não havia uma data confirmada para a expansão do acesso.
O Google também divulgou números ambiciosos para o Argon.
| Indicador | Dado divulgado |
|---|---|
| Resultado no DeepSWE v1.1 | 77,9% |
| Limite de saída anterior | 64 mil tokens |
| Novo limite de saída | 1 milhão de tokens |
| Preço promocional de entrada | US$ 2 por milhão de tokens |
| Preço promocional de saída | US$ 10 por milhão de tokens |
O DeepSWE v1.1 avalia capacidades relacionadas à engenharia de software de longo prazo. Já o aumento para 1 milhão de tokens amplia a quantidade de conteúdo que o modelo pode produzir em uma única saída, embora esse limite, isoladamente, não determine a qualidade do resultado.
📊 Benchmarks impressionam. E o uso real?
O entusiasmo em torno do Carbon contrasta com as dúvidas relatadas durante o lançamento do Argon.
Segundo uma reportagem da Bloomberg, pessoas com acesso direto ao modelo demonstraram ceticismo sobre seu desempenho em tarefas importantes, especialmente programação e design de interfaces front-end.
A crítica não era necessariamente que o modelo apresentasse resultados ruins em todos os testes, mas que seu desempenho em benchmarks nem sempre se traduzisse em resultados igualmente fortes no trabalho cotidiano.
Essa distinção é decisiva para quem utiliza IA profissionalmente. Um modelo pode obter uma pontuação elevada em uma avaliação padronizada e ainda cometer erros, exigir correções frequentes ou produzir código difícil de manter em projetos reais.
O Google contestou a interpretação de que o Gemini 4 estivesse abaixo das expectativas em programação.
Um funcionário familiarizado com o desenvolvimento afirmou à Bloomberg que havia um amplo consenso interno de que a família Gemini 4 estava na vanguarda. Koray Kavukcuoglu, chefe do Google DeepMind, também demonstrou confiança na capacidade da empresa de permanecer entre os líderes do setor.
🧠 Por que a Anthropic virou a referência?
A comparação com a Anthropic é especialmente relevante porque a programação com agentes de IA exige mais do que gerar trechos de código.
Esses sistemas precisam interpretar objetivos, planejar etapas, utilizar ferramentas, identificar erros e corrigir problemas ao longo de tarefas que podem durar bastante tempo.
Nesse cenário, a avaliação de que o Carbon se aproxima do Opus 5.5 é um indício de que o Google busca fortalecer justamente uma das áreas em que os modelos concorrentes disputam a preferência dos desenvolvedores.
Mas há uma diferença entre uma avaliação informal de funcionários e uma comparação independente. Sem resultados públicos detalhados, testes reproduzíveis e acesso ao modelo, ainda não é possível concluir que o Carbon realmente supera ou iguala seu concorrente em todas essas tarefas.
🔮 O que esperar agora?
O Google tem dois desafios simultâneos: demonstrar que o Argon funciona bem fora dos benchmarks e decidir como transformar os avanços internos do Carbon em um produto confiável.
Se as avaliações iniciais forem confirmadas, o novo modelo poderá reforçar a posição do Gemini na programação assistida por IA. Entretanto, a distribuição restrita do Argon mostra que desempenho e disponibilidade são questões distintas.
Por enquanto, o Carbon permanece nos bastidores, enquanto desenvolvedores e clientes aguardam acesso mais amplo ao Argon.
A disputa pela liderança em IA continua, mas a próxima virada talvez não venha apenas de uma pontuação recorde. Ela pode depender de qual modelo consegue transformar promessas de laboratório em código funcional, com menos erros e menos intervenção humana.