Gemma 4 recebe atualização silenciosa que corrige chamada de ferramentas e respostas cortadas
O Google lançou uma atualização de seus modelos abertos Gemma 4 que ativa o Flash Attention 4, acelerando o processamento de prompts em 25% a 70% em GPUs Nvidia Hopper e reduzindo o tempo até o primeiro token em até 31%. Ela corrige bugs na chamada de ferramentas e casos em que o modelo interrompia as respostas, e melhorou o raciocínio agêntico em todos os cenários testados, com alta de 10,1% em um caso de telecom.
O Google atualizou todos os tamanhos de parâmetros da geração, mas manteve o mesmo nome Gemma 4, o que gerou críticas da comunidade pela confusão de versões. Os usuários podem aumentar um parâmetro de orçamento de tokens para OCR mais nítido, de até 2,51 megapixels.
Ver resumo completo de 17 de julho de 2026