Os LLMs locais avançam rapidamente. Nos cerca de seis meses que o tenho no meu computador, o que está realmente disponível mudou muito e não é necessariamente maior. As pessoas que constroem esses modelos entendem quem realmente os executa, que são, em sua maioria, pessoas comuns com hardware de consumo, e não laboratórios ou farms de servidores.
Grande parte do trabalho recente tem sido dedicada à construção de modelos menores que irão lidar bem com GPUs regulares, em vez de monitorar uma série de parâmetros que ninguém pode executar de qualquer maneira. O novo Gemma 4 12B do Google é um exemplo bastante claro dessa tendência. Ele foi projetado pensando em laptops e GPUs dedicadas, que geralmente pertencem a pessoas comuns, e o Google colocou a arquitetura como o principal motivo para isso.
Quer se manter atualizado sobre as últimas IA? O boletim informativo XDA AI Insider é publicado semanalmente com análises aprofundadas, recomendações de ferramentas e informações práticas que você não encontrará em nenhum outro lugar do site. Assine alterando suas preferências de boletim informativo!
O novo modelo aberto de médio porte do Google
Ele foi projetado para hardware normal, não para laboratórios
Gemma 4 12B foi vendido em junho de 2026. Ele fica entre o E4B menor e o MoE 26B mais pesado da linha do Google, então é uma opção de tamanho médio, o que considero útil porque é um tamanho que corresponde às GPUs que as pessoas realmente têm em casa.
O Google foi quem mais falou sobre arquitetura. A maioria dos modelos multimodais usa codificadores separados que convertem imagens e áudio em um formato que o modelo de linguagem possa ler. Gemma 4 12B pulou totalmente esta etapa; a imagem e o áudio vão diretamente para o LLM por meio de projeção leve, sem que um codificador separado faça o trabalho primeiro. O resultado é uma latência mais baixa porque o LLM não espera a conclusão do codificador antes de começar a ser executado.
Mas por causa do ganho de latência, é principalmente uma coisa multimodal, e você só sente isso quando está alimentando imagens ou áudio. Para usar texto, a arquitetura não muda muito, porque o texto sempre entrava diretamente de qualquer maneira. Mas o Gemma 4 12B usa a mesma estrutura de decodificador que o Gemma 4 31B Dense maior, então no lado do texto você obtém o mesmo mecanismo de raciocínio central do modelo maior em um tamanho que realmente carrega em uma GPU normal.
É também o primeiro Gemma de tamanho médio a lidar com entrada de áudio nativa. E a janela de contexto agora sobe para 256K. O Google diz que roda perto de 26B com menos da metade da memória, embora ninguém tenha feito a comparação que vi.
Usei Gemma 4 e Qwen 3.5 para as mesmas tarefas locais e um estava quilômetros à frente
Colocá-los uns contra os outros para descobrir o que funciona melhor para meu fluxo de trabalho
Meu PC para jogos acabou sendo uma máquina LLM decente… afinal
Foram necessárias algumas tentativas no início
Meu PC é uma versão dos jogos que outra pessoa fez para mim. Para ser honesto, eu só queria algo que pudesse rodar Rocket League sem problemas, mas descobri que também é bom para LLMs locais. Meu primeiro modelo foi um gpt-oss 20B que comprei com uma GPU de 8GB com um pouco de overclock na RAM do sistema. Desde então, mudei para modelos menores e mais otimizados que realmente aproveitam mais o hardware do que o 20B, por incrível que pareça.
Carregar o Gemma 4 12B era algo próprio. O LM Studio tem cerca de 356 versões e todas parecem praticamente iguais, então escolher uma foi uma dor de cabeça antes de qualquer outra coisa. Escolhi a versão Q4_0 do QAT porque o Google a treinou com quantização integrada no próprio treinamento, de modo que a qualidade permanece mesmo em um tamanho menor.
Minha primeira tentativa de download falhou. Eu tinha todas as 48 camadas indo para GPU, contexto no padrão 30K e quantização de cache KV, que é uma das configurações experimentais. A memória estimada era de 11,35 GB, o que obviamente era demais para o meu hardware. Então diminuí a carga da GPU para 32 e reduzi o contexto para 4K, que ficou em torno de 7,3 GB. Ainda falhou. Atualizei o LM Studio neste ponto porque meu tempo de execução é muito anterior ao Gemma 4. Tentei novamente e ainda falhei.
Desativar a quantização experimental do cache KV e reduzir a carga da GPU para 28 realmente funcionou. A própria UI avisa que o cache KV pode causar problemas em alguns modelos, e o Gemma 4 acaba sendo um deles. Não tenho certeza se a atualização do LM Studio fez alguma coisa no final, talvez o cache KV tenha sido a única coisa que importou o tempo todo. Acabei com mais de 20.000 contextos.
Outra coisa que vale a pena mencionar é que o pop-up “Falha ao carregar o modelo” nunca explica o porquê. O único sinal útil o tempo todo foi a estimativa de memória na parte superior das configurações de carregamento, que é atualizada conforme você altera as configurações. Se você o estiver executando em um hardware que não foi projetado para LLMs nativos, esse cálculo é um fato digno de nota.
As duas GPUs antigas que salvei fazem mais trabalho de IA do que uma placa nova de US$ 2.000, e não irei atualizar tão cedo.
Eu construí uma configuração de IA nativa a partir de duas GPUs antigas à venda por um preço barato e é melhor do que uma única placa nova
Usando Gemma 4 12B
O que alguns testes revelaram
O Gemma 4 12B também deve ser bom para codificação, mas eu não codifico. Então o teste para mim foi como ele lida com o raciocínio. Comecei com o quebra-cabeça lógico sobre a disposição dos assentos. Ligando o pensamento, durou anos e nunca chegou a uma resposta; mas a mesma coisa aconteceu com Thinking off. Acabei completando o mesmo quebra-cabeça por meio do modelo de nuvem, o que me disse que o quebra-cabeça em si era insolúvel, então cabia a mim. Mas o que me incomoda é que Gemma nunca percebeu que isto é insolúvel, o que penso que mostra que os modelos locais ainda estão atrás das nuvens.
Em seguida, dei a ele um quebra-cabeça para resolver e ele encontrou os dois lados em segundos. No entanto, a mentalidade é um pouco estranha para mim. Quando ativado, o raciocínio ocorre em um bloco oculto e a resposta final permanece curta. Se estiver desligado, o modelo argumenta em voz alta e a resposta se torna mais longa à medida que o trabalho que estaria no bloco de reflexão acaba na página. Já escrevi antes sobre como o Gemma 4 E4B injeta seu raciocínio na resposta, o que aparentemente é um erro do LM Studio, então pode ser a mesma situação aqui.
Em seguida, a tarefa JSON. Algo que eu realmente quero gerar lotes em minhas notas Obsidian, com vários esquemas e restrições. E fiquei pensando sobre isso. A estrutura estava perfeita como esperado e todos os campos estavam em conformidade com o esquema, e também não cobria o JSON com barreiras de decréscimo como muitos modelos fazem. Mas alguns limites ainda caíram e alguns valores duplicaram.
Além desses testes, também tive algumas perguntas para documentar o design, e ele seguiu uma estrutura melhor (sem minha orientação) do que meus outros modelos Gemma, e de alguma forma deu respostas mais abrangentes enquanto chegava ao ponto mais rápido (todos com os mesmos parâmetros).
Troquei minha cara assinatura do Claude Pro por esses modelos nativos e minha produtividade não diminuiu
Codificação local de primeira vibração
Vale a pena, com ressalvas
O Gemma 4 12B é um captador sólido se você tiver o hardware para operá-lo livremente. Ele tropeçou em um quebra-cabeça que a nuvem resolveu imediatamente, mas por outro lado ele resistiu e acabou sendo uma solução melhor para meu trabalho documental. Claro, provavelmente não serei capaz de usá-lo em todo o seu potencial com minha GPU e ainda não testei o áudio corretamente, mas ele funciona muito bem, então não sinto necessidade de trocá-lo por algo menor.







