LLMs locais são uma daquelas coisas que começaram como uma novidade e acabaram sendo mais úteis do que eu esperava. Depois de usá-los por vários meses, ainda estou surpreso que você possa pegar seu hardware e realmente ter uma conversa offline com ele. Os dois aos quais sempre volto são Gemma 4 (variante E4B no desktop, E2B no celular) e Qwen 3.5 9B. Já uso os dois há algum tempo e há diferenças perceptíveis entre os dois. Então pensei em confrontá-los para ver qual é a melhor solução para meus casos de uso.
Quer se manter atualizado sobre as últimas IA? O boletim informativo XDA AI Insider é publicado semanalmente com análises aprofundadas, recomendações de ferramentas e informações práticas que você não encontrará em nenhum outro lugar do site. Assine alterando suas preferências de boletim informativo!
Abandonei o LM Studio por uma alternativa de código aberto e meu modelo nativo faz coisas que não conseguia antes
É melhor em todos os sentidos, eu precisava que a IA nativa fosse melhor
Uma breve visão geral de Qwen e Gemma
Por que esses dois acabaram na minha rotação
Qwen 3.5 9B foi lançado em fevereiro como parte da família Qwen 3.5. É um modelo 9B denso com uma arquitetura híbrida Gated DeltaNet, o que significa apenas que ele pode lidar com contextos longos sem atingir VRAM como os transformadores padrão costumam fazer. A janela de contexto é nativamente de 262.000, mas pode ser estendida para mais de um milhão de tokens via YaRN e é multimodal. Fui atraído pela GDN desde o início – 9B rodando com 60.000 ou mais comprimentos de contexto em meus 8 GB de VRAM não é algo que eu consegui usar antes.
O Gemma 4 é a família aberta do Google com quatro tamanhos – variantes de borda E2B e E4B para telefones e laptops, bem como modelos maiores de 26B MoE e 31B densos. E foi projetado para parâmetros “eficientes”, já que a incorporação de camada fornece uma pequena área ativa, de modo que o E4B tem um peso total de cerca de 8 B com uma eficiência de 4,5 B. A janela de contexto aumenta para 128 K, o que é bastante decente. No entanto, o que me surpreendeu nas variantes de ponta é que elas, na verdade, vêm com mais do que as variantes maiores. A entrada de áudio existe apenas nos dispositivos E2B e E4B, pois o codificador foi projetado especificamente para dispositivos com pouca memória, portanto, as variantes pequenas não são apenas versões simplificadas das versões grandes.
A oferta do Google para variantes de ponta tem tudo a ver com o utilitário integrado ao dispositivo, portanto, coisas como respostas inteligentes, resumos e tudo o mais precisam ser executados localmente sem latência. Qwen posiciona o 3.5 como um agente multimodal nativo cujo lado do raciocínio é verdadeiramente equilibrado. Como usuário geral de chatbot, ambos se encaixam muito bem no fluxo de trabalho que eu já tinha, mas se eu os colocasse um ao lado do outro nas mesmas tarefas…
Apenas conversando com eles
Onde o cérebro realmente entra em ação
No lado do bate-papo, estou usando as duas configurações de amostra recomendadas para uso geral (o que é um pouco criativo). Então Qwen com temperatura 1,0, top-p 0,95, penalidade de presença 1,5 e Gemma com sua configuração padrão temp 1,0, top-p 0,95, top-k 64. Também deixei o navegador MCP desativado. A ideia era ver o que todos sabiam apenas pelos dados de treinamento, sem ajuda de busca externa.
Kwen está claramente avançando na discussão. Sempre que peço a ela para desenvolver algo em etapas, como estruturar um guia de estudo ou detalhar um tópico que estou tentando entender, as respostas parecem mais profundas do que as que Gemma me dá após as mesmas instruções. Há também uma razão técnica para isso. A mentalidade do Qwen 3.5 é herdada e refinada do Qwen 3, por isso é mais testada em batalha. E o 9B realmente supera a geração anterior Qwen3-30B com base em critérios de raciocínio em mais de três vezes o seu tamanho.
Gemma não se sente desconfortável neste departamento, simplesmente não é onde ela brilha. As respostas tendem a ser mais curtas e coloquiais, o que às vezes é exatamente o que eu quero quando estou apenas conversando. A latência também é mais rápida no meu hardware porque o modelo é otimizado para o limite.
Em termos de ferramentas, ambos os modelos possuem chamadas de funções integradas, portanto são praticamente iguais no papel. No entanto, na prática, o quão bem o uso da ferramenta MCP realmente funciona depende mais do executor do que do modelo.
Tudo o que não está escrito
Além do bate-papo somente por texto
Coloque sua papelada em ordem primeiro. Embora, para ser mais preciso, multimodal se refere a modelos com codificadores reais para processamento direto de imagens, áudio e layout visual. Portanto, ele pode “ver” um PDF como pixels, gráficos e tudo, mas aqui novamente a capacidade do RAG depende mais do corredor do que do modelo. Ainda assim, os documentos fazem parte de como eu uso a IA, então valeu a pena dar uma olhada rápida nesses dois. Qwen tem um limite de contexto maior, o que o torna mais adequado para relatórios maiores, mas não preciso dele. Sinto que depois de testar três executores diferentes, eu escolheria o documento do LM Studio para qualquer modelo que estou usando.
Comecei a notar uma diferença nas imagens, e o Gemma 4 E4B me ajudou especialmente quando se tratava de trabalhar na encruzilhada de criatividade e análise, como capturar imagens de um sistema de design. Na verdade, há uma boa razão para isso. A documentação do Gemma 4 menciona especificamente a compreensão da tela e da interface do usuário como uma opção para usar a imagem principal do modelo, bem como a compreensão de gráficos e OCR. O modelo foi treinado deliberadamente para este perfil. O Qwen 3.5 9B também não é ruim visualmente, mas o tutorial da Gemma é mais adaptado ao meu trabalho.
O áudio é apenas uma coisa da Gemma. Possui ASR nativo e conversão de texto em fala para E2B e E4B e, para ser sincero, estou mais impressionado com os recursos do que com o uso ativo – testei-o com llama.cpp e o reconhecimento foi sólido, mas ainda não entrou no meu fluxo regular.
Onde cada um ainda tem seu lugar
Trata-se apenas de escolher o caminho certo para o seu fluxo de trabalho
O Qwen 3.5 9B ainda é o modelo em que tento pensar porque é um pensamento mais maduro do que o de Gemma. Também é uma opção melhor para sessões mais longas, devido ao meu hardware limitado. Mas Gemma tem uma influência mais ampla na minha configuração. O E4B é o que procuro no desktop quando se trata de imagens, e a variante E2B também me segue no celular via PocketPal, então é a opção mais acessível das duas.
Aquele que eu continuo abrindo
Para meus casos de uso em particular, é o Gemma 4 E4B que está na frente. As respostas têm um tom mais próximo de um chatbot em nuvem, são melhores com recursos visuais, são mais leves e posso acessá-las de praticamente qualquer lugar. Nada disso quer dizer que o Qwen 3.5 9B não seja um modelo realmente impressionante – ele tem uma vantagem no raciocínio, tornando-o mais adequado para pesquisa e estudo.






