Os modelos nativos mais comentados tendem a estar na faixa de 7B a 12B, que também é a maioria das configurações se você tiver um hardware decente. Qualquer coisa menos é geralmente descartada como um brinquedo antes de ser feita uma tentativa honesta. Mas nem todo mundo tem mais de 16 GB de VRAM para trabalhar, e os modelos sub-2B realmente pequenos estão se tornando mais capazes do que você imagina, e eu queria ver se valia a pena usá-los, apesar de serem capazes de rodar modelos de tamanho médio.

Os dois modelos aos quais sempre volto são o Qwen 3.5 9B e o Gemma 4 E4B, ambos funcionam bem com meus 8 GB de VRAM, então o hardware não é um problema para mim. A questão era mais sobre até onde você pode ir antes que o modelo nativo se torne inválido. Então, peguei três das opções menores que encontrei e que ainda afirmam fazer um trabalho real e testei-as duas vezes: um guia de estudo estruturado de fim de semana e uma consulta meteorológica em tempo real usando meu Brave Search MCP.

Quer se manter atualizado sobre as últimas IA? O boletim informativo XDA AI Insider é publicado semanalmente com análises aprofundadas, recomendações de ferramentas e informações práticas que você não encontrará em nenhum outro lugar do site. Assine alterando sua newsletter.

Troquei o Claude Pro por um modelo 9B local por uma semana e finalmente descobri pelo que estava pagando US$ 20 por mês.

A diferença foi menor do que eu esperava

Gema 4 E2B

E2B é o menor dos modelos orientados para borda do Google Gemma 4, projetado para telefones e laptops. E significa parâmetros “efetivos” e usa incorporação camada por camada para manter baixo o consumo de memória ativa enquanto os pesos totais ficam em outro lugar. Na prática, isso significa cerca de 5 GB de RAM com quantização de 4 bits, com uma janela de contexto de 128K, chamadas de função nativa, modos de pensamento configuráveis ​​e suporte instantâneo do sistema adequado. Então, todas as coisas que o E4B pode fazer, só que em menor escala.

No guia de estudo estruturado, ele atingiu todas as seis seções obrigatórias, manteve o formato intacto e não alucinava títulos de cursos ou livros, como era claramente exigido. O problema é o mesmo comportamento irritante que vi no E4B, onde ele agenda o processo de agendamento diretamente na resposta. Minha resposta começou literalmente com “Processo de planejamento – Solicitação de análise…”. Escrevi o prompt do sistema informando especificamente para não combinar pensamento com resposta, e ele o ignorou completamente, assim como E4B. E depois de pesquisar um pouco, parece ser um problema com o LM Studio, não com o modelo. Então é isso que acontece agora.

Um teste em tempo real com Brave Search correu bem na primeira tentativa. Perguntei sobre o clima na Cidade do Cabo e obtive uma resposta razoável em Celsius. Mas quando iniciei um novo bate-papo com a mesma pergunta, recebi um número Fahrenheit marcado como Celsius. Então pedi Celsius novamente e ainda não funcionou. Vale a pena saber se você planeja usá-lo para dados em tempo real.

Qwen 3,5 0,8 B

Convincentemente errado em basicamente tudo

A menor entrada no Alibaba Qwen 3.5 Pequenas séries lançadas em março de 2026 junto com variantes 2B, 4B e 9B. É licenciado pelo Apache 2.0, multimodal (texto e visão abaixo de 1 GB são realmente impressionantes para o tamanho) e usa a mesma arquitetura Gated DeltaNet do 9B que já estou usando. Essa última parte é interessante porque a Google Ad Network mantém uma pequena pegada de cache KV e 0,8B inicialmente se estende para um contexto de 262K, o que é incrível para um modelo desse tamanho. Mas eu não deveria ter ficado surpreso antes de usá-lo…

O guia de estudo estruturado saiu pior do que Gemma. Ele manteve os cabeçalhos das seções intactos – programação de sábado, programação de domingo, perguntas de autoteste – mas o conteúdo abaixo não correspondia mais ao tópico real. A hierarquia visual de alguma forma encontrou seu caminho na grade CSS, nas técnicas de flexbox, nas barras de navegação fixas, nos estados de foco e nas páginas iniciais de comércio eletrônico. Eu também disse explicitamente para não nomear ferramentas específicas, e ainda incluía Photoshop, Figma, Sketch, Amazon e Google como exemplos (os dois últimos como sites com dicas visuais que são pelo menos relacionadas ao tópico, mas ainda violam a regra de não nomenclatura). Ele também adicionou um parágrafo resumido de encerramento após a seção Perguntas de autoteste, outra coisa que eu explicitamente disse para não fazer.

A verificação ao vivo foi a maneira mais engraçada e ruim. Ele me disse que eram 57ºC na Cidade do Cabo e a “temperatura real” era de 52ºC. Nunca passou de 50°C na minha região – não sou especialista em temperatura, mas acho que mais de 50°C seria insuportável. Qwen provavelmente quis dizer Fahrenheit, o que faria mais sentido. Então eu recuei, mas dobrou e então comecei a descobrir as coisas. Confiante, educado e completamente errado.

Pelo menos é realmente chamado de ferramenta; modelos deste tamanho geralmente não são confiáveis ​​para chamar ferramentas MCP. E sua escrita também era pelo menos coerente.

LFM2.5-1.2B-Instrução

Falhou ruidosamente, mas também venceu silenciosamente

Esta é a exceção à regra. É da Liquid AI, não do Google, Alibaba ou Meta, e é construído em uma arquitetura completamente diferente das outras duas. LFM2 é um modelo híbrido que combina portas multiplicativas e convoluções curtas com blocos de atenção de consulta agrupados em vez de trabalhar com um transformador padrão. A recompensa é uma pré-busca e decodificação de CPU 2x mais rápida em comparação com modelos de tamanho semelhante, menos de 1 GB de memória e 32.000 contextos. Liquid é bastante aberto em seus documentos sobre para que serve e para que não serve – eles o recomendam para tarefas de agente, mineração de dados e RAG, e claramente não o recomendam para trabalho ou programação com uso intensivo de conhecimento. Mas ainda tentei…

O guia de estudo estruturado teve o pior desempenho por ampla margem, como eu deveria esperar. Jogou todo o formato pela janela; apenas quatro parágrafos de prosa cobrindo hierarquia visual, dica de sábado, dica de domingo e conclusão. Mas pelo menos não alucinava nenhuma ferramenta, desviava-se do tema ou acrescentava uma meta-conclusão após o encerramento. Simplesmente não conseguia seguir a formatação estrutural.

Os testes em tempo real foram onde ele realmente superou Gemma e Kwen. Ele chamou a ferramenta Brave Search de limpa e voltou com “cerca de 18°C ​​com céu parcialmente nublado”. Foi uma frase, a unidade correta e dentro de alguns graus das condições reais. Não houve alucinações ou delírios. Acontece que o modelo que perdeu a tarefa criativa é aquele em quem eu realmente confiaria para realizar o trabalho para o qual foi criado.

Finalmente encontrei um LLM local que quero usar todos os dias (e não é para codificação)

IA nativa que realmente se adapta ao meu dia

Não brinquedos, apenas especialistas

Para ser justo, executei todos os três testes iguais em vez de adaptar as instruções aos pontos fortes de cada modelo, de modo que os resultados se concentrem no que eles poderiam fazer imediatamente, e não no que poderiam fazer se você realmente se concentrasse em seus pontos fortes. O LFM2-1.2B é altamente recomendado para tarefas de agente, mineração de dados e RAG, provavelmente por isso que a chamada do Brave Search foi a parte mais limpa de todo o experimento. Qwen 3.5 0.8B é mais uma base de refinamento para coisas como classificação e resumo do que um chatbot de uso geral.

Modelos pequenos são apenas ferramentas diferentes com trabalhos diferentes. O LFM2-1.2B é aquele que eu realmente manteria instalado para o trabalho para o qual foi projetado, com o Gemma 4 E2B em segundo lugar para qualquer coisa que exija estrutura e um pouco de criatividade.

Link da fonte