Testei 3 LLMs nativos em meu RTX 4070 Ti para trabalho real – apenas um conseguiu um lugar permanente

Tenho experimentado LLMs locais há alguns anos. Porém, os resultados raramente corresponderam às minhas expectativas e, depois de alguns dias de uso, eu voltaria aos modelos de nuvem até mesmo para tarefas básicas. Depois da conversa da comunidade e do entusiasmo sobre pequenos LLMs locais, decidi dar outra chance a vários deles em meu PC para jogos.

Quando visitei o diretório de modelos de Ollam e examinei a lista, parecia que a IA nativa finalmente havia se tornado prática em GPUs de consumo. Os 12 GB de VRAM do meu RTX 4070 Ti pareciam suficientes para parar de ler benchmarks e começar a testar modelos para meu fluxo de trabalho real.

Comecei com o modelo Llama 3.2 Vision, mas o Ollama 0.30.7 recusou-se a carregá-lo devido a um problema conhecido de arquitetura do mllama. Em seguida, mudei para DeepSeek-R1 8B, Qwen 3.5 9B e Gemma 4 E4B. Usei todos os três modelos com os mesmos prompts e avaliei a utilidade em relação aos números de benchmark. Eu esperava que a modelo mais animada vencesse, mas isso não aconteceu.

Finalmente encontrei um LLM nativo de código aberto que realmente compete com a IA da nuvem

O código aberto está chegando

DeepSeek-R1 8B

Pense mais, dê menos

Estatísticas rápidas: download de 5,2 GB, ~ 9,3 GB de VRAM, ~ 70 tps.

Quando decidi incluir DeepSeekR1 Como candidato, eu tinha grandes esperanças neste experimento porque era impossível ignorar sua reputação na comunidade. R1 era o modelo local de IA de que todos falavam, então é claro que foi o primeiro modelo que carreguei no Ollam.

Quando executei o prompt de raciocínio, ele carregou rapidamente e passou cerca de 24 segundos pensando antes de enviar. O modo Think estava ativado por padrão e adicionei um prompt do sistema para torná-lo mais forte, mas não fez muita diferença. Era muito popular por suas habilidades de raciocínio. Eu esperava dicas fortes e estruturadas para solução de problemas, mas fiquei desapontado quando comecei a analisar os resultados. À primeira vista, a resposta parecia estruturada, mas o controle real parecia superficial em comparação com outros modelos. Até deixou alguns blocos de código vazios.

Então veio o prompt do resumo. Publiquei um dos meus artigos do XDA e pedi que resumissem em quatro frases e, surpreendentemente, foi o único modelo que seguiu minhas instruções de quatro frases, então inicialmente parecia uma vitória. Mas houve problemas com o conteúdo. Ele inventou detalhes que não estavam no artigo – referências a áreas de stub .xda que não existem em nenhum lugar do artigo, ou de forma alguma. A precisão era mais importante do que seguir as instruções.

Finalmente, para codificação básica e instruções de conversação, obtive bons resultados, não os melhores dos três, mas melhores que os resultados anteriores. Ele produziu um script funcional com instruções de configuração e marcadores de edição, ainda melhor que o Qwen. Mas novamente me perdi no resultado das negociações. A resposta conversacional foi estruturada, mas perdeu completamente o meu contexto. Pedi o próximo passo após hospedar serviços como Nextcloud, Immich e Vaultwarden e ele sugeriu hospedar mecanismos de busca e mapas. Dei a ele o contexto do meu laboratório doméstico, mas ainda parecia desconectado do contexto de alguém que já executava um grande servidor.

O problema não foi a falha do DeepSeek-R1 8B. O problema era que, para um modelo baseado no raciocínio, ele produzia consistentemente as respostas menos úteis das três.

Qwen 3.5 9B

Respostas inteligentes se você puder encontrá-las

Estatísticas rápidas: download de 6,6 GB, ~ 9 GB de VRAM, 65-67 tps.

Qwen 3.5 é um dos modelos locais mais recomendados na comunidade hoje. Ele tem uma forte reputação na comunidade local de IA, então minhas expectativas já eram altas. E correspondeu em grande parte a essa reputação, mas, ao contrário do DeepSeek, o problema aqui não era a qualidade da resposta.

À primeira vista, o resultado do raciocínio imediatamente pareceu mais completo do que o DeepSeek. A resposta foi bem estruturada com seções claras sobre causas, diagnóstico e soluções. Finalmente, parecia um verdadeiro fluxo de trabalho de solução de problemas. Mas no final da resposta senti que demorou muito mais do que o necessário. Ele tentou explicar tudo, mesmo que eu não perguntasse. Acabei percebendo o mesmo padrão em todos os prompts.

O resultado do resumo foi como se realmente tivesse lido o artigo. Embora eu tenha solicitado especificamente um resumo em quatro frases, ele ignorou. Mas o resumo era preciso e não continha detalhes alucinatórios como o DeepSeek. Também fiz três perguntas de acompanhamento que um jornalista de tecnologia deveria fazer sobre o artigo, e os acompanhamentos correram bem até que vi o que o Gemma 4 gerou.

No prompt de codificação, Kwen evitou completamente o palavreado. Pedi um script Python e ele me deu isso, nada mais, nada menos. Mas, para ser sincero, esperava um pouco mais de explicação, talvez instruções de configuração, uma discussão sobre implantação ou algumas notas operacionais. Comparado com DeepSeek e Gemma, parecia muito inacabado.

A resposta conversacional foi a que mais me surpreendeu; usou mais de 12.000 tokens para uma simples solicitação de indicação de três pontos. Qwen acertou a pergunta ao identificar a hospedagem de e-mail e o gerenciamento de identidade como o próximo passo lógico. E entendeu o contexto da auto-hospedagem e fez recomendações adequadas, ao contrário do DeepSeek, que me pediu para hospedar mapas. Quen geralmente tinha uma resposta. O desafio era extraí-lo de todo o resto.

Qwen 3.5 9B tinha conhecimento consistente e raramente cometia erros, mas muitas vezes parecia que estava escrevendo uma documentação quando eu só precisava de uma resposta.

Gema 4 E4B

Aquele que simplesmente funciona

Estatísticas rápidas: download de 9,6 GB, ~ 7 GB de VRAM, 86-90 tps

eu usei Gema 4 para vários experimentos. Eu sabia que era capaz, mas não esperava que estivesse tão à frente de Qwen e DeepSeek. A maioria das discussões da comunidade gira em torno de DeepSeek e Qwen. No entanto, Gemma acabou por ser o modelo mais surpreendente no teste. Foi o modelo mais pesado em termos de tamanho de download, com 9,6 GB. Mas em tempo de execução, ele consumiu quase 2 GB a menos de VRAM do que os outros dois e rodou quase 25% mais rápido que o DeepSeek – a otimização do dispositivo do Google foi mostrada em tempo de execução.

Percebi a diferença no primeiro prompt. Enquanto DeekSeek me deu instruções vagas e Quen me deu uma redação desnecessária, Gemma realmente entendeu a pergunta e me deu o que eu precisava. Dei a todos os modelos o mesmo prompt do homelab: por que meu servidor fica lento por volta das 22h e dei a eles algumas de minhas pilhas. Todos eles me deram respostas; nenhum deles estava errado, mas apenas a resposta de Gemma parecia mais uma informação do que uma pilha de texto. Explicou as possíveis causas e forneceu um fluxo de trabalho de diagnóstico com um plano de remediação acionável. Ele me disse exatamente o que poderia ter acontecido, como investigar e, finalmente, o que fazer a seguir.

Resumindo, DeepSeek alucinou com os detalhes e Quen deu uma resposta convincente – boa o suficiente para eu parar por aí. Qwen forneceu uma boa resposta – um resumo legível e perguntas práticas. Se eu não tivesse incluído Gemma, Qwen teria vencido facilmente esta rodada. Gemma não apenas me deu um bom resumo, como Qwen, mas também fez perguntas complementares que realmente fazem sentido para jornalistas de tecnologia. Despesas gerais e compensações de recursos, escalabilidade e casos extremos, curvas de adoção e mudanças no setor. Assim pensei como jornalista sênior.

O teste de codificação disse a mesma coisa. Na verdade, me deu a melhor pontuação no teste de codificação. Os outros dois também me deram resultados, mas pareciam superficiais e sem detalhes. Gemma gerou o código mais longo, e eu digo que é bom não porque comprimento é igual a qualidade, mas porque o código foi minuciosamente comentado e a saída incluía pré-requisitos, configuração explicada, uso implícito e notas sobre tratamento de erros. Não apenas gerou código. Isso gerou documentação.

O teste de conversação seguiu o mesmo padrão. Em vez de recomendar projetos ambiciosos de infraestrutura, como mecanismos de busca auto-hospedados, concentrou-se em serviços que um usuário de laboratório doméstico poderia realmente usar em seguida. O modelo reconheceu a complexidade, a carga de manutenção e os requisitos de rede. Este é um comportamento surpreendentemente maduro para um modelo local pequeno.

O Gemma 4 E4B não foi o modelo mais popular em meus testes, mas foi o único que entendeu de forma consistente o que eu estava tentando perguntar.

7 coisas que eu gostaria de saber quando comecei a hospedar meu LLM por conta própria

Já faço meu LLM há algum tempo e essas são todas as coisas que aprendi ao longo do tempo e que gostaria de ter sabido no início.

O que é realmente importante para GPUs de jogos

Após esse experimento, uma coisa ficou clara: a IA nativa não está mais reservada para hardware caro de estações de trabalho. E é maduro o suficiente para que o modelo com menos voz vencesse meu teste. Todos os três modelos rodaram confortavelmente em GPUs para jogos com 12 GB de VRAM. A parte surpreendente foi como eles se comportaram de maneira diferente quando receberam as mesmas instruções. Os modos de raciocínio, a contagem de tokens e a reputação do modelo eram menos importantes do que a utilidade diária. Gemma 4 conquistou um lugar permanente no meu computador porque foi o mais útil na prática, não pelos benchmarks.

Link da fonte