Testei meu LLM local usando 4 ferramentas diferentes e apenas uma realmente liberou seu potencial

Se você é como eu e não deseja criar ferramentas CLI, ou talvez seja novo no LLM auto-hospedado, o LM Studio é provavelmente seu executor padrão. É meu corredor padrão há cerca de seis meses e ainda está sem memória muscular. Mas o espaço local do LLM se move rapidamente e estou acompanhando-o porque já estou muito aprofundado, então achei que deveria pelo menos ver o que mais há por aí. Conheci alguns outros corredores (e um equipamento que não é exatamente um corredor) e todos eles são bastante decentes à sua maneira.

Então, se você está indeciso sobre qual escolher, ou talvez apenas começando, veja como o mesmo modelo funcionou em quatro deles. O modelo em questão é o Gemma 4 E4B, uma variante de aresta multimodal que usei em todas as ferramentas em um ponto ou outro.

Quer se manter atualizado sobre as últimas IA? O boletim informativo XDA AI Insider é publicado semanalmente com análises aprofundadas, recomendações de ferramentas e informações práticas que você não encontrará em nenhum outro lugar do site. Assine alterando suas preferências de boletim informativo!

Estúdio LM

É apenas um hábito agora

O LM Studio é gratuito, mas de código fechado, com GUI primeiro e o hub HuggingFace é conectado diretamente ao navegador do modelo. Você instala com um clique, não há terminal nem arquivo de configuração, a menos que você queira se aprofundar neles. Já faz algum tempo que é a IA nativa mais fácil e é por isso que ainda está no meu computador. Eu o peguei quando mergulhei pela primeira vez no self catering e ele me ensinou muito como todo esse espaço funciona. E esta ainda é minha configuração padrão para criar um novo modelo que desejo testar.

Mas o Gemma 4 E4B faz especificamente essa coisa estranha no LM Studio, onde o raciocínio é incorporado à resposta real. Assim, você obterá os traços de pensamento e a resposta combinados em um bloco. Acho que esse é um bug conhecido dos modelos Gemma no LM Studio, já vi outras pessoas mencionarem isso e ainda acontece comigo. Adicione a isso o LM Studio, que ainda não tem suporte para entrada de áudio, o que significa que o recurso de cabeçalho E4B (o áudio nativo) simplesmente fica lá sem uso. Portanto, especialmente para este modelo, o LM Studio é a pior solução.

Ligue.cpp

Isso me permite usar todo o potencial da Gemma

llama.cpp é o tempo de execução C++ de código aberto no qual quase todos os outros executores desta lista (incluindo LM Studio) são baseados. Então, quando você usa outros, você já está usando llama.cpp, apenas envolvendo uma camada em torno dele e pulando diretamente esse wrapper. É principalmente uma ferramenta CLI, que geralmente é tudo que preciso ouvir para que algo falhe, mas há uma GUI do navegador que você pode iniciar com um único comando.

Este me foi recomendado especificamente para o Gemma 4 E4B, pois possui uma entrada de áudio. A configuração foi muito menos intimidante do que eu imaginava, os binários pré-construídos do GitHub me colocaram em funcionamento em minutos e, uma vez instalada a GUI, parece uma janela de bate-papo normal. Então agora eu poderia usar o lado de áudio do E4B. Acontece que não há transmissão ao vivo – você precisa fazer upload de um arquivo de áudio. E você não pode simplesmente fazer upload de qualquer arquivo de áudio, primeiro você precisa convertê-lo para o formato WAV. Então, sim, llama.cpp permite o uso total do E4B (ele também tem visão), mas é um pouco chato, para ser honesto.

Janeiro IA

Tem áudio, mas também tem outra coisa que me vendeu

Jan é de código aberto, gratuito, com GUI em primeiro lugar e baseado na filosofia file-to-app, para que seus bate-papos e configurações apareçam no disco em um formato simples que você mesmo pode abrir. É um aplicativo de desktop que vem com downloads de modelo HuggingFace integrados e também permite conectar provedores de nuvem como Claude ou OpenAI por meio de chaves de API se você quiser uma interface única para tudo. Isso o torna um executor LLM híbrido, o que considero bastante raro.

Procurei depois de llama.cpp porque queria abertura sem a etapa terminal, e Jan está basicamente certo nesse meio-termo. Transferir meu Gemma 4 E4B GGUF foi indolor. A IU também é muito limpa, sem nada de sabor de desenvolvimento, e também possui áudio e recursos visuais, então o E4B merece o que merece aqui.

Contudo, meu amor por Jan vai além de Gemma; o que realmente me convenceu neste corredor foi a configuração do MCP. Já pensei em brincar mais com os servidores MCP, mas não é um processo muito rápido usar outros executores. Porém, com Jan, vários servidores MCP são pré-configurados, basta ligá-los (e instalar a extensão do Chrome do navegador no MCP). Adoro quando as ferramentas tornam essas integrações mais acessíveis.

Qualquer coisa, LLM

Não é um corredor, mas dá uma memória a Gemma

AnythingLLM não é realmente um runner, é um front-end do Mintplex Labs que envolve um runner de sua escolha. Então você ainda precisa de llama.cpp ou LM studio ou algo que faça o modelo real rodando em segundo plano. É uma ferramenta gratuita, de código aberto e mais focada em RAG com gerenciamento de espaço de trabalho.

Eu tentei isso porque estava procurando armazenamento persistente localmente e o AnythingLLM continuava aparecendo. E sim, ele fornece isso, há um sistema de memória automático que extrai fatos de seus bate-papos em segundo plano a cada poucas horas, e você também pode adicionar memórias manualmente se quiser ser preciso. Testei com um Gemma 4 E4B rodando no LM Studio e o lado da memória funcionou muito bem, o modelo começou a referenciar coisas de chats antigos sem que eu tivesse que repetir nada. Não há entrada de áudio no lado do AnythingLLM, portanto a função de áudio E4B não está disponível através dele. No entanto, ele não transferiu o problema de sangramento de resposta do LM Studio.

Eu classificaria isso como uma ferramenta de IA nativa geral, mas como ela não executa o modelo em si, não tenho certeza de quanto do que experimentei foi AnythingLLM versus Gemma 4, que faz as coisas em uma janela diferente no Gemma 4. Vale a pena mencionar se memória é o que você está procurando.

Áudio mais MCP mais GUI

O LM Studio teria sido minha escolha se tivesse áudio e se não houvesse justificativa, caso contrário ele faz tudo que preciso. llama.cpp é ótimo e o áudio é sua maior atração para este modelo, mas Jan também tem áudio e é mais fácil de usar do que llama.cpp, e a configuração do MCP foi o que me surpreendeu. Então para rodar o Gemma 4 E4B, Jan foi quem me permitiu usar o modelo ao máximo sem me incomodar em nenhum momento.

Link da fonte