O LM Studio tem sido meu executor padrão desde que executo LLMs locais, o que agora é mais do que suficiente para considerá-lo parte do meu fluxo diário e não apenas algo que estou experimentando mais. Grande parte do apelo do LM Studio é que ele tem uma GUI, instalação com um clique e nenhuma necessidade de linha de comando para usar. Desenvolvimento não é minha praia, nem mesmo usar um terminal, então um executor fácil de usar era importante para mim, e foi isso que me entusiasmou primeiro com a IA auto-hospedada.
Porém, quanto mais uso modelos nativos para encontrar coisas que não quero que um chatbot na nuvem toque, mais começo a experimentar o poder do LM Studio. Alguns modelos não funcionam corretamente nele, então alguns recursos importantes dos modelos mais recentes permanecem intactos porque meu corredor ainda não os suporta. Um colega mencionou llama.cpp para mim há algum tempo e, a princípio, listei-o como uma opção de desenvolvedor, mas quando finalmente voltei atrás, ficou claro que eu estava me impedindo de algo muito mais acessível do que pensava.
Quer se manter atualizado sobre as últimas IA? O boletim informativo XDA AI Insider é publicado semanalmente com análises aprofundadas, recomendações de ferramentas e informações práticas que você não encontrará em nenhum outro lugar do site. Assine alterando sua newsletter.
Um terminal runner que evitei sem motivo real
Eu executei em cinco minutos
Por muito tempo, llama.cpp viveu na minha cabeça como uma opção que você deixa passar se realmente souber o que está fazendo. Cada guia de configuração que eu percorreria abriria com informações sobre a instalação do compilador e eu fecharia a guia antes que a página terminasse de carregar. No entanto, nada disso era verdade no meu caso de uso. O Página de lançamentos do GitHub possui binários pré-construídos para Windows, Mac e Linux com versões separadas dependendo do seu hardware. Literalmente, bastou baixar, descompactar, executar um comando no terminal e pronto.
llama.cpp é um tempo de execução C++ de código aberto para executar grandes modelos de linguagem localmente, criado por Georgy Gerganov em março de 2023, logo depois que Meta abandonou o peso LLaMA. E, de fato, llama.cpp é o principal mecanismo de back-end por trás do LM Studio, Ollama e da maioria dos outros aplicativos nativos de IA dos quais você já ouviu falar. Eles são basicamente invólucros construídos em torno disso, então elimina o intermediário. Ele também vem com um servidor lhama e uma IU da web integrada que você acessa por meio de um navegador, para que o bate-papo real possa acontecer em uma GUI limpa.
Existem razões reais para usá-lo em um executor GUI. Os wrappers adicionam sobrecarga, de modo que o mesmo modelo no mesmo hardware é executado significativamente mais rápido no llama.cpp do que no LM Studio, na faixa de 5 a 20%, dependendo da sua configuração. llama.cpp também geralmente suporta novos modelos primeiro porque é o projeto principal no qual todo o resto se baseia, enquanto LM Studio e Ollama têm que esperar um ciclo de atualização. Portanto, você não está esperando que um corredor se atualize nos últimos pesos abertos.
Ollama ainda é a maneira mais fácil de iniciar LLMs locais, mas a pior maneira de mantê-los funcionando
Ollama é ótimo para começar… só não perca tempo.
O que me expulsou do LM Studio
Eu meio que comecei a superar isso
Na verdade, não vou parar de usar o LM Studio completamente e não é uma ferramenta ruim. Mas quanto mais eu usei modelos nativos para fluxos de trabalho reais, mais comecei a me deparar com coisas que o LM Studio ainda não suporta, e o modelo que eu queria usar era um deles.
Este modelo foi o Gemma 4 E4B. Seu recurso de destaque é a entrada de áudio nativa – reconhecimento automático de fala e tradução de fala em vários idiomas – e esse recurso está disponível apenas em duas variantes de ponta, o E2B e o E4B. Nenhum dos modelos maiores do Gemma 4 o possui. Portanto, se o seu corredor não emite áudio, você está usando um modelo multimodal com um de seus modos desativado. O LM Studio não oferece suporte a áudio, o que significa que não consegui usar o Gemma em todo o seu potencial, o que finalmente me levou a enviar llama.cpp.
O que realmente mudou desde a mudança para llama.cpp
Algumas vitórias inesperadas ao longo do caminho
A primeira coisa que notei foi algo que nem tentei consertar e na verdade esqueci: o raciocínio de Gemma 4 transborda para o LM Studio, onde combina seu pensamento com a resposta. Já não estava lá. O WebUI llama.cpp coloca o raciocínio em uma caixa dobrável separada para que você possa ver a resposta e, opcionalmente, estender o raciocínio, se desejar. Eu aguentei esse bug no LM Studio, mas llama.cpp o corrigiu.
O lado do áudio foi o verdadeiro motivo da mudança e funciona bem. Você não pode apertar o botão de gravação sem fazer algumas soluções alternativas, mas o upload de arquivos WAV é um pouco mais rápido do que a configuração. Sua análise de áudio é quase perfeita com base em meus testes quando falei as mesmas instruções que enviei em texto – ele as interpretou da mesma maneira. A análise de imagens também atende às minhas expectativas. Vai além do texto e também consegue interpretar objetos orgânicos e compreender o contexto de uma foto.
Mas o valor que realmente obtive veio dos recursos integrados. Possui prompts de sistema de sessão separados, uma maneira mais limpa de conectar servidores MCP e muito mais controles de parâmetros do que o LM Studio. Como não uso llama.cpp para desenvolvimento, mas apenas para pesquisas e tarefas diárias, foi nesses controles que ocorreu a maior parte da atualização para mim.
A maioria dos parâmetros além dos normais (temperatura, min-p e penalidade de presença repetida) não são aplicáveis ao meu fluxo de trabalho, mas encontrei um que realmente faz uma diferença notável. DRY (Don’t Repeat Yourself) é uma versão mais inteligente da penalidade de repetição – ela só entra em ação quando frases inteiras começam a se repetir, e não tokens individuais, então não sinto o efeito colateral do modelo evitando anormalmente palavras comuns como “o”.
O Mirostat e a Temperatura Dinâmica também merecem destaque. Ambos ajustam a forma como o modelo escolhe os tokens em tempo real com base na resposta real, em vez de você bloquear tudo previamente em um valor fixo. Isso permite uma prosa mais consistente em sessões mais longas. Mas eles são mais adequados para fluxos de trabalho mais criativos do que técnicos.
7 coisas que eu gostaria de saber quando comecei a hospedar meu LLM por conta própria
Já faço meu LLM há algum tempo e essas são todas as coisas que aprendi ao longo do tempo e que gostaria de ter sabido no início.
Eu deveria ter mudado antes
Troquei porque o modelo que eu queria usar estava à frente da ferramenta em que eu estava usando e o llama.cpp conseguia acompanhar. Isso provavelmente continuará a acontecer à medida que os modelos abertos se tornarem mais capazes, por isso vale a pena escolher um corredor que acompanhe. Além disso, embora llama.cpp seja principalmente para desenvolvedores, você não precisa ser do tipo para usá-lo. Quando a GUI está em execução, é basicamente um bate-papo normal, só que mais rápido, mais limpo e com muito mais controles. O LM Studio ainda é um lugar para uso diário, mas llama.cpp é realmente uma atualização.







