Se você já passou algum tempo experimentando modelos nativos de IA, é quase certo que passou pelo mesmo ciclo que eu. Você encontra um novo modelo interessante, ativa o Ollam ou o Hugging Face, espera o download terminar, apenas para descobrir que o novo modelo está rastejando a dois tokens por segundo ou simplesmente se recusa a caber na memória. Entre meu laptop, PC para jogos, PC do meu parceiro e uma bancada de testes ocasional, se eu ganhasse um dólar por cada vez que isso acontecesse, teria pelo menos o suficiente para pagar meio mês de Claude Pro.
É aqui que o LLMFit entra em ação. Em vez de você ter que adivinhar quais modelos seu hardware pode suportar enquanto você coça a cabeça olhando diferentes quantizações e contagens de parâmetros, o LLMFit analisa seu sistema e recomenda modelos de IA que devem funcionar bem. Muitos usuários de IA em nuvem estão gradualmente migrando para a auto-hospedagem de seus modelos de IA nativos e, se você for um deles, o LLMFit deve ser a primeira coisa a usar para obter a configuração correta do terreno.
5 coisas que eu gostaria que alguém tivesse me contado antes de eu tentar hospedar um LLM local
É mais capaz do que você imagina, mas o segredo é diminuir suas expectativas
O LLMFit elimina as suposições ao executar modelos nativos de IA
É um mecanismo de recomendação com reconhecimento de hardware para LLMs nativos
LLMFit é essencialmente um mecanismo de recomendação para modelos nativos de IA, o que torna seu trabalho muito mais fácil se você estiver começando com IA auto-hospedada. Antes de se comprometer com um download massivo de modelo de 10, 15 ou 20 GB, a primeira coisa a fazer é determinar se o seu hardware pode lidar de forma realista com tal modelo. Uma vez que você instale e execute-oO LLMFit avaliará sua CPU, GPU e RAM e VRAM disponíveis antes de classificar mais de 250 modelos com base no desempenho deles em seu computador.
A estrela do show aqui é a pontuação Fit, que combina velocidade, duração do contexto e qualidade em um para obter um modelo com cem pontos. Em vez de forçá-lo a decifrar páginas de benchmarks, ele lhe dará uma lista útil de modelos que realmente valem o seu tempo. Claro, se você estiver sentado em uma estação de trabalho com VRAM suficiente para fazer corar os laboratórios de IA corporativos, você não terá falta de opções de qualquer maneira, mas para o resto de nós que trabalham com hardware de consumo, o LLMFit foi criado para resolver exatamente esse tipo de problema.
Também não para nas recomendações. O LLMFit se integra diretamente ao Ollama e ao llama.cpp, portanto, depois de encontrar um modelo adequado, você poderá executá-lo sem alternar entre diferentes aplicativos. Junto com cada recomendação há algo especialmente útil para iniciantes, ou seja, rotulagem de carga de trabalho, uma ferramenta que informa se o modelo que você está vendo é mais adequado para tarefas de codificação, chat, geração de imagens ou MoE (combinação de especialistas). Isso significa diretamente menos tempo pesquisando nomes de modelos no Google e mais tempo usando-os.
Executei modelos nativos de IA em um laptop de seis anos sem GPU e eles realmente funcionaram
Seu laptop antigo é poderoso o suficiente para IA local… se você limitar suas expectativas
Como instalar o LLMFit em seu dispositivo Windows
Apenas três equipes para começar
Para instalar o LLMFit no seu dispositivo, primeiro você precisa do Scoop no seu PC com Windows. Scoop é um instalador de linha de comando confiável para Windows. Para instalar o Scoop, basta colar esta linha de código em uma janela elevada do PowerShell:
Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser
Provavelmente, você não verá nenhuma resposta e o comando funcionará corretamente ou o PowerShell perguntará se você deseja alterar a política de execução. Pressione Y e pressione Enter. Copie a seguinte linha na mesma janela:
Invoke-RestMethod -Uri https://get.scoop.sh | Invoke-Expression
Isso instalará o Scoop no seu dispositivo Windows. A próxima coisa que você precisa fazer é abrir uma janela de prompt de comando e simplesmente digitar isto:
scoop install llmfit
Isso instala o LLMFit no seu dispositivo. Basta digitar llmfit em uma janela CMD ou PowerShell e ele aparecerá imediatamente com todos os dados sobre modelos de IA nativos que você pode instalar e executar em seu dispositivo.
LLMs locais não eram suficientes, então uso um sistema de duas camadas que mantém minhas coisas confidenciais off-line
Os dados privados permanecem locais, e a IA mais inteligente virá mais tarde.
Testei o LLMFit em um laptop de seis anos
Ele me disse exatamente qual modelo funcionou melhor
Quando instalei o LLMFit em meu laptop de seis anos, ele detectou rapidamente o hardware e listou os modelos que achava que funcionariam melhor com ele. Este é um laptop Mi antigo comprado em 2019 com 8 GB de RAM e uma CPU Intel i5-10210U com clock de 1,60 GHz. No departamento gráfico, não há nada do que se gabar, exceto os gráficos integrados Intel UHD. Mesmo neste hardware antigo, o LLMFit levou apenas alguns segundos para começar a funcionar depois de detectar os recursos do meu dispositivo.
LLMFit é uma ferramenta apenas para teclado. Funciona como a antiga interface BIOS da placa-mãe.
O LLMFit deu ao modelo Phi-mini-MoE-instruct da Microsoft uma pontuação impressionante de 90,4 em 100 na pontuação composta, colocando-o no topo da lista do que funcionaria melhor. A ferramenta estimou que executar esse modelo de parâmetro de 7,6 B em llama.cpp me daria cerca de 40-42 marcadores por segundo, então baixei imediatamente a quantização exata recomendada pelo LLMFit (Q4_K_M).
Felizmente, existe a opção de baixar o modelo diretamente da própria ferramenta e, quando apertei a tecla “d”, baixei imediatamente o modelo AI do Hugging Face. Não recebi os tokens e a velocidade prometidos pelo LLMFit quando o executei, mas ainda estava na faixa de 20 a 25 tokens por segundo.
No entanto, o problema surgiu quando olhei mais de perto Uma longa lista de modelos de IA dentro do instrumento. Muitos dos modelos listados já são antigos e desatualizados, o que imediatamente me disse que o aplicativo precisa ser atualizado com muito mais modelos e com muito mais frequência. No entanto, como ponto de partida, não vejo nenhuma desvantagem em instalar o LLMFit e usá-lo com seu hardware para uso local antes de baixar grandes modelos de IA.
Meu LLM local pode ligar para Claude quando estiver preso e isso fez toda a diferença para minha primeira configuração local.
LLMs domésticos não são muito bons por si só
Alguém que usa modelos nativos de IA deveria usar o LLMFit? Até que você saiba como a contagem e a quantização de parâmetros afetam seu hardware, o LLMFit elimina a maior parte das tentativas e erros.
Na minha opinião, o LLMFit é melhor considerado um trampolim, e não uma ferramenta na qual você confiará para sempre. Leva apenas algumas semanas para experimentar a IA nativa para ter uma boa noção do seu hardware. Depois de aprender como a contagem de parâmetros, a quantização e os requisitos de memória afetam o desempenho, você mesmo poderá fazer suposições fundamentadas. No entanto, até chegar a esse ponto, uma ferramenta que elimine a maior parte das tentativas e erros é verdadeiramente valiosa. Isso lhe dá a confiança necessária para baixar modelos sabendo que há uma boa chance de que eles tenham o desempenho esperado.
Isso ficou especialmente claro quando ajudei um amigo a mergulhar sua IA nativa em um Acer Nitro 5 com uma GPU de laptop RTX 3050. Não tivemos que baixar modelos intermináveis e examinar todos eles para ver qual funcionava melhor. O LLMFit detectou imediatamente padrões que correspondiam ao hardware e combinavam perfeitamente com Ollama, llama.cpp e outros front-ends auto-hospedados. Mais do que tudo, porém, ele suaviza as primeiras aventuras DIY, substituindo a frustração pelo ímpeto e ajudando os recém-chegados a construir uma base sólida sem gastar horas em modelos que nunca funcionarão bem no início.







