LLMs nativos fazem parte da configuração do meu desktop há muito tempo, e escrevi sobre alguns deles. No entanto, nunca levei o telefone tão a sério e, mesmo depois da minha experiência inicial executando o Gemma 4 no celular, ainda tinha o Claude por padrão, o que provavelmente não mudará tão cedo.
Mas o uso de inteligência artificial nativa em dispositivos móveis tem se mostrado inestimável durante o tempo de inatividade – pelo menos quando há interrupções simultâneas do ISP e da torre de celular, o que acontece aqui de tempos em tempos. Então achei que valia a pena levar isso mais a sério e explorar o que mais havia por aí, então acabei com Llama, Gemma e o que teria sido Phi, mas fiz um desvio com Qwen. E submeti todos eles aos mesmos testes para determinar qual deles realmente vale a pena manter no meu telefone.
Gema 4 E2B
Começando com o que eu já sabia
O Gemma 4 E2B é o modelo mais avançado do Google, projetado desde o início para funcionar em um telefone, e não reduzido a algo maior. Sua arquitetura permite rodar com cerca de 2GB de memória e processar imagens nativamente. Foi meu primeiro modelo móvel e quase o único, porque funcionou tão bem que não vi motivo para desviar em casos de uso do mundo real. Então pensei em ver como minha linha de base resistiria a alguma nova competição.
Primeiro, apresentei uma série de instruções que a comunidade local de LLM usa como verificações rápidas de humor – o teste do morango, a bolinha de gude em uma xícara e os Irmãos de Sally. Eu peguei isso de Site de Mervyn PrysonDesenvolvedor de IA.
De acordo com Gemma, Strawberry tem dois R’s, o que é um caso famoso de falha de modelo pequeno – algo a ver com a forma como eles escrevem a palavra, e até mesmo alguns cloudbots caem nessa por qualquer motivo. Contudo, o mármore era estranho; ele percorreu a lógica passo a passo, identificou corretamente que a xícara estava de cabeça para baixo e, de alguma forma, pousou na bola de gude do micro-ondas com a xícara. As irmãs de Sally tinham a mesma forma e o raciocínio sugeria a resposta certa sem nunca chegar lá. Todos os três tinham os mesmos padrões de narração, mas simplesmente não conseguiam encontrar a resposta. Não é exatamente estúpido, é mais provável que o fio do raciocínio clique logo no final.
Então dei a ele a verdadeira tarefa para a qual vim aqui: um curso de fim de semana Python 101 para iniciantes, com exemplos de código e exercícios em cada um. O curso foi bom. Ele colocou um esforço real na estrutura, dividindo as coisas em blocos de uma hora com exemplos de código e exercícios. Acho que o que falhou foi a configuração técnica – apenas me disse para “abrir um editor de texto ou um intérprete Python on-line” sem realmente pensar no que eles realmente são para um iniciante. Considero Gemma meu modelo visual, principalmente porque os cursos não parecem ser o seu forte.
Executei LLMs locais usando o iGPU mais barato da Intel e os resultados foram surpreendentemente decentes
Não é como uma GPU dedicada, mas você pode executar alguns LLMs leves com o N100.
Lama 3.2 3B
Especialista em meta-diálogo, por telefone
Llama 3.2 3B é o pequeno modelo de diálogo do Meta especificamente adaptado para tarefas de bate-papo e resumo que você realmente realiza em seu telefone. Os próprios benchmarks do Met afirmam que ele supera o Gemma 2 2.6B e o Phi-3.5 mini, embora aparentemente o Met diria isso. Escolhi isso porque Llama Family é o nome padrão que todo mundo usa quando quer um modelo pequeno, então tive que tentar sozinho. Também porque eu realmente não tinha ideia de como isso se compararia ao meu estado original de Gemma.
Lama também errou com morangos, mas de uma forma mais engraçada. Ele soletrava a palavra letra por letra (MORANGO) e ainda dizia que havia dois R’s. A pergunta de Marmor foi uma lavagem, o mesmo padrão de lógica, mas com conclusões erradas, como a de Gemma. As irmãs de Sally eram na verdade piores, a resposta foi duas com o raciocínio “uma para cada um dos irmãos” que não segue de forma alguma. Só por diversão, também perguntei o que ela gosta no café da manhã, e ela educadamente se recusou a ser pessoal, seguida de uma lista de opções de café da manhã. Resumindo, era praticamente o que eu esperava, já que a maioria das modelos parece tropeçar neles, mas Lama era um pouco pior.
O curso foi onde o Lama realmente avançou. A estrutura parecia menos sofisticada que a de Gemma, sem emoticons e cabeçalhos de seção em negrito, e apenas blocos de código e explicações para mim. O código em si parecia um pouco mais prático, incluindo um prompt de entrada e um loop final no projeto final, que é mais do que a demonstração “Hello World” de Gemma me deu. Não sou uma pessoa de Python, então não posso dizer com certeza se foi um bom curso no sentido mais verdadeiro, mas parecia mais próximo do que eu realmente seguiria em uma manhã de sábado.
Finalmente encontrei um LLM local que quero usar todos os dias (e não é para codificação)
IA nativa que realmente se adapta ao meu dia
Qwen 3.5 4B
Minha terceira escolha não planejada
O Phi-3.5 mini deveria ser o terceiro modelo. Eu queria testá-lo porque a Microsoft o treinou em dados sintéticos filtrados com “qualidade de livro didático” em vez de raspagem regular da Internet, o que é uma escolha de design realmente interessante. Mas o Phi travava o PocketPal toda vez que eu tentava, e a versão menor do IQ2 travava todo o meu telefone por algum motivo. Então mudei para Qwen 3.5 4B. É o modelo pequeno e denso do Alibaba que tem um raciocínio forte e também uma visão. É muito maior que o Phi, mas ainda funciona bem.
Nas instruções básicas, Qven era na verdade o único dos três que tinha direitos de morango – listava todas as letras com um número flutuante, e era três. A questão da bola de gude que ainda era necessária era a mesma lógica gravitacional que todo mundo estava usando. Foi nas irmãs de Sally que tudo ficou estranho. Kwen começou com três, reduziu-se para dois e depois se questionou no meio da resposta com “espere, deixe-me reavaliar” antes de voltar do zero para a lista de família. Eu sinto que está se questionando, o que não é uma coisa ruim.
No entanto, o curso foi o mais forte dos três. Quen nomeou editores específicos que um iniciante poderia abrir – VS Code, PyCharm, Replit – em vez de brandir um “editor de texto”, e o projeto final foi uma calculadora de gorjetas com variáveis reais em vez de um loop de boas-vindas. Provavelmente aquele que eu manteria carregado para estudo offline.
Usei Gemma 4 e Qwen 3.5 para as mesmas tarefas locais e um estava quilômetros à frente
Colocá-los uns contra os outros para descobrir o que funciona melhor para meu fluxo de trabalho
Aquele que eu realmente manteria
Minha escolha final seria Qwen. Surpreendeu os demais em termos de raciocínio e estrutura. Gemma continua carregado, pois prefiro-o para trabalhar com recursos visuais devido à sua excelente análise de imagens. Para ser sincero, sempre que tento outros padrões, de alguma forma acabo com Gemma e a família Quen, então não foi muito surpreendente.
Se você quiser experimentar, eu uso o runner PocketPal disponível no site Android e iOSe tem integração direta com o hub Hugging Face, então você tem muitas opções para escolher.







