LLMs locais costumavam parecer algo de desktop. Toda a conversa em torno deles envolve uma GPU decente, um arquivo de modelo grande e um executor GUI poderoso e completo. Essa é a configuração exata para mim também e tem funcionado bem até agora, sem as pequenas limitações da minha GPU menor.
Mas a máquina que faz o trabalho real na maioria dos dias não é. É uma fração do tamanho do meu telefone e geralmente produz tokens mais rápido do que a configuração do meu desktop. Um telefone geralmente é visto como uma opção de compromisso executando uma versão mais fraca da mesma ferramenta, mas quando se trata de modelos abertos, os telefones não são mais um compromisso. O motivo tem menos a ver com o telefone ser inteligente e mais com ampliar a área de trabalho.
Quer se manter atualizado sobre as últimas IA? O boletim informativo XDA AI Insider é publicado semanalmente com análises aprofundadas, recomendações de ferramentas e informações práticas que você não encontrará em nenhum outro lugar do site. Assine alterando suas preferências de boletim informativo!
O telefone elimina a taxa de configuração para executar modelos nativos
Mas vai além da conveniência
Todo mundo sabe que o telefone agora é uma solução mais conveniente para quase todas as tarefas, por isso não preciso convencer ninguém. Quero dizer, o LLM nativo do meu telefone não compete com o do meu desktop. Ele compete com a IA da nuvem no mesmo telefone e ganha a primeira latência de token porque não há espera por um servidor para frente e para trás e não há atraso normal que mesmo uma conexão rápida não possa esconder completamente.
Na minha área de trabalho, se eu quiser perguntar algo rapidamente a um modelo local, o LM Studio já deve estar aberto com o modelo correto carregado. Caso contrário, terei dez ou mais segundos de tempo de carregamento antes que o primeiro token seja exibido. O PocketPal carrega meu modelo anterior em segundos quando abro o aplicativo, então estou digitando antes mesmo de me sentar.
Há também um ângulo de fluxo de trabalho que acho que passa despercebido. Quando já estou lendo ou trabalhando em algo no meu telefone, não quero mudar de contexto para a área de trabalho apenas para iniciá-lo usando o modelo nativo. Com escalas abertas habilitadas no celular, posso continuar com todo o fluxo de trabalho.
Um modelo maior com melhor hardware deveria vencer, mas não ganha
Por que a folha de especificações está
Executei meu modelo de desktop e meu modelo de telefone pelos mesmos prompts um milhão de vezes e os números são chocantes. O modelo 4B no celular fica confortavelmente em torno de 13 chips por segundo no meu iPhone 16 e o 2B até 20+. Enquanto isso, o 9B no meu desktop LM Studio, com descarregamento de GPU definido até onde posso empurrá-lo enquanto uso outros aplicativos, pode chegar a 9tok/s para exatamente as mesmas tarefas. A mesma família de modelos, os mesmos prompts, mas o menor com hardware mais fraco ainda está na frente.
O motivo é o comportamento de descarregamento. O LM Studio me permite enviar camadas de transformador de modelo para a GPU, cada uma custando VRAM. Se meu 9B não couber no meu cartão de 8 GB, o excesso é armazenado na RAM do sistema e processado pela CPU, que é onde a velocidade cai drasticamente. Para tornar a área de trabalho utilizável para outra coisa – navegador, Figma, Obsidian, a lista continua – preciso deixar algum espaço livre, o que significa menos camadas na GPU, o que significa renderização mais lenta. Eu poderia dedicar uma sessão de computador apenas ao LLM local, o que me permitiria ficar atualizado, mas a maneira como trabalho não é realista.
Meu telefone realmente não precisa se comprometer porque, em primeiro lugar, ele só pode rodar modelos menores, e esses modelos já foram projetados especificamente para essa limitação. Por exemplo, o Qwen 3.5 é um dos meus favoritos, e o Qwen 3.5 2B é claramente um alvo de implantação de smartphones para esta família de balanças abertas. Nada sobre isso foi forçado em um dispositivo que não consegue lidar com isso. A configuração Metal no PocketPal e as camadas deslizantes da GPU fazem o mesmo trabalho que o descarregamento da GPU no LM Studio, exceto que não lutam contra um orçamento VRAM separado porque o chip A18 usa memória unificada.
E a diferença na qualidade do modelo é menor do que sugere o número de parâmetros. Diz-se que o 4B do próprio Qwen corresponde à geração anterior 80B em muitos benchmarks, então “pequeno” não significa “ruim”, pelo menos não como costumava ser.
Isso não se aplica a uma única configuração
A área de trabalho ainda vence por uma coisa em particular
Quando fecho todo o resto na área de trabalho e deixo o LM Studio usar a máquina inteira, 9B ou 12B com carga máxima de GPU atinge facilmente a faixa de mais de 20 marcadores/segundo. Modelos menores com a mesma configuração podem atingir os três dígitos se nada mais funcionar. Portanto, a área de trabalho ainda vence nas tarefas em que realmente preciso de parâmetros extras; Estou falando de sessões em que você se senta propositalmente para trabalhar com um LLM em algo como design de vibração ou análise de documentos ou síntese de pesquisa.
O comprimento do contexto é o outro. Colocar um trabalho de pesquisa completo ou uma transcrição longa no 2B é preenchido rapidamente, e o telefone regula termicamente longas gerações de mais de um ou dois parágrafos. A área de trabalho simplesmente não apresenta esses problemas.
Portanto, os telefones nem sempre superam os PCs. Para LLMs nativos, o ajuste é mais importante do que a potência bruta, e meu telefone é quase perfeito para a forma como os uso.








