Depois de obter suporte da Nvidia, mudei minha configuração de IA nativa para AMD Lemonade e resolvi meu problema de portabilidade de IA nativa.

Meu laboratório doméstico é uma mistura de hardware, desde uma AMD Radeon RT 7900 XTX rodando uma única caixa de inferência até carros-chefe da Nvidia rodando modelos mais potentes e dispersos minicomputadores. Ah, e o DGX Spark na prateleira é estranho em seu estilo ARM64. Eu não mudaria essa mistura por nada no mundo. Adoro cada peça de hardware por motivos diferentes, mas por muito tempo todos eles exigiram seu próprio conjunto de conclusões.

A parte mais preguiçosa do meu cérebro odiava essa situação, mas não havia muita escolha, pois eu precisava de CUDA aqui, ROCm ali e um pouco de Vulkan quando nenhum dos outros dois funcionava. A solução não foi um servidor de inferência melhor; era um software que suporta vários back-ends, então posso configurar um conjunto de inferências para qualquer hardware. Entra no Lemonade Server, um projeto de código aberto apoiado pela AMD que coloca as mesmas APIs compatíveis com OpenAI, Ollama e Anthropic em cada caixa que possuo e inventa o próprio back-end.

Estou servindo um LLM de 200 bilhões de parâmetros em uma estação de trabalho Lenovo do tamanho de um Mac Mini

Este minicomputador é pequeno e ridiculamente poderoso.

Lemonade finalmente permite que eu possa usar um software para tudo

O dispositivo mais estranho da Nvidia foi o último obstáculo

Já faz algum tempo que quero usar o Lemonade porque a promessa de consertar problemas de hardware era boa demais para ser ignorada. Mas só recentemente o CUDA foi suportado e, ainda mais recentemente, o GB10 ARM64 DGX dentro do Spark foi devidamente suportado. Essa foi a última peça do quebra-cabeça e mudei todos os meus LLMs locais para usar o Lemonade.

Executar qualquer forma de CUDA no DGX Spark significava ler os fóruns e comentários do GitHub para encontrar as versões noturnas do Python que funcionavam para projetos individuais e fixá-las para que eu não atualizasse acidentalmente o Python e quebrasse a compilação. Quase todos os pacotes de ML que o pip instala são fornecidos com CUDA 12.x, e o Spark se recusa a funcionar sem o CUDA 13. Já perdi tempo de trabalho na solução de problemas antes.

O discurso de vendas da camada de abstração Lemonade foi escrito por você. Agora as bordas sujas ao redor do sm_121 DGX Spark não são mais problema meu. Instalei o mesmo software executado em meu hardware AMD; ele detecta o hardware e configura o back-end e minha pilha de agentes não sabe a diferença.

A portabilidade supera o desempenho máximo em tudo que construo

Um servidor, quatro máquinas muito diferentes

Vivo pela simplicidade em meu laboratório doméstico. Não preciso do servidor mais rápido em todas as caixas; Quero o mesmo servidor em cada caixa. Um plano de controle para entender e gerenciar. Tudo o que construo – agentes, ferramentas MCP, automação, experimentos de fim de semana incompletos – aponta para um endpoint compatível com OpenAI no host local. Assim que conseguir construir uma especificação, o projeto que comecei com o DGX Spark pode ser movido para um RX 7900 XTX ou RTX 5090, ou até mesmo um mini PC rodando um Intel iGPU. As ferramentas superam a falta de hardware no meu laboratório doméstico e eu gasto menos tempo solucionando problemas.

O Lemonade me permite fazer isso mais do que qualquer outro software que experimentei. Ollama está chegando, mas limita os projetos que posso fazer. vLLM é sempre um alvo móvel e o LM Studio funciona bem na minha área de trabalho, mas em nenhum outro lugar. Com o Lemonade, o backend é determinado pelo software com base no que está instalado. ROCm ou Vulkan em caixas AMD, CUDA em Nvidia e Vulkan em Intel.

Um instalador, um processo instalado e em execução, independentemente do hardware que desejo usar. E extras versáteis como Whisper para transcrição e Kokoro para TTS significam que não preciso executar várias coisas para chegar onde quero.

É claro que uma pilha desenvolvida especificamente será melhor em todos os benchmarks. vLLM ou TensorRT-LLM ajustado em um RTX Pro 6000 fará círculos em torno do caminho CUDA llama.cpp do Lemonade, mas os números de pico nunca foram meu ponto fraco: uma reformulação foi necessária.

Finalmente encontrei um LLM local que realmente quero usar para codificação

O Qwen3-Coder-Next é um ótimo modelo e fica ainda melhor com Claude Code como arnês.

Ryzen AI Halo colocou essa teoria de lado

Alguns números reais para apoiar meu ponto

A diferença entre Vulkan e ROCm no hardware AMD diminuiu significativamente e, ao mesmo tempo Ferramentas orientadas para CUDA ainda tem vantagem, também quebra com mais frequência (no meu DGX Spark há muitos meses). O Lemonade facilita a determinação de qual back-end será melhor para o modelo e caso de uso escolhido, pois vem com um benchmark integrado.

O Qwen3 Coder 30B-A3B (MoE) foi uma revelação, mostrando como modelos enormes que usam o design Mixture-of-Experts podem gerar tokens mais rapidamente do que modelos menores e densos. É um dos meus modelos favoritos para as tarefas diárias, e a Lemonade o executa como uma campeã.

Modelo

Sistema de back-end

TTFT (ms)

TPS

VRAM máx. (GB)

Lama 3.2 3B

Vulcão

188

78,3

4,0

Qwen3 8B (Q4_1)

ROCm

95

41.2

6.6

Qwen3 8B (Q4_1)

Vulcão

141

43,9

6.8

Codificador Qwen3 30B-A3B (MoE)

ROCm

173

69,5

19,0

Codificador Qwen3 30B-A3B (MoE)

Vulcão

219

90,1

19,0

Mas Lemonade não é apenas backends Vulkan, ROCm e CUDA. Possui Whisper.cpp para fala, StableDiffusion.cpp para geração de imagens, Kokoro para conversão de texto em fala e FLM para uso de NPU. Os modelos NPU precisam ser adaptados ao backend FLM, mas rodar o Strix Halo com um NPU de 20W foi realmente útil.

Motor

TTFT

TPS

Notas

ROCm

95ms

41.2

o melhor pré-preenchimento

Vulcão

141ms

43,9

melhor transcrição

NPU (FLM)

~1370ms

11,0

consistência do metrônomo

Tentar fazer com que a maioria dos servidores LLM usem NPU é uma dor e já tentei isso muitas vezes antes. Com o Lemonade, se o servidor detectar seu NPU, ele apenas trabalhando. Tive que instalar o pacote manualmente porque o Ryzen AI Halo que estou usando roda no Linux, mas é ainda mais fácil no Windows, onde o Lemonade instala o backend NPU para você.

A pequena caixa Ryzen AI da AMD faz o que o DGX Spark da Nvidia faz com uma fração da potência

Mesmo preço, conta de luz muito diferente

O melhor servidor LLM local é aquele em que nunca preciso pensar

Eu vim para essa missão a melhor plataforma local de LLM e percebi que tinha feito a pergunta errada. O melhor servidor para meu laboratório doméstico não é aquele que está no topo de qualquer tabela; é o que faz com que minha sombria coleção de hardware pareça uma máquina. Lemonade fornece uma fração do rendimento máximo de meus carros-chefe da Nvidia para garantir que qualquer coisa que eu construir funcionará em qualquer lugar. Depois de anos executando e mantendo pilhas paralelas, eu faria essa negociação novamente sem piscar.

Também não significa que perdi rendimento. Lemonade tem um backend vLLM para o dia em que o projeto supera llama.cpp. Se o seu hardware se parece com o meu, é hora de otimizá-lo para facilitar o uso. Seu eu futuro tem coisas melhores para fazer do que reequipar sempre que houver uma grande mudança.

Link da fonte