Eu uso o Ollam há muito tempo para executar LLMs locais e não tenho muito do que reclamar. Ele faz o trabalho e não preciso me ajustar muito. Docker anunciou recentemente seu próprio model runner, que oferece muitos dos mesmos recursos que você obtém com Ollama. Ele pode extrair, executar, gerenciar e servir modelos de IA nativos usando Docker Desktop ou Docker Engine. Ele suporta modelos GGUF usando llama.cpp, modelos Safetensors usando vLLM, aceleração de hardware em sistemas suportados e modelos de Docker Hub, Hugging Face ou outros registros OCI. Estou usando-o em vez do Ollam há quase uma semana, mas não posso dizer que vou continuar com ele.
Docker Model Runner se encaixa perfeitamente no Docker
E é muito fácil de configurar
Docker Model Runner funciona de maneira diferente de executar um modelo em um contêiner normal. O Docker lida com o modelo como seu próprio artefato OCI, enquanto um mecanismo de inferência dedicado o carrega e executa localmente. O modelo permanece em cache após o primeiro download, é carregado na memória quando recebe uma solicitação e descarregado quando não está mais em uso. Isso torna o processo familiar se você já usa o Docker, pois a mesma CLI agora lida com contêineres, imagens e modelos nativos.
Para a maioria dos usuários, o back-end padrão llama.cpp é o mais importante. Ele executa modelos GGUF quantizados em Apple Silicon, Windows e Linux com aceleração automática de metal em Macs compatíveis. Docker também oferece vLLM para detecção de maior rendimento com modelos Safetensors, embora esse back-end exija GPUs NVIDIA suportadas e atualmente tenha suporte de plataforma muito mais restrito. Você pode acessar qualquer back-end usando APIs compatíveis com OpenAI e Ollama, o que significa que muitos aplicativos já desenvolvidos por Ollama podem se conectar ao Docker Model Runner apenas alterando a URL base.
Configurá-lo usando Docker Desktop é ridiculamente fácil. Você precisa do Docker Desktop versão 4.40 ou posterior no MacOS ou versão 4.41 ou posterior no Windows. Abra o Docker Desktop e vá para Configurações -> IAe habilite o Docker Model Runner. Você também pode habilitar o acesso TCP do lado do host aqui se quiser se conectar ao Open WebUI, uma ferramenta de codificação ou outro aplicativo local. Uma vez ativada, a nova seção Modelos permite descobrir, baixar, executar e conversar com modelos sem abrir um terminal. Ainda prefiro a linha de comando porque o fluxo de trabalho é muito próximo do Ollam.
Usando Docker Model Runner para tarefas diárias
A experiência é semelhante à de Ollam
Após o download do modelo, usar o Docker Model Runner não é muito diferente de usar o Ollam. Docker Model Runner abre um chat interativo no terminal onde você pode enviar prompts após cada resposta e continuar a conversa sem reiniciar o modelo. O Docker Desktop também fornece uma interface básica de bate-papo na guia Modelos, que é útil quando desejo testar um modelo sem configurar outro aplicativo.
As interfaces integradas são suficientes para receber prompts rapidamente, mas eu não as usaria como a principal forma de interagir com LLMs nativos. Docker Model Runner se torna muito mais útil quando você o combina com algo como Open WebUI. Por fornecer uma API compatível com Ollama, o Open WebUI pode lidar com isso quase tão bem quanto o servidor Ollama. Você só precisa especificar OLLAMA_BASE_URL para o Docker Model Runner.
Ele fornece uma interface semelhante ao ChatGPT com histórico de bate-papo, renderização Markdown, troca de modelo, prompts do sistema e configurações de geração configuráveis. Os modelos ainda são executados por meio do Docker Model Runner, mas o Open WebUI cuida da interface.
A mesma abordagem funciona com ferramentas de codificação de IA como Cline, Continue, Aider, Cursor e OpenCode.
Você pode usar qualquer espaço reservado como chave de API, pois as solicitações locais não exigem isso. Em seguida, você seleciona um modelo usando o mesmo nome que aparece na lista de modelos do docker, como ai/qwen2.5-coder. Também gosto que o Docker permita configurar modelos separadamente. Se o modelo de codificação começar com uma janela de contexto desnecessariamente pequena, posso aumentá-la facilmente.
Docker Model Runner não torna o Ollam obsoleto
Ollama é tão bom
Depois de usar ambos, não acho que o Docker Model Runner produza melhores resultados que o Ollama. Se ambas as ferramentas executarem o mesmo modelo GGUF usando llama.cpp com configurações semelhantes, o modelo, o nível de quantização, o tamanho do contexto e o hardware terão um impacto muito maior do que o aplicativo que o atende. O Docker permite que você use vLLM em sistemas NVIDIA compatíveis, mas isso não é importante para a maioria das pessoas que usam modelos quantizados em um laptop comum.
O Docker Model Runner é mais adequado se o Docker Desktop já fizer parte do seu fluxo de trabalho. Ele permite gerenciar modelos e contêineres usando a mesma interface, armazenar modelos como artefatos OCI, usá-los em projetos do Compose e testar solicitações usando o Docker Desktop. Também prefiro seu gerenciador de modelo gráfico em vez de lembrar de cada comando CLI. No entanto, instalar e manter o Docker Desktop apenas para usar LLMs nativos adiciona peso desnecessário.
Ollam também tem a vantagem de um ecossistema mais estável. Muitos aplicativos de IA nativos fornecem uma opção dedicada para Ollama, e a maioria dos guias de configuração assumem que sua API está disponível na porta 11434. Docker Model Runner oferece uma API compatível com Ollama, portanto, muitos desses aplicativos ainda funcionam, mas alguns exigem URL base manual ou alterações de nome de modelo. O suporte do Docker para diferentes mecanismos de inferência e registros é mais flexível, embora também introduza configurações adicionais e limitações específicas da plataforma.
Estou melhor com Ollam
Se você já usa o Ollama e tudo está funcionando, não há muitos motivos práticos para mudar. Você provavelmente executará os mesmos modelos em velocidades quase semelhantes e obterá os mesmos resultados. Docker Model Runner é mais envolvente para quem já usa Docker Desktop ou deseja integrar modelos nativos em aplicativos em contêineres.








