Executando Ollama no Docker: Configuração, GPU e quando optar pelo gerenciado
O Ollama no Docker oferece inferência de LLM reproduzível no seu próprio hardware. Mas as operações com Docker são difíceis: passthrough de GPU, limites de memória, volumes de dados, atualizações de SO e APIs expostas. Equipes que executam containers Ollama acabam gerenciando a base técnica em vez de usar LLMs. O Opsily elimina as operações. Faça o deploy em 4 minutos em vez de 4 dias.
Por que o Opsily supera o Ollama DIY no Docker
O Ollama no Docker é poderoso. Mas 'docker run' vira 'docker-compose', que vira Kubernetes, que vira uma equipe de operações completa. Veja o que muda quando hospedamos para você.
GPU configurada desde o primeiro dia
O passthrough de GPU NVIDIA é automático no Opsily. Sem dependências CUDA, sem depuração de '--gpus all'. Sua inferência de LLM roda na velocidade máxima. O Docker DIY exige configuração manual de nvidia-docker, correspondência de drivers e configuração em nível de host. Nós cuidamos disso para você.
Atualizações de SO e patches de segurança: automáticos
Containers Ollama precisam de um SO host. Esse SO precisa de patches toda semana. DIY significa que você faz o patch ou ignora riscos de segurança. O Opsily atualiza cada servidor diariamente. Sem alertas de segurança às 3 da manhã. Sem tempo de inatividade. Seu Ollama continua rodando.
Seus dados permanecem privados. Na UE.
Docker no seu servidor = seus dados são seu problema. Ollama auto-hospedado na Alemanha atende ao GDPR. O Opsily mantém seus modelos e chamadas de API em data centers da UE. Sem API de inferência de terceiros. Sem vendor lock-in. Conformidade com GDPR por padrão.
Built for teams who need reliability
Com a confiança de equipes ágeis
















Como o Docker Ollama funciona
Se você mesmo está executando o Ollama em containers, este é o caminho que a maioria das equipes segue. E onde as coisas ficam complexas.
Comece a partir da imagem base do Ollama. Adicione seus modelos como RUN ollama pull llama2. Exponha a porta 11434 para a API. Seu container agora é uma caixa de inferência de LLM reproduzível.
Um único container é bom para desenvolvimento local. A produção precisa de Ollama + Open WebUI juntos. O Compose adiciona rede, montagens de volume, variáveis de ambiente e políticas de reinicialização. Agora você tem um stack.
Se você tem GPU NVIDIA: adicione runtime: nvidia e device_ids. Mapeie volumes /root/.ollama para armazenamento de modelos. Defina limites de memória para que os containers não sofram OOM. Modelos Ollama em produção consomem 8-16GB de RAM para tamanhos de 7B-13B.
Comece a partir da imagem base do Ollama. Adicione seus modelos como RUN ollama pull llama2. Exponha a porta 11434 para a API. Seu container agora é uma caixa de inferência de LLM reproduzível.
Um único container é bom para desenvolvimento local. A produção precisa de Ollama + Open WebUI juntos. O Compose adiciona rede, montagens de volume, variáveis de ambiente e políticas de reinicialização. Agora você tem um stack.
Se você tem GPU NVIDIA: adicione runtime: nvidia e device_ids. Mapeie volumes /root/.ollama para armazenamento de modelos. Defina limites de memória para que os containers não sofram OOM. Modelos Ollama em produção consomem 8-16GB de RAM para tamanhos de 7B-13B.
Escreva um Dockerfile
Comece a partir da imagem base do Ollama. Adicione seus modelos como RUN ollama pull llama2. Exponha a porta 11434 para a API. Seu container agora é uma caixa de inferência de LLM reproduzível.
Configure o Docker Compose
Um único container é bom para desenvolvimento local. A produção precisa de Ollama + Open WebUI juntos. O Compose adiciona rede, montagens de volume, variáveis de ambiente e políticas de reinicialização. Agora você tem um stack.
Adicione gerenciamento de GPU e memória
Se você tem GPU NVIDIA: adicione runtime: nvidia e device_ids. Mapeie volumes /root/.ollama para armazenamento de modelos. Defina limites de memória para que os containers não sofram OOM. Modelos Ollama em produção consomem 8-16GB de RAM para tamanhos de 7B-13B.
Faça o deploy em produção e mantenha
Envie para seu servidor. Configure o endpoint da API do Ollama. Exponha-o com segurança (proxy reverso, chave de API, TLS). Depois, atualize o SO host, gerencie atualizações de modelos, monitore a utilização da GPU e escale quando superar o container. É aqui que o DIY se torna caro.
Apps que combinam com o Ollama
O Ollama sozinho é apenas uma API. Estes frontends transformam-no em uma ferramenta que sua equipe usa todos os dias.
Self-hosted chat interface for local and private LLMs
Enhanced ChatGPT Clone: Multi-LLM Chatbots with Modular AI
Private AI document chat that works with any LLM, anywhere

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.
Franz Koller
Co-Founder · Joy
Ollama vs Outras LLMs em Container
Se você está avaliando inferência de LLM baseada em container, você tem opções:
Ollama: O mais popular. Binários pré-construídos. Gerenciamento de modelos fácil (ollama pull llama2). Compatibilidade com API OpenAI para migração rápida. Funciona em Mac, Linux, Windows. 60K+ estrelas no GitHub. Comunidade ativa.
Vllm: Desempenho bruto. Melhor para processamento em lote. Mais difícil de configurar. Sem gerenciador de modelos como o Ollama. Popular em laboratórios de ML, não em equipes de operações.
LocalAI: Alternativa open source. Inicialização mais lenta. Sem imagens Docker oficiais. Mantido pela comunidade. Ecossistema menor.
LM Studio: Apenas GUI de desktop. Não é em container. Bom para experimentação individual. Não escala para equipes.
O Ollama vence para setups Docker em produção. Mas as operações Docker ainda custam caro: tempo para depurar nvidia-docker, ajuste de memória, armazenamento de modelos em disco, segurança de endpoint de API, atualização mensal de SO, estratégia de backup.
Docker Compose: O setup que a maioria das equipes tenta
Aqui está um stack Docker Compose típico para executar Ollama com Open WebUI em produção:
version: '3.8', services: ollama (image: ollama/ollama:latest, runtime: nvidia, ports: 11434:11434, volumes: ollama_data:/root/.ollama, restart: unless-stopped) e open-webui (image: ghcr.io/open-webui/open-webui:latest, ports: 3000:8080, environment: OLLAMA_BASE_URL=http://ollama:11434, depends_on: ollama, restart: unless-stopped).
Isso funciona localmente. Mas a produção adiciona: gerenciamento de segredos, proxy reverso (Nginx), certificados TLS, autenticação por chave de API, monitoramento, envio de logs, cron jobs de backup e manuais de recuperação de desastres. Aquele setup de 5 minutos vira um projeto de 40 horas.
Quando permanecer no Docker DIY
Se sua equipe já executa Kubernetes ou tem engenheiros de operações na folha de pagamento: o Docker DIY pode fazer sentido. Você tem a equipe para mantê-lo.
Se você está prototipando: o Docker local é rápido e gratuito.
Se você não tem GPU em casa e quer experimentar: Docker em um servidor alugado custa $5-10/mês em computação. Adicione seu tempo de operação e você já está perto do nosso preço fixo de $20/mês para hospedagem Opsily.
Quando mudar para a hospedagem gerenciada Opsily
- Você está cansado de aplicar patches - atualizações de SO toda semana, alertas de segurança, testes antes do lançamento.
- A configuração de GPU é irritante - nvidia-docker, correspondência de versão de driver, verificações de compatibilidade CUDA.
- Você precisa de GDPR - residência de dados na UE, sem APIs de inferência de terceiros, seus modelos continuam sendo seus.
- Sua equipe está crescendo - ticket de suporte Docker significa troca de contexto e perda de produtividade.
- Seu Ollama é crítico para o negócio - suporte pago, SLA de uptime, backups automáticos, recuperação de desastres.
Se algum desses pontos soa familiar, os $20/mês do Opsily (ou $40-70 para mais capacidade) economizam seu dinheiro logo no primeiro mês por não ter que manter tudo sozinho.
Ollama Docker DIY vs Opsily Gerenciado
Preços de junho de 2026. O custo DIY inclui mão de obra; Opsily é tudo incluso.
Preços simples e transparentes
Todos os planos incluem hospedagem alemã compatível com GDPR, patches automáticos, backups diários e 99.9% de uptime. Sem taxas ocultas. Escale a qualquer momento.
Loading pricing...
Confiança e Conformidade
O Opsily atende aos padrões de segurança e privacidade com os quais as equipes que executam Ollama se preocupam.
GDPR Compliant
Residência de dados em data centers alemães. Sem transferências de dados para terceiros. Conformidade total com os requisitos de segurança do artigo 32 do GDPR.
Data Encryption
Criptografia AES-256 em repouso. TLS 1.3 em trânsito. Seus modelos Ollama e logs de inferência são criptografados em disco.
Automated Security Updates
Cada servidor recebe patches diariamente. Vulnerabilidades de segurança corrigidas em até 24 horas após o lançamento. Sem tempo de inatividade para patches no Opsily.
EU Infrastructure
Servidores em Frankfurt, Alemanha. Proprietários e gerenciados pelo Opsily. Sem aluguel de nuvem de terceiros. Controle total dos seus dados.
Open Source Transparency
O Ollama é open source (licença MIT). Open WebUI é open source. LibreChat é open source. Sem LLMs proprietárias lendo seus dados.
Perguntas frequentes
Pull the official Ollama Docker image, then run: docker run -d -v ollama:/root/.ollama -p 11434:11434 ollama/ollama. This exposes Ollama's API on port 11434. To load models, run docker exec <container> ollama pull llama2. For production, use Docker Compose to manage Ollama and Open WebUI together. See our setup guide for the full Compose file.
O que nossos clientes dizem
Equipes em toda a UE executam seu stack no Opsily. Veja como isso funciona na prática.
EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.
Franz Koller
Co-Founder • Joy
We were paying per user on everything and it added up fast. Now we run five apps for less than one of those old plans. My finance team finally stopped asking questions.
Elise
Head of Operations
Wanted to use n8n for ages but the self-host part always stopped me. Opsily just handled it. Got the power without becoming an IT person overnight.
Federica B.
Automation Consultant
Pronto para pular as operações Docker?
Sua instância Opsily está pronta em 4 minutos. O Ollama roda. A GPU está configurada. As atualizações são automáticas. Sem depuração Docker. Sem patches no fim de semana.