Ejecutar Ollama en Docker: Configuración, GPU y cuándo optar por una solución gestionada
Ollama en Docker te ofrece una inferencia de LLM reproducible en tu propio hardware. Pero la operativa de Docker es compleja: passthrough de GPU, límites de memoria, volúmenes de datos, parches del SO y APIs expuestas. Los equipos que ejecutan contenedores de Ollama terminan gestionando la operativa en lugar de usar los LLMs. Opsily elimina la operativa. Despliega en 4 minutos en lugar de 4 días.
Por qué Opsily supera al DIY de Ollama en Docker
Ollama en Docker es potente. Pero 'docker run' se convierte en 'docker-compose', que se convierte en Kubernetes, que se convierte en todo un equipo de operaciones. Esto es lo que cambia cuando lo alojamos por ti.
GPU configurada desde el primer día
El passthrough de NVIDIA GPU es automático en Opsily. Sin dependencias de CUDA, sin depuración de '--gpus all'. Tu inferencia de LLM funciona a máxima velocidad. El Docker DIY requiere configuración manual de nvidia-docker, coincidencia de controladores y configuración a nivel de host. Nosotros nos encargamos para que tú no tengas que hacerlo.
Actualizaciones del SO y parches de seguridad: automáticos
Los contenedores de Ollama necesitan un SO host. Ese SO necesita parches cada semana. DIY significa que los aplicas tú o ignoras los riesgos de seguridad. Opsily aplica parches a cada servidor diariamente. Sin alertas de seguridad a las 3 a.m. Sin tiempo de inactividad. Tu Ollama sigue funcionando.
Tus datos permanecen privados. En la UE.
Docker en tu servidor = tus datos son tu problema. Ollama autohospedado en Alemania cumple con el GDPR. Opsily mantiene tus modelos y llamadas a la API en centros de datos de la UE. Sin API de inferencia de terceros. Sin dependencia de proveedores. Cumplimiento del GDPR por defecto.
Built for teams who need reliability
Con la confianza de equipos de alto rendimiento
















Cómo funciona Ollama en Docker
Si ejecutas Ollama en contenedores por tu cuenta, este es el camino que siguen la mayoría de los equipos. Y donde las cosas se complican.
Empieza desde la imagen base de Ollama. Añade tus modelos como RUN ollama pull llama2. Expón el puerto 11434 para la API. Tu contenedor es ahora una caja de inferencia de LLM reproducible.
Un solo contenedor está bien para desarrollo local. La producción necesita Ollama + Open WebUI juntos. Compose añade redes, montajes de volúmenes, variables de entorno y políticas de reinicio. Ahora tienes un stack.
Si tienes GPU NVIDIA: añade runtime: nvidia y device_ids. Mapea volúmenes /root/.ollama para el almacenamiento de modelos. Establece límites de memoria para que los contenedores no sufran OOM. Los modelos de Ollama en producción consumen 8-16GB de RAM para tamaños de 7B-13B.
Empieza desde la imagen base de Ollama. Añade tus modelos como RUN ollama pull llama2. Expón el puerto 11434 para la API. Tu contenedor es ahora una caja de inferencia de LLM reproducible.
Un solo contenedor está bien para desarrollo local. La producción necesita Ollama + Open WebUI juntos. Compose añade redes, montajes de volúmenes, variables de entorno y políticas de reinicio. Ahora tienes un stack.
Si tienes GPU NVIDIA: añade runtime: nvidia y device_ids. Mapea volúmenes /root/.ollama para el almacenamiento de modelos. Establece límites de memoria para que los contenedores no sufran OOM. Los modelos de Ollama en producción consumen 8-16GB de RAM para tamaños de 7B-13B.
Escribe un Dockerfile
Empieza desde la imagen base de Ollama. Añade tus modelos como RUN ollama pull llama2. Expón el puerto 11434 para la API. Tu contenedor es ahora una caja de inferencia de LLM reproducible.
Configura Docker Compose
Un solo contenedor está bien para desarrollo local. La producción necesita Ollama + Open WebUI juntos. Compose añade redes, montajes de volúmenes, variables de entorno y políticas de reinicio. Ahora tienes un stack.
Añade gestión de GPU y memoria
Si tienes GPU NVIDIA: añade runtime: nvidia y device_ids. Mapea volúmenes /root/.ollama para el almacenamiento de modelos. Establece límites de memoria para que los contenedores no sufran OOM. Los modelos de Ollama en producción consumen 8-16GB de RAM para tamaños de 7B-13B.
Despliega en producción y mantén
Envía a tu servidor. Configura el endpoint de la API de Ollama. Expónlo de forma segura (proxy inverso, clave API, TLS). Luego parchea el SO host, gestiona las actualizaciones de modelos, monitoriza la utilización de la GPU y escala cuando superes la capacidad del contenedor. Aquí es donde el DIY se vuelve costoso.
Apps que se combinan con Ollama
Ollama por sí solo es solo una API. Estos frontends lo convierten en una herramienta que tu equipo usa cada día.
Self-hosted chat interface for local and private LLMs
Enhanced ChatGPT Clone: Multi-LLM Chatbots with Modular AI
Private AI document chat that works with any LLM, anywhere

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.
Franz Koller
Co-Founder · Joy
Ollama frente a otros LLMs en contenedores
Si estás evaluando la inferencia de LLM basada en contenedores, tienes opciones:
Ollama: El más popular. Binarios precompilados. Gestión de modelos sencilla (ollama pull llama2). Compatibilidad con la API de OpenAI para una migración rápida. Funciona en Mac, Linux, Windows. 60K+ estrellas en GitHub. Comunidad activa.
Vllm: Rendimiento bruto. Mejor para procesamiento por lotes. Más difícil de configurar. Sin gestor de modelos como Ollama. Popular en laboratorios de ML, no en equipos de operaciones.
LocalAI: Alternativa de código abierto. Inicio más lento. Sin imágenes oficiales de Docker. Mantenido por la comunidad. Ecosistema más pequeño.
LM Studio: Solo GUI de escritorio. No está en contenedores. Bueno para experimentación individual. No se puede escalar a equipos.
Ollama gana para configuraciones de Docker en producción. Pero las operaciones de Docker siguen costándote: tiempo para depurar nvidia-docker, ajuste de memoria, almacenamiento de modelos en disco, seguridad del endpoint de la API, parches mensuales del SO, estrategia de respaldo.
Docker Compose: La configuración que intentan la mayoría de los equipos
Aquí tienes un stack típico de Docker Compose para ejecutar Ollama con Open WebUI en producción:
version: '3.8', services: ollama (image: ollama/ollama:latest, runtime: nvidia, ports: 11434:11434, volumes: ollama_data:/root/.ollama, restart: unless-stopped) y open-webui (image: ghcr.io/open-webui/open-webui:latest, ports: 3000:8080, environment: OLLAMA_BASE_URL=http://ollama:11434, depends_on: ollama, restart: unless-stopped).
Esto funciona localmente. Pero la producción añade: gestión de secretos, proxy inverso (Nginx), certificados TLS, autenticación con clave API, monitorización, envío de logs, trabajos cron de respaldo y manuales de recuperación ante desastres. Esa configuración de 5 minutos se convierte en un proyecto de 40 horas.
Cuándo quedarse con Docker DIY
Si tu equipo ya ejecuta Kubernetes o tiene ingenieros de operaciones en nómina: el Docker DIY puede tener sentido. Tienes el personal para mantenerlo.
Si estás creando prototipos: Docker local es rápido y gratuito.
Si no tienes GPU en casa y quieres experimentar: Docker en un VPS alquilado cuesta $5-10/mes por cómputo. Suma tu tiempo de operaciones y ya estarás cerca de nuestro precio fijo de $20/mes por el hosting de Opsily.
Cuándo cambiar al hosting gestionado de Opsily
- Estás cansado de aplicar parches - actualizaciones del SO cada semana, alertas de seguridad, pruebas antes del despliegue.
- La configuración de la GPU es molesta - nvidia-docker, coincidencia de versiones de controladores, comprobaciones de compatibilidad de CUDA.
- Necesitas GDPR - residencia de datos en la UE, sin APIs de inferencia de terceros, tus modelos siguen siendo tuyos.
- Tu equipo está creciendo - un ticket de soporte de Docker significa cambio de contexto y pérdida de productividad.
- Tu Ollama es crítico para el negocio - soporte pagado, SLA de tiempo de actividad, respaldos automáticos, recuperación ante desastres.
Si algo de esto te resulta familiar, los $20/mes de Opsily (o $40-70 para más capacidad) te ahorran dinero desde el primer mes al no tener que mantenerlo tú mismo.
Ollama Docker DIY vs Opsily gestionado
Precios a junio de 2026. El costo de DIY incluye mano de obra; Opsily es todo incluido.
Precios simples y transparentes
Todos los planes incluyen hosting alemán conforme al GDPR, parches automáticos, respaldos diarios y 99.9% de tiempo de actividad. Sin tarifas ocultas. Escala en cualquier momento.
Loading pricing...
Confianza y cumplimiento
Opsily cumple con los estándares de seguridad y privacidad que le importan a los equipos que ejecutan Ollama.
GDPR Compliant
Residencia de datos en centros de datos alemanes. Sin transferencias de datos a terceros. Cumplimiento total con los requisitos de seguridad del artículo 32 del GDPR.
Data Encryption
Cifrado AES-256 en reposo. TLS 1.3 en tránsito. Tus modelos de Ollama y logs de inferencia están cifrados en disco.
Automated Security Updates
Cada servidor se parchea diariamente. Vulnerabilidades de seguridad corregidas dentro de las 24 horas posteriores a su lanzamiento. Sin tiempo de inactividad por parches en la infraestructura de Opsily.
EU Infrastructure
Servidores en Frankfurt, Alemania. Propiedad y gestión de Opsily. Sin alquiler de nubes de terceros. Control total de tus datos.
Open Source Transparency
Ollama es código abierto (licencia MIT). Open WebUI es código abierto. LibreChat es código abierto. Sin LLMs propietarios leyendo tus datos.
Preguntas frecuentes
Pull the official Ollama Docker image, then run: docker run -d -v ollama:/root/.ollama -p 11434:11434 ollama/ollama. This exposes Ollama's API on port 11434. To load models, run docker exec <container> ollama pull llama2. For production, use Docker Compose to manage Ollama and Open WebUI together. See our setup guide for the full Compose file.
Lo que dicen nuestros clientes
Equipos en toda la UE ejecutan su stack en Opsily. Así es como se ve en la práctica.
EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.
Franz Koller
Co-Founder • Joy
We were paying per user on everything and it added up fast. Now we run five apps for less than one of those old plans. My finance team finally stopped asking questions.
Elise
Head of Operations
Wanted to use n8n for ages but the self-host part always stopped me. Opsily just handled it. Got the power without becoming an IT person overnight.
Federica B.
Automation Consultant
¿Listo para saltarte la operativa de Docker?
Tu instancia de Opsily está lista en 4 minutos. Ollama funciona. La GPU está configurada. Las actualizaciones son automáticas. Sin depuración de Docker. Sin parches los fines de semana.