Ollama in Docker ausführen: Setup, GPU und wann sich Managed Hosting lohnt
Ollama in Docker ermöglicht reproduzierbare LLM-Inferenz auf eigener Hardware. Doch Docker-Betrieb ist komplex: GPU-Passthrough, Speicherlimits, Daten-Volumes, OS-Patches und offene APIs. Teams, die Ollama-Container betreiben, verbringen mehr Zeit mit der Verwaltung als mit der Nutzung von LLMs. Opsily nimmt Ihnen den Betrieb ab. Deployment in 4 Minuten statt 4 Tagen.
Warum Opsily besser ist als DIY-Ollama in Docker
Ollama in Docker ist leistungsstark. Aber aus 'docker run' wird 'docker-compose', dann Kubernetes und schließlich ein ganzes Ops-Team. Hier erfahren Sie, was sich ändert, wenn wir das Hosting für Sie übernehmen.
GPU ab dem ersten Tag konfiguriert
NVIDIA GPU-Passthrough ist bei Opsily automatisch. Keine CUDA-Abhängigkeiten, kein Debugging mit '--gpus all'. Ihre LLM-Inferenz läuft mit voller Geschwindigkeit. DIY-Docker erfordert manuelles nvidia-docker-Setup, Treiber-Abgleich und Konfiguration auf Host-Ebene. Wir erledigen das für Sie.
OS-Updates und Sicherheits-Patches: automatisch
Ollama-Container benötigen ein Host-Betriebssystem. Dieses muss wöchentlich gepatcht werden. Bei DIY-Lösungen patchen Sie selbst oder ignorieren Sicherheitsrisiken. Opsily patcht jeden Server täglich. Keine Sicherheitswarnungen um 3 Uhr morgens. Keine Ausfallzeiten. Ihr Ollama läuft einfach weiter.
Ihre Daten bleiben privat. In der EU.
Docker auf Ihrem Server = Ihre Daten sind Ihr Problem. Selbstgehostetes Ollama in Deutschland erfüllt die DSGVO. Opsily speichert Ihre Modelle und API-Aufrufe in EU-Rechenzentren. Keine Inferenz-API von Drittanbietern. Kein Vendor-Lock-in. DSGVO-Konformität standardmäßig inklusive.
Built for teams who need reliability
Vertraut von agilen Teams
















So funktioniert Docker Ollama
Wenn Sie Ollama selbst in Containern betreiben, ist dies der Weg, den die meisten Teams gehen. Und hier wird es komplex.
Starten Sie mit dem Ollama-Basis-Image. Fügen Sie Ihre Modelle mit RUN ollama pull llama2 hinzu. Öffnen Sie Port 11434 für die API. Ihr Container ist nun eine reproduzierbare LLM-Inferenz-Box.
Ein einzelner Container reicht für die lokale Entwicklung. In der Produktion werden Ollama + Open WebUI benötigt. Compose fügt Networking, Volume-Mounts, Umgebungsvariablen und Restart-Policies hinzu. Jetzt haben Sie einen Stack.
Bei NVIDIA GPU: Fügen Sie runtime: nvidia und device_ids hinzu. Mappen Sie /root/.ollama-Volumes für die Modellspeicherung. Setzen Sie Speicherlimits, damit Container nicht wegen OOM abstürzen. Ollama-Produktionsmodelle benötigen 8-16GB RAM für 7B-13B-Größen.
Starten Sie mit dem Ollama-Basis-Image. Fügen Sie Ihre Modelle mit RUN ollama pull llama2 hinzu. Öffnen Sie Port 11434 für die API. Ihr Container ist nun eine reproduzierbare LLM-Inferenz-Box.
Ein einzelner Container reicht für die lokale Entwicklung. In der Produktion werden Ollama + Open WebUI benötigt. Compose fügt Networking, Volume-Mounts, Umgebungsvariablen und Restart-Policies hinzu. Jetzt haben Sie einen Stack.
Bei NVIDIA GPU: Fügen Sie runtime: nvidia und device_ids hinzu. Mappen Sie /root/.ollama-Volumes für die Modellspeicherung. Setzen Sie Speicherlimits, damit Container nicht wegen OOM abstürzen. Ollama-Produktionsmodelle benötigen 8-16GB RAM für 7B-13B-Größen.
Schreiben Sie ein Dockerfile
Starten Sie mit dem Ollama-Basis-Image. Fügen Sie Ihre Modelle mit RUN ollama pull llama2 hinzu. Öffnen Sie Port 11434 für die API. Ihr Container ist nun eine reproduzierbare LLM-Inferenz-Box.
Konfigurieren Sie Docker Compose
Ein einzelner Container reicht für die lokale Entwicklung. In der Produktion werden Ollama + Open WebUI benötigt. Compose fügt Networking, Volume-Mounts, Umgebungsvariablen und Restart-Policies hinzu. Jetzt haben Sie einen Stack.
GPU- und Speichermanagement hinzufügen
Bei NVIDIA GPU: Fügen Sie runtime: nvidia und device_ids hinzu. Mappen Sie /root/.ollama-Volumes für die Modellspeicherung. Setzen Sie Speicherlimits, damit Container nicht wegen OOM abstürzen. Ollama-Produktionsmodelle benötigen 8-16GB RAM für 7B-13B-Größen.
In Produktion bringen und warten
Auf Ihren Server pushen. Ollama-API-Endpunkt konfigurieren. Sicher freigeben (Reverse Proxy, API-Key, TLS). Dann das Host-OS patchen, Modell-Updates verwalten, GPU-Auslastung überwachen und skalieren, wenn Sie aus dem Container herauswachsen. Hier wird DIY teuer.
Apps, die perfekt zu Ollama passen
Ollama allein ist nur eine API. Diese Frontends machen daraus ein Werkzeug, das Ihr Team täglich nutzt.
Self-hosted chat interface for local and private LLMs
Enhanced ChatGPT Clone: Multi-LLM Chatbots with Modular AI
Private AI document chat that works with any LLM, anywhere

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.
Franz Koller
Co-Founder · Joy
Ollama vs. andere containerisierte LLMs
Wenn Sie containerbasierte LLM-Inferenz evaluieren, haben Sie Optionen:
Ollama: Am beliebtesten. Vorgefertigte Binärdateien. Einfaches Modellmanagement (ollama pull llama2). OpenAI-API-Kompatibilität für schnelle Migration. Läuft auf Mac, Linux, Windows. 60K+ GitHub-Sterne. Aktive Community.
Vllm: Rohe Performance. Besser für Batching. Schwieriger einzurichten. Kein Modellmanager wie Ollama. Beliebt in ML-Labs, weniger bei Ops-Teams.
LocalAI: Open-Source-Alternative. Langsameres Startup. Keine offiziellen Docker-Images. Community-gepflegt. Kleineres Ökosystem.
LM Studio: Nur Desktop-GUI. Nicht containerisiert. Gut für Experimente. Nicht für Teams skalierbar.
Ollama gewinnt bei Produktions-Docker-Setups. Aber Docker-Betrieb kostet Sie Zeit: Debugging von nvidia-docker, Speicher-Tuning, Modellspeicherung auf der Festplatte, API-Endpunkt-Sicherheit, monatliches OS-Patching, Backup-Strategie.
Docker Compose: Das Setup, das die meisten Teams versuchen
Hier ist ein typischer Docker-Compose-Stack für den Betrieb von Ollama mit Open WebUI in der Produktion:
version: '3.8', services: ollama (image: ollama/ollama:latest, runtime: nvidia, ports: 11434:11434, volumes: ollama_data:/root/.ollama, restart: unless-stopped) und open-webui (image: ghcr.io/open-webui/open-webui:latest, ports: 3000:8080, environment: OLLAMA_BASE_URL=http://ollama:11434, depends_on: ollama, restart: unless-stopped).
Das funktioniert lokal. Aber in der Produktion kommt hinzu: Secrets-Management, Reverse Proxy (Nginx), TLS-Zertifikate, API-Key-Auth, Monitoring, Log-Shipping, Backup-Cronjobs und Disaster-Recovery-Playbooks. Aus dem 5-Minuten-Setup wird ein 40-Stunden-Projekt.
Wann Sie bei DIY-Docker bleiben sollten
Wenn Ihr Team bereits Kubernetes betreibt oder Ops-Ingenieure beschäftigt: DIY-Docker kann sinnvoll sein. Sie haben das Personal, um es zu warten.
Wenn Sie Prototypen erstellen: Lokales Docker ist schnell und kostenlos.
Wenn Sie zu Hause keine GPU haben und experimentieren möchten: Docker auf einem gemieteten Server kostet $5-10/Monat für die Rechenleistung. Rechnet man Ihre Arbeitszeit dazu, sind Sie bereits bei unserem $20/Monat Pauschalpreis für Opsily-Hosting.
Wann Sie zu Managed Opsily-Hosting wechseln sollten
- Sie haben genug vom Patchen - Wöchentliche OS-Updates, Sicherheitswarnungen, Tests vor dem Rollout.
- GPU-Setup ist nervig - nvidia-docker, Treiber-Versionen abgleichen, CUDA-Kompatibilitätsprüfungen.
- Sie benötigen DSGVO - EU-Datenstandort, keine Inferenz-APIs von Drittanbietern, Ihre Modelle bleiben Ihre Modelle.
- Ihr Team wächst - Ein Docker-Support-Ticket bedeutet Kontextwechsel und Produktivitätsverlust.
- Ihr Ollama ist geschäftskritisch - Bezahlter Support, Uptime-SLA, automatische Backups, Disaster Recovery.
Wenn Ihnen das bekannt vorkommt, spart Ihnen Opsily für $20/Monat (oder $40-70 für mehr Kapazität) bereits im ersten Monat Geld, weil Sie es nicht selbst warten müssen.
Ollama Docker DIY vs. Opsily Managed
Preise Stand Juni 2026. DIY-Kosten beinhalten Arbeitszeit; Opsily ist alles inklusive.
Einfache, transparente Preisgestaltung
Alle Pläne beinhalten DSGVO-konformes deutsches Hosting, automatisches Patching, tägliche Backups und 99.9% Uptime. Keine versteckten Gebühren. Jederzeit skalierbar.
Loading pricing...
Vertrauen & Compliance
Opsily erfüllt die Sicherheits- und Datenschutzstandards, die für Teams, die Ollama nutzen, wichtig sind.
GDPR Compliant
Datenstandort in deutschen Rechenzentren. Keine Datenübertragung an Dritte. Volle Einhaltung der DSGVO-Sicherheitsanforderungen gemäß Artikel 32.
Data Encryption
AES-256-Verschlüsselung im Ruhezustand. TLS 1.3 bei der Übertragung. Ihre Ollama-Modelle und Inferenz-Logs sind auf der Festplatte verschlüsselt.
Automated Security Updates
Jeder Server wird täglich gepatcht. Sicherheitslücken werden innerhalb von 24 Stunden nach Veröffentlichung behoben. Kein Patching mit Ausfallzeiten auf der Opsily-Plattform.
EU Infrastructure
Server in Frankfurt, Deutschland. Eigentum und Verwaltung durch Opsily. Kein Cloud-Mietmodell von Drittanbietern. Volle Kontrolle über Ihre Daten.
Open Source Transparency
Ollama ist Open Source (MIT-Lizenz). Open WebUI ist Open Source. LibreChat ist Open Source. Keine proprietären LLMs, die Ihre Daten lesen.
Häufig gestellte Fragen
Pull the official Ollama Docker image, then run: docker run -d -v ollama:/root/.ollama -p 11434:11434 ollama/ollama. This exposes Ollama's API on port 11434. To load models, run docker exec <container> ollama pull llama2. For production, use Docker Compose to manage Ollama and Open WebUI together. See our setup guide for the full Compose file.
Was unsere Kunden sagen
Teams in der gesamten EU betreiben ihren Stack auf Opsily. So sieht das in der Praxis aus.
EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.
Franz Koller
Co-Founder • Joy
We were paying per user on everything and it added up fast. Now we run five apps for less than one of those old plans. My finance team finally stopped asking questions.
Elise
Head of Operations
Wanted to use n8n for ages but the self-host part always stopped me. Opsily just handled it. Got the power without becoming an IT person overnight.
Federica B.
Automation Consultant
Bereit, den Docker-Betrieb zu überspringen?
Ihre Opsily-Instanz ist in 4 Minuten bereit. Ollama läuft. GPU ist konfiguriert. Updates sind automatisch. Kein Docker-Debugging. Kein Patchen am Wochenende.