Hosted in Germany • GDPR-ready

Nutzen Sie AnythingLLM 10x schneller mit GPU-Beschleunigung in Docker

Hören Sie auf zu warten. Aktivieren Sie NVIDIA GPU-Unterstützung in Docker und lassen Sie 13B lokale Modelle in 200ms statt 2 Sekunden antworten. Inklusive Einrichtungsanleitung und Managed-Hosting-Option.

CCRMAAnalyticsAAutomationBBlogFForms

Warum GPU für AnythingLLM wichtig ist

Lokale LLMs ohne GPU-Rechenleistung sind unbrauchbar. Die GPU macht sie zu produktiven Werkzeugen.

10x schnellere Inferenz

Ein 13B-Parameter-Modell läuft mit 5 Tokens/Sekunde auf einer GPU gegenüber 0,5 Tokens/Sekunde auf einer CPU. Das ist der Unterschied zwischen einer 200ms-Antwort und 2 Sekunden Wartezeit. Ihre Nutzer merken das. Ihre LLM-Kosten pro Inferenz sinken von 2 Cent auf 0,2 Cent. Für ein Team, das täglich 1000 Anfragen verarbeitet, sind das 6000 Dollar Ersparnis pro Jahr.

Private Modelle lokal ausführen

Mit GPU-Beschleunigung bleiben Ollama- oder Llama.cpp-Modelle auf Ihrer Hardware. Keine Daten verlassen Ihre Umgebung. Keine OpenAI API-Aufrufe bedeuten keine externe Abhängigkeit. Kein Vendor-Lock-in. Ihre Dokumente, Ihr Kontext, Ihre Kontrolle. DSGVO-konform durch Design.

Skalieren ohne SaaS

AnythingLLM plus lokale Modelle bedeutet, dass Ihnen der gesamte Stack gehört. Opsily entfernt die Komplexität von Docker, NVIDIA und DevOps. Wir verwalten CUDA-Versionen, Treiberkompatibilität, Speicherzuweisung und Laufzeitkonfiguration. Sie deployen, konfigurieren und iterieren Ihre LLM-Workflows. Keine Kopfschmerzen bei der Bereitstellung.

Built for teams who need reliability

200ms
Durchschnittliche Antwortzeit mit GPU
16GB
VRAM für 13B-Modelle benötigt
80%
Kostenreduktion gegenüber API-Aufrufen
10x
Schneller als reine CPU-Inferenz
Monthly Cost Breakdown
Zapier Pro$29.00
HubSpot Starter$45.00
Typeform Basic$25.00
Total SaaS Cost$99.00/mo
Opsily Server
$20.00/mo
You save $948/year

Vertraut von agilen Teams

Joy Logo
Logo3
Logo7
Firmenlogo
Firmenlogo
Firmenlogo
Firmenlogo
Firmenlogo
Joy Logo
Logo3
Logo7
Firmenlogo
Firmenlogo
Firmenlogo
Firmenlogo
Firmenlogo

GPU-Beschleunigung in 5 Schritten aktivieren

Docker GPU-Unterstützung erfordert die NVIDIA-Laufzeit. Hier ist der Weg von Null bis zum Betrieb.

console.opsily.com/deploy
1
App
2
Region
3
Plan
4
Domain

Choose Your App

Select an app to get started.

1

NVIDIA Docker-Laufzeit installieren

Ihr Host-System benötigt nvidia-docker oder das nvidia-container-toolkit. Installation über das NVIDIA-Repo: GPG-Schlüssel hinzufügen, das neueste nvidia-docker-Paket ziehen, prüfen ob nvidia-smi Ihre GPU anzeigt.

2

Docker-Daemon-Konfiguration aktualisieren

Setzen Sie nvidia als Standard-Laufzeit in /etc/docker/daemon.json. Laden Sie den Docker-Daemon neu. Testen Sie mit docker run nvidia/cuda nvidia-smi, um zu bestätigen, dass die GPU innerhalb der Container sichtbar ist.

3

AnythingLLM Compose-Datei konfigurieren

Fügen Sie die gpu-Laufzeit zum AnythingLLM-Service hinzu. Setzen Sie die Umgebungsvariable: CUDA_VISIBLE_DEVICES=0 (oder Ihre GPU-ID). Mounten Sie /dev/nvidia* für den GPU-Gerätezugriff. Setzen Sie OLLAMA_NUM_GPU=35, um 35 Layer auf die GPU auszulagern.

4

Lokales Modell ziehen und starten

Führen Sie ollama pull mistral oder ollama pull llama2:13b aus. Überprüfen Sie, ob das Modell auf Ihren Host heruntergeladen wurde. AnythingLLM erkennt es und listet es unter Workspace-Einstellungen > AI Providers > Ollama auf.

5

Test-Chat ausführen und Geschwindigkeit messen

Erstellen Sie einen Workspace. Laden Sie ein Dokument hoch. Stellen Sie eine Frage. Prüfen Sie die Antwortzeit in der Browser-Konsole. Wenn Sie 200-400ms Antworten bei einem 13B-Modell sehen, funktioniert die GPU. Wenn Sie immer noch 5+ Sekunden sehen, prüfen Sie CUDA_VISIBLE_DEVICES und die Docker-Logs.

Technische Details

NVIDIA Runtime: Die unsichtbare Ebene

Docker hat standardmäßig keinen GPU-Zugriff. Das NVIDIA Container Toolkit korrigiert dies. Es fängt docker run-Befehle ab, erkennt GPU-Anfragen und injiziert die passenden NVIDIA-Bibliotheken, Treiber und Gerätedateien in den Container.

Ohne das Toolkit läuft AnythingLLM zwar, aber die Modelle nutzen nur die CPU. Mit dem Toolkit steht GPU-Rechenleistung innerhalb des Containers genauso zur Verfügung wie auf dem Host.

CUDA und cuDNN: Versionsabgleich

CUDA ist die Rechenplattform von NVIDIA. cuDNN besteht aus optimierten Bibliotheken für neuronale Netze. Ihre Host-CUDA-Version muss mit der CUDA-Version in Ihrem AnythingLLM Docker-Image übereinstimmen. Ein Konflikt führt dazu, dass Modelle die GPU nicht nutzen.

Prüfung: nvidia-smi (zeigt die Host-Treiberversion). Prüfen Sie die Docker-Logs für den AnythingLLM-Container (zeigt die CUDA-Version im Image). Wenn sie nicht übereinstimmen, ziehen Sie ein anderes Image-Tag von ollama/ollama:gpu oder geben Sie CUDA 11.8 vs 12.1 explizit an.

Speicher und Layer-Auslagerung

Ein 13B-Modell benötigt mindestens 16GB VRAM, um vollständig auf die GPU zu passen. Wenn Ihre Karte 8GB hat, setzen Sie OLLAMA_NUM_GPU=20 (lagert 20 Transformer-Layer auf die GPU aus, der Rest läuft auf der CPU). Das ist langsamer, aber immer noch 3-5x schneller als reine CPU-Nutzung.

AnythingLLM und Ollama handhaben diesen Kompromiss automatisch. Überwachen Sie nvidia-smi während der Inferenz, um zu sehen, welche Layer auf der GPU liegen. Wenn Sie 0% GPU-Auslastung während des Chats sehen, passt das Modell auf die CPU und die GPU wird nicht genutzt.

Docker Compose vs. Raw docker run

Compose-Dateien sind sauberer. Eine Datei definiert den gesamten Stack: AnythingLLM-Container, Netzwerk, Volumes, GPU-Geräte, Umgebungsvariablen. Nutzen Sie docker-compose up -d und alles startet. Nutzen Sie docker-compose logs -f zum Debuggen. Nutzen Sie docker-compose down zum Stoppen.

Raw docker run-Befehle sind zwar einzeilig, aber schwerer zu reproduzieren und später zu debuggen. Für die Produktion sollten Sie immer Compose verwenden.

Datenpersistenz und Backups

AnythingLLM speichert Dokumente, Embeddings und Chats in einer lokalen Datenbank (standardmäßig SQLite). Mounten Sie diese auf ein Host-Volume: volumes: - /pfad/auf/host/anythingllm-data:/app/server/storage. So überleben Ihre Daten Container-Neustarts und Updates.

Für die Produktion sollten Sie diesen Ordner wöchentlich sichern. Für die EU-Konformität bleibt dieser Ordner in Ihrer Umgebung. Keine Cloud-Synchronisierung. Kein Zugriff durch Dritte.

Franz Koller

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.

Franz Koller

Co-Founder · Joy

80%

Schneller und günstiger als API-basierte LLMs

Lokale GPU-Inferenz kostet 0,2 Cent pro 1000 Tokens (Hardware über 3 Jahre amortisiert). OpenAI GPT-4 kostet 3 Cent. Lokale Modelle sind nach dem ersten Jahr der GPU-Hardware-Investition 15x günstiger.

Preispläne ansehen

Entwickelt für Teams mit Compliance-Anforderungen

Self-hosted bedeutet, dass Ihre Daten Ihnen gehören. Kein Drittanbieter, keine SaaS-Abhängigkeit, kein Risiko durch Datenexport.

GDPR compliant

Daten bleiben in Ihrer Umgebung. Keine Synchronisierung mit externen APIs. Kein Training mit Ihren Dokumenten. Vollständiger Audit-Trail und Löschkontrolle.

Data sovereignty

Betrieb vollständig auf deutscher oder EU-only Umgebung mit Opsily. Erfüllt SCHREMS II und NIS2-Anforderungen. Kein Datentransfer in Drittländer.

No vendor lock-in

AnythingLLM ist Open-Source. Exportieren Sie Ihre Chats und Dokumente jederzeit. Wechseln Sie den Hosting-Anbieter oder betreiben Sie es on-premise, ohne Daten zu verlieren. Sie sind nicht gefangen.

Encrypted at rest

Alle Daten sind mit AES-256 verschlüsselt. Verschlüsselungsschlüssel werden auf Ihrer Hardware gespeichert. Opsily hat niemals Zugriff auf Ihre Schlüssel oder Klartext-Dokumente.

AnythingLLM mit GPU hosten, ohne Konfigurationsaufwand

Opsily kümmert sich um NVIDIA-Laufzeit, CUDA-Versionen, Speicherverwaltung, Backups und SSL. Sie laden Dokumente hoch und chatten. Alle Pläne beinhalten tägliche Backups, 99.9% Uptime-SLA und deutsches DSGVO-konformes Hosting.

Monthly
Annual

Loading pricing...

Häufige Fragen zum AnythingLLM GPU-Setup

A 4GB consumer GPU (RTX 3060 Mini) runs 7B models. A 16GB GPU (RTX 4080) runs 13B models smoothly. For production with multiple concurrent users, 24GB (RTX 4090 or A6000) is safer. But most teams start with RTX 4070 (12GB) and it covers 7B-10B models at 200ms latency.

Was unsere Kunden sagen

Teams in der gesamten EU betreiben ihren Stack auf Opsily. So sieht das in der Praxis aus.

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.

Franz Koller

Franz Koller

Co-Founder • Joy

We were paying per user on everything and it added up fast. Now we run five apps for less than one of those old plans. My finance team finally stopped asking questions.

Elise

Head of Operations

Wanted to use n8n for ages but the self-host part always stopped me. Opsily just handled it. Got the power without becoming an IT person overnight.

Federica B.

Automation Consultant

Bereit für GPU-beschleunigtes AnythingLLM?

Richten Sie es selbst mit unserer Anleitung oben ein oder lassen Sie Opsily die NVIDIA-Laufzeit, CUDA, Backups und Skalierung übernehmen. DSGVO-Hosting inklusive.