Hosted in Germany • GDPR-ready

Exécutez AnythingLLM 10x plus vite avec l'accélération GPU dans Docker

Arrêtez d'attendre les réponses. Activez le support GPU NVIDIA dans Docker et obtenez des réponses de modèles locaux 13B en 200ms, au lieu de 2 secondes. Guide de configuration + option d'hébergement managé inclus.

CCRMAAnalyticsAAutomationBBlogFForms

Pourquoi le GPU est crucial pour AnythingLLM

Les LLM locaux sans calcul GPU sont inutilisables. Le GPU les transforme en outils de production.

Inférence 10x plus rapide

Un modèle de 13B paramètres tourne à 5 tokens/seconde sur GPU contre 0,5 token/seconde sur CPU. C'est la différence entre une réponse en 200ms et une attente de 2 secondes. Vos utilisateurs le remarquent. Votre coût LLM par inférence passe de 2 cents à 0,2 cent. Pour une équipe effectuant 1000 inférences par jour, cela représente 6000 dollars économisés par an.

Exécutez des modèles privés localement

Avec l'accélération GPU, les modèles Ollama ou Llama.cpp restent sur votre matériel. Aucune donnée ne quitte votre environnement. Pas d'appels API OpenAI signifie aucune dépendance externe. Pas de dépendance vis-à-vis d'un fournisseur. Vos documents, votre contexte, votre contrôle. Conforme au RGPD par conception.

Passez à l'échelle sans SaaS

AnythingLLM et les modèles locaux signifient que vous possédez toute la stack. Opsily élimine la complexité liée à Docker, NVIDIA et au DevOps. Nous gérons les versions CUDA, la compatibilité des pilotes, l'allocation mémoire et la configuration du runtime. Vous déployez, configurez et itérez sur vos workflows LLM. Fini les soucis techniques.

Built for teams who need reliability

200ms
Temps de réponse moyen avec GPU
16GB
VRAM nécessaire pour les modèles 13B
80%
Réduction des coûts vs appels API
10x
Plus rapide qu'une inférence sur CPU seul
Monthly Cost Breakdown
Zapier Pro$29.00
HubSpot Starter$45.00
Typeform Basic$25.00
Total SaaS Cost$99.00/mo
Opsily Server
$20.00/mo
You save $948/year

Approuvé par des équipes agiles

Logo Joy
Logo3
Logo7
Logo entreprise
Logo entreprise
Logo entreprise
Logo entreprise
Logo entreprise
Logo Joy
Logo3
Logo7
Logo entreprise
Logo entreprise
Logo entreprise
Logo entreprise
Logo entreprise

Activez l'accélération GPU en 5 étapes

Le support GPU Docker nécessite le runtime NVIDIA. Voici le cheminement de configuration, de zéro à opérationnel.

console.opsily.com/deploy
1
App
2
Region
3
Plan
4
Domain

Choose Your App

Select an app to get started.

1

Installez le runtime NVIDIA Docker

Votre machine hôte nécessite nvidia-docker ou nvidia-container-toolkit. Installez depuis le dépôt NVIDIA : ajoutez la clé GPG, récupérez le dernier paquet nvidia-docker, vérifiez que nvidia-smi détecte bien votre GPU.

2

Mettez à jour la configuration du démon Docker

Définissez nvidia comme runtime par défaut dans /etc/docker/daemon.json. Rechargez le démon Docker. Testez avec docker run nvidia/cuda nvidia-smi pour confirmer que le GPU est visible dans les containers.

3

Configurez le fichier compose de AnythingLLM

Ajoutez le runtime gpu au service AnythingLLM. Définissez l'environnement : CUDA_VISIBLE_DEVICES=0 (ou votre ID GPU). Montez /dev/nvidia* pour l'accès au périphérique GPU. Définissez OLLAMA_NUM_GPU=35 pour décharger 35 couches sur le GPU.

4

Récupérez et démarrez un modèle local

Exécutez ollama pull mistral ou ollama pull llama2:13b. Vérifiez que le modèle est téléchargé sur votre hôte. AnythingLLM le détectera et l'affichera sous Paramètres de l'espace de travail > Fournisseurs IA > Ollama.

5

Effectuez un test de chat et mesurez la vitesse

Créez un espace de travail. Importez un document. Posez une question. Vérifiez le temps de réponse dans la console du navigateur. Si vous voyez des réponses en 200-400ms sur un modèle 13B, le GPU fonctionne. Si vous voyez toujours 5+ secondes, vérifiez CUDA_VISIBLE_DEVICES et les logs docker.

Détails techniques

Runtime NVIDIA : La couche invisible

Docker n'a pas accès au GPU par défaut. Le NVIDIA Container Toolkit corrige cela. Il intercepte les commandes docker run, détecte les demandes GPU et injecte les bibliothèques, pilotes et fichiers de périphériques NVIDIA appropriés dans le container.

Sans le toolkit, AnythingLLM fonctionne correctement mais les modèles tournent uniquement sur CPU. Avec le toolkit, le calcul GPU est disponible à l'intérieur du container, tout comme sur l'hôte.

CUDA et cuDNN : Correspondance des versions

CUDA est la plateforme de calcul de NVIDIA. cuDNN est une bibliothèque optimisée pour les réseaux de neurones. Votre version CUDA sur l'hôte doit correspondre à la version CUDA dans votre image Docker AnythingLLM. Une incompatibilité empêchera l'utilisation du GPU.

Vérification : nvidia-smi (affiche la version du pilote hôte). Vérifiez les logs docker du container AnythingLLM (affiche la version CUDA dans l'image). En cas de conflit, récupérez une autre balise d'image depuis ollama/ollama:gpu ou spécifiez explicitement CUDA 11.8 ou 12.1.

Mémoire et déchargement des couches

Un modèle 13B nécessite au moins 16GB de VRAM pour tenir entièrement sur le GPU. Si votre carte a 8GB, réglez OLLAMA_NUM_GPU=20 (décharge 20 couches de transformeur sur le GPU, le reste sur CPU). C'est plus lent mais toujours 3-5x plus rapide qu'un CPU seul.

AnythingLLM et Ollama gèrent ce compromis automatiquement. Surveillez nvidia-smi pendant l'inférence pour voir quelles couches sont sur le GPU. Si vous voyez 0% d'utilisation GPU pendant le chat, le modèle est sur CPU et le GPU n'est pas utilisé.

Docker Compose vs docker run brut

Les fichiers Compose sont plus propres. Un seul fichier définit toute la stack : container AnythingLLM, réseau, volumes, périphériques GPU, variables d'environnement. Utilisez docker-compose up -d pour tout démarrer. Utilisez docker-compose logs -f pour déboguer. Utilisez docker-compose down pour arrêter.

Les commandes docker run brutes sont sur une seule ligne mais plus difficiles à reproduire et à déboguer plus tard. Pour la production, utilisez toujours compose.

Persistance des données et sauvegardes

AnythingLLM stocke les documents, embeddings et chats dans une base de données locale (SQLite par défaut). Montez cela sur un volume hôte : volumes: - /chemin/sur/hote/anythingllm-data:/app/server/storage. Ainsi, vos données survivent aux redémarrages et mises à jour du container.

Pour la production, sauvegardez ce dossier chaque semaine. Pour la conformité européenne, ce dossier reste sur votre environnement. Pas de synchronisation cloud. Pas d'accès tiers.

Franz Koller

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.

Franz Koller

Co-Founder · Joy

80%

Plus rapide et moins cher que les LLM basés sur API

L'inférence GPU locale coûte 0,2 cent pour 1000 tokens (matériel amorti sur 3 ans). OpenAI GPT-4 coûte 3 cents. Les modèles locaux sont 15x moins chers après votre première année d'investissement matériel GPU.

Voir les tarifs

Conçu pour les équipes avec des besoins de conformité

L'auto-hébergement signifie que vous possédez vos données. Pas de fournisseur tiers, pas de dépendance SaaS, aucun risque d'exportation de données.

GDPR compliant

Les données restent sur votre environnement. Aucune synchronisation avec des API externes. Aucun entraînement sur vos documents. Piste d'audit complète et contrôle de suppression.

Data sovereignty

Exécutez entièrement sur une infrastructure allemande ou européenne avec Opsily. Répond aux exigences SCHREMS II et NIS2. Aucun transfert de données transfrontalier.

No vendor lock-in

AnythingLLM est open-source. Exportez vos chats et documents à tout moment. Changez de fournisseur d'hébergement ou exécutez sur site sans perdre vos données. Vous n'êtes pas enfermé.

Encrypted at rest

Toutes les données sont chiffrées avec AES-256. Clés de chiffrement stockées sur votre matériel. Opsily n'a jamais accès à vos clés ou à vos documents en clair.

Hébergez AnythingLLM avec GPU, aucune configuration requise

Opsily gère le runtime NVIDIA, les versions CUDA, la gestion mémoire, les sauvegardes et le SSL. Vous importez vos documents et chattez. Tous les plans incluent des sauvegardes quotidiennes, un SLA de disponibilité de 99.9% et un hébergement allemand conforme au RGPD.

Monthly
Annual

Loading pricing...

Questions fréquentes sur la configuration GPU AnythingLLM

A 4GB consumer GPU (RTX 3060 Mini) runs 7B models. A 16GB GPU (RTX 4080) runs 13B models smoothly. For production with multiple concurrent users, 24GB (RTX 4090 or A6000) is safer. But most teams start with RTX 4070 (12GB) and it covers 7B-10B models at 200ms latency.

Ce que disent nos clients

Des équipes à travers l'UE exécutent leur stack sur Opsily. Voici à quoi cela ressemble en pratique.

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.

Franz Koller

Franz Koller

Co-Founder • Joy

We were paying per user on everything and it added up fast. Now we run five apps for less than one of those old plans. My finance team finally stopped asking questions.

Elise

Head of Operations

Wanted to use n8n for ages but the self-host part always stopped me. Opsily just handled it. Got the power without becoming an IT person overnight.

Federica B.

Automation Consultant

Prêt pour AnythingLLM accéléré par GPU ?

Configurez-le vous-même avec notre guide ci-dessus, ou laissez Opsily gérer le runtime NVIDIA, CUDA, les sauvegardes et la mise à l'échelle. Hébergement RGPD inclus.