Ejecuta AnythingLLM 10x más rápido con aceleración GPU en Docker
Deja de esperar respuestas. Habilita el soporte para GPU NVIDIA en Docker y consigue que los modelos locales de 13B respondan en 200ms, no en 2 segundos. Guía de configuración + opción de hosting gestionado incluida.
Por qué la GPU es importante para AnythingLLM
Los LLM locales sin potencia de GPU son inutilizables. La GPU los transforma en herramientas de producción.
Inferencia 10x más rápida
Un modelo de 13B parámetros funciona a 5 tokens/segundo en GPU frente a 0.5 tokens/segundo en CPU. Esa es la diferencia entre una respuesta de 200ms y una espera de 2 segundos. Tus usuarios lo notan. Tu coste de LLM por inferencia cae de 2 centavos a 0.2 centavos. Para un equipo que ejecuta 1000 inferencias al día, eso supone 6000 dólares ahorrados anualmente.
Ejecuta modelos privados localmente
Con la aceleración GPU, los modelos de Ollama o Llama.cpp permanecen en tu hardware. Ningún dato sale de tu entorno. Sin llamadas a la API de OpenAI significa sin dependencia externa. Sin vendor lock-in. Tus documentos, tu contexto, tu control. Cumple con GDPR por diseño.
Escala sin SaaS
AnythingLLM más modelos locales significa que eres dueño de todo el stack. Opsily elimina la complejidad de Docker, NVIDIA y DevOps. Nosotros gestionamos las versiones de CUDA, la compatibilidad de drivers, la asignación de memoria y la configuración del runtime. Tú despliegas, configuras e iteras en tus flujos de trabajo de LLM. Sin dolores de cabeza de gestión.
Built for teams who need reliability
Con la confianza de equipos de alto rendimiento
















Habilita la aceleración GPU en 5 pasos
El soporte de GPU en Docker requiere el runtime de NVIDIA. Aquí tienes la ruta de configuración desde cero hasta la ejecución.
Choose Your App
Select an app to get started.
Instala el runtime de NVIDIA Docker
Tu máquina host necesita nvidia-docker o nvidia-container-toolkit. Instala desde el repositorio de NVIDIA: añade la clave GPG, descarga el paquete nvidia-docker más reciente y verifica que nvidia-smi muestre tu GPU.
Actualiza la configuración del daemon de Docker
Establece nvidia como el runtime predeterminado en /etc/docker/daemon.json. Recarga el daemon de Docker. Prueba con docker run nvidia/cuda nvidia-smi para confirmar que la GPU es visible dentro de los contenedores.
Configura el archivo compose de AnythingLLM
Añade el runtime gpu al servicio de AnythingLLM. Establece el entorno: CUDA_VISIBLE_DEVICES=0 (o tu ID de GPU). Monta /dev/nvidia* para el acceso al dispositivo GPU. Establece OLLAMA_NUM_GPU=35 para descargar 35 capas a la GPU.
Descarga e inicia el modelo local
Ejecuta ollama pull mistral o ollama pull llama2:13b. Verifica que el modelo se descargó en tu host. AnythingLLM lo detectará y lo listará en Workspace settings > AI Providers > Ollama.
Ejecuta un chat de prueba y mide la velocidad
Crea un espacio de trabajo. Ingresa un documento. Haz una pregunta. Comprueba el tiempo de respuesta en la consola del navegador. Si ves respuestas de 200-400ms en un modelo de 13B, la GPU está funcionando. Si sigues viendo más de 5 segundos, comprueba CUDA_VISIBLE_DEVICES y los logs de docker.
Runtime de NVIDIA: La capa invisible
Docker no tiene acceso a la GPU por defecto. El NVIDIA Container Toolkit soluciona esto. Intercepta los comandos docker run, detecta las peticiones de GPU e inyecta las librerías, drivers y archivos de dispositivo de NVIDIA correctos en el contenedor.
Sin el toolkit, AnythingLLM funciona bien pero los modelos corren solo en CPU. Con el toolkit, la potencia de la GPU está disponible dentro del contenedor igual que en el host.
CUDA y cuDNN: Coincidencia de versiones
CUDA es la plataforma de computación de NVIDIA. cuDNN son librerías de redes neuronales optimizadas. Tu versión de CUDA en el host debe coincidir con la versión de CUDA en tu imagen Docker de AnythingLLM. La falta de coincidencia significa que los modelos no usarán la GPU.
Comprueba: nvidia-smi (muestra la versión del driver del host). Comprueba los logs de docker para el contenedor AnythingLLM (muestra la versión de CUDA dentro de la imagen). Si entran en conflicto, descarga una etiqueta de imagen diferente de ollama/ollama:gpu o especifica CUDA 11.8 frente a 12.1 explícitamente.
Memoria y descarga de capas
Un modelo de 13B necesita al menos 16GB de VRAM para caber completamente en la GPU. Si tu tarjeta tiene 8GB, establece OLLAMA_NUM_GPU=20 (descarga 20 capas transformer a la GPU, el resto en la CPU). Esto es más lento pero sigue siendo 3-5x más rápido que solo con CPU.
AnythingLLM y Ollama gestionan este compromiso automáticamente. Monitoriza nvidia-smi durante la inferencia para ver qué capas están en la GPU. Si ves un 0% de utilización de GPU durante el chat, el modelo se ajustó en la CPU y no se está usando la GPU.
Docker Compose frente a docker run básico
Los archivos Compose son más limpios. Un archivo define todo el stack: contenedor AnythingLLM, red, volúmenes, dispositivos GPU, variables de entorno. Usa docker-compose up -d y todo arranca. Usa docker-compose logs -f para depurar. Usa docker-compose down para detener.
Los comandos docker run básicos son de una sola línea pero más difíciles de reproducir y depurar después. Para producción, usa siempre compose.
Persistencia de datos y copias de seguridad
AnythingLLM almacena documentos, embeddings y chats en una base de datos local (SQLite por defecto). Monta esto en un volumen del host: volumes: - /path/on/host/anythingllm-data:/app/server/storage. Ahora tus datos sobreviven a reinicios y actualizaciones del contenedor.
Para producción, haz una copia de seguridad de esta carpeta semanalmente. Para el cumplimiento en la UE, esta carpeta permanece en tu infraestructura. Sin sincronización en la nube. Sin acceso de proveedores.

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.
Franz Koller
Co-Founder · Joy
Más rápido y barato que los LLM basados en API
La inferencia local con GPU cuesta 0.2 centavos por cada 1000 tokens (hardware amortizado a 3 años). OpenAI GPT-4 cuesta 3 centavos. Los modelos locales son 15x más baratos después de tu primer año de inversión en hardware GPU.
Ver planes de preciosCreado para equipos con necesidades de cumplimiento
Self-hosted significa que eres dueño de tus datos. Sin proveedores externos, sin dependencia de SaaS, sin riesgo de exportación de datos.
GDPR compliant
Los datos permanecen en tu infraestructura. Sin sincronización con API externas. Sin entrenamiento con tus documentos. Registro de auditoría completo y control de eliminación.
Data sovereignty
Ejecuta todo en infraestructura alemana o solo de la UE con Opsily. Cumple con los requisitos SCHREMS II y NIS2. Sin transferencia de datos transfronteriza.
No vendor lock-in
AnythingLLM es de código abierto. Exporta tus chats y documentos en cualquier momento. Cambia de proveedor de hosting o ejecútalo on-prem sin perder datos. No estás atrapado.
Encrypted at rest
Todos los datos cifrados con AES-256. Claves de cifrado almacenadas en tu hardware. Opsily nunca tiene acceso a tus claves o documentos en texto plano.
Aloja AnythingLLM con GPU, sin configuración requerida
Opsily gestiona el runtime de NVIDIA, versiones de CUDA, gestión de memoria, copias de seguridad y SSL. Tú subes documentos y chateas. Todos los planes incluyen copias de seguridad diarias, SLA de disponibilidad del 99.9% y hosting alemán conforme al GDPR.
Loading pricing...
Preguntas frecuentes sobre la configuración de GPU en AnythingLLM
A 4GB consumer GPU (RTX 3060 Mini) runs 7B models. A 16GB GPU (RTX 4080) runs 13B models smoothly. For production with multiple concurrent users, 24GB (RTX 4090 or A6000) is safer. But most teams start with RTX 4070 (12GB) and it covers 7B-10B models at 200ms latency.
Lo que dicen nuestros clientes
Equipos en toda la UE ejecutan su stack en Opsily. Así es como se ve en la práctica.
EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.
Franz Koller
Co-Founder • Joy
We were paying per user on everything and it added up fast. Now we run five apps for less than one of those old plans. My finance team finally stopped asking questions.
Elise
Head of Operations
Wanted to use n8n for ages but the self-host part always stopped me. Opsily just handled it. Got the power without becoming an IT person overnight.
Federica B.
Automation Consultant
¿Listo para AnythingLLM con aceleración GPU?
Configúralo tú mismo con nuestra guía anterior, o deja que Opsily se encargue del runtime de NVIDIA, CUDA, copias de seguridad y escalado. Hosting conforme al GDPR incluido.