Execute o AnythingLLM 10x mais rápido com aceleração de GPU no Docker
Pare de esperar por respostas. Ative o suporte a GPU NVIDIA no Docker e faça com que modelos locais de 13B respondam em 200ms, não em 2 segundos. Guia de configuração + opção de hospedagem gerenciada incluídos.
Por que a GPU é importante para o AnythingLLM
LLMs locais sem computação de GPU são inutilizáveis. A GPU os transforma em ferramentas de produção.
Inferência 10x mais rápida
Um modelo de 13B parâmetros roda a 5 tokens/segundo em GPU, contra 0,5 tokens/segundo em CPU. Essa é a diferença entre uma resposta de 200ms e uma espera de 2 segundos. Seus usuários percebem. O custo do seu LLM por inferência cai de 2 centavos para 0,2 centavos. Para uma equipe que executa 1000 inferências diariamente, isso representa 6000 dólares economizados anualmente.
Execute modelos privados localmente
Com aceleração de GPU, modelos Ollama ou Llama.cpp permanecem no seu hardware. Nenhum dado sai do seu ambiente. Sem chamadas de API da OpenAI significa sem dependência externa. Sem vendor lock-in. Seus documentos, seu contexto, seu controle. Em conformidade com o GDPR por design.
Escale sem SaaS
AnythingLLM mais modelos locais significa que você é dono de toda a stack. A Opsily remove a complexidade do Docker, NVIDIA e DevOps. Nós gerenciamos versões de CUDA, compatibilidade de drivers, alocação de memória e configuração de runtime. Você implanta, configura e itera nos seus fluxos de trabalho de LLM. Sem dores de cabeça com o ambiente.
Built for teams who need reliability
Com a confiança de equipes ágeis
















Ative a aceleração de GPU em 5 passos
O suporte a GPU no Docker requer o runtime NVIDIA. Aqui está o caminho de configuração do zero até o funcionamento.
Choose Your App
Select an app to get started.
Instale o runtime NVIDIA Docker
Sua máquina host precisa do nvidia-docker ou nvidia-container-toolkit. Instale a partir do repositório da NVIDIA: adicione a chave GPG, baixe o pacote nvidia-docker mais recente, verifique se o nvidia-smi mostra sua GPU.
Atualize a configuração do daemon do Docker
Defina nvidia como o runtime padrão em /etc/docker/daemon.json. Recarregue o daemon do Docker. Teste com docker run nvidia/cuda nvidia-smi para confirmar que a GPU está visível dentro dos containers.
Configure o arquivo compose do AnythingLLM
Adicione o runtime de gpu ao serviço AnythingLLM. Defina o ambiente: CUDA_VISIBLE_DEVICES=0 (ou seu ID de GPU). Monte /dev/nvidia* para acesso ao dispositivo de GPU. Defina OLLAMA_NUM_GPU=35 para descarregar 35 camadas para a GPU.
Baixe e inicie o modelo local
Execute ollama pull mistral ou ollama pull llama2:13b. Verifique se o modelo foi baixado no seu host. O AnythingLLM irá detectá-lo e listá-lo em Workspace settings > AI Providers > Ollama.
Execute um chat de teste e meça a velocidade
Crie um workspace. Ingestione um documento. Faça uma pergunta. Verifique o tempo de resposta no console do navegador. Se você vir respostas de 200-400ms em um modelo de 13B, a GPU está funcionando. Se ainda vir 5+ segundos, verifique CUDA_VISIBLE_DEVICES e os logs do docker.
Runtime NVIDIA: A Camada Invisível
O Docker não tem acesso à GPU por padrão. O NVIDIA Container Toolkit corrige isso. Ele intercepta comandos docker run, detecta solicitações de GPU e injeta as bibliotecas, drivers e arquivos de dispositivo NVIDIA corretos no container.
Sem o toolkit, o AnythingLLM roda bem, mas os modelos rodam apenas na CPU. Com o toolkit, a computação de GPU fica disponível dentro do container, assim como no host.
CUDA e cuDNN: Correspondência de Versão
CUDA é a plataforma de computação da NVIDIA. cuDNN são bibliotecas de redes neurais otimizadas. A versão do CUDA no seu host deve corresponder à versão do CUDA na sua imagem Docker do AnythingLLM. Incompatibilidade significa que os modelos não usarão a GPU.
Verifique: nvidia-smi (mostra a versão do driver do host). Verifique os logs do docker para o container AnythingLLM (mostra a versão do CUDA dentro da imagem). Se houver conflito, baixe uma tag de imagem diferente de ollama/ollama:gpu ou especifique CUDA 11.8 vs 12.1 explicitamente.
Memória e Descarregamento de Camadas
Um modelo de 13B precisa de pelo menos 16GB de VRAM para caber inteiramente na GPU. Se sua placa tiver 8GB, defina OLLAMA_NUM_GPU=20 (descarregue 20 camadas de transformador para a GPU, o restante na CPU). Isso é mais lento, mas ainda 3-5x mais rápido que apenas CPU.
AnythingLLM e Ollama lidam com esse compromisso automaticamente. Monitore o nvidia-smi durante a inferência para ver quais camadas estão na GPU. Se você vir 0% de utilização de GPU durante o chat, o modelo coube na CPU e a GPU não está sendo usada.
Docker Compose vs docker run bruto
Arquivos Compose são mais limpos. Um arquivo define toda a stack: container AnythingLLM, rede, volumes, dispositivos de GPU, variáveis de ambiente. Use docker-compose up -d e tudo inicia. Use docker-compose logs -f para depurar. Use docker-compose down para parar.
Comandos docker run brutos são de linha única, mas mais difíceis de reproduzir e depurar depois. Para produção, use sempre compose.
Persistência de Dados e Backups
O AnythingLLM armazena documentos, embeddings e chats em um banco de dados local (SQLite por padrão). Monte isso em um volume do host: volumes: - /caminho/no/host/anythingllm-data:/app/server/storage. Agora seus dados sobrevivem a reinicializações e atualizações de container.
Para produção, faça backup desta pasta semanalmente. Para conformidade na UE, esta pasta permanece no seu ambiente. Sem sincronização na nuvem. Sem acesso de terceiros.

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.
Franz Koller
Co-Founder · Joy
Mais rápido e mais barato que LLMs baseados em API
A inferência local em GPU custa 0,2 centavos por 1000 tokens (hardware amortizado em 3 anos). O OpenAI GPT-4 custa 3 centavos. Modelos locais são 15x mais baratos após o seu primeiro ano de investimento em hardware de GPU.
Ver planos de preçosCriado para equipes com necessidades de conformidade
Auto-hospedado significa que você é dono dos seus dados. Sem fornecedor terceirizado, sem dependência de SaaS, sem risco de exportação de dados.
GDPR compliant
Os dados permanecem no seu ambiente. Sem sincronização com APIs externas. Sem treinamento com seus documentos. Trilha de auditoria completa e controle de exclusão.
Data sovereignty
Execute inteiramente em ambiente alemão ou apenas na UE com a Opsily. Atende aos requisitos SCHREMS II e NIS2. Sem transferência transfronteiriça de dados.
No vendor lock-in
AnythingLLM é open-source. Exporte seus chats e documentos a qualquer momento. Troque de provedor de hospedagem ou execute on-prem sem perder dados. Você não está preso.
Encrypted at rest
Todos os dados criptografados com AES-256. Chaves de criptografia armazenadas no seu hardware. A Opsily nunca tem acesso às suas chaves ou documentos em texto simples.
Hospede o AnythingLLM com GPU, sem necessidade de configuração
A Opsily cuida do runtime NVIDIA, versões CUDA, gerenciamento de memória, backups e SSL. Você faz upload dos documentos e conversa. Todos os planos incluem backups diários, SLA de 99.9% de uptime e hospedagem alemã em conformidade com o GDPR.
Loading pricing...
Perguntas comuns sobre a configuração de GPU do AnythingLLM
A 4GB consumer GPU (RTX 3060 Mini) runs 7B models. A 16GB GPU (RTX 4080) runs 13B models smoothly. For production with multiple concurrent users, 24GB (RTX 4090 or A6000) is safer. But most teams start with RTX 4070 (12GB) and it covers 7B-10B models at 200ms latency.
O que nossos clientes dizem
Equipes em toda a UE executam sua stack na Opsily. Veja como isso funciona na prática.
EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.
Franz Koller
Co-Founder • Joy
We were paying per user on everything and it added up fast. Now we run five apps for less than one of those old plans. My finance team finally stopped asking questions.
Elise
Head of Operations
Wanted to use n8n for ages but the self-host part always stopped me. Opsily just handled it. Got the power without becoming an IT person overnight.
Federica B.
Automation Consultant
Pronto para o AnythingLLM com aceleração de GPU?
Configure você mesmo com nosso guia acima, ou deixe a Opsily cuidar do runtime NVIDIA, CUDA, backups e escalabilidade. Hospedagem GDPR incluída.