Hosted in Germany • GDPR-ready

Execute o AnythingLLM 10x mais rápido com aceleração de GPU no Docker

Pare de esperar por respostas. Ative o suporte a GPU NVIDIA no Docker e faça com que modelos locais de 13B respondam em 200ms, não em 2 segundos. Guia de configuração + opção de hospedagem gerenciada incluídos.

CCRMAAnalyticsAAutomationBBlogFForms

Por que a GPU é importante para o AnythingLLM

LLMs locais sem computação de GPU são inutilizáveis. A GPU os transforma em ferramentas de produção.

Inferência 10x mais rápida

Um modelo de 13B parâmetros roda a 5 tokens/segundo em GPU, contra 0,5 tokens/segundo em CPU. Essa é a diferença entre uma resposta de 200ms e uma espera de 2 segundos. Seus usuários percebem. O custo do seu LLM por inferência cai de 2 centavos para 0,2 centavos. Para uma equipe que executa 1000 inferências diariamente, isso representa 6000 dólares economizados anualmente.

Execute modelos privados localmente

Com aceleração de GPU, modelos Ollama ou Llama.cpp permanecem no seu hardware. Nenhum dado sai do seu ambiente. Sem chamadas de API da OpenAI significa sem dependência externa. Sem vendor lock-in. Seus documentos, seu contexto, seu controle. Em conformidade com o GDPR por design.

Escale sem SaaS

AnythingLLM mais modelos locais significa que você é dono de toda a stack. A Opsily remove a complexidade do Docker, NVIDIA e DevOps. Nós gerenciamos versões de CUDA, compatibilidade de drivers, alocação de memória e configuração de runtime. Você implanta, configura e itera nos seus fluxos de trabalho de LLM. Sem dores de cabeça com o ambiente.

Built for teams who need reliability

200ms
Tempo médio de resposta com GPU
16GB
VRAM necessária para modelos de 13B
80%
Redução de custo vs chamadas de API
10x
Mais rápido que inferência apenas em CPU
Monthly Cost Breakdown
Zapier Pro$29.00
HubSpot Starter$45.00
Typeform Basic$25.00
Total SaaS Cost$99.00/mo
Opsily Server
$20.00/mo
You save $948/year

Com a confiança de equipes ágeis

Logo Joy
Logo3
Logo7
Logo da Empresa
Logo da empresa
Logo da Empresa
Logo da Empresa
Logo da Empresa
Logo Joy
Logo3
Logo7
Logo da Empresa
Logo da empresa
Logo da Empresa
Logo da Empresa
Logo da Empresa

Ative a aceleração de GPU em 5 passos

O suporte a GPU no Docker requer o runtime NVIDIA. Aqui está o caminho de configuração do zero até o funcionamento.

console.opsily.com/deploy
1
App
2
Region
3
Plan
4
Domain

Choose Your App

Select an app to get started.

1

Instale o runtime NVIDIA Docker

Sua máquina host precisa do nvidia-docker ou nvidia-container-toolkit. Instale a partir do repositório da NVIDIA: adicione a chave GPG, baixe o pacote nvidia-docker mais recente, verifique se o nvidia-smi mostra sua GPU.

2

Atualize a configuração do daemon do Docker

Defina nvidia como o runtime padrão em /etc/docker/daemon.json. Recarregue o daemon do Docker. Teste com docker run nvidia/cuda nvidia-smi para confirmar que a GPU está visível dentro dos containers.

3

Configure o arquivo compose do AnythingLLM

Adicione o runtime de gpu ao serviço AnythingLLM. Defina o ambiente: CUDA_VISIBLE_DEVICES=0 (ou seu ID de GPU). Monte /dev/nvidia* para acesso ao dispositivo de GPU. Defina OLLAMA_NUM_GPU=35 para descarregar 35 camadas para a GPU.

4

Baixe e inicie o modelo local

Execute ollama pull mistral ou ollama pull llama2:13b. Verifique se o modelo foi baixado no seu host. O AnythingLLM irá detectá-lo e listá-lo em Workspace settings > AI Providers > Ollama.

5

Execute um chat de teste e meça a velocidade

Crie um workspace. Ingestione um documento. Faça uma pergunta. Verifique o tempo de resposta no console do navegador. Se você vir respostas de 200-400ms em um modelo de 13B, a GPU está funcionando. Se ainda vir 5+ segundos, verifique CUDA_VISIBLE_DEVICES e os logs do docker.

Detalhes Técnicos

Runtime NVIDIA: A Camada Invisível

O Docker não tem acesso à GPU por padrão. O NVIDIA Container Toolkit corrige isso. Ele intercepta comandos docker run, detecta solicitações de GPU e injeta as bibliotecas, drivers e arquivos de dispositivo NVIDIA corretos no container.

Sem o toolkit, o AnythingLLM roda bem, mas os modelos rodam apenas na CPU. Com o toolkit, a computação de GPU fica disponível dentro do container, assim como no host.

CUDA e cuDNN: Correspondência de Versão

CUDA é a plataforma de computação da NVIDIA. cuDNN são bibliotecas de redes neurais otimizadas. A versão do CUDA no seu host deve corresponder à versão do CUDA na sua imagem Docker do AnythingLLM. Incompatibilidade significa que os modelos não usarão a GPU.

Verifique: nvidia-smi (mostra a versão do driver do host). Verifique os logs do docker para o container AnythingLLM (mostra a versão do CUDA dentro da imagem). Se houver conflito, baixe uma tag de imagem diferente de ollama/ollama:gpu ou especifique CUDA 11.8 vs 12.1 explicitamente.

Memória e Descarregamento de Camadas

Um modelo de 13B precisa de pelo menos 16GB de VRAM para caber inteiramente na GPU. Se sua placa tiver 8GB, defina OLLAMA_NUM_GPU=20 (descarregue 20 camadas de transformador para a GPU, o restante na CPU). Isso é mais lento, mas ainda 3-5x mais rápido que apenas CPU.

AnythingLLM e Ollama lidam com esse compromisso automaticamente. Monitore o nvidia-smi durante a inferência para ver quais camadas estão na GPU. Se você vir 0% de utilização de GPU durante o chat, o modelo coube na CPU e a GPU não está sendo usada.

Docker Compose vs docker run bruto

Arquivos Compose são mais limpos. Um arquivo define toda a stack: container AnythingLLM, rede, volumes, dispositivos de GPU, variáveis de ambiente. Use docker-compose up -d e tudo inicia. Use docker-compose logs -f para depurar. Use docker-compose down para parar.

Comandos docker run brutos são de linha única, mas mais difíceis de reproduzir e depurar depois. Para produção, use sempre compose.

Persistência de Dados e Backups

O AnythingLLM armazena documentos, embeddings e chats em um banco de dados local (SQLite por padrão). Monte isso em um volume do host: volumes: - /caminho/no/host/anythingllm-data:/app/server/storage. Agora seus dados sobrevivem a reinicializações e atualizações de container.

Para produção, faça backup desta pasta semanalmente. Para conformidade na UE, esta pasta permanece no seu ambiente. Sem sincronização na nuvem. Sem acesso de terceiros.

Franz Koller

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.

Franz Koller

Co-Founder · Joy

80%

Mais rápido e mais barato que LLMs baseados em API

A inferência local em GPU custa 0,2 centavos por 1000 tokens (hardware amortizado em 3 anos). O OpenAI GPT-4 custa 3 centavos. Modelos locais são 15x mais baratos após o seu primeiro ano de investimento em hardware de GPU.

Ver planos de preços

Criado para equipes com necessidades de conformidade

Auto-hospedado significa que você é dono dos seus dados. Sem fornecedor terceirizado, sem dependência de SaaS, sem risco de exportação de dados.

GDPR compliant

Os dados permanecem no seu ambiente. Sem sincronização com APIs externas. Sem treinamento com seus documentos. Trilha de auditoria completa e controle de exclusão.

Data sovereignty

Execute inteiramente em ambiente alemão ou apenas na UE com a Opsily. Atende aos requisitos SCHREMS II e NIS2. Sem transferência transfronteiriça de dados.

No vendor lock-in

AnythingLLM é open-source. Exporte seus chats e documentos a qualquer momento. Troque de provedor de hospedagem ou execute on-prem sem perder dados. Você não está preso.

Encrypted at rest

Todos os dados criptografados com AES-256. Chaves de criptografia armazenadas no seu hardware. A Opsily nunca tem acesso às suas chaves ou documentos em texto simples.

Hospede o AnythingLLM com GPU, sem necessidade de configuração

A Opsily cuida do runtime NVIDIA, versões CUDA, gerenciamento de memória, backups e SSL. Você faz upload dos documentos e conversa. Todos os planos incluem backups diários, SLA de 99.9% de uptime e hospedagem alemã em conformidade com o GDPR.

Monthly
Annual

Loading pricing...

Perguntas comuns sobre a configuração de GPU do AnythingLLM

A 4GB consumer GPU (RTX 3060 Mini) runs 7B models. A 16GB GPU (RTX 4080) runs 13B models smoothly. For production with multiple concurrent users, 24GB (RTX 4090 or A6000) is safer. But most teams start with RTX 4070 (12GB) and it covers 7B-10B models at 200ms latency.

O que nossos clientes dizem

Equipes em toda a UE executam sua stack na Opsily. Veja como isso funciona na prática.

EUR 800 a year for tools that used to cost us multiples of that. We replaced HubSpot, Make.com, and our password manager with self-hosted apps on Opsily. One provider, one fee.

Franz Koller

Franz Koller

Co-Founder • Joy

We were paying per user on everything and it added up fast. Now we run five apps for less than one of those old plans. My finance team finally stopped asking questions.

Elise

Head of Operations

Wanted to use n8n for ages but the self-host part always stopped me. Opsily just handled it. Got the power without becoming an IT person overnight.

Federica B.

Automation Consultant

Pronto para o AnythingLLM com aceleração de GPU?

Configure você mesmo com nosso guia acima, ou deixe a Opsily cuidar do runtime NVIDIA, CUDA, backups e escalabilidade. Hospedagem GDPR incluída.