Como hospedar seu próprio assistente de IA em um VPS? Guia completo
Todo mês você envia milhares de consultas para um serviço de IA na nuvem. Toda vez que você faz isso, está pagando pelo servidor de outra pessoa e cedendo seus dados, na esperança de que essa seja a opção mais acessível.
Na verdade, existe uma maneira mais inteligente.
Você pode executar seu próprio assistente de IA privado em um Servidor Virtual Privado (VPS) por apenas US$ 5 a US$ 20 por mês, sem limites de uso, sem vazamento de dados e com controle total sobre qual modelo de IA usar.
Nossa equipe técnica passou semanas testando essa configuração de ponta a ponta, e este guia fornece cada etapa em linguagem simples e clara para que você possa entrar em operação hoje mesmo.
Desenvolvedores, proprietários de pequenas empresas, pesquisadores e profissionais de marketing.ivacy-usuários focados que desejam um ambiente privado e Chatbot de IA auto-hospedado em um VPS E eles não confiam na OpenAI, na Anthropic ou em qualquer API paga.
O que você precisa antes de começar?
Antes de escrever qualquer comando, certifique-se de que seu VPS atenda às especificações de hardware corretas.
Por favor, tente entender que os modelos de IA consomem muita memória.
Se você estiver carregando um modelo Q4 (versão quantizada 4), de 6 GB a 8 GB de RAM são suficientes. No entanto, se estiver carregando um modelo com 7 bilhões de parâmetros, serão necessários de 13 GB a 14 GB de RAM, antes que o sistema operacional e outros serviços consumam sua parcela.
Ter uma memória RAM fraca significa travamentos constantes e respostas lentas.
Nossa equipe testou as configurações mínimas e recomendadas em diversos provedores de VPS. Eis o que realmente funciona.
Requisitos de hardware e VPS
Abaixo, adicionamos uma lista com os requisitos mínimos e recomendados de hardware e VPS para que seu assistente de IA possa ser hospedado em seu próprio servidor e executar cargas de trabalho corretamente, sem interrupções.
Por favor, leve em consideração esses requisitos ao alugar um servidor VPS para hospedar seu próprio assistente de IA.
| Spec | Mínimo (Modelos Pequenos) | Recomendado (modelos 7B, 13B e superiores) |
| vCPU | 4 vCPUs | 8+ vCPU |
| RAM | 8 GB | 16 GB a 32 GB |
| Armazenamento | 100 GB SSD | SSD NVMe de 200 GB ou mais |
| OS | Ubuntu LTS 22.04 | Ubuntu LTS 22.04 |
| GPU | Não é necessária | Opcional (acelera a inferência) |
| Largura de Banda | 1 TB por mês | 2 TB+ por mês |
Se o seu VPS tiver menos de 8 GB de RAM, mesmo modelos leves como o TinyLlama apresentarão lentidão. Sempre escolha um modelo de IA que corresponda ao tamanho da sua RAM disponível. Um modelo 7B (Q4) precisa de aproximadamente 8 GB. Um modelo 13B precisa de 16 GB a 18 GB. Um modelo 70B precisa de mais de 40 GB ou um VPS com GPU.
Provedores de VPS recomendados (VPS econômico)
Nossa equipe de pesquisa comparou dezenas de provedores de VPS. Estes quatro são os melhores VPS para hospedagem própria de assistentes de IA, oferecendo o melhor preço e facilidade de uso para executar um assistente de IA.
# 1. Kamatera
Kamatera Opera infraestrutura em nuvem desde 1995. Permite criar um VPS totalmente personalizado, escolhendo exatamente o número de núcleos de CPU, RAM, SSD e a localização do data center.

Os preços começam em US$ 4 por mês e incluem um período de teste gratuito de 30 dias com até US$ 100 em créditos para servidor. É uma ótima opção para equipes que desejam controle preciso sem contratos de longo prazo.
- Configuração VPS totalmente personalizada: Escolha CPU, RAM, SSD e sistema operacional separadamente, em vez de selecionar entre planos fixos.
- Teste gratuito de 30 dias: Inclui até US$ 100 em valor de servidor e 1 TB de tráfego para testar sua configuração de IA sem custo algum.
- Escalabilidade instantânea: Adicione RAM ou núcleos de CPU em menos de 60 segundos em um servidor em produção, sem tempo de inatividade.
- Centros de dados globais: Localizações na América do Norte, Europa, Ásia e Austrália para baixa latência onde quer que você precise.
- Cobrança por hora transparente: Pague apenas pelo que usar, sem necessidade de contratos de longo prazo.
# 2. Vultr
Vultr é um provedor de nuvem focado em desenvolvedores, fundado em 2014 e com sede nos EUA. Oferece computação em nuvem a partir de US$ 2.50 por mês e opera 32 data centers em 19 países.

A plataforma VX1, lançada recentemente em outubro de 2025, utiliza núcleos AMD EPYC dedicados com desempenho até 80% superior por dólar em comparação com os principais provedores de hiperescala.
- Planos de entrada a partir de US$ 2.50 por mês: O ponto de partida mais acessível para modelos de IA leves como TinyLlama ou Phi-3.
- Computação em nuvem VX1: Núcleos EPYC dedicados com rede de até 50 Gbps e armazenamento NVMe para inferência com uso intensivo de CPU.
- 32 locais globais: Um dos provedores de nuvem independentes com maior distribuição geográfica disponível.
- Planos NVMe de alto desempenho: A partir de US$ 6 por mês com SSDs NVMe rápidosEssencial para carregar arquivos de modelos grandes rapidamente.
- Faturamento por hora: Utilize uma GPU ou uma instância com muita RAM somente quando precisar e pague pelo uso real.
# 3. Nuvem Hetzner
A Hetzner é uma provedora alemã com centros de dados em operação desde 1997.
Seu produto em nuvem foi lançado em 2017 e se tornou popular por oferecer alguns dos preços mais baixos do setor. Uma instância com 4 vCPUs e 8 GB de RAM custa atualmente a partir de cerca de 8.49 euros por mês.

Eles seguem os rigorosos padrões de proteção de dados da UE, o que é uma grande vantagem para a empresa.ivacy-configurações de IA focadas.
- Melhor relação custo-benefício da Europa: Um CX33 com 4 vCPUs e 8 GB de RAM custa aproximadamente 6.49 euros por mês, muito abaixo de planos comparáveis em outros lugares.
- Soberania de dados da UE: Os servidores operam na Alemanha e na Finlândia sob rigorosas leis europeias de proteção de dados, sendo ideais para cargas de trabalho de IA sensíveis ao GDPR.
- Instâncias CAX baseadas em ARM: Servidores Ampere Altra com baixo consumo de energia a partir de 3.79 EUR por mês para inferência de modelos leves.
- Tráfego mensal de 20 TB incluído: Uma generosa cotação permite que seu assistente de IA lide com uso intenso sem surpresas na fatura.
- Ganhe 20 euros de crédito grátis ao se cadastrar: Suficiente para testar sua configuração completa de IA por um mês sem custo algum.
# 4. DigitalOcean
DigitalOcean é o provedor de nuvem original que prioriza a experiência do desenvolvedor. Seus Droplets são implantados em menos de 60 segundos e têm preços a partir de US$ 4 por mês.

Eles introduziram a cobrança por segundo, o que reduz o desperdício em instâncias de teste de curta duração. A DigitalOcean é conhecida pela melhor documentação para iniciantes do setor, com mais de 350 tutoriais da comunidade.
- Droplets a partir de US$ 4 por mês: Os planos de CPU compartilhada oferecem um ponto de partida sólido para pequenos modelos de IA com custo inicial mínimo.
- Droplets NVMe Premium a partir de US$ 7 por mês: Armazenamento SSD mais rápido e as gerações mais recentes de CPU para um carregamento de modelos mais ágil.
- Cobrança por segundo: A partir de janeiro de 2026, você pagará apenas pelo tempo de uso real, tornando os ciclos de desenvolvimento e teste mais baratos.
- Implantação com um clique e backups de instantâneos: Cópias de segurança semanais automáticas, a 20% do custo do Droplet, protegem seus dados de modelo e configuração.
- Ampla biblioteca de tutoriais: Mais de 350 guias sobre Nginx, Docker, firewalls e muito mais, para que os iniciantes possam configurar tudo com segurança e sem complicações.
As informações de preços estão corretas até 2026. Os preços de VPS mudam com frequência. Sempre verifique os sites oficiais dos provedores para obter as tarifas mais recentes antes de comprar.
Escolhendo o modelo de IA certo
O modelo que você escolher determinará a quantidade de RAM necessária, a velocidade de resposta e a qualidade das respostas. Não existe uma única resposta correta.
Depende do tamanho do seu VPS e do que você quer que a IA faça.
Modelos pequenos e leves (4 GB de RAM ou menos)
Esses modelos funcionam em planos VPS econômicos com 4 a 8 GB de RAM. Eles respondem rapidamente e são ótimos pontos de partida.
- TinyLlama (1.1B): Um modelo com 1.1 bilhão de parâmetros, treinado com 3 trilhões de tokens. Funciona em praticamente qualquer VPS. Ideal para perguntas e respostas simples, sumarização de texto e assistentes rápidos.
- Phi-3 Mini (3.8B): O modelo compacto da Microsoft que oferece desempenho muito superior ao seu tamanho. Excelente capacidade de raciocínio e programação com menos de 2 GB de memória.
- Gemma 2B: Modelo aberto do Google treinado com 2 trilhões de tokens. Saída limpa, inferência rápida, funciona em servidores com pouca RAM.
Modelos equilibrados (8 a 16 GB de RAM)
Essas são as máquinas de processamento mais robustas. Elas oferecem qualidade próxima à do GPT-3.5 em um VPS de gama média.
- Mistral 7B: Um dos modelos de código aberto mais populares. Apresenta desempenho superior ao Llama 2 13B em diversos benchmarks, utilizando metade da memória. Excelente para bate-papo, programação e sumarização.
- Lhama 3 8B: Modelo de última geração da Meta. Forte capacidade de seguir instruções, conversação em múltiplas etapas e geração de código. Requer cerca de 8 GB de RAM em formato quantizado de 4 bits.
Modelos avançados (16 a 32 GB de RAM)
Para equipes ou usuários avançados que precisam da melhor qualidade possível em uma configuração auto-hospedada.
- DeepSeek (7B / 67B): Modelo robusto de codificação e raciocínio. A versão 7B funciona sem problemas em um VPS de 16 GB. A variante maior requer um VPS com GPU ou 32 GB ou mais de RAM.
- Mixtral 8x7B: Um modelo de combinação de especialistas da Mistral AI. Eficiente para sua qualidade, comportando-se como um modelo de 47 bits, mas ativando apenas 12 bits de parâmetros por token. Requer cerca de 24 GB de RAM.
- Qwen 2.5 (7B / 14B / 72B): O modelo multilíngue da Alibaba oferece excelente desempenho em inglês, chinês e outros idiomas. A versão 7B é um modelo robusto para uso diário.
Tabela de comparação de modelos de IA
Esta é a tabela comparativa! Listamos todos os modelos sob um mesmo título para que você possa ter uma ideia completa sobre eles.
| Modelo | Memória RAM necessária | Agilidade (Speed) | Qualidade | Mais Adequada Para |
| TinyLlama 1.1B | 2 GB | Muito rápido | Básico | Perguntas e respostas simples, VPS econômico |
| Phi-3 Mini 3.8B | 3 GB | pomposidade | Boa | Programação e raciocínio em VPS de pequeno porte. |
| Gema 2B | 2 GB | pomposidade | Boa | Bate-papo geral, configurações com pouca RAM |
| Mistral 7B (4º trimestre) | 5 GB | Suporte: | Muito Bom | Bate-papo, sumarização, codificação |
| Lhama 3 8B (4º trimestre) | 6 GB | Suporte: | Muito Bom | Seguindo as instruções, converse |
| Mixtral 8x7B (quantizado em Q4) | 24 GB | Mais lento | Excelente | Raciocínio complexo, empreendimento |
| DeepSeek 7B | 6 GB | Suporte: | Muito Bom | Programação, tarefas técnicas |
| Qwen 2.5 14B | 12 GB | Suporte: | Excelente | Multilíngue, pesquisa |
Melhores ferramentas de auto-hospedagem para assistentes de IA
O modelo de IA é apenas o cérebro. Você também precisa de uma ferramenta para executá-lo e uma interface web para se comunicar com ele. Aqui estão as ferramentas que nossa equipe testou e recomendou.
Ollama
O Ollama é a maneira mais fácil de executar grandes modelos de linguagem em um servidor Linux. Você o instala com um comando, baixa qualquer modelo com outro e sua IA está funcionando.
Ele oferece uma API compatível com OpenAI na porta 11434, portanto, qualquer aplicativo que se comunique com a OpenAI também pode se comunicar com o Ollama. Ele suporta Llama 3, Mistral, Gemma, DeepSeek, Qwen, Phi e mais de 100 outros modelos.
Entre as principais características do Ollama, destacam-se a facilidade de implantação, a configuração intuitiva para iniciantes e a instalação de modelos com um único comando.
Abrir WebUI
O Open WebUI oferece uma interface de navegador semelhante ao ChatGPT para seu modelo auto-hospedado.
Ele se conecta ao Ollama ou a qualquer API compatível com OpenAI e adiciona recursos como histórico de conversas, contas de usuário, funções multiusuário, upload de documentos para RAG e entrada de voz.
Ele funciona como um contêiner Docker e é implantado em minutos. Suporta acesso multiusuário e foi projetado para operar completamente offline.
IA local
LocalAI é um servidor compatível com a API OpenAI que funciona localmente. É útil quando você deseja substituir chamadas à API OpenAI em um aplicativo existente sem alterar o código.
Basta apontar a URL base da API para sua instância do LocalAI. Suporta LLMs, geração de imagens, conversão de fala em texto e conversão de texto em fala.
Interface Web de Geração de Texto
Também conhecida como oobabooga, esta ferramenta oferece as opções de configuração mais avançadas para executar modelos locais. Você obtém controle preciso sobre os parâmetros de amostragem, configurações de quantização do modelo e métodos de carregamento.
É mais adequado para desenvolvedores e pesquisadores que desejam experimentar profundamente o comportamento do modelo.
LangChain
LangChain é um framework Python para construir fluxos de trabalho de IA e pipelines de automação. Você pode conectar seu modelo auto-hospedado a bancos de dados, APIs, repositórios de documentos e ferramentas externas.
É a estrutura ideal para construir sistemas de perguntas e respostas de documentos, agentes de IA e aplicações RAG (Rapid Ability and Generation) com base no Ollama.
Configuração de VPS passo a passo
Assim que seu VPS estiver em funcionamento. Ubuntu 22.04, siga estes passos em ordem. Os passos descritos abaixo abrangem a conexão e a preparação do servidor para Ollama e Open WebUI.
Os comandos estão em negrito. Basta copiar e colar no seu terminal para executar o processo. Juntamente com os passos, também adicionamos capturas de tela para que você possa seguir os comandos exatamente como fizemos:
Passo 1: Conecte-se ao seu VPS
Use SSH para conectar-se a partir da sua máquina local >> Substitua your_server_ip pelo endereço IP real do seu VPS.
| ssh root@seu_ip_do_servidor |

Se você estiver usando uma chave SSH, adicione a opção -i apontando para o seu arquivo de chave privada.
Etapa 2: Atualizar o servidor
Sempre execute uma atualização completa do sistema antes de instalar qualquer coisa >> Isso corrige vulnerabilidades de segurança e garante que suas listas de pacotes estejam atualizadas.
| apt update && apt upgrade -y |

Etapa 3: instalar o Docker
O Docker é usado para executar o Open WebUI e outras ferramentas em contêineres isolados.
| curl -fsSL https://get.docker.com | shsystemctl enable dockerSystemctl start docker |

Etapa 4: Instale o Docker Compose
Para instalar o Docker Compose, execute os seguintes comandos.
| apt install docker-compose-plugin -yversão do docker compose |

Passo 5: Proteja seu VPS
Esta etapa não é opcional >> Um VPS não seguro será comprometido poucas horas após ser conectado >> Alterar a porta SSH (reduz ataques de varredura automatizados):
| nano / etc / ssh / sshd_config# Alterar a porta 22 para a porta 2222systemctl reiniciar sshd |
Desative o login do usuário root. No arquivo /etc/ssh/sshd_config, defina: >> PermitRootLogin não
Ativar firewall (UFW):
| ufw permitir 2222/tcpufw permitir 80/tcpufw permitir 443/tcpufw enable |
Instale o Fail2Ban para bloquear tentativas de login por força bruta:
| apt install fail2ban -ysystemctl enable fail2bansystemctl start fail2ban |
Seguindo as instruções acima, você conseguirá configurar e hospedar o assistente de IA em seu VPS. O processo é bem simples. Basta seguir os passos na ordem indicada.
Instalando o Ollama no VPS
O Ollama se encarrega do trabalho pesado de baixar, gerenciar e executar modelos de IA. Nossa equipe técnica confirmou que a instalação em uma única linha funciona perfeitamente no Ubuntu 22.04.
| curl -fsSL https://ollama.com/install.sh | eh |

Após a instalação, verifique se o Ollama está em execução:
| versão lhamastatus do systemctl ollama |
Agora, selecione seu primeiro modelo. Comece com o Llama 3 8B para um bom equilíbrio entre qualidade e RAM:
| ollama puxar llama3 |
Teste diretamente pelo terminal! Agora existem duas maneiras de fazer isso:
Opção 1) Modo interativo (recomendado para iniciantes):
| ollama corre lhama3 |
Em seguida, digite sua instrução quando o >>> aparecer.
Opção 2) Resposta em uma linha com prompt embutido:
| ollama run llama3 “Olá, quem é você?” |
Você pode executar o Llama 3 no modo interativo digitando `olama run llama3` e inserindo seu comando, ou passar um comando rápido de uma linha diretamente, como mostrado acima.
| ollama run llama3 “Olá, quem é você?” |
Para listar todos os modelos que você baixou:
| lista ollama |
O Ollama se instala automaticamente como um serviço do systemd. Ele inicia na inicialização do sistema e roda em segundo plano. Você não precisa iniciá-lo manualmente após reiniciar o computador.

Para baixar modelos mais leves para um VPS econômico:
| puxada de lhama phi3ollama puxar gemma:2bollama puxa tinyllama |
Configurando uma interface web semelhante ao ChatGPT
Conversar com o Ollama pelo terminal é bom para testes, mas não é prático para uso diário. O Open WebUI oferece uma interface de bate-papo completa baseada em navegador.
Veja como instalá-lo com o Docker.
| janela de encaixe execute -d -p3000:8080\ –add-host=host.docker.internal:host-gateway \ -v open-webui:/app/backend/dados\ –nome open-webui \ –reiniciar sempre \ ghcr.io/open-webui/open-webui:main |
Abra seu navegador >> Acesse http://your_server_ip:3000 >> Ao iniciar o aplicativo pela primeira vez, crie uma conta de administrador. Em seguida, selecione o modelo do seu Ollama no menu suspenso e comece a conversar.
- A porta 3000 não deve ser aberta para a internet pública sem uma senha ou um proxy reverso na frente.
- Veja o Seção "Protegendo seu Assistente de IA" abaixo, antes de expor isso a usuários externos.
Os recursos da interface web aberta incluem histórico de conversas salvo localmente, upload de arquivos para perguntas e respostas sobre documentos, suporte para múltiplos modelos do Ollama em uma única interface, contas de usuário e suporte a múltiplos usuários, além de um design limpo e otimizado para dispositivos móveis.
Adicionando sua própria base de conhecimento (RAG)
Um modelo de IA padrão só conhece aquilo com que foi treinado. O RAG (Retrieval-Augmented Generation) permite que você conecte seus próprios documentos para que a IA possa responder a perguntas sobre seu conteúdo específico.
É assim que se constrói um chatbot interno para empresas ou um assistente de documentação.
O que é RAG?
O RAG funciona em duas etapas. Primeiro, seus documentos são divididos em partes e armazenados como vetores incorporados em um banco de dados.
Ao fazer uma pergunta, o sistema recupera os trechos mais relevantes e os fornece à IA como contexto. A IA, então, responde usando tanto seu conhecimento prévio quanto o conteúdo do seu documento.
O resultado são respostas precisas e fundamentadas, em vez de respostas alucinatórias.
Ferramentas para RAG
Essas ferramentas simplificam a construção de pipelines RAG, lidando com o processamento e incorporação de documentos. Isso permite que você se concentre na criação eficiente de aplicações de IA precisas.
- LangChain: Framework Python para encadear etapas de recuperação e geração. Funciona com Ollama e a maioria dos bancos de dados de vetores.
- Índice de Lhama: Especializado em ingestão e recuperação de documentos. Em muitos casos, é mais fácil de configurar para perguntas e respostas sobre documentos do que o LangChain.
- ChromaDB: Banco de dados vetorial leve e de código aberto que funciona localmente. Não requer nenhum serviço externo. Um bom ponto de partida para pequenas bases de conhecimento.
- Qdrant: Banco de dados vetorial de alto desempenho que roda em Docker. Melhor opção para grandes coleções de documentos.
Upload de documentos
O carregamento de documentos permite que seu sistema de IA aprenda com seus dados. Ele transforma arquivos estáticos em conhecimento pesquisável que pode ser consultado instantaneamente por meio de perguntas em linguagem natural.
- O Open WebUI possui suporte integrado para upload de documentos.
- Você pode arrastar e soltar arquivos diretamente na interface de bate-papo. Os formatos suportados incluem PDFs, arquivos Markdown, documentos do Word (.docx) e arquivos de texto simples.
- Para conteúdo de sites, você pode colar o texto diretamente ou usar o carregador web do LangChain para extrair e indexar páginas automaticamente.
Casos de uso de exemplo
O RAG desbloqueia soluções práticas entre equipes, transformando informações dispersas em um assistente unificado e pesquisável que reduz o tempo de busca e aumenta a precisão na tomada de decisões.
- Chatbot interno da empresa: Faça o upload de seus Procedimentos Operacionais Padrão (POPs), políticas de RH e documentação do produto. Permita que sua equipe faça perguntas em linguagem simples.
- Assistente de documentação: Faça o upload da sua documentação técnica e permita que os desenvolvedores façam perguntas sem precisar vasculhar páginas e páginas manualmente.
- Assistente de pesquisa: Faça upload de documentos, relatórios e anotações. Peça à IA para encontrar conexões, resumir as descobertas e responder a perguntas específicas.
Protegendo seu assistente de IA
Executar uma IA auto-hospedada em um VPS público sem segurança é como deixar a porta da frente aberta. Esta seção aborda as medidas de segurança que nossa equipe implementa antes da entrada em produção.
Habilitar HTTPS
Instale o Nginx como um proxy reverso para que sua interface de IA seja acessível via HTTPS em vez de um endereço IP e porta brutos.
| apt install nginx certbot python3-certbot-nginx -y |
Crie uma configuração do Nginx para o seu domain:
| Servidor { nome_do_servidor seudomain.com; Localização / proxy_pass http://localhost:3000; proxy_set_header Host $ host; proxy_set_header X-Real-IP $ remote_addr; }} |
Obtenha um certificado SSL gratuito com o Let's Encrypt:
| certbot –nginx -d seudomain.com |
O Certbot renovará automaticamente seu certificado e atualizará a configuração do Nginx automaticamente.
Autenticação
A interface web aberta inclui contas de usuário integradas e proteção por senha.
Habilite essa opção nas configurações de administrador. Para equipes, você pode configurar o login OAuth com o Google ou o GitHub, ou configurar funções multiusuário para que diferentes pessoas tenham diferentes níveis de acesso.
Para uma configuração privada de usuário único, a autenticação HTTP básica adicionada no nível do Nginx é uma camada robusta de proteção.
Melhores práticas de segurança para VPS
Manter seu VPS seguro deve se tornar um hábito diário. Juntas, essas práticas criam um ambiente mais seguro e confiável para executar cargas de trabalho de IA.
- Backups automáticos: Habilite os snapshots semanais no painel de controle do seu provedor de VPS. Tanto a DigitalOcean quanto a Vultr oferecem esse recurso por uma pequena taxa mensal.
- Monitoramento: Instale o htop ou configure uma instância gratuita do Uptime para monitorar a integridade do seu servidor e receber alertas quando algo der errado.
- Limitação de taxa: Adicione limitação de taxa à sua configuração do Nginx para evitar tentativas de login por força bruta na sua interface de IA.
- Isolamento de recursos: Execute o Open WebUI e o Ollama em contêineres Docker separados para que uma falha em um não afete o outro.
Otimizando o desempenho
Colocar um modelo em funcionamento é o primeiro passo. Fazê-lo funcionar de forma rápida e eficiente exige um pouco mais de trabalho. Eis o que realmente faz a diferença.
Utilizar modelos quantizados
A quantização comprime um modelo reduzindo a precisão de seus números, por exemplo, de números de ponto flutuante de 16 bits para números inteiros de 4 bits. A O modelo 7B (Q4) em precisão total precisa de cerca de 8 GB de RAM.
O mesmo modelo em quantização de 4 bits (Q4) precisa de cerca de 5 GB. Você perde um pouco na qualidade da saída, mas ganha uma redução drástica no uso de RAM e uma melhoria significativa na velocidade.
O Ollama baixa modelos quantizados por padrão.
Aceleração da GPU
Se o seu VPS tiver uma GPU NVIDIA, o Ollama a utilizará automaticamente para inferência. A inferência por GPU é de 5 a 20 vezes mais rápida do que a inferência apenas por CPU para o mesmo modelo.
Para configurar o suporte à GPU:
| instalação automática de drivers do Ubuntunvidia-smi # Instale o NVIDIA Container Toolkitcurl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg –dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpgcurl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.listsudo apt update && sudo apt install -y nvidia-container-toolkitsudo nvidia-ctk runtime configure –runtime=dockersudo systemctl reiniciar a janela de encaixe ollama corre lhama3 |
Para usar efetivamente a GPU (especialmente ao executar o Open WebUI via Docker), você também precisa instalar o NVIDIA Container Toolkit entre nvidia-smi e ollama run llama3.
Ferramentas de monitoramento de recursos
Fique de olho no seu servidor! É como ter uma sala de controle com luzes piscantes e mostradores que indicam exatamente o que está acontecendo:
- topo: Uso de CPU e RAM em tempo real. Execute o htop em qualquer sessão de terminal.
- nvtop: Monitor de uso da GPU. Execute “apt install nvtop -y” e depois “nvtop” para monitorar a utilização da GPU durante a inferência.
- Prometeu e Grafana: Para um painel de monitoramento completo com dados históricos, alertas e gráficos. Oferece uma visão profissional da saúde do servidor.
Executando modelos de IA de forma eficiente em servidores VPS de pequeno porte.
Nem todos podem pagar por um VPS com 16 GB de RAM de imediato. Veja como aproveitar ao máximo um servidor menor.
Melhores modelos para computadores com pouca RAM (menos de 8 GB)
Modelos leves como o Llama 3 8B funcionam sem problemas com menos de 8 GB de RAM, utilizando técnicas de quantização de forma eficiente.
- Phi-3 Mini: Melhor relação qualidade/RAM para um VPS pequeno. Cerca de 2.3 GB em formato quantizado.
- TinyLlama: Apenas 638 MB. Funciona em qualquer VPS com 2 GB de RAM ou mais. Qualidade limitada, mas rápido.
- Gemma 2B: Aproximadamente 1.5 GB. Um assistente geral sólido para tarefas básicas.
Configuração da memória swap
A troca (swap) permite que seu servidor use espaço em disco como RAM extra quando a RAM física se esgota. É mais lenta que a RAM real, mas evita travamentos quando um modelo excede ligeiramente a memória disponível.
| fallocate -l 8G /arquivo de trocachmod 600 / swapfilemkswap / swapfileswapon / swapfileecho '/swapfile none swap sw 0 0' | tee -a /etc/fstab |
A memória swap é uma rede de segurança, não uma ferramenta de desempenho. Se o seu modelo depende muito da memória swap, a inferência será extremamente lenta. Use a memória swap para evitar travamentos, mas invista em mais RAM para obter velocidade real.
Tweaks desempenho
Ajustar as threads e reduzir o tamanho do contexto ajuda a conservar a RAM, acelerar as respostas e manter um desempenho estável no VPS.
- Otimização de threads da CPU: O Ollama detecta e utiliza automaticamente todos os núcleos de CPU disponíveis. Se as respostas estiverem lentas, reduza o tamanho do contexto do modelo.
- Ajuste do tamanho do contexto: Defina OLLAMA_NUM_CTX=2048 para configurações leves em vez do valor padrão de 4096 para usar menos RAM e responder mais rapidamente.
- Quantização do modelo: Sempre utilize modelos quantizados Q4 ou Q5 em configurações de VPS. Evite modelos de precisão total (FP16), a menos que você tenha um VPS com GPU e 24 GB ou mais de VRAM.
Funcionalidades Avançadas
A adição de sistemas de voz e multiagentes transforma sua IA em um assistente poderoso, capaz de interação e execução de tarefas complexas.
Integração do Voice Assistant
Você pode adicionar recursos de conversão de fala em texto e de texto em fala para tornar seu assistente de IA totalmente capaz de usar comandos de voz.
- Whisper STT: Modelo de reconhecimento de fala de código aberto da OpenAI. Executa localmente e transcreve áudio com precisão em vários idiomas. A interface web aberta oferece suporte nativo ao Whisper.
- Piper TTS: Um mecanismo de conversão de texto em fala rápido e local. Produz vozes com som natural sem enviar áudio para serviços externos.
Automação AI
Conecte sua IA auto-hospedada a fluxos de trabalho de automação para que ela possa executar ações, e não apenas responder a perguntas.
- Zapier: Conecte seu endpoint da API do Ollama a milhares de aplicativos por meio da ação HTTP do Zapier. Acione resumos, rascunhos e classificações de IA dentro de fluxos de trabalho existentes.
- Fluxos de trabalho n8n: Alternativa ao Zapier com hospedagem própria. Crie fluxos de automação de IA complexos que permanecem em sua própria infraestrutura. Combina bem com o Ollama para automação totalmente privada.
Sistemas Multiagentes
Para tarefas mais complexas, vários agentes de IA podem trabalhar juntos, onde um planeja, outro pesquisa e outro redige.
- AutoGen (Microsoft): Framework para construção de conversas multiagentes. Funciona com modelos Ollama locais como backend.
- CrewAI: Framework Python para orquestrar uma equipe de agentes de IA com funções e tarefas definidas. Integra-se com LangChain e Ollama.
Acesso API
O Ollama expõe uma API compatível com OpenAI em http://seu_ip_do_servidor:11434. Qualquer ferramenta ou script que utilize o SDK Python da OpenAI pode se comunicar com seu modelo auto-hospedado alterando apenas uma linha:
De openai import OpenAI
Em seguida, execute este comando.
| cliente = OpenAI( base_url=”http://your_server_ip:11434/v1″, api_key=”ollama”) resposta = cliente.chat.completions.create( modelo=”llama3″, mensagens=[{“função”: “usuário”, “conteúdo”: “Olá!”}])imprimir(resposta.escolhas[0].mensagem.conteúdo) |
Problemas comuns e soluções
A maioria dos problemas se resume a recursos limitados, contêineres mal configurados ou portas bloqueadas, e podem ser resolvidos com verificações rápidas e ajustes simples.
Modelos falham
Se o Ollama travar durante a execução ou não conseguir carregar um modelo, a causa mais comum é a falta de memória RAM. Verifique a memória disponível com o comando “free -h”.
Se você estiver no limite, configure a memória swap ou mude para um modelo quantizado menor. Evite executar vários modelos grandes ao mesmo tempo.
Respostas lentas
Geralmente, uma saída lenta significa que o modelo é muito grande para sua CPU ou RAM. Primeiro, tente usar um modelo quantizado em Q4.
Se isso não resolver o problema, tente um modelo menor, como o Phi-3 Mini, em vez do Mistral 7B. Para uma solução definitiva, atualize para um VPS com mais RAM ou adicione uma placa de vídeo.
Problemas com o Docker
Se a interface web Open parar de responder, verifique o status e os registros do contêiner:
| docker ps -adocker logs open-webui --tail 50docker restart open-webui |
Problemas de acesso ao porto
Se você não conseguir acessar a porta 3000 pelo seu navegador, verifique as regras do seu firewall:
| status ufwufw permitir 3000/tcp |
Verifique também se o firewall em nuvem do seu provedor de VPS, no painel de controle, não está bloqueando a porta no nível da rede. DigitalOcean, Vultr e Hetzner possuem um firewall em nuvem separado que fica acima do UFW.
Discriminação de custos
O custo mensal depende da potência desejada para sua configuração de IA, variando de implementações leves em CPUs a sistemas de GPU de última geração capazes de lidar com modelos complexos.
| Tipo de configuração | Custo Mensal (USD) | O que você ganha |
| Iniciante (Modelos pequenos) | $ 5 para US $ 10 | 4 vCPUs, 8 GB de RAM, TinyLlama ou Phi-3, somente CPU |
| Gama média (modelos 7B) | $ 15 para US $ 40 | 8 vCPUs, 16 GB de RAM, Mistral 7B ou Llama 3 8B, somente CPU |
| Desempenho (modelos 13B+) | $ 50 para US $ 100 | 8+ vCPUs, 32 GB de RAM, Mixtral ou DeepSeek, CPU |
| VPS com GPU (qualquer modelo) | $ 80 a $ 300 + | NVIDIA A100/L40S, inferência rápida, possibilidade de mais de 70 bilhões de modelos. |
Custos de hospedagem própria versus API da OpenAI
Com um uso típico de 100 mil tokens por dia, o GPT-4o da OpenAI custa aproximadamente US$ 150 por mês.

A VPS da Hetzner Com 16 GB de RAM, executar o Llama 3 8B custa entre 16 e 21 euros por mês e suporta um número ilimitado de tokens.

O ponto de equilíbrio para uso moderado geralmente ocorre entre 2 e 3 meses. Depois disso, a hospedagem própria gera economia mensal, sem limites de taxa e com total privacidade de dados.ivacy.
Uma equipe que utiliza 5 milhões de tokens por dia pagaria US$ 700 ou mais por mês com a API da OpenAI. A mesma carga de trabalho em um VPS de 32 GB hospedado localmente custa de US$ 40 a US$ 80 por mês.
Economia anual: Mais de US$ 7,000.
Melhores casos de uso para IA auto-hospedada
A IA autohospedada funciona bem onde privacy e a personalização são de suma importância. Isso possibilita um fluxo de trabalho automático e seguro, acesso a conhecimento interno, assistência na codificação e experimentação.
- IA para empresas privadas: Mantenha dados comerciais sensíveis e processos internos completamente fora de servidores de IA de terceiros.
- Copiloto de programação: Execute o DeepSeek Coder ou o Llama 3 como uma alternativa privada ao GitHub Copilot. Conecte-o ao VS Code através da extensão Continue.
- Suporte ao cliente com IA: Você pode criar um chatbot de suporte de primeiro nível treinado com a documentação do seu produto usando o RAG. Mantenha todas as consultas de clientes em sua própria infraestrutura.
- Assistente de pesquisa: Você pode até mesmo fazer upload de documentos e anotações. Faça perguntas complexas e obtenha respostas baseadas em seus próprios documentos.
- Bot de conhecimento interno da empresa: Substitua wikis internas por um assistente de IA que lê seus arquivos do Notion, Confluence ou Markdown e responde em linguagem simples.
- Projetos para laboratório doméstico: Você pode experimentar modelos e criar fluxos de trabalho automatizados sem pagar taxas por token.
Alternativas à hospedagem própria de VPS
Um VPS não é a única maneira de hospedar seus próprios servidores. Aqui estão as principais alternativas e quando elas fazem mais sentido. Vamos ser simples e diretos.
- Hospedagem de PC local: Execute o Ollama diretamente no seu laptop ou computador. Funciona bem para uso pessoal. Não é adequado para acesso em equipe ou disponibilidade 24 horas por dia, 7 dias por semana.
- Hospedagem NAS: Dispositivos Synology e QNAP com 16 GB ou mais de RAM podem executar modelos pequenos. Silenciosos, com baixo consumo de energia e sempre ligados. Limitados pelo desempenho da CPU do NAS.
- Clusters Kubernetes: Para equipes que executam vários serviços de IA em grande escala. Configuração mais complexa, mas permite escalonamento automático e melhor gerenciamento de recursos em vários nós.
- Plataformas de IA sem servidor: Serviços como Cloudflare Workers AI ou Replicate permitem executar modelos de código aberto via API sem precisar gerenciar um servidor. A configuração é mais fácil, mas você perde o controle total dos dados e paga novamente por token.
FAQ: Como hospedar seu próprio assistente de IA em um VPS
Posso executar IA em um VPS de 10 dólares?
Sim, mas com algumas limitações. Um VPS de US$ 10 oferece 4 vCPUs e 8 GB de RAM. Você pode executar o Phi-3 Mini (3.8B) ou o TinyLlama tranquilamente nele. O Mistral 7B é possível com quantização de 4 bits e memória swap, mas as respostas serão lentas.
Qual modelo de IA é o melhor para iniciantes?
O Llama 3 8B é o melhor modelo de IA para iniciantes, caso seu VPS tenha 16 GB de RAM, ou o Phi-3 Mini, se tiver 8 GB de RAM. Evite migrar para modelos maiores, como o Mixtral 8x7B, até ter certeza de que seu servidor suporta os menores sem problemas.
Preciso de um VPS com GPU?
Não! A inferência somente com CPU, usando modelos quantizados, é perfeitamente adequada para uso pessoal ou em pequenas equipes. As respostas levam de 2 a 10 segundos por mensagem, dependendo do tamanho do modelo e das especificações do VPS. Um VPS com GPU (aproximadamente US$ 80 por mês) não é necessário para começar.
A IA autohospedada é segura?
Se configurado corretamente, sim! Seus dados nunca saem do seu servidor. Configure o HTTPS com o Let's Encrypt, use a autenticação integrada do Open WebUI, mantenha o Ollama atrás de um proxy reverso e habilite o UFW e o Fail2Ban.
Posso usar meus próprios documentos?
Sim, você pode usar seus próprios documentos. Isso se chama RAG (Retrieval-Augmented Generation). O Open WebUI possui suporte integrado para upload de documentos. Você pode enviar PDFs, arquivos Markdown e documentos do Word.
Quanta memória RAM os modelos de IA precisam?
Um modelo 7B precisa de aproximadamente 5 a 6 GB. Um modelo 13B precisa de cerca de 16 GB a 18 GB. Um modelo 70B precisa de mais de 40 GB. Sempre adicione de 2 a 3 GB de espaço extra para o sistema operacional e o próprio Ollama.
Posso criar uma alternativa ao ChatGPT?
Sim, você pode criar uma alternativa ao ChatGPT. O Ollama, juntamente com o Open WebUI, oferece uma alternativa totalmente privada e auto-hospedada, com uma interface de chat praticamente idêntica. Você terá conversas com várias interações, upload de documentos, histórico de conversas, contas de usuário e entrada de voz. Você controla o modelo e o servidor.
Veredito final: Como hospedar seu próprio assistente de IA em um VPS
Hospedar seu próprio assistente de IA em um VPS não é mais um projeto para especialistas (você mesmo pode fazer isso em poucos minutos).
Com o Ollama cuidando do gerenciamento de modelos e o Open WebUI oferecendo uma interface refinada, nossa equipe técnica confirmou que um assistente de IA privado e eficiente pode ser configurado em 30 a 60 minutos em qualquer VPS Ubuntu 22.04 com 8 GB de RAM ou mais.
Comece com um VPS econômico da Hetzner ou Vultr, instale o Llama 3 8B ou o Phi-3 Mini através do Ollama, adicione o Open WebUI para a interface do navegador, proteja-o com o Let's Encrypt e você terá um assistente de IA totalmente privado que custa uma fração de qualquer API paga.
Quanto mais você esperar, mais pagará em taxas de API. A economia dura enquanto você usar o serviço.