Comment héberger soi-même son assistant IA sur un VPS ? Guide complet
Chaque mois, vous envoyez des milliers de requêtes à un service d'IA dans le cloud. À chaque fois, vous payez pour le serveur d'un tiers et vous lui confiez vos données, en espérant que ce soit l'option la plus économique.
Il existe en fait une solution plus intelligente.
Vous pouvez exécuter votre propre assistant IA privé sur un serveur privé virtuel (VPS) pour aussi peu que 5 à 20 dollars par mois, sans limite d'utilisation, sans fuite de données et vous aurez un contrôle total sur le modèle d'IA que vous utilisez.
Notre équipe technique a passé des semaines à tester cette configuration de bout en bout, et ce guide vous décrit chaque étape en langage clair et simple afin que vous puissiez être opérationnel dès aujourd'hui.
Développeurs, propriétaires de petites entreprises, chercheurs et professionnelsivacy-utilisateurs ciblés qui souhaitent un environnement privé et Chatbot IA auto-hébergé sur un VPS et ils ne font confiance ni à OpenAI, ni à Anthropic, ni à aucune API payante.
De quoi avez-vous besoin avant de commencer ?
Avant de saisir la moindre commande, assurez-vous que votre VPS répond aux spécifications matérielles requises.
Veuillez comprendre que les modèles d'IA sont très gourmands en mémoire.
Si vous chargez un modèle Q4 (version quantifiée 4), 6 à 8 Go de RAM suffisent. En revanche, si vous chargez un modèle à 7 milliards de paramètres, il faut compter environ 13 à 14 Go de RAM, avant même que le système d'exploitation et les autres services n'en consomment.
Une mémoire RAM insuffisante entraîne des plantages constants et des temps de réponse lents.
Notre équipe a testé les configurations minimales et recommandées auprès de plusieurs fournisseurs de VPS. Voici ce qui fonctionne réellement.
Configuration matérielle et VPS requise
Vous trouverez ci-dessous une liste des exigences minimales et recommandées en matière de matériel et de VPS afin que votre assistant IA puisse être auto-hébergé et exécuter correctement les charges de travail sans interruption.
Veuillez tenir compte de ces exigences lors de la location d'un serveur VPS pour l'auto-hébergement d'un assistant IA.
| Spec | Minimum (petits modèles) | Recommandé (modèles 7B, 13B et supérieurs) |
| Processeur virtuel | 4 vCPU | 8+ vCPU |
| RAM | 8 GB | 16 Go à 32 Go |
| Stockage | 100 Go SSD | SSD NVMe de plus de 200 Go |
| OS | Ubuntu LTS 22.04 | Ubuntu LTS 22.04 |
| GPU | Pas nécessaire | Optionnel (accélère l'inférence) |
| Bande passante | 1 To par mois | 2 To+ par mois |
Si votre VPS dispose de moins de 8 Go de RAM, même les modèles légers comme TinyLlama seront ralentis. Veillez à toujours adapter la taille de votre modèle d'IA à la RAM disponible. Un modèle de 7 milliards d'octets (T4) nécessite environ 8 Go. Un modèle de 13 milliards d'octets nécessite entre 16 et 18 Go. Un modèle de 70 milliards d'octets nécessite plus de 40 Go ou un VPS avec GPU.
Fournisseurs VPS recommandés (VPS économiques)
Notre équipe de recherche a comparé des dizaines de fournisseurs de VPS. Voici les quatre meilleurs VPS pour l'auto-hébergement d'assistants IA : ils offrent le meilleur rapport qualité-prix et une grande facilité d'utilisation.
# 1. Kamatera
Kamatera exploite une infrastructure cloud depuis 1995. Elle vous permet de créer un VPS entièrement personnalisé en choisissant précisément le nombre de cœurs de processeur, la RAM, le SSD et l'emplacement du centre de données.

L'abonnement commence à 4 $ par mois et inclut un essai gratuit de 30 jours ainsi qu'un crédit serveur allant jusqu'à 100 $. Il convient parfaitement aux équipes qui souhaitent un contrôle précis sans engagement de prix.
- Configuration VPS entièrement personnalisée : Choisissez séparément le processeur, la mémoire vive, le disque SSD et le système d'exploitation au lieu de choisir parmi des forfaits prédéfinis.
- Essai gratuit de 30 jours: Inclut jusqu'à 100 $ de valeur serveur et 1 To de trafic pour tester gratuitement votre configuration d'IA.
- Évolutivité instantanée : Ajoutez de la RAM ou des cœurs de processeur en moins de 60 secondes sur un serveur en production sans interruption de service.
- Centres de données mondiaux : Des emplacements en Amérique du Nord, en Europe, en Asie et en Australie pour une faible latence où que vous soyez.
- Facturation horaire transparente : Payez uniquement ce que vous consommez, sans engagement à long terme.
# 2. Vultr
Vultr est un fournisseur de services cloud axé sur les développeurs, fondé en 2014 et basé aux États-Unis. Il propose des services de cloud computing à partir de 2.50 $ par mois et exploite 32 centres de données répartis dans 19 pays.

Leur plateforme VX1, lancée récemment en octobre 2025, utilise des cœurs AMD EPYC dédiés offrant des performances jusqu'à 80 % supérieures par dollar par rapport aux principaux hyperscalers.
- Formules d'entrée à partir de 2.50 $ par mois : Le point de départ le plus abordable pour les modèles d'IA légers comme TinyLlama ou Phi-3.
- VX1 Cloud Compute : Cœurs EPYC dédiés avec une connectivité réseau jusqu'à 50 Gbit/s et un stockage NVMe pour l'inférence intensive en ressources CPU.
- 32 sites dans le monde : L'un des fournisseurs de cloud indépendants les plus répartis géographiquement.
- Offres NVMe hautes performances : À partir de 6 XNUMX $ par mois avec SSD NVMe rapides, essentiel pour charger rapidement les fichiers de modèles volumineux.
- Facturation horaire : Lancez une instance avec GPU ou une mémoire vive importante uniquement lorsque vous en avez besoin et payez en fonction de votre utilisation réelle.
# 3. Nuage Hetzner
Hetzner est un fournisseur allemand qui exploite des centres de données depuis 1997.
Leur offre cloud, lancée en 2017, a rapidement gagné en popularité grâce à ses prix parmi les plus bas du marché. Une instance avec 4 vCPU et 8 Go de RAM est actuellement disponible à partir d'environ 8.49 € par mois.

Ils respectent les normes strictes de l'UE en matière de protection des données, ce qui constitue un atout majeur pour les relations publiques.ivacy-configurations d'IA axées sur.
- Meilleur rapport qualité-prix en Europe : Un CX33 avec 4 vCPU et 8 Go de RAM coûte environ 6.49 EUR par mois, bien en dessous des forfaits comparables proposés ailleurs.
- Souveraineté des données de l'UE : Les serveurs sont situés en Allemagne et en Finlande et soumis à des lois européennes strictes en matière de protection des données, ce qui est idéal pour les charges de travail d'IA sensibles au RGPD.
- Instances CAX basées sur ARM : Serveurs Ampere Altra économes en énergie à partir de 3.79 EUR par mois pour l'inférence de modèles légers.
- 20 To de trafic mensuel inclus : Une allocation généreuse permet à votre assistant IA de gérer une utilisation intensive sans factures surprises.
- 20 EUR de crédit gratuit à l'inscription : de quoi tester gratuitement votre configuration d'IA complète pendant un mois.
# 4. DigitalOcean
DigitalOcean est le fournisseur de cloud d'origine qui privilégie l'expérience développeur. Leurs Droplets se déploient en moins de 60 secondes et sont disponibles à partir de 4 $ par mois.

Ils ont instauré une facturation à la seconde, ce qui réduit le gaspillage lié aux instances de test éphémères. DigitalOcean est réputé pour sa documentation, la meilleure du secteur pour les débutants, avec plus de 350 tutoriels créés par la communauté.
- Abonnements à partir de 4 $ par mois : Les forfaits CPU partagés constituent un excellent point de départ pour les petits modèles d'IA, avec un coût initial minimal.
- Droplets NVMe Premium à partir de 7 $ par mois : Stockage SSD plus rapide et processeurs de dernière génération pour un chargement des modèles plus rapide.
- Facturation à la seconde : À compter de janvier 2026, vous ne paierez que pour le temps d'utilisation réel, ce qui rendra les cycles de développement et de test moins coûteux.
- Déploiement en un clic et sauvegardes par instantané : Des sauvegardes hebdomadaires automatiques, à 20 % du coût du Droplet, protègent vos données de modèle et de configuration.
- Bibliothèque de tutoriels très vaste : Plus de 350 guides couvrant Nginx, Docker, les pare-feu et bien plus encore, pour que les débutants puissent configurer leur environnement en toute sécurité et sans confusion.
Les tarifs indiqués sont valables en date de 2026. Les prix des VPS évoluent fréquemment. Consultez toujours le site web officiel du fournisseur pour connaître les tarifs les plus récents avant tout achat.
Choisir le bon modèle d'IA
Le modèle que vous choisissez détermine la quantité de RAM nécessaire, la rapidité des réponses et leur qualité. Il n'y a pas de réponse unique.
Cela dépend de la taille de votre VPS et de ce que vous souhaitez que l'IA fasse.
Modèles petits et légers (4 Go de RAM ou moins)
Ces modèles fonctionnent sur des forfaits VPS économiques avec 4 à 8 Go de RAM. Ils sont rapides et constituent d'excellents points de départ.
- TinyLlama (1.1B) : Modèle à 1.1 milliard de paramètres entraîné sur 3 000 milliards de jetons. Fonctionne sur la quasi-totalité des VPS. Idéal pour les questions-réponses simples, la synthèse de texte et les assistants rapides.
- Phi-3 Mini (3.8B) : Le modèle compact de Microsoft aux performances exceptionnelles. Excellentes capacités de raisonnement et de programmation avec moins de 2 Go de mémoire.
- Gemma 2B : Modèle ouvert de Google, entraîné sur 2 000 milliards de jetons. Sortie claire, inférence rapide, fonctionne sur des serveurs à faible mémoire vive.
Modèles équilibrés (8 à 16 Go de RAM)
Ce sont des serveurs robustes. Ils offrent une qualité proche de celle de GPT-3.5 sur un VPS de milieu de gamme.
- Mistral 7B : L'un des modèles open source les plus populaires. Il surpasse le Llama 2 13B sur de nombreux tests de performance tout en consommant deux fois moins de mémoire. Idéal pour la messagerie instantanée, la programmation et la synthèse vocale.
- Lama 3 8B : Modèle de dernière génération de Meta. Suivi d'instructions performant, conversations multi-tours et génération de code. Nécessite environ 8 Go de RAM quantifiée sur 4 bits.
Modèles avancés (16 à 32 Go de RAM)
Pour les équipes ou les utilisateurs avancés qui exigent la meilleure qualité possible d'une configuration auto-hébergée.
- DeepSeek (7B / 67B) : Modèle de codage et de raisonnement performant. La version 7 octets fonctionne parfaitement sur un VPS de 16 Go. La version supérieure nécessite un VPS avec GPU ou au moins 32 Go de RAM.
- Mixtral 8x7B : Modèle de type « mix of experts » de Mistral AI. Performant compte tenu de sa qualité, il se comporte comme un modèle 47B tout en n'activant que 12B paramètres par jeton. Nécessite environ 24 Go de RAM.
- Qwen 2.5 (7B / 14B / 72B) : Le modèle multilingue d'Alibaba offre d'excellentes performances en anglais, en chinois et dans d'autres langues. La version 7B est un modèle fiable pour une utilisation quotidienne.
Tableau comparatif des modèles d'IA
Voici le tableau comparatif ! Nous avons regroupé tous les modèles sous une même rubrique afin que vous puissiez vous faire une idée précise de leurs caractéristiques.
| Modèle | RAM nécessaire | Speed | Qualité | Idéal pour |
| TinyLlama 1.1B | 2 GB | Très vite | Fonction Plug & Play | Questions-réponses simples, VPS économique |
| Phi-3 Mini 3.8B | 3 GB | Rapide | Bon | Programmation et raisonnement sur un petit VPS |
| Gemme 2B | 2 GB | Rapide | Bon | Discussions générales, configurations avec peu de RAM |
| Mistral 7B (Q4) | 5 GB | Moyenne | Très bien | Discussion, résumé, codage |
| Lama 3 8B (Q4) | 6 GB | Moyenne | Très bien | Instructions ci-dessous, discussion |
| Mixtral 8x7B (quantifié Q4) | 24 GB | Ralentissez | Excellent | Raisonnement complexe, entreprise |
| DeepSeek 7B | 6 GB | Moyenne | Très bien | Codage, tâches techniques |
| Qwen2.5 14B | 12 GB | Moyenne | Excellent | Multilingue, recherche |
Meilleurs outils d'auto-hébergement pour assistants IA
Le modèle d'IA n'est que le cerveau. Il vous faut également un outil pour l'exécuter et une interface web pour communiquer avec lui. Voici les outils que notre équipe a testés et recommandés.
Ollama
Ollama est la solution la plus simple pour exécuter des modèles de langage complexes sur un serveur Linux. Son installation se fait en une seule commande, le chargement d'un modèle en une autre, et votre IA est opérationnelle.
Elle propose une API compatible avec OpenAI sur le port 11434 ; ainsi, toute application communiquant avec OpenAI peut également communiquer avec Ollama. Elle prend en charge Llama 3, Mistral, Gemma, DeepSeek, Qwen, Phi et plus de 100 autres modèles.
Les principales caractéristiques d'Ollama incluent un déploiement facile, une configuration conviviale pour les débutants et une installation en une seule commande.
Ouvrir l'interface utilisateur Web
Open WebUI vous offre une interface de navigateur similaire à ChatGPT pour votre modèle auto-hébergé.
Il se connecte à Ollama ou à toute API compatible OpenAI et ajoute des fonctionnalités telles que l'historique des conversations, les comptes utilisateurs, les rôles multi-utilisateurs, le téléchargement de documents pour RAG et la saisie vocale.
Il s'exécute sous forme de conteneur Docker et se déploie en quelques minutes. Il prend en charge l'accès multi-utilisateurs et est conçu pour fonctionner entièrement hors ligne.
IA locale
LocalAI est un serveur compatible avec l'API OpenAI qui s'exécute localement. Il est utile pour remplacer les appels à l'API OpenAI dans une application existante sans modifier le code.
Il suffit d'indiquer l'URL de base de l'API à votre instance LocalAI. Prend en charge les modèles linguistiques, la génération d'images, la transcription vocale et la synthèse vocale.
Interface Web de génération de texte
Également appelé oobabooga, cet outil offre les options de configuration les plus avancées pour l'exécution de modèles locaux. Vous bénéficiez d'un contrôle précis sur les paramètres d'échantillonnage, les paramètres de quantification du modèle et les méthodes de chargement.
Il convient mieux aux développeurs et aux chercheurs qui souhaitent expérimenter en profondeur le comportement des modèles.
LangChaîne
LangChain est un framework Python permettant de créer des flux de travail d'IA et des pipelines d'automatisation. Vous pouvez connecter votre modèle auto-hébergé à des bases de données, des API, des systèmes de stockage de documents et des outils externes.
Il s'agit du framework de référence pour la création de systèmes de questions-réponses sur les documents, d'agents d'IA et d'applications RAG basés sur Ollama.
Configuration VPS étape par étape
Une fois votre VPS opérationnel Sous Ubuntu 22.04, suivez ces étapes dans l'ordre. Les étapes décrites ci-dessous concernent la connexion et la préparation du serveur pour Ollama et Open WebUI.
Les commandes sont en gras. Il vous suffit de les copier-coller dans votre terminal pour exécuter la procédure. En plus des étapes, nous avons également ajouté des captures d'écran afin que vous puissiez suivre les commandes exactement comme nous l'avons fait :
Étape 1 : Connectez-vous à votre VPS
Utilisez SSH pour vous connecter depuis votre machine locale >> Remplacez votre_adresse_ip_serveur par l'adresse IP réelle de votre VPS.
| ssh root@votre_adresse_ip |

Si vous utilisez une clé SSH, ajoutez l'option -i pointant vers votre fichier de clé privée.
Étape 2 : Mettre à jour le serveur
Effectuez toujours une mise à jour complète du système avant d'installer quoi que ce soit >> Cela corrige les failles de sécurité et garantit que vos listes de paquets sont à jour.
| apt update && apt upgrade -y |

Étape 3: installer Docker
Docker est utilisé pour exécuter Open WebUI et d'autres outils dans des conteneurs isolés.
| curl -fsSL https://get.docker.com | shsystemctl activer dockersystemctl démarrer docker |

Étape 4 : Installer Docker Compose
Pour installer Docker Compose, veuillez exécuter les commandes suivantes.
| apt installer docker-compose-plugin -yversion de Docker Compose |

Étape 5 : Sécurisez votre VPS
Cette étape est indispensable >> Un VPS non sécurisé sera compromis en quelques heures après sa mise en ligne >> Changez le port SSH (réduit les attaques par scan automatisé) :
| nano / etc / ssh / sshd_config# Remplacer le port 22 par le port 2222systemctl restart sshd |
Désactiver la connexion root. Dans /etc/ssh/sshd_config, définissez : >> PermitRootLogin no
Activer le pare-feu (UFW) :
| ufw autorise 2222 / tcpufw autorise 80 / tcpufw autorise 443 / tcpufw activer |
Installez Fail2Ban pour bloquer les tentatives de connexion par force brute :
| apt installer fail2ban -ysystemctl activer fail2bansystemctl démarrer fail2ban |
En suivant scrupuleusement les instructions ci-dessus, vous pourrez installer et héberger vous-même l'assistant IA sur votre VPS. La procédure est très simple : il vous suffit de suivre les étapes dans l'ordre.
Installation d'Ollama sur le VPS
Ollama se charge des tâches complexes de téléchargement, de gestion et d'exécution des modèles d'IA. Notre équipe technique a confirmé que l'installation en une seule ligne fonctionne parfaitement sur Ubuntu 22.04.
| curl -fsSL https://ollama.com/install.sh | merde |

Après l'installation, vérifiez qu'Ollama est en cours d'exécution :
| ollama –versionsystemctl status ollama |
Maintenant, choisissez votre premier modèle. Commencez par le Llama 3 8B pour un bon équilibre entre qualité et quantité de RAM :
| ollama pull llama3 |
Testez-le directement depuis le terminal ! Il y a maintenant deux façons de procéder :
Option 1) Mode interactif (recommandé pour les débutants) :
| ollama cours lama3 |
Saisissez ensuite votre invite lorsque le symbole >>> apparaît.
Option 2) Une seule ligne avec invite intégrée :
| ollama run llama3 « Bonjour, qui êtes-vous ? » |
Vous pouvez exécuter Llama 3 en mode interactif en tapant ollama run llama3 et en saisissant votre invite de commande, ou en passant directement une commande rapide comme indiqué ci-dessus.
| ollama run llama3 « Bonjour, qui êtes-vous ? » |
Pour afficher la liste de tous les modèles que vous avez téléchargés :
| liste d'ollama |
Ollama s'installe automatiquement en tant que service systemd. Il démarre au démarrage du système et s'exécute en arrière-plan. Il n'est pas nécessaire de le démarrer manuellement après un redémarrage.

Pour obtenir des modèles plus légers pour un VPS économique :
| ollama tire phi3ollama tire gemma:2bollama tire tinyllama |
Mise en place d'une interface web de type ChatGPT
Discuter avec Ollama via le terminal convient pour les tests, mais n'est pas pratique au quotidien. Open WebUI offre une interface de chat complète directement dans votre navigateur.
Voici comment l'installer avec Docker.
| docker exécuter -d \ -p 3000:8080\ --add-host=host.docker.internal:host-gateway \ -v open-webui:/app/backend/data \ –nom open-webui \ –redémarrer toujours \ ghcr.io/open-webui/open-webui:main |
Ouvrez votre navigateur >> Allez sur http://your_server_ip:3000 >> Lors du premier lancement, créez un compte administrateur. Sélectionnez ensuite votre modèle Ollama dans le menu déroulant et commencez à discuter.
- Le port 3000 ne doit pas être ouvert sur Internet sans mot de passe ou sans proxy inverse en amont.
- Voir le Section Sécuriser votre assistant IA ci-dessous avant de divulguer ceci à des utilisateurs externes.
Les fonctionnalités d'Open WebUI incluent l'historique des conversations enregistré localement, le téléchargement de fichiers pour les questions-réponses sur les documents, la prise en charge de plusieurs modèles Ollama dans une seule interface, les comptes d'utilisateurs et la prise en charge multi-utilisateurs, ainsi qu'une conception épurée et adaptée aux mobiles.
Ajouter votre propre base de connaissances (RAG)
Un modèle d'IA standard ne connaît que les données sur lesquelles il a été entraîné. RAG (Génération augmentée par la recherche) vous permet de connecter vos propres documents afin que l'IA puisse répondre à des questions concernant votre contenu spécifique.
Voici comment créer un chatbot interne d'entreprise ou un assistant de documentation.
Qu’est-ce que le RAG ?
RAG fonctionne en deux étapes. Premièrement, vos documents sont divisés en segments et stockés sous forme d'embeddings vectoriels dans une base de données.
Lorsque vous posez une question, le système extrait les passages les plus pertinents et les transmet à l'IA pour contextualiser le tout. L'IA répond ensuite en utilisant à la fois ses connaissances acquises et le contenu de votre document.
Le résultat, ce sont des réponses précises et fondées, et non des réponses hallucinées.
Outils pour RAG
Ces outils simplifient la construction de pipelines RAG en gérant le traitement et l'intégration des documents. Cela vous permet de vous concentrer sur la création efficace d'applications d'IA précises.
- Chaîne Lang : Framework Python permettant d'enchaîner les étapes de récupération et de génération. Compatible avec Ollama et la plupart des bases de données vectorielles.
- LlamaIndex : Spécialisé dans l'ingestion et la récupération de documents. Plus facile à configurer que LangChain pour les questions-réponses sur les documents dans de nombreux cas.
- ChromaDB : Base de données vectorielles légère et open source, fonctionnant en local. Aucun service externe requis. Idéale pour les petites bases de connaissances.
- Qdrant : Base de données vectorielle haute performance fonctionnant sous Docker. Idéale pour les grandes collections de documents.
Téléchargement de documents
Le téléchargement de documents permet à votre système d'IA d'apprendre de vos données. Il transforme ainsi des fichiers statiques en connaissances exploitables, interrogeables instantanément grâce à des questions en langage naturel.
- Open WebUI intègre une fonction de téléchargement de documents.
- Vous pouvez glisser-déposer des fichiers directement dans l'interface de chat. Les formats pris en charge incluent les PDF, les fichiers Markdown, les documents Word (.docx) et les fichiers texte brut.
- Pour le contenu du site web, vous pouvez coller le texte directement ou utiliser le chargeur web de LangChain pour extraire et indexer automatiquement les pages.
Exemples de cas d'utilisation
RAG débloque des solutions pratiques pour les équipes en transformant les informations dispersées en un assistant unifié et consultable qui réduit le temps de recherche et améliore la précision de la prise de décision.
- Chatbot interne de l'entreprise : Téléchargez vos procédures opérationnelles standard (SOP), vos politiques RH et votre documentation produit. Permettez à votre équipe de poser des questions en langage clair.
- Assistant de documentation : Téléchargez votre documentation technique et permettez aux développeurs de poser des questions sans avoir à parcourir manuellement des pages entières.
- Assistant de recherche: Téléchargez des documents, des rapports et des notes. Demandez à l'IA de trouver des liens, de résumer les résultats et de répondre à des questions précises.
Sécuriser votre assistant IA
Exécuter une IA auto-hébergée sur un VPS public sans sécurité, c'est comme laisser sa porte d'entrée ouverte. Cette section décrit les mesures que notre équipe met en place avant la mise en production.
Activer HTTPS
Installez Nginx comme proxy inverse afin que votre interface d'IA soit accessible via HTTPS plutôt que via une adresse IP et un port bruts.
| apt install nginx certbot python3-certbot-nginx -y |
Créez une configuration Nginx pour votre domain:
| serveur { nom_serveur votredomain.com ; emplacement / proxy_pass http://localhost:3000 ; proxy_set_header Hôte $ hôte; proxy_set_header X-Real-IP $ remote_addr; }} |
Obtenez un certificat SSL gratuit avec Let's Encrypt :
| certbot –nginx -d votredomain.com |
Certbot renouvellera automatiquement votre certificat et mettra à jour la configuration Nginx automatiquement.
Authentification
Open WebUI intègre des comptes utilisateurs et une protection par mot de passe.
Activez cette option dans les paramètres d'administration. Pour les équipes, vous pouvez configurer l'authentification OAuth avec Google ou GitHub, ou définir des rôles multi-utilisateurs afin que chaque personne dispose de niveaux d'accès différents.
Pour une configuration privée mono-utilisateur, l'authentification HTTP de base ajoutée au niveau de Nginx constitue une couche de protection robuste.
Bonnes pratiques de sécurité pour les VPS
Sécuriser votre VPS devrait devenir une habitude quotidienne. Ensemble, ces pratiques permettent de créer une configuration plus sûre et plus fiable pour l'exécution de charges de travail d'IA.
- Sauvegardes automatiques: Activez les instantanés hebdomadaires sur le tableau de bord de votre fournisseur VPS. DigitalOcean et Vultr proposent tous deux ce service moyennant un petit supplément mensuel.
- Surveillance: Installez htop ou configurez une instance gratuite d'Uptime pour surveiller l'état de votre serveur et recevoir des alertes en cas de problème.
- Limitation de débit : Ajoutez une limitation de débit à votre configuration Nginx pour empêcher les tentatives de connexion par force brute sur votre interface d'IA.
- Isolation des ressources : Exécutez Open WebUI et Ollama dans des conteneurs Docker séparés afin qu'une panne dans l'un n'entraîne pas l'arrêt de l'autre.
Optimiser les performances
La première étape consiste à faire fonctionner un modèle. Le rendre rapide et efficace demande un peu plus d'efforts. Voici ce qui fait réellement la différence.
Utiliser des modèles quantifiés
La quantification compresse un modèle en réduisant la précision de ses nombres, par exemple de nombres flottants 16 bits à des entiers 4 bits. A Le modèle 7B (Q4) en pleine précision nécessite environ 8 Go de RAM.
Le même modèle en quantification 4 bits (Q4) nécessite environ 5 Go. Vous perdez légèrement en qualité d'image, mais vous gagnez énormément en termes d'utilisation de la RAM et en vitesse.
Ollama télécharge par défaut les modèles quantifiés.
Accélération GPU
Si votre VPS est équipé d'un GPU NVIDIA, Ollama l'utilisera automatiquement pour l'inférence. L'inférence GPU est 5 à 20 fois plus rapide que l'inférence CPU seule pour un même modèle.
Pour configurer la prise en charge du GPU :
| ubuntu-drivers autoinstallNvidia-smi # Installer NVIDIA Container Toolkitcurl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpgcurl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.listsudo apt update && sudo apt install -y nvidia-container-toolkitsudo nvidia-ctk runtime configure --runtime=dockersudo systemctl redémarrer le docker ollama cours lama3 |
Pour utiliser réellement le GPU (en particulier lors de l'exécution d'Open WebUI via Docker), vous devez également installer le NVIDIA Container Toolkit entre nvidia-smi et ollama run llama3.
Outils de surveillance des ressources
Surveillez votre serveur ! Imaginez une salle de contrôle avec des voyants clignotants et des cadrans qui vous indiquent précisément ce qui se passe :
- htop : Utilisation du processeur et de la RAM en temps réel. Exécutez htop dans n'importe quelle session de terminal.
- nvtop : Moniteur d'utilisation du GPU. Exécutez « apt install nvtop -y » puis nvtop pour surveiller l'utilisation du GPU pendant l'inférence.
- Prométhée et Grafana : Pour un tableau de bord de surveillance complet avec données historiques, alertes et graphiques. Offre une vue professionnelle de l'état de santé du serveur.
Exécution efficace de modèles d'IA sur des serveurs VPS de petite taille
Tout le monde n'a pas les moyens de s'offrir immédiatement un VPS avec 16 Go de RAM. Voici comment tirer le meilleur parti d'un serveur plus modeste.
Meilleurs modèles pour les appareils disposant d'une faible quantité de RAM (moins de 8 Go)
Les modèles légers comme le Llama 3 8B fonctionnent de manière fluide avec moins de 8 Go de RAM grâce à des techniques de quantification efficaces.
- Phi-3 Mini : Meilleur rapport qualité/RAM pour un petit VPS. Environ 2.3 Go en version quantifiée.
- Petit Lama : Seulement 638 Mo. Fonctionne sur n'importe quel VPS avec 2 Go de RAM ou plus. Qualité limitée, mais rapide.
- Gemma 2B : Environ 1.5 Go. Un assistant général fiable pour les tâches de base.
Configuration de la mémoire d'échange
Le swap permet à votre serveur d'utiliser l'espace disque comme mémoire vive supplémentaire lorsque la mémoire vive physique est saturée. Il est plus lent que la mémoire vive physique, mais évite les plantages lorsqu'un modèle dépasse légèrement la mémoire disponible.
| fallocate -l 8G /swapfilechmod 600 /swapfilemkswap /swapfileswapon /swapfileecho '/swapfile none swap sw 0 0' | tee -a /etc/fstab |
L'espace d'échange est un mécanisme de sécurité, pas un outil d'optimisation des performances. Si votre modèle repose fortement sur l'espace d'échange, l'inférence sera extrêmement lente. Utilisez l'espace d'échange pour éviter les plantages, mais augmentez la mémoire vive pour une vitesse optimale.
Tweaks performance
L'optimisation des threads et la réduction de la taille du contexte permettent de préserver la RAM, d'accélérer les réponses et de maintenir des performances fluides sur le VPS.
- Optimisation des threads du processeur : Ollama détecte et utilise automatiquement tous les cœurs du processeur disponibles. Si les réponses sont lentes, réduisez la taille du contexte du modèle.
- Réglage de la taille du contexte : Définissez OLLAMA_NUM_CTX=2048 pour les configurations légères au lieu de la valeur par défaut de 4096 afin d'utiliser moins de RAM et de répondre plus rapidement.
- Quantification du modèle : Utilisez toujours des modèles quantifiés Q4 ou Q5 sur les configurations VPS. Évitez les modèles en pleine précision (FP16) sauf si vous disposez d'un VPS avec GPU et au moins 24 Go de VRAM.
Fonctionnalités avancées
L'ajout de systèmes vocaux et multi-agents transforme votre IA en un assistant puissant capable d'interaction et d'exécution de tâches complexes.
Intégration de l'assistant vocal
Vous pouvez ajouter les fonctions de conversion de la parole en texte et de la synthèse vocale pour rendre votre assistant IA entièrement compatible avec la voix.
- Chuchotement STT : Modèle de reconnaissance vocale open source d'OpenAI. Fonctionne en local et transcrit l'audio avec précision dans plusieurs langues. L'interface web ouverte prend en charge Whisper nativement.
- Piper TTS : Un moteur de synthèse vocale local et rapide. Produit des voix naturelles sans envoyer l'audio à des services externes.
Automatisation de l'IA
Connectez votre IA auto-hébergée à des flux de travail d'automatisation afin qu'elle puisse agir et pas seulement répondre à des questions.
- Zapier : Connectez votre point de terminaison API Ollama à des milliers d'applications via l'action HTTP de Zapier. Déclenchez des résumés, des brouillons et des classifications IA directement dans vos flux de travail existants.
- Flux de travail n8n : Alternative auto-hébergée à Zapier. Créez des pipelines d'automatisation IA complexes qui restent sur votre propre infrastructure. Se combine parfaitement avec Ollama pour une automatisation entièrement privée.
Systèmes multi-agents
Pour les tâches plus complexes, plusieurs agents d'IA peuvent travailler ensemble : l'un planifie, l'autre effectue des recherches et le troisième rédige.
- AutoGen (Microsoft) : Framework pour la création de conversations multi-agents. Fonctionne avec des modèles Ollama locaux en tant que backend.
- CrewAI : Framework Python permettant d'orchestrer une équipe d'agents IA aux rôles et tâches définis. Intégration avec LangChain et Ollama.
Accès API
Ollama expose une API compatible avec OpenAI à l'adresse http://votre_adresse_ip_serveur:11434. Tout outil ou script utilisant le SDK Python d'OpenAI peut communiquer avec votre modèle auto-hébergé en modifiant une seule ligne :
Importez OpenAI depuis openai
Ensuite, exécutez ceci,
| client = OpenAI( base_url="http://votre_adresse_ip_serveur:11434/v1", clé_API="ollama") réponse = client.chat.completions.create( modèle="llama3", messages=[{“role”: “utilisateur”, “content”: “Bonjour !”}])imprimer(response.choices[0].message.content) |
Problèmes courants et solutions
La plupart des problèmes sont dus à des ressources limitées, à des conteneurs mal configurés ou à des ports bloqués, et peuvent être résolus par des vérifications rapides et des ajustements simples.
Crashs de modèles
Si Ollama se bloque en cours de réponse ou ne parvient pas à charger un modèle, la cause la plus fréquente est un manque de mémoire vive (RAM). Vérifiez la mémoire disponible avec la commande « free -h ».
Si vous atteignez la limite, configurez de la mémoire d'échange ou passez à un modèle quantifié plus petit. Évitez d'exécuter plusieurs modèles volumineux simultanément.
Réponses lentes
Un temps de réponse long signifie généralement que le modèle est trop volumineux pour votre processeur ou votre mémoire vive. Essayez d'abord un modèle quantifié Q4.
Si cela ne résout pas le problème, essayez un modèle plus compact comme le Phi-3 Mini à la place du Mistral 7B. Pour une solution définitive, passez à un VPS avec plus de RAM ou ajoutez une carte graphique.
Problèmes Docker
Si Open WebUI cesse de répondre, vérifiez l'état du conteneur et les journaux :
| docker ps -adocker logs open-webui –tail 50docker restart open-webui |
Problèmes d'accès aux ports
Si vous ne pouvez pas accéder au port 3000 depuis votre navigateur, vérifiez les règles de votre pare-feu :
| statut de ufwufw autorise 3000 / tcp |
Vérifiez également que le pare-feu cloud de votre fournisseur VPS, accessible depuis son panneau de contrôle, ne bloque pas le port au niveau du réseau. DigitalOcean, Vultr et Hetzner utilisent tous un pare-feu cloud distinct, situé au-dessus d'UFW.
Évaluation du coût
Vos coûts mensuels dépendent de la puissance souhaitée pour votre configuration d'IA, allant de déploiements CPU légers à des systèmes GPU haut de gamme capables de gérer de grands modèles.
| Type de configuration | Coût mensuel (USD) | Ce que vous obtenez |
| Démarreur (petits modèles) | De 5 à 10 $ | 4 vCPU, 8 Go de RAM, TinyLlama ou Phi-3, CPU uniquement |
| Milieu de gamme (modèles 7B) | De 15 à 40 $ | 8 vCPU, 16 Go de RAM, Mistral 7B ou Llama 3 8B, processeur uniquement |
| Performances (modèles 13B+) | De 50 à 100 $ | 8 vCPU ou plus, 32 Go de RAM, Mixtral ou DeepSeek, processeur |
| VPS GPU (tous modèles) | 80 $ à 300 $+ | NVIDIA A100/L40S, inférence rapide, plus de 70 milliards de modèles possibles |
Auto-hébergement vs Coûts de l'API OpenAI
Avec une utilisation typique de 100 000 jetons par jour, GPT-4o d'OpenAI coûte environ 150 dollars par mois.

A VPS Hetzner Avec 16 Go de RAM, Llama 3 8B coûte environ 16 à 21 EUR par mois et gère un nombre illimité de jetons.

Le seuil de rentabilité pour une utilisation moyenne se situe généralement entre 2 et 3 mois. Ensuite, l'auto-hébergement permet de réaliser des économies chaque mois, sans limite de débit et avec un accès complet aux données.ivacy.
Une équipe utilisant 5 millions de jetons par jour paierait 700 $ ou plus par mois avec l'API OpenAI. La même charge de travail sur un VPS auto-hébergé de 32 Go coûte entre 40 et 80 $ par mois.
Économies annuelles : Plus de 7 000 $.
Meilleurs cas d'utilisation de l'IA auto-hébergée
L'IA auto-hébergée fonctionne bien là où privacy La personnalisation est primordiale. Elle permet un flux de travail automatisé et sécurisé, l'accès aux connaissances internes, l'assistance au codage et l'expérimentation.
- IA pour entreprises privées : Évitez totalement de faire transiter les données commerciales sensibles et les processus internes par des serveurs d'IA tiers.
- Copilote de programmation : Exécutez DeepSeek Coder ou Llama 3 comme alternative privée à GitHub Copilot. Connectez-le à VS Code via l'extension Continue.
- Assistance client par IA : Vous pouvez créer un chatbot de support de premier niveau, entraîné sur la documentation de votre produit grâce à RAG. Conservez toutes les demandes clients sur votre propre infrastructure.
- Assistant de recherche: Vous pouvez même télécharger des documents et des notes. Posez des questions complexes et obtenez des réponses étayées par vos propres documents.
- Bot de connaissances internes à l'entreprise : Remplacez vos wikis internes par un assistant IA qui lit vos fichiers Notion, Confluence ou Markdown et répond en langage clair.
- Projets de laboratoire à domicile : Vous pouvez expérimenter avec des modèles et créer des flux de travail automatisés sans payer de frais par jeton.
Alternatives à l'auto-hébergement VPS
Un VPS n'est pas la seule solution pour héberger soi-même ses serveurs. Voici les principales alternatives et leurs cas d'utilisation les plus pertinents. Soyons clairs et concis.
- Hébergement de PC local : Exécutez Ollama directement sur votre ordinateur portable ou de bureau. Idéal pour un usage personnel. Ne convient pas à un accès en équipe ni à une disponibilité 24h/24 et 7j/7.
- Hébergement NAS : Les appareils Synology et QNAP dotés de plus de 16 Go de RAM peuvent faire fonctionner des modèles compacts. Silencieux, économes en énergie et toujours actifs. Limités par les performances du processeur du NAS.
- Clusters Kubernetes : Pour les équipes exécutant plusieurs services d'IA à grande échelle. Configuration plus complexe, mais permet la mise à l'échelle automatique et une meilleure gestion des ressources sur plusieurs nœuds.
- Plateformes d'IA sans serveur : Des services comme Cloudflare Workers AI ou Replicate permettent d'exécuter des modèles open source via une API sans avoir à gérer de serveur. La configuration est simplifiée, mais vous perdez le contrôle total de vos données et vous payez à nouveau par jeton.
FAQ : Comment héberger soi-même son assistant IA sur un VPS
Puis-je exécuter une IA sur un VPS à 10 $ ?
Oui, mais avec quelques limitations. Un VPS à 10 $ vous offre 4 vCPU et 8 Go de RAM. Vous pouvez y faire tourner Phi-3 Mini (3.8 octets) ou TinyLlama sans problème. Mistral 7B est possible avec une quantification 4 bits et de la mémoire swap, mais les temps de réponse seront longs.
Quel modèle d'IA est le mieux adapté aux débutants ?
Llama 3 8B est le meilleur modèle d'IA pour les débutants si votre VPS dispose de 16 Go de RAM, ou Phi-3 Mini s'il en possède 8 Go. Évitez de passer directement à des modèles plus lourds comme Mixtral 8x7B tant que vous n'avez pas vérifié que votre serveur gère correctement les plus petits.
Ai-je besoin d'un VPS avec GPU ?
Non ! L’inférence sur CPU uniquement avec des modèles quantifiés est parfaitement adaptée aux configurations personnelles ou aux petites équipes. Le temps de réponse varie de 2 à 10 secondes par message selon la taille du modèle et les spécifications du VPS. Un VPS avec GPU (environ 80 $ par mois) n’est pas nécessaire pour commencer.
L'IA auto-hébergée est-elle sécurisée ?
Correctement configuré, oui ! Vos données ne quittent jamais votre serveur. Configurez HTTPS avec Let's Encrypt, utilisez l'authentification intégrée d'Open WebUI, placez Ollama derrière un proxy inverse et activez UFW et Fail2Ban.
Puis-je utiliser mes propres documents ?
Oui, vous pouvez utiliser vos propres documents. Il s'agit de la génération augmentée par la récupération (RAG). Open WebUI intègre une fonction de téléchargement de documents. Vous pouvez télécharger des fichiers PDF, Markdown et Word.
De combien de RAM les modèles d'IA ont-ils besoin ?
Un modèle 7B nécessite environ 5 à 6 Go de RAM. Un modèle 13B nécessite environ 16 à 18 Go de RAM. Un modèle 70B nécessite plus de 40 Go de RAM. Prévoyez toujours 2 à 3 Go supplémentaires pour le système d'exploitation et Ollama.
Puis-je créer une alternative à ChatGPT ?
Oui, il est possible de créer une alternative à ChatGPT. Ollama, associé à Open WebUI, vous offre une solution entièrement privée et auto-hébergée, avec une interface de chat quasi identique. Vous bénéficiez de conversations à plusieurs tours, du partage de documents, de l'historique des conversations, de comptes utilisateurs et de la saisie vocale. Vous contrôlez à la fois le modèle et le serveur.
Verdict final : Comment héberger soi-même son assistant IA sur un VPS
Héberger soi-même son propre assistant IA sur un VPS n'est plus un projet d'expert (vous pouvez le faire vous-même et en quelques minutes seulement).
Grâce à Ollama qui gère la gestion des modèles et à Open WebUI qui offre une interface soignée, notre équipe technique a confirmé qu'un assistant IA privé performant peut être configuré en 30 à 60 minutes sur n'importe quel VPS Ubuntu 22.04 avec 8 Go de RAM ou plus.
Commencez avec un VPS économique de chez Hetzner ou Vultr, installez Llama 3 8B ou Phi-3 Mini via Ollama, ajoutez Open WebUI pour l'interface navigateur, sécurisez-le avec Let's Encrypt et vous obtenez un assistant IA entièrement privé qui coûte une fraction du prix de n'importe quelle API payante.
Plus vous attendez, plus les frais d'API vous coûteront cher. Les économies sont valables tant que le service est actif.