Jak samodzielnie hostować własnego asystenta AI na serwerze VPS? Pełny poradnik
Każdego miesiąca wysyłasz tysiące zapytań do usługi AI w chmurze. Za każdym razem płacisz za czyjś serwer i rezygnujesz ze swoich danych, mając nadzieję, że to najtańsza opcja.
Istnieje jednak mądrzejszy sposób.
Możesz uruchomić własnego prywatnego asystenta AI na wirtualnym serwerze prywatnym (VPS) za jedyne 5–20 dolarów miesięcznie, bez limitów użytkowania, bez wycieków danych i z pełną kontrolą nad tym, z którego modelu AI korzystasz.
Nasz zespół techniczny poświęcił tygodnie na kompleksowe przetestowanie tej konfiguracji, a niniejszy przewodnik opisuje każdy krok w prostym języku angielskim, dzięki czemu możesz zacząć korzystać z niej już dziś.
Deweloperzy, właściciele małych firm, badacze i privacy-skupionych użytkowników, którzy chcą mieć prywatną i samodzielnie hostowany chatbot AI na serwerze VPS i nie ufają OpenAI, Anthropic ani żadnemu płatnemu API.
Czego potrzebujesz przed rozpoczęciem?
Zanim napiszesz jakiekolwiek polecenie, upewnij się, że Twój VPS spełnia odpowiednie wymagania sprzętowe.
Proszę zrozumieć, że modele sztucznej inteligencji wymagają dużej ilości pamięci.
Jeśli ładujesz Q4 (kwantyzowaną wersję 4), w takim przypadku 6 GB do 8 GB RAM jest w porządku. Jeśli jednak ładujesz model z 7-parametrowym parametrem, potrzeba około 13 GB do 14 GB RAM, zanim system operacyjny i inne usługi zużyją swoją część.
Słaba pamięć RAM oznacza częste awarie i wolne reakcje.
Nasz zespół przetestował minimalne i zalecane konfiguracje u wielu dostawców VPS. Oto co naprawdę działa.
Wymagania sprzętowe i VPS
Poniżej zamieściliśmy listę minimalnych i zalecanych wymagań sprzętowych i VPS, dzięki czemu Twój asystent AI może być hostowany samodzielnie i bez żadnych przerw prawidłowo wykonywać obciążenia.
Wynajmując serwer VPS do samodzielnego hostingu z asystentem AI, należy pamiętać o tych wymaganiach.
| Spec | Minimum (małe modele) | Zalecane (modele 7B, 13B i wyższe) |
| procesor wirtualny | 4 procesor wirtualny | 8+ wirtualnych procesorów |
| RAM | 8 GB | 16 GB do 32 GB |
| Dyski | 100 GB SSD | Dysk SSD NVMe o pojemności ponad 200 GB |
| OS | Ubuntu LTS 22.04 | Ubuntu LTS 22.04 |
| GPU | Nie wymagane | Opcjonalnie (przyspiesza wnioskowanie) |
| Przepustowość | 1 TB miesięcznie | 2 TB+ miesięcznie |
Jeśli Twój VPS ma mniej niż 8 GB pamięci RAM, nawet lekkie modele, takie jak TinyLlama, będą działać wolniej. Zawsze dopasowuj rozmiar modelu AI do dostępnej pamięci RAM. Model 7B (Q4) potrzebuje około 8 GB. Model 13B potrzebuje od 16 GB do 18 GB. Model 70B potrzebuje ponad 40 GB lub VPS z GPU.
Polecani dostawcy VPS (budżetowy VPS)
Nasz zespół badawczy porównał dziesiątki dostawców VPS. Oto cztery najlepsze serwery VPS do samodzielnego hostingu asystentów AI, które oferują najkorzystniejszą cenę i łatwość obsługi podczas korzystania z asystenta AI.
# 1. Kamatera
Kamatera zajmuje się infrastrukturą chmurową od 1995 roku. Umożliwia ona zbudowanie w pełni spersonalizowanego VPS-a poprzez wybór konkretnych rdzeni procesora, pamięci RAM, dysku SSD i lokalizacji centrum danych.

Ceny zaczynają się od 4 dolarów miesięcznie i obejmują 30-dniowy bezpłatny okres próbny z możliwością wykorzystania do 100 dolarów kredytu serwerowego. Rozwiązanie to sprawdza się w przypadku zespołów, które chcą mieć szczegółową kontrolę bez konieczności płacenia określonej ceny.
- W pełni niestandardowa konfiguracja VPS: Zamiast wybierać spośród stałych planów, możesz osobno wybrać procesor, pamięć RAM, dysk SSD i system operacyjny.
- 30 dniowy okres próbny: Obejmuje do 100 USD wartości serwera i 1 TB ruchu, aby bezpłatnie przetestować konfigurację sztucznej inteligencji.
- Natychmiastowa skalowalność: Dodaj pamięć RAM lub rdzenie procesora w mniej niż 60 sekund na aktywnym serwerze bez przestoju.
- Globalne centra danych: Lokalizacje w Ameryce Północnej, Europie, Azji i Australii zapewniające niskie opóźnienia, gdziekolwiek ich potrzebujesz.
- Przejrzyste rozliczanie godzinowe: Płać tylko za to, z czego korzystasz, nie jest wymagane podpisywanie długoterminowych umów.
# 2. Vultr
Vultr to dostawca usług w chmurze zorientowany na deweloperów, założony w 2014 roku z siedzibą główną w USA. Oferuje usługi w chmurze już od 2.50 USD miesięcznie i zarządza 32 centrami danych w 19 krajach.

Platforma VX1, wprowadzona niedawno, w październiku 2025 r., wykorzystuje dedykowane rdzenie AMD EPYC, które zapewniają nawet o 80% lepszą wydajność w przeliczeniu na dolara w porównaniu z głównymi procesorami hiperskalerskimi.
- Plany wstępu od 2.50 USD miesięcznie: Najbardziej przystępna cena bazowa dla lekkich modeli AI, takich jak TinyLlama czy Phi-3.
- VX1 Cloud Compute: Dedykowane rdzenie EPYC z łącznością sieciową do 50 Gb/s i pamięcią masową NVMe do wnioskowania intensywnie wykorzystującego procesor.
- 32 lokalizacji na całym świecie: Jeden z najbardziej rozproszonych geograficznie niezależnych dostawców usług w chmurze.
- Plany NVMe o wysokiej wydajności: Już od 6 USD miesięcznie szybkie dyski SSD NVMe, co ma kluczowe znaczenie dla szybkiego ładowania dużych plików modeli.
- Rozliczenie godzinowe: Uruchamiaj procesor graficzny lub instancję o dużej pojemności pamięci RAM tylko wtedy, gdy tego potrzebujesz, i płać za rzeczywiste wykorzystanie.
# 3. Chmura Hetznera
Hetzner to niemiecki dostawca usług przetwarzania danych, którego centra danych działają od 1997 roku.
Ich produkt chmurowy został wprowadzony na rynek w 2017 roku i zyskał popularność dzięki oferowaniu jednych z najniższych cen w branży. Cena instancji z 4 procesorami wirtualnymi i 8 GB pamięci RAM zaczyna się obecnie od około 8.49 EUR miesięcznie.

Przestrzegają rygorystycznych standardów ochrony danych UE, co jest dużym atutem dla klientów.ivacy-skoncentrowane konfiguracje AI.
- Najlepszy stosunek ceny do jakości w Europie: CX33 z 4 vCPU i 8 GB pamięci RAM kosztuje około 6.49 EUR miesięcznie, znacznie poniżej porównywalnych cen w innych ofertach.
- Suwerenność danych UE: serwery działają w Niemczech i Finlandii, podlegając surowym europejskim przepisom o ochronie danych, co jest idealnym rozwiązaniem w przypadku zadań związanych ze sztuczną inteligencją, na które nakładane są wymogi RODO.
- Instancje CAX oparte na architekturze ARM: energooszczędne serwery Ampere Altra w cenach już od 3.79 EUR miesięcznie, przeznaczone do lekkiego wnioskowania modelowego.
- Miesięczny transfer danych o wielkości 20 TB obejmuje: hojny limit, dzięki któremu Twój asystent AI poradzi sobie z intensywnym użytkowaniem bez nieoczekiwanych rachunków.
- 20 EUR darmowego kredytu po rejestracji: wystarczająco, aby bezpłatnie przetestować pełną konfigurację sztucznej inteligencji przez miesiąc.
# 4. DigitalOcean
DigitalOcean to oryginalny dostawca usług w chmurze, który stawia na pierwszym miejscu środowisko programistyczne. Ich Droplets wdrażają się w mniej niż 60 sekund, a ceny zaczynają się od 4 dolarów miesięcznie.

Wprowadzili rozliczenie sekundowe, co zmniejsza marnotrawstwo na krótkotrwałych instancjach testowych. DigitalOcean jest znany z najlepszej w branży dokumentacji dla początkujących, z ponad 350 samouczkami społecznościowymi.
- Kropelki od 4$ miesięcznie: Plany współdzielonego procesora zapewniają solidny punkt wyjścia dla małych modeli sztucznej inteligencji przy minimalnych kosztach początkowych.
- Premium NVMe Droplets od 7 USD miesięcznie: Szybszy dysk SSD i najnowsze generacje procesorów zapewniają szybsze ładowanie modeli.
- Rozliczanie sekundowe: od stycznia 2026 r. płacisz tylko za rzeczywisty czas użytkowania, dzięki czemu cykle rozwoju i testowania stają się tańsze.
- Wdrażanie i tworzenie kopii zapasowych za pomocą jednego kliknięcia: Automatyczne cotygodniowe kopie zapasowe za 20% kosztów Droplet chronią Twój model i dane konfiguracyjne.
- Ogromna biblioteka samouczków: Ponad 350 przewodników obejmujących Nginx, Docker, zapory sieciowe i inne, dzięki którym początkujący mogą przeprowadzić bezpieczną konfigurację bez obaw.
Informacje o cenach są aktualne na rok 2026. Ceny serwerów VPS często się zmieniają. Przed zakupem zawsze sprawdź aktualne ceny na oficjalnych stronach dostawców.
Wybór odpowiedniego modelu AI
Wybrany model decyduje o tym, ile pamięci RAM potrzebujesz, jak szybko otrzymujesz odpowiedzi i jak dobre są one w rzeczywistości. Nie ma jednej, dobrej odpowiedzi.
Zależy to od rozmiaru Twojego VPS i tego, co chcesz, aby sztuczna inteligencja zrobiła.
Małe, lekkie modele (4 GB pamięci RAM lub mniej)
Te modele działają na budżetowych planach VPS z pamięcią RAM od 4 do 8 GB. Reagują szybko i stanowią doskonałą bazę wypadową.
- TinyLlama (1.1B): Model o 1.1 miliarda parametrów, wytrenowany na 3 bilionach tokenów. Działa na niemal każdym serwerze VPS. Idealny do prostych sesji pytań i odpowiedzi, podsumowań tekstowych i szybkich asystentów.
- Phi-3 Mini (3.8B): Kompaktowy model Microsoftu, który oferuje znacznie więcej niż jego rozmiar. Dobre możliwości logiczne i programistyczne, a pamięć RAM poniżej 2 GB.
- Gemma 2B: Otwarty model Google'a wytrenowany na 2 bilionach tokenów. Czyste dane wyjściowe, szybkie wnioskowanie, działa na serwerach z małą ilością pamięci RAM.
Modele zbalansowane (8 do 16 GB RAM)
To prawdziwe konie robocze. Oferują jakość zbliżoną do GPT-3.5 na VPS-ach średniej klasy.
- Mistral 7B: Jeden z najpopularniejszych modeli open source. W wielu testach wydajnościowych osiąga lepsze wyniki niż Llama 2 13B, zużywając przy tym o połowę mniej pamięci. Doskonały do czatów, kodowania i podsumowań.
- Lama 3 8B: Najnowsza generacja modelu Meta. Silne śledzenie instrukcji, konwersacja wieloobrotowa i generowanie kodu. Wymaga około 8 GB pamięci RAM w 4-bitowej formie kwantowej.
Zaawansowane modele (16 do 32 GB RAM)
Dla zespołów i zaawansowanych użytkowników, którzy oczekują najwyższej możliwej jakości od samodzielnie hostowanej konfiguracji.
- Głębokie wyszukiwanie (7B / 67B): Mocny model kodowania i wnioskowania. Wersja 7B działa komfortowo na serwerze VPS z 16 GB. Większy wariant wymaga VPS z kartą graficzną lub 32+ GB pamięci RAM.
- Mieszany 8x7B: Model typu mix-of-experts od Mistral AI. Wydajny jak na swoją jakość, zachowuje się jak model 47B, ale aktywuje tylko 12B parametrów na token. Wymaga około 24 GB pamięci RAM.
- Qwen 2.5 (7B / 14B / 72B): Wielojęzyczny model Alibaby z silną pozycją w języku angielskim, chińskim i innych. Wersja 7B to solidny model do codziennego użytku.
Tabela porównawcza modeli AI
Oto tabela porównawcza! Zebraliśmy wszystkie modele pod jednym nagłówkiem, abyś mógł/mogła uzyskać o nich właściwe pojęcie.
| Model | Potrzebna pamięć RAM | Prędkość | Jakość | Najlepsze dla: |
| TinyLama 1.1B | 2 GB | Bardzo szybki | Basic | Proste pytania i odpowiedzi, budżetowy VPS |
| Phi-3 Mini 3.8B | 3 GB | pompatyczność | Dobry | Kodowanie, rozumowanie na małych serwerach VPS |
| Gemmy 2B | 2 GB | pompatyczność | Dobry | Ogólny czat, konfiguracja z małą ilością pamięci RAM |
| Mistral 7B (Q4) | 5 GB | Średni | bardzo dobry | Czat, podsumowanie, kodowanie |
| Lama 3 8B (Q4) | 6 GB | Średni | bardzo dobry | Postępując zgodnie z instrukcją, czatuj |
| Mixtral 8x7B (Q4 kwantyzowane) | 24 GB | Wolniej | Doskonały | Złożone rozumowanie, przedsiębiorstwo |
| DeepSeek 7B | 6 GB | Średni | bardzo dobry | Kodowanie, zadania techniczne |
| Qwen 2.5 14B | 12 GB | Średni | Doskonały | Wielojęzyczny, badania |
Najlepsze narzędzia do samodzielnego hostingu dla asystentów AI
Model sztucznej inteligencji to po prostu mózg. Potrzebujesz również narzędzia do jego uruchomienia i interfejsu internetowego, aby się z nim komunikować. Oto narzędzia przetestowane i polecane przez nasz zespół.
Ollama
Ollama to najprostszy sposób na uruchomienie dużych modeli językowych na serwerze Linux. Instalujesz go jednym poleceniem, pobierasz dowolny model innym, a Twoja sztuczna inteligencja działa.
Obsługuje API zgodne z OpenAI na porcie 11434, więc każda aplikacja komunikująca się z OpenAI może również komunikować się z Ollamą. Obsługuje Llama 3, Mistral, Gemma, DeepSeek, Qwen, Phi i ponad 100 innych modeli.
Do najważniejszych cech Ollama należą: łatwe wdrożenie, przyjazna dla początkujących konfiguracja i instalacja w modelu opartym na jednym poleceniu.
Otwórz interfejs WWW
Open WebUI udostępnia interfejs przeglądarki podobny do ChatGPT dla Twojego samodzielnie hostowanego modelu.
Łączy się z Ollamą lub dowolnym interfejsem API zgodnym z OpenAI i dodaje funkcje, takie jak historia konwersacji, konta użytkowników, role wielu użytkowników, przesyłanie dokumentów do RAG i wprowadzanie głosu.
Działa jako kontener Docker i wdraża się w ciągu kilku minut. Obsługuje dostęp wielu użytkowników i jest zaprojektowany do działania całkowicie offline.
Lokalna AI
LocalAI to serwer zgodny z API OpenAI, który działa lokalnie. Jest przydatny, gdy chcesz zastąpić wywołania API OpenAI w istniejącej aplikacji bez konieczności modyfikowania kodu.
Wystarczy wskazać adres URL API bazowego na swojej instancji LocalAI. Obsługuje LLM, generowanie obrazów, zamianę mowy na tekst i tekstu na mowę.
Generowanie tekstu WebUI
To narzędzie, znane również jako oobabooga, oferuje najbardziej zaawansowane opcje konfiguracji do uruchamiania modeli lokalnych. Otrzymujesz szczegółową kontrolę nad parametrami próbkowania, ustawieniami kwantyzacji modelu i metodami ładowania.
Lepiej nadaje się dla programistów i badaczy, którzy chcą dogłębnie eksperymentować z zachowaniem modelu.
LangChain
LangChain to framework Pythona do tworzenia przepływów pracy AI i potoków automatyzacji. Możesz połączyć swój samodzielnie hostowany model z bazami danych, interfejsami API, magazynami dokumentów i narzędziami zewnętrznymi.
Jest to platforma do tworzenia systemów pytań i odpowiedzi dotyczących dokumentów, agentów AI i aplikacji RAG na bazie Ollama.
Konfiguracja VPS krok po kroku
Gdy Twój VPS będzie już uruchomiony W przypadku Ubuntu 22.04 należy wykonać podane niżej kroki w podanej kolejności. Poniższe kroki obejmują podłączanie i przygotowywanie serwera dla Ollama i Open WebUI.
Polecenia zaznaczyliśmy pogrubioną czcionką. Wystarczy je skopiować i wkleić do terminala, aby uruchomić proces. Oprócz instrukcji dodaliśmy również zrzuty ekranu, dzięki którym będziesz mógł wykonać polecenia dokładnie tak, jak my to zrobiliśmy:
Krok 1: Połącz się z serwerem VPS
Użyj protokołu SSH, aby połączyć się z lokalnego komputera >> Zastąp your_server_ip rzeczywistym adresem IP swojego VPS.
| ssh root@your_server_ip |

Jeśli używasz klucza SSH, dodaj flagę -i wskazującą na plik klucza prywatnego.
Krok 2: Aktualizacja serwera
Zawsze wykonuj pełną aktualizację systemu przed zainstalowaniem czegokolwiek >> To łata luki w zabezpieczeniach i zapewnia aktualność list pakietów.
| apt update && apt upgrade -y |

Krok 3: Zainstaluj Docker
Docker służy do uruchamiania Open WebUI i innych narzędzi w odizolowanych kontenerach.
| curl -fsSL https://get.docker.com | shsystemctl włącz dockersystemctl start docker |

Krok 4: Zainstaluj Docker Compose
Aby zainstalować Docker Compose, uruchom następujące polecenia.
| apt install docker-compose-plugin -ywersja docker compose |

Krok 5: Zabezpiecz swój VPS
Ten krok nie jest opcjonalny >> Niezabezpieczony serwer VPS zostanie naruszony w ciągu kilku godzin od momentu podłączenia do sieci >> Zmień port SSH (zmniejsza liczbę ataków ze skanowania automatycznego):
| nano / etc / ssh / sshd_config# Zmień port 22 na port 2222systemctl restart sshd |
Wyłącz logowanie roota. W pliku /etc/ssh/sshd_config ustaw: >> PermitRootLogin no
Włącz zaporę sieciową (UFW):
| ufw zezwala na 2222/tcpufw zezwala na 80/tcpufw zezwala na 443/tcpufw włącz |
Zainstaluj Fail2Ban, aby zablokować próby siłowego logowania:
| apt install fail2ban -ysystemctl włącz fail2bansystemctl start fail2ban |
Jeśli zastosujesz się do powyższych poleceń, będziesz mógł skonfigurować i samodzielnie hostować asystenta AI na swoim VPS. Proces jest naprawdę prosty. Wystarczy wykonać podane kroki w odpowiedniej kolejności.
Instalacja Ollama na VPS
Ollama zajmuje się trudną pracą związaną z pobieraniem, zarządzaniem i uruchamianiem modeli AI. Nasz zespół techniczny potwierdził, że instalacja jednowierszowa działa poprawnie w systemie Ubuntu 22.04.
| curl -fsSL https://ollama.com/install.sh | cii |

Po instalacji sprawdź, czy Ollama działa:
| ollama – wersjasystemctl status ollama |
Teraz wybierz swój pierwszy model. Zacznij od Llama 3 8B, aby uzyskać dobry stosunek jakości do pamięci RAM:
| ollama pull llama3 |
Przetestuj to bezpośrednio z terminala! Teraz możesz to zrobić na dwa sposoby:
Opcja 1) Tryb interaktywny (zalecany dla początkujących):
| ollama biegnij llama3 |
Następnie wpisz to, co chcesz powiedzieć, gdy pojawi się znak >>>.
Opcja 2) Jednowierszowy komunikat z wbudowanym monitem:
| ollama run llama3 „Cześć, kim jesteś?” |
Możesz uruchomić Llamę 3 w trybie interaktywnym, wpisując ollama run llama3 i wprowadzając swój monit lub po prostu wpisując jedną linijkę tekstu, jak pokazano powyżej
| ollama run llama3 „Cześć, kim jesteś?” |
Aby wyświetlić listę wszystkich pobranych modeli:
| lista ollamów |
Ollama instaluje się automatycznie jako usługa systemd. Uruchamia się podczas rozruchu i działa w tle. Nie ma potrzeby ręcznego uruchamiania po ponownym uruchomieniu.

Aby wybrać lżejsze modele dla budżetowego VPS:
| ollama pull phi3ollama pull gemma:2bollama pull tinyllama |
Konfigurowanie interfejsu internetowego podobnego do ChatGPT
Rozmowa z Ollamą przez terminal jest wygodna do testowania, ale niepraktyczna w codziennym użytkowaniu. Open WebUI oferuje pełny interfejs czatu oparty na przeglądarce.
Oto jak zainstalować go za pomocą Dockera.
| uruchomienie okna dokowanego -d \ -p 3000:8080 \ –add-host=host.docker.internal:host-gateway \ -v open-webui:/app/backend/data \ –name open-webui \ –zawsze uruchamiaj ponownie \ ghcr.io/open-webui/open-webui:main |
Otwórz przeglądarkę >> Przejdź do http://your_server_ip:3000 >> Przy pierwszym uruchomieniu utwórz konto administratora. Następnie wybierz model Ollama z listy rozwijanej i rozpocznij czat.
- Port 3000 nie powinien być otwierany dla publicznego Internetu bez hasła lub odwrotnego serwera proxy.
- Zobacz Zabezpieczanie sekcji asystenta AI poniżej przed udostępnieniem ich zewnętrznym użytkownikom.
Funkcje Open WebUI obejmują lokalnie zapisaną historię konwersacji, przesyłanie plików w celu zadawania pytań i odpowiedzi dotyczących dokumentów, obsługę wielu modeli Ollama w jednym interfejsie, konta użytkowników i obsługę wielu użytkowników oraz przejrzysty, przyjazny dla urządzeń mobilnych design.
Dodawanie własnej bazy wiedzy (RAG)
Standardowy model sztucznej inteligencji (AI) zna tylko to, na czym został wytrenowany. RAG (Retrieval-Augmented Generation) pozwala na łączenie własnych dokumentów, dzięki czemu AI może odpowiadać na pytania dotyczące konkretnych treści.
W ten sposób zbudujesz wewnętrznego firmowego chatbota lub asystenta dokumentacji.
Co to jest RAG?
RAG działa w dwóch krokach. Najpierw dokumenty są dzielone na fragmenty i zapisywane jako osadzenia wektorowe w bazie danych.
Gdy zadajesz pytanie, system pobiera najbardziej istotne fragmenty i przekazuje je sztucznej inteligencji jako kontekst. Następnie sztuczna inteligencja odpowiada, wykorzystując zarówno swoją wiedzę szkoleniową, jak i treść dokumentu.
Rezultatem są trafne i uzasadnione odpowiedzi, a nie halucynacje.
Narzędzia dla RAG
Narzędzia te upraszczają tworzenie procesów RAG, obsługując przetwarzanie dokumentów i osadzanie. Dzięki temu możesz skupić się na efektywnym tworzeniu precyzyjnych aplikacji AI.
- LangChain: Framework Pythona do łączenia kroków pobierania i generowania. Działa z Ollamą i większością wektorowych baz danych.
- Indeks lamy: Specjalizuje się w pobieraniu i wyszukiwaniu dokumentów. W wielu przypadkach konfiguracja funkcji pytań i odpowiedzi do dokumentów jest łatwiejsza niż w przypadku LangChain.
- ChromaDB: Lekka baza danych wektorowych typu open source, działająca lokalnie. Nie wymaga usług zewnętrznych. Dobry punkt wyjścia dla małych baz wiedzy.
- Qdrant: Wydajna baza danych wektorowa działająca w Dockerze. Lepszy wybór dla dużych zbiorów dokumentów.
Przesyłanie dokumentów
Przesyłanie dokumentów umożliwia systemowi sztucznej inteligencji uczenie się na podstawie danych. Zamienia statyczne pliki w wyszukiwalną wiedzę, którą można błyskawicznie przeszukiwać za pomocą pytań w języku naturalnym.
- Open WebUI ma wbudowaną obsługę przesyłania dokumentów.
- Możesz przeciągać i upuszczać pliki bezpośrednio do interfejsu czatu. Obsługiwane formaty to pliki PDF, pliki Markdown, dokumenty Word (.docx) i zwykłe pliki tekstowe.
- W przypadku treści witryny internetowej możesz wkleić tekst bezpośrednio lub skorzystać z modułu ładującego strony internetowe LangChain, który automatycznie pobiera i indeksuje strony.
Przykładowe przypadki użycia
RAG udostępnia praktyczne rozwiązania dla różnych zespołów, przekształcając rozproszone informacje w ujednoliconego, przeszukiwalnego asystenta, który skraca czas wyszukiwania i zwiększa dokładność podejmowania decyzji.
- Wewnętrzny chatbot firmy: Prześlij swoje procedury operacyjne (SOP), polityki kadrowe i dokumentację produktu. Pozwól swojemu zespołowi zadawać pytania prostym językiem.
- Asystent dokumentacji: Prześlij swoją dokumentację techniczną i pozwól programistom zadawać pytania bez konieczności ręcznego przeszukiwania stron.
- Pomocnik badawczy: Prześlij dokumenty, raporty i notatki. Poproś sztuczną inteligencję o znalezienie powiązań, podsumowanie ustaleń i udzielenie odpowiedzi na konkretne pytania.
Zabezpieczanie asystenta AI
Uruchomienie samodzielnie hostowanej sztucznej inteligencji na publicznym serwerze VPS bez zabezpieczeń to jak pozostawienie otwartych drzwi wejściowych. W tej sekcji omówiono, co nasz zespół wdraża przed uruchomieniem.
Włącz HTTPS
Zainstaluj Nginx jako odwrotny serwer proxy, aby interfejs AI był dostępny przez HTTPS zamiast surowego adresu IP i portu.
| apt install nginx certbot python3-certbot-nginx -y |
Utwórz konfigurację Nginx dla swojego domain:
| serwer { nazwa_serwera twojadomain.z; Lokalizacja / { proxy_pass http://localhost:3000; proxy_set_header Host $ host; proxy_set_header X-Real-IP $ remote_addr; }} |
Uzyskaj bezpłatny certyfikat SSL z Let's Encrypt:
| certbot –nginx -d twójdomain.com |
Certbot automatycznie odnowi Twój certyfikat i zaktualizuje konfigurację Nginx.
Uwierzytelnianie
Open WebUI obejmuje wbudowane konta użytkowników i ochronę hasłem.
Włącz tę opcję w ustawieniach administratora. W przypadku zespołów możesz skonfigurować logowanie OAuth za pomocą Google lub GitHub albo skonfigurować role wielodostępne, aby różne osoby miały różne poziomy dostępu.
W przypadku konfiguracji prywatnej dla pojedynczego użytkownika podstawowe uwierzytelnianie HTTP dodane na poziomie Nginx stanowi solidną warstwę ochrony.
Najlepsze praktyki bezpieczeństwa VPS
Dbanie o bezpieczeństwo serwera VPS powinno stać się Twoim codziennym nawykiem. Razem te praktyki tworzą bezpieczniejszą i bardziej niezawodną konfigurację do obsługi obciążeń AI.
- Automatyczne kopie zapasowe: Włącz cotygodniowe migawki w panelu swojego dostawcy VPS. DigitalOcean i Vultr oferują tę funkcję za niewielką miesięczną opłatą.
- Monitoring: Zainstaluj htop lub skonfiguruj bezpłatną instancję Uptime, aby monitorować stan serwera i otrzymywać powiadomienia w razie awarii.
- Ograniczenie szybkości: Dodaj ograniczenie przepustowości do konfiguracji Nginx, aby zapobiec próbom siłowego logowania do interfejsu AI.
- Izolacja zasobów: Uruchom Open WebUI i Ollama w oddzielnych kontenerach Docker, aby awaria jednego nie spowodowała awarii drugiego.
Optymalizacja wydajności
Uruchomienie modelu to pierwszy krok. Szybkie i wydajne uruchomienie wymaga nieco więcej pracy. Oto, co naprawdę robi różnicę.
Użyj modeli kwantowych
Kwantowanie kompresuje model poprzez zmniejszenie precyzji jego liczb, na przykład z 16-bitowych liczb zmiennoprzecinkowych do 4-bitowych liczb całkowitych. A Model 7B (Q4) w pełnej precyzji potrzebuje około 8 GB pamięci RAM.
Ten sam model z kwantyzacją 4-bitową (Q4) potrzebuje około 5 GB. Tracisz niewielką część jakości wyjściowej, ale zyskujesz znaczący spadek wykorzystania pamięci RAM i znaczną poprawę szybkości.
Ollama domyślnie pobiera modele skwantyzowane.
Przyspieszenie GPU
Jeśli Twój VPS jest wyposażony w procesor graficzny NVIDIA, Ollama automatycznie użyje go do wnioskowania. Wnioskowanie oparte na procesorze graficznym jest od 5 do 20 razy szybsze niż wnioskowanie oparte wyłącznie na procesorze w przypadku tego samego modelu.
Aby skonfigurować obsługę GPU:
| automatyczna instalacja sterowników ubuntunvidia-smi # Zainstaluj zestaw narzędzi NVIDIA Container Toolkitcurl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg –dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpgcurl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.listsudo apt update && sudo apt install -y nvidia-container-toolkitsudo nvidia-ctk runtime configure –runtime=dockerSudo systemctl uruchom ponownie okno dokowane ollama biegnij llama3 |
Aby faktycznie wykorzystać GPU (szczególnie podczas uruchamiania Open WebUI za pośrednictwem Dockera), należy również zainstalować NVIDIA Container Toolkit pomiędzy nvidia-smi i ollama run llama3.
Narzędzia do monitorowania zasobów
Miej oko na swój serwer! To jak mieć pokój kontrolny z migającymi światłami i pokrętłami, które dokładnie pokazują, co się dzieje:
- góra: Wykorzystanie procesora i pamięci RAM w czasie rzeczywistym. Uruchom htop w dowolnej sesji terminala.
- nvtop: Monitor wykorzystania GPU. Uruchom „apt install nvtop -y”, a następnie nvtop, aby monitorować wykorzystanie GPU podczas wnioskowania.
- Prometeusz i Grafana: Prawidłowy panel monitorowania z danymi historycznymi, alertami i wykresami. Zapewnia profesjonalny wgląd w stan serwera.
Efektywne uruchamianie modeli AI na małych serwerach VPS
Nie każdy może sobie od razu pozwolić na VPS z 16 GB RAM-u. Oto jak w pełni wykorzystać potencjał mniejszego serwera.
Najlepsze modele z małą ilością pamięci RAM (poniżej 8 GB)
Lekkie modele, takie jak Llama 3 8B, działają płynnie na pamięci RAM poniżej 8 GB, wykorzystując efektywnie techniki kwantyzacji.
- Phi-3 Mini: Najlepszy stosunek jakości do pamięci RAM dla małego VPS. Około 2.3 GB w postaci skwantyzowanej.
- TinyLlama: Tylko 638 MB. Działa na każdym serwerze VPS z 2 GB RAM lub więcej. Ograniczona jakość, ale szybkość.
- Gemma 2B: Około 1.5 GB. Solidny, uniwersalny asystent do podstawowych zadań.
Konfiguracja pamięci wymiany
Funkcja Swap pozwala serwerowi wykorzystać przestrzeń dyskową jako dodatkową pamięć RAM, gdy zabraknie fizycznej pamięci RAM. Jest wolniejsza niż pamięć RAM, ale zapobiega awariom, gdy model nieznacznie przekroczy dostępną pamięć.
| fallocate -l 8G /swapfilechmod 600 /plik wymianymkswap /plik wymianyzamień /plik wymianyecho '/swapfile none swap sw 0 0' | tee -a /etc/fstab |
Swap to siatka bezpieczeństwa, a nie narzędzie zwiększające wydajność. Jeśli Twój model w dużym stopniu opiera się na swapie, wnioskowanie będzie bardzo powolne. Używaj swapu, aby zapobiegać awariom, ale kup więcej pamięci RAM, aby uzyskać rzeczywistą prędkość.
Wariacje wydajności
Dokładne dostrojenie wątków i zmniejszenie rozmiaru kontekstu pomaga oszczędzać pamięć RAM, przyspieszać reakcje i utrzymywać płynną wydajność na serwerze VPS.
- Optymalizacja wątków procesora: Ollama automatycznie wykrywa i wykorzystuje wszystkie dostępne wątki procesora. Jeśli odpowiedzi są wolne, zmniejsz rozmiar kontekstu modelu.
- Dostrajanie rozmiaru kontekstu: W przypadku lekkich konfiguracji ustaw OLLAMA_NUM_CTX=2048 zamiast domyślnej wartości 4096, aby zużywać mniej pamięci RAM i reagować szybciej.
- Kwantyzacja modelu: Zawsze używaj modeli kwantyzowanych Q4 lub Q5 w konfiguracjach VPS. Unikaj modeli o pełnej precyzji (FP16), chyba że masz VPS z GPU i 24+ GB pamięci VRAM.
Funkcje zaawansowane
Dodanie systemów głosowych i wieloagentowych przekształca Twoją sztuczną inteligencję w potężnego asystenta zdolnego do interakcji i wykonywania złożonych zadań.
Integracja Voice Assistant
Możesz dodać funkcje zamiany mowy na tekst i tekstu na mowę, aby Twój asystent AI mógł w pełni posługiwać się głosem.
- Szept STT: Model rozpoznawania mowy OpenAI o otwartym kodzie źródłowym. Działa lokalnie i precyzyjnie transkrybuje dźwięk w wielu językach. Open WebUI natywnie obsługuje Whisper.
- Piper TTS: Szybki, lokalny moduł przetwarzania tekstu na mowę. Generuje naturalnie brzmiące głosy bez wysyłania dźwięku do usług zewnętrznych.
Automatyzacja AI
Połącz samodzielnie hostowaną sztuczną inteligencję z procesami automatyzacji, aby mogła ona podejmować działania, a nie tylko odpowiadać na pytania.
- Zapier: Połącz swój punkt końcowy API Ollama z tysiącami aplikacji za pomocą akcji HTTP w Zapier. Uruchamiaj podsumowania, wersje robocze i klasyfikacje AI w ramach istniejących przepływów pracy.
- Przepływy pracy n8n: Samodzielnie hostowana alternatywa dla Zapiera. Twórz złożone procesy automatyzacji AI, które działają w ramach Twojej własnej infrastruktury. Dobrze integruje się z Ollamą, zapewniając w pełni prywatną automatyzację.
Systemy wieloagentowe
W przypadku bardziej złożonych zadań wielu agentów AI może pracować razem, przy czym jeden planuje, drugi przeprowadza badania, a trzeci zapisuje dane.
- AutoGen (Microsoft): Framework do budowania konwersacji wieloagentowych. Działa z lokalnymi modelami Ollama jako zaplecze.
- CrewAI: Framework Pythona do zarządzania zespołem agentów AI z określonymi rolami i zadaniami. Integruje się z LangChain i Ollama.
Dostęp API
Ollama udostępnia API zgodne z OpenAI pod adresem http://your_server_ip:11434. Każde narzędzie lub skrypt korzystający z pakietu OpenAI Python SDK może komunikować się z Twoim hostowanym modelem, zmieniając jeden wiersz:
Z importu OpenAI OpenAI
Następnie uruchom to,
| klient = OpenAI( base_url=”http://your_server_ip:11434/v1″, api_key=”ollama”) odpowiedź = client.chat.completions.create( model=”llama3″, messages=[{“role”: “user”, “content”: “Witaj!”}])drukuj(odpowiedź.wybory[0].wiadomość.zawartość) |
Typowe problemy i ich rozwiązania
Większość problemów wynika z ograniczonych zasobów, błędnie skonfigurowanych kontenerów lub zablokowanych portów i można je rozwiązać za pomocą szybkich kontroli i prostych korekt.
Awarie modeli
Jeśli Ollama zawiesza się w trakcie odpowiedzi lub nie wczytuje modelu, najczęstszą przyczyną jest brak pamięci RAM. Sprawdź dostępną pamięć poleceniem „free -h”.
Jeśli osiągnąłeś limit, skonfiguruj pamięć wymiany lub przełącz się na mniejszy model skwantyzowany. Unikaj uruchamiania wielu dużych modeli jednocześnie.
Powolne odpowiedzi
Wolny wynik zazwyczaj oznacza, że model jest zbyt duży dla Twojego procesora lub pamięci RAM. Najpierw przejdź na model kwantyzowany Q4.
Jeśli to nie pomoże, spróbuj mniejszego modelu, takiego jak Phi-3 Mini zamiast Mistral 7B. Aby rozwiązać problem na stałe, zmień serwer na VPS z większą ilością pamięci RAM lub dodaj kartę graficzną.
Problemy z Dockerem
Jeśli Open WebUI przestanie odpowiadać, sprawdź status kontenera i logi:
| doker ps -alogi dockera open-webui –tail 50docker restart open-webui |
Problemy z dostępem do portu
Jeśli nie możesz dotrzeć do portu 3000 za pomocą przeglądarki, sprawdź reguły zapory sieciowej:
| status ufwufw zezwala na 3000/tcp |
Sprawdź również, czy zapora sieciowa Twojego dostawcy VPS w panelu sterowania nie blokuje portu na poziomie sieci. DigitalOcean, Vultr i Hetzner mają osobną zaporę sieciową, która znajduje się nad UFW.
Zestawienie kosztów
Twoje miesięczne koszty zależą od tego, jak wydajne ma być Twoje środowisko sztucznej inteligencji. Obejmują one zarówno lekkie wdrożenia oparte na procesorach CPU, jak i zaawansowane systemy GPU, które potrafią obsługiwać duże modele.
| Typ instalacji | Miesięczny koszt (USD) | Co otrzymujesz |
| Starter (modele miniaturowe) | $ 5 do $ 10 | 4 vCPU, 8 GB RAM, TinyLlama lub Phi-3, tylko CPU |
| Średnia półka (modele 7B) | $ 15 do $ 40 | 8 vCPU, 16 GB RAM, Mistral 7B lub Llama 3 8B, tylko CPU |
| Wydajność (modele 13B+) | $ 50 do $ 100 | 8+ vCPU, 32 GB RAM, Mixtral lub DeepSeek, CPU |
| GPU VPS (dowolny model) | 80 dolarów do 300 dolarów + | NVIDIA A100/L40S, szybkie wnioskowanie, możliwe modele 70B+ |
Koszty hostingu własnego i API OpenAI
Przy typowym wykorzystaniu 100 tys. tokenów dziennie, GPT-4o firmy OpenAI kosztuje około 150 USD miesięcznie.

A Hetzner VPS z 16 GB pamięci RAM, Llama 3 8B kosztuje około 16–21 EUR miesięcznie i obsługuje nieograniczoną liczbę tokenów.

Próg rentowności dla średniego wykorzystania wynosi zazwyczaj od 2 do 3 miesięcy. Po tym okresie hosting własny pozwala zaoszczędzić pieniądze co miesiąc, bez limitów stawek i z pełnym pakietem danych.ivacy.
Zespół wykorzystujący 5 milionów tokenów dziennie zapłaciłby 700 dolarów lub więcej miesięcznie za korzystanie z API OpenAI. To samo obciążenie na samodzielnie hostowanym serwerze VPS o pojemności 32 GB kosztuje od 40 do 80 dolarów miesięcznie.
Roczne oszczędności: ponad 7,000 USD.
Najlepsze przypadki użycia samodzielnie hostowanej sztucznej inteligencji
Samodzielnie hostowana sztuczna inteligencja sprawdza się tam, gdzieivacy i personalizacja mają największe znaczenie. Umożliwia to bezpieczny, automatyczny przepływ pracy, wewnętrzny dostęp do wiedzy, pomoc w kodowaniu i eksperymentowanie.
- Prywatna sztuczna inteligencja w biznesie: Trzymaj poufne dane biznesowe i procesy wewnętrzne całkowicie poza serwerami AI stron trzecich.
- Drugi pilot kodujący: Uruchom DeepSeek Coder lub Llama 3 jako prywatną alternatywę dla GitHub Copilot. Połącz go z VS Code za pomocą rozszerzenia Continue.
- Obsługa klienta AI: Możesz zbudować bota wsparcia pierwszej linii, który będzie przeszkolony w zakresie dokumentacji Twojego produktu, korzystając z RAG. Przechowuj wszystkie zapytania klientów w ramach własnej infrastruktury.
- Pomocnik badawczy: Możesz nawet przesyłać dokumenty i notatki. Zadawaj złożone pytania i uzyskuj odpowiedzi oparte na własnych dokumentach.
- Wewnętrzny bot wiedzy przedsiębiorstwa: Zastąp wewnętrzne wiki asystentem AI, który odczytuje dane z plików Notion, Confluence lub Markdown i udziela odpowiedzi prostym językiem.
- Projekty laboratoryjne w domu: Możesz eksperymentować z modelami i tworzyć zautomatyzowane przepływy pracy bez płacenia opłat za każdy token.
Alternatywy dla samodzielnego hostingu VPS
VPS to nie jedyny sposób na samodzielny hosting. Oto główne alternatywy i wskazówki, kiedy mają one większy sens. Bądźmy prości i konkretni.
- Hosting lokalnego komputera: Uruchom Ollamę bezpośrednio na laptopie lub komputerze stacjonarnym. Działa dobrze do użytku osobistego. Nie nadaje się do pracy zespołowej ani do całodobowej dostępności.
- Hosting NAS: Urządzenia Synology i QNAP z pamięcią RAM 16+ GB mogą obsługiwać małe modele. Ciche, energooszczędne, zawsze aktywne. Ograniczone wydajnością procesora NAS.
- Klastry Kubernetes: Dla zespołów korzystających z wielu usług AI na dużą skalę. Bardziej złożona konfiguracja, ale umożliwiająca automatyczne skalowanie i lepsze zarządzanie zasobami w wielu węzłach.
- Platformy AI bezserwerowe: Usługi takie jak Cloudflare Workers AI czy Replicate umożliwiają uruchamianie modeli open source za pośrednictwem API bez konieczności zarządzania serwerem. Łatwiejsza konfiguracja, ale tracisz pełną kontrolę nad danymi i ponownie płacisz za token.
FAQ: Jak samodzielnie hostować własnego asystenta AI na serwerze VPS
Czy mogę uruchomić sztuczną inteligencję na serwerze VPS za 10 USD?
Tak, ale z niewielkimi ograniczeniami. Serwer VPS za 10 dolarów oferuje 4 wirtualne procesory (vCPU) i 8 GB pamięci RAM. Można na nim wygodnie uruchomić Phi-3 Mini (3.8 B) lub TinyLlama. Serwer Mistral 7B jest kompatybilny z 4-bitową kwantyzacją i pamięcią wymiany, ale jego reakcja będzie powolna.
Który model sztucznej inteligencji jest najlepszy dla początkujących?
Llama 3 8B to najlepszy model AI dla początkujących, jeśli Twój VPS ma 16 GB RAM, lub Phi-3 Mini, jeśli ma 8 GB RAM. Unikaj przesiadki na większe modele, takie jak Mixtral 8x7B, dopóki nie upewnisz się, że Twój serwer bez problemu obsługuje mniejsze.
Czy potrzebuję VPS z procesorem GPU?
Nie! Wnioskowanie oparte wyłącznie na procesorze i modelach kwantyzowanych jest idealne dla konfiguracji indywidualnych lub małych zespołów. Odpowiedzi na wiadomość trwają od 2 do 10 sekund, w zależności od rozmiaru modelu i specyfikacji serwera VPS. Do rozpoczęcia nie jest wymagany serwer VPS z kartą graficzną (GPU) (około 80 dolarów miesięcznie).
Czy samohostingowa sztuczna inteligencja jest bezpieczna?
Prawidłowo skonfigurowane, tak! Twoje dane nigdy nie opuszczają Twojego serwera. Skonfiguruj HTTPS z Let's Encrypt, użyj wbudowanego uwierzytelniania Open WebUI, umieść Ollamę za odwrotnym proxy i włącz UFW oraz Fail2Ban.
Czy mogę korzystać z własnych dokumentów?
Tak, możesz używać własnych dokumentów. To się nazywa RAG (Retrieval-Augmented Generation). Open WebUI ma wbudowaną obsługę przesyłania dokumentów. Możesz przesyłać pliki PDF, pliki Markdown i dokumenty Word.
Ile pamięci RAM potrzebują modele AI?
Model 7B potrzebuje około 5–6 GB. Model 13B potrzebuje około 16–18 GB. Model 70B potrzebuje ponad 40 GB. Zawsze należy dodać 2–3 GB narzutu na system operacyjny i samą Ollamę.
Czy mogę stworzyć alternatywę dla ChatGPT?
Tak, możesz stworzyć alternatywę dla ChatGPT. Ollama plus Open WebUI oferuje w pełni prywatną, samodzielnie hostowaną alternatywę z niemal identycznym interfejsem czatu. Otrzymujesz możliwość prowadzenia rozmów w trybie wieloetapowym, przesyłania dokumentów, historię rozmów, konta użytkowników i wprowadzania głosowego. Kontrolujesz model i serwer.
Ostateczny werdykt: Jak samodzielnie hostować własnego asystenta AI na serwerze VPS
Samodzielne hostowanie asystenta AI na serwerze VPS nie jest już zadaniem wymagającym specjalistycznej wiedzy (możesz to zrobić sam i to w ciągu kilku minut)
Dzięki oprogramowaniu Ollama do zarządzania modelami i dopracowanemu interfejsowi Open WebUI nasz zespół techniczny potwierdził, że skonfigurowanie wydajnego prywatnego asystenta AI zajmuje od 30 do 60 minut na dowolnym serwerze VPS z systemem Ubuntu 22.04 i 8 GB pamięci RAM lub więcej.
Zacznij od niedrogiego VPS od Hetzner lub Vultr, pobierz Llama 3 8B lub Phi-3 Mini przez Ollama, dodaj Open WebUI dla interfejsu przeglądarki, zabezpiecz za pomocą Let's Encrypt, a otrzymasz w pełni prywatnego asystenta AI, którego cena stanowi ułamek ceny jakiegokolwiek płatnego interfejsu API.
Im dłużej czekasz, tym więcej płacisz opłat za API. Oszczędności utrzymują się tak długo, jak długo korzystasz z API.