Unbegrenztes Hosting, unübertroffene Leistung
Beginnen Sie jetzt bei 0.01 $

Wie hoste ich meinen eigenen KI-Assistenten auf einem VPS? Vollständige Anleitung

Avatar von Mamta Goswami Mamta Goswami
20 min gelesen
Wie Sie Ihren eigenen KI-Assistenten auf einem VPS hosten

Monatlich senden Sie Tausende von Anfragen an einen Cloud-KI-Dienst. Jedes Mal bezahlen Sie für den Server eines anderen, geben Ihre Daten preis und hoffen, dass dies die günstigste Option ist. 

Es gibt tatsächlich einen intelligenteren Weg. 

Sie können Ihren eigenen privaten KI-Assistenten auf einem virtuellen privaten Server (VPS) für nur 5 bis 20 US-Dollar pro Monat betreiben, ohne Nutzungsbeschränkungen, ohne Datenlecks und Sie erhalten die volle Kontrolle darüber, welches KI-Modell Sie verwenden. 

Unser technisches Team hat wochenlang dieses Setup von Anfang bis Ende getestet, und diese Anleitung beschreibt jeden Schritt in einfacher, verständlicher Sprache, damit Sie noch heute live gehen können.

Für wen ist dieser Leitfaden gedacht?

Entwickler, Kleinunternehmer, Forscher und PR-Mitarbeiterivacy-fokussierte Nutzer, die einen privaten & selbstgehosteter KI-Chatbot auf einem VPS und sie vertrauen weder OpenAI noch Anthropic oder irgendeiner kostenpflichtigen API.

Was Sie vor dem Start benötigen?

Bevor Sie auch nur einen einzigen Befehl eingeben, vergewissern Sie sich, dass Ihr VPS die richtigen Hardware-Spezifikationen erfüllt. 

Bitte versuchen Sie zu verstehen, dass KI-Modelle speicherintensiv sind. 

Beim Laden eines Q4 (quantisierte Version 4) reichen 6 bis 8 GB RAM aus. Beim Laden eines 7B-Parametermodells werden hingegen etwa 13 bis 14 GB RAM benötigt, bevor das Betriebssystem und andere Dienste ihren Anteil belegen. 

Schwacher Arbeitsspeicher führt zu ständigen Abstürzen und langsamen Reaktionszeiten. 

Unser Team hat sowohl minimale als auch empfohlene Konfigurationen bei verschiedenen VPS-Anbietern getestet. Folgendes funktioniert tatsächlich.

Hardware- und VPS-Anforderungen

Nachfolgend finden Sie eine Liste der minimalen und empfohlenen Hardware- und VPS-Anforderungen, damit Ihr KI-Assistent selbst gehostet werden kann und ohne Unterbrechungen Arbeitslasten ordnungsgemäß ausführen kann.

Bitte beachten Sie diese Anforderungen bei der Anmietung eines VPS-Servers für das Selbsthosting eines KI-Assistenten.

SpecMinimum (Kleine Modelle)Empfohlen (Modelle 7B, 13B und höher)
vCPU4 vCPU8+ vCPU
RAM8 GB16 GB bis 32 GB
Lagerung100 GB SSD200 GB+ NVMe SSD
OSUbuntu LTS 22.04Ubuntu LTS 22.04
GPUNicht erforderlichOptional (beschleunigt die Schlussfolgerung)
Bandbreite1 TB pro Monat2 TB+ pro Monat
Hinweis

Verfügt Ihr VPS über weniger als 8 GB RAM, laufen selbst ressourcenschonende Modelle wie TinyLlama deutlich langsamer. Passen Sie die Größe Ihres KI-Modells stets an Ihren verfügbaren Arbeitsspeicher an. Ein 7B (Q4)-Modell benötigt etwa 8 GB. Ein 13B-Modell benötigt 16 bis 18 GB. Ein 70B-Modell benötigt mindestens 40 GB oder einen GPU-VPS.

Unser Forschungsteam hat Dutzende von VPS-Anbietern verglichen. Diese vier besten VPS-Anbieter eignen sich hervorragend für das Selbsthosting von KI-Assistenten und bieten das beste Preis-Leistungs-Verhältnis sowie eine hohe Benutzerfreundlichkeit.

# 1. Kamatera

Kamatera betreibt seit 1995 Cloud-Infrastruktur. Sie ermöglicht es Ihnen, einen vollständig individualisierten VPS zu erstellen, indem Sie die genauen CPU-Kerne, den Arbeitsspeicher, die SSD und den Standort des Rechenzentrums auswählen. 

Kamatera Preise und Tarife

Die Preise beginnen bei 4 US-Dollar pro Monat und beinhalten eine 30-tägige kostenlose Testphase mit bis zu 100 US-Dollar Serverguthaben. Es eignet sich ideal für Teams, die detaillierte Kontrolle ohne langfristige Preisbindung wünschen.

  • Vollständig anpassbare VPS-Konfiguration: Wählen Sie CPU, RAM, SSD und Betriebssystem separat, anstatt aus festen Paketen zu wählen.
  • 30 Tage kostenlose Testversion: Beinhaltet einen Serverwert von bis zu 100 US-Dollar und 1 TB Datenverkehr, um Ihre KI-Konfiguration kostenlos zu testen.
  • Sofortige Skalierbarkeit: Fügen Sie RAM oder CPU-Kerne in weniger als 60 Sekunden auf einem laufenden Server hinzu – ohne Ausfallzeiten.
  • Globale Rechenzentren: Standorte in Nordamerika, Europa, Asien und Australien für niedrige Latenzzeiten, wo immer Sie sie benötigen.
  • Transparente Abrechnung nach Stunden: Sie zahlen nur für das, was Sie nutzen – ohne langfristige Verträge.

# 2. Vultr

Vultr ist ein 2014 gegründeter Cloud-Anbieter mit Hauptsitz in den USA, der sich vorrangig an Entwickler richtet. Das Unternehmen bietet Cloud-Computing ab 2.50 US-Dollar pro Monat an und betreibt 32 Rechenzentrumsstandorte in 19 Ländern. 

Vultr-Pläne

Ihre kürzlich im Oktober 2025 eingeführte VX1-Plattform nutzt dedizierte AMD EPYC-Kerne und bietet eine bis zu 80 % bessere Leistung pro Dollar im Vergleich zu großen Hyperscalern.

  • Einstiegstarife ab 2.50 $ pro Monat: Der günstigste Einstiegspunkt für leichte KI-Modelle wie TinyLlama oder Phi-3.
  • VX1 Cloud Compute: Dedizierte EPYC-Kerne mit bis zu 50 Gbit/s Netzwerkgeschwindigkeit und NVMe-Speicher für rechenintensive Inferenzprozesse.
  • 32 Standorte weltweit: Einer der geografisch am weitesten verteilten unabhängigen Cloud-Anbieter auf dem Markt.
  • Hochleistungs-NVMe-Pläne: Ab 6 $ pro Monat mit schnelle NVMe-SSDs, was für das schnelle Laden großer Modelldateien unerlässlich ist.
  • Stundenabrechnung: Aktivieren Sie eine GPU- oder RAM-reiche Instanz nur dann, wenn Sie sie benötigen, und bezahlen Sie nach tatsächlicher Nutzung.

# 3. Hetzner Wolke

Hetzner ist ein deutscher Anbieter mit seit 1997 betriebenen Rechenzentren. 

Ihr Cloud-Produkt wurde 2017 eingeführt und erfreute sich aufgrund seiner branchenweit niedrigen Preise großer Beliebtheit. Eine Instanz mit 4 vCPUs und 8 GB RAM ist derzeit ab etwa 8.49 EUR pro Monat erhältlich. 

Hetzner-Pläne

Sie halten sich an strenge EU-Datenschutzstandards, was ein großer Vorteil für PR ist.ivacy-fokussierte KI-Setups.

  • Bestes Preis-Leistungs-Verhältnis in Europa: Ein CX33 mit 4 vCPUs und 8 GB RAM kostet etwa 6.49 EUR pro Monat und liegt damit weit unter vergleichbaren Angeboten anderer Anbieter.
  • EU-Datensouveränität: Die Server werden in Deutschland und Finnland unter der Einhaltung strenger europäischer Datenschutzgesetze betrieben und sind somit ideal für DSGVO-sensible KI-Workloads geeignet.
  • ARM-basierte CAX-Instanzen: Energieeffiziente Ampere Altra Server ab 3.79 EUR pro Monat für einfache Modellinferenz.
  • 20 TB monatliches Datenvolumen inklusive: Großzügiges Datenvolumen, damit Ihr KI-Assistent auch bei hoher Nutzung keine unerwarteten Kosten verursacht.
  • 20 EUR Gratis-Guthaben bei Anmeldung: ausreichend, um Ihr komplettes KI-Setup einen Monat lang kostenlos zu testen.

# 4. DigitalOcean

DigitalOcean ist der ursprüngliche Cloud-Anbieter, der die Entwicklererfahrung in den Mittelpunkt stellt. Ihre Droplets werden in weniger als 60 Sekunden bereitgestellt und sind ab 4 US-Dollar pro Monat erhältlich.

DigitalOcean-Pläne

Sie führten die sekundengenaue Abrechnung ein, wodurch der Verbrauch kurzlebiger Testinstanzen reduziert wird. DigitalOcean ist bekannt für die branchenweit beste Dokumentation für Einsteiger mit über 350 Community-Tutorials.

  • Tröpfchen ab 4 Dollar pro Monat: Shared-CPU-Pläne bieten Ihnen eine solide Ausgangsbasis für kleine KI-Modelle bei minimalen Vorabkosten.
  • Premium NVMe Droplets ab 7 US-Dollar pro Monat: Schnellerer SSD-Speicher und die neuesten CPU-Generationen für ein zügigeres Laden von Modellen.
  • Abrechnung pro Sekunde: Ab Januar 2026 zahlen Sie nur noch für die tatsächliche Nutzungsdauer, wodurch Entwicklungs- und Testzyklen günstiger werden.
  • Bereitstellung und Snapshot-Backups mit einem Klick: Automatische wöchentliche Backups zu 20 % der Droplet-Kosten schützen Ihre Modell- und Konfigurationsdaten.
  • Umfangreiche Tutorial-Bibliothek: Mehr als 350 Anleitungen zu Nginx, Docker, Firewalls und mehr, damit Anfänger eine sichere und unkomplizierte Einrichtung vornehmen können.
Disclaimer

Die Preisangaben entsprechen dem Stand von 2026. VPS-Preise ändern sich häufig. Prüfen Sie daher vor dem Kauf immer die offiziellen Webseiten der Anbieter auf die aktuellsten Preise.

Auswahl des richtigen KI-Modells

Das gewählte Modell bestimmt, wie viel Arbeitsspeicher benötigt wird, wie schnell die Antworten erfolgen und wie gut diese tatsächlich sind. Es gibt keine allgemeingültige richtige Antwort. 

Das hängt von der Größe Ihres VPS und den gewünschten Aufgaben der KI ab.

Kleine, leichte Modelle (4 GB RAM oder weniger)

Diese Modelle laufen auf günstigen VPS-Tarifen mit 4 bis 8 GB RAM. Sie reagieren schnell und eignen sich hervorragend als Einstiegsmodelle.

  • TinyLlama (1.1 Mrd.): Ein Modell mit 1.1 Milliarden Parametern, trainiert mit 3 Billionen Token. Läuft auf nahezu jedem VPS. Ideal für einfache Frage-Antwort-Systeme, Textzusammenfassungen und schnelle Assistenten.
  • Phi-3 Mini (3.8 B): Microsofts kompaktes Modell mit überraschender Leistung. Gutes logisches Denken und Programmierfähigkeiten mit weniger als 2 GB Arbeitsspeicher.
  • Gemma 2B: Googles offenes Modell wurde mit 2 Billionen Token trainiert. Saubere Ausgabe, schnelle Inferenz, funktioniert auch auf Servern mit wenig RAM.

 Ausgewogene Modelle (8 bis 16 GB RAM)

Das sind die Arbeitstiere. Sie bieten Ihnen nahezu GPT-3.5-Qualität auf einem VPS der Mittelklasse.

  • Mistral 7B: Eines der beliebtesten Open-Source-Modelle. Es schneidet in vielen Benchmarks besser ab als Llama 2 13B und benötigt dabei nur die Hälfte des Speichers. Hervorragend geeignet für Chat, Programmierung und Zusammenfassungen.
  • Lama 3 8B: Metas neueste Generation. Leistungsstarke Befehlsverarbeitung, mehrstufige Konversation und Codegenerierung. Benötigt ca. 8 GB RAM in 4-Bit-quantisierter Form.

Erweiterte Modelle (16 bis 32 GB RAM)

Für Teams oder Power-User, die die bestmögliche Qualität von einer selbstgehosteten Lösung erwarten.

  • DeepSeek (7B / 67B): Leistungsstarkes Codierungs- und Logikmodell. Die Version 7B läuft problemlos auf einem 16-GB-VPS. Die größere Variante benötigt einen GPU-VPS oder mindestens 32 GB RAM.
  • Mixtral 8x7B: Ein Mixture-of-Experts-Modell von Mistral AI. Es ist hinsichtlich seiner Qualität effizient und verhält sich wie ein 47-B-Modell, aktiviert aber nur 12 Milliarden Parameter pro Token. Es benötigt etwa 24 GB RAM.
  • Qwen 2.5 (7B / 14B / 72B): Alibabas mehrsprachiges Modell überzeugt mit starker Leistung in Englisch, Chinesisch und weiteren Sprachen. Die Version 7B ist ein zuverlässiges Alltagsgerät.

Vergleichstabelle für KI-Modelle

Hier ist die Vergleichstabelle! Wir haben alle Modelle unter einer Überschrift aufgelistet, damit Sie sich einen guten Überblick verschaffen können.

ModellRAM erforderlichSchnelligkeitQualitätAm besten geeignet für
TinyLlama 1.1B2 GBSehr schnellPlug-and-Play-BetriebEinfache Fragen und Antworten, günstiger VPS
Phi-3 Mini 3.8B3 GBSchnellGutProgrammieren, logisches Denken auf einem kleinen VPS
Juwel 2B2 GBSchnellGutAllgemeiner Chat, Systeme mit wenig RAM
Mistral 7B (Q4)5 GBMediumSehr gutChat, Zusammenfassung, Codierung
Lama 3 8B (Q4)6 GBMediumSehr gutAnweisung befolgen, Chat
Mixtral 8x7B (Q4 quantisiert)24 GBLangsamerAusgezeichnetKomplexes Denken, Unternehmen
DeepSeek 7B6 GBMediumSehr gutProgrammierung, technische Aufgaben
Qwen 2.5 14B12 GBMediumAusgezeichnetMehrsprachigkeit, Forschung

Die besten Self-Hosting-Tools für KI-Assistenten

Das KI-Modell ist nur das Gehirn. Sie benötigen außerdem ein Tool, um es auszuführen, und eine Weboberfläche zur Kommunikation. Hier sind die Tools, die unser Team getestet und empfohlen hat.

Ollama

Ollama ist die einfachste Möglichkeit, große Sprachmodelle auf einem Linux-Server auszuführen. Die Installation erfolgt mit einem Befehl, das Abrufen beliebiger Modelle mit einem weiteren, und schon läuft Ihre KI. 

Es stellt eine OpenAI-kompatible API auf Port 11434 bereit, sodass jede Anwendung, die mit OpenAI kommuniziert, auch mit Ollama kommunizieren kann. Es unterstützt Llama 3, Mistral, Gemma, DeepSeek, Qwen, Phi und über 100 weitere Modelle. 

Zu den wichtigsten Funktionen von Ollama gehören die einfache Bereitstellung, die anfängerfreundliche Einrichtung und die Installation mit nur einem Befehl.

WebUI öffnen

Open WebUI bietet Ihnen eine ChatGPT-ähnliche Browseroberfläche für Ihr selbstgehostetes Modell. 

Es verbindet sich mit Ollama oder einer beliebigen OpenAI-kompatiblen API und bietet zusätzliche Funktionen wie Gesprächsverlauf, Benutzerkonten, Mehrbenutzerrollen, Dokumenten-Uploads für RAG und Spracheingabe. 

Es läuft als Docker-Container und ist innerhalb weniger Minuten einsatzbereit. Es unterstützt den Mehrbenutzerzugriff und ist für den vollständig offlinefähigen Betrieb konzipiert.

LocalAI

LocalAI ist ein OpenAI-API-kompatibler Server, der lokal ausgeführt wird. Er ist nützlich, wenn Sie OpenAI-API-Aufrufe in einer bestehenden Anwendung ersetzen möchten, ohne Ihren Code zu ändern. 

Verweisen Sie einfach die API-Basis-URL auf Ihre LocalAI-Instanz. Unterstützt LLMs, Bildgenerierung, Spracherkennung und Sprachsynthese.

WebUI zur Textgenerierung

Dieses auch als Oobabooga bekannte Tool bietet die fortschrittlichsten Konfigurationsoptionen für die Ausführung lokaler Modelle. Sie erhalten detaillierte Kontrolle über Abtastparameter, Modellquantisierungseinstellungen und Lademethoden. 

Es eignet sich besser für Entwickler und Forscher, die intensiv mit dem Modellverhalten experimentieren möchten.

LangChain

LangChain ist ein Python-Framework zum Erstellen von KI-Workflows und Automatisierungspipelines. Sie können Ihr selbstgehostetes Modell mit Datenbanken, APIs, Dokumentenspeichern und externen Tools verbinden. 

Es ist das bevorzugte Framework für die Entwicklung von Dokumenten-Frage-Antwort-Systemen, KI-Agenten und RAG-Anwendungen auf Basis von Ollama.

Schritt-für-Schritt-Anleitung zur VPS-Einrichtung

Sobald Ihr VPS läuft Bei Ubuntu 22.04 befolgen Sie diese Schritte in der angegebenen Reihenfolge. Die folgenden Schritte beschreiben die Verbindung und Vorbereitung des Servers für Ollama und Open WebUI.

Die Befehle sind fett gedruckt. Sie können sie einfach in Ihr Terminal kopieren und einfügen, um den Vorgang auszuführen. Zusätzlich zu den einzelnen Schritten haben wir auch Screenshots hinzugefügt, damit Sie die Befehle genau so nachvollziehen können, wie wir es getan haben:

Schritt 1: Verbindung zu Ihrem VPS herstellen

Verwenden Sie SSH, um von Ihrem lokalen Rechner aus eine Verbindung herzustellen >> Ersetzen Sie your_server_ip durch die tatsächliche IP-Adresse Ihres VPS.

ssh root@your_server_ip
Verbinden Sie sich mit Ihrem VPS

Wenn Sie einen SSH-Schlüssel verwenden, fügen Sie den Parameter -i hinzu, der auf Ihre private Schlüsseldatei verweist. 

Schritt 2: Server aktualisieren

Führen Sie vor jeder Installation eine vollständige Systemaktualisierung durch. >> Dadurch werden Sicherheitslücken geschlossen und sichergestellt, dass Ihre Paketlisten aktuell sind.

apt update && apt upgrade -y
Server aktualisieren

Schritt 3: Installieren Sie Docker

Docker wird verwendet, um Open WebUI und andere Tools in isolierten Containern auszuführen.

curl -fsSL https://get.docker.com | shsystemctl aktiviert Dockersystemctl start docker
Installieren Sie Docker

Schritt 4: Docker Compose installieren

Um Docker Compose zu installieren, führen Sie bitte die folgenden Befehle aus.

apt install docker-compose-plugin -yDocker-Compile-Version
Installieren Sie Docker Compose

Schritt 5: Sichern Sie Ihren VPS

Dieser Schritt ist nicht optional >> Ein ungesicherter VPS wird innerhalb weniger Stunden nach der Inbetriebnahme kompromittiert >> Ändern Sie den SSH-Port (reduziert automatisierte Scan-Angriffe):

nano / etc / ssh / sshd_config# Port 22 in Port 2222 ändernsystemctl neustarten sshd

Root-Login deaktivieren. In /etc/ssh/sshd_config Folgendes einstellen: >> PermitRootLogin-Nr

Firewall aktivieren (UFW):

ufw erlauben 2222 / tcpufw erlauben 80 / tcpufw erlauben 443 / tcpufw aktivieren

Installieren Sie Fail2Ban, um Brute-Force-Anmeldeversuche zu blockieren:

apt install fail2ban -ysystemctl enable fail2bansystemctl start fail2ban

Wenn Sie die oben genannten Befehle genau befolgen, können Sie den KI-Assistenten auf Ihrem VPS einrichten und selbst hosten. Der Vorgang ist ganz einfach. Sie müssen lediglich die Schritte der Reihe nach befolgen.

Installation von Ollama auf dem VPS

Ollama übernimmt die aufwendigen Aufgaben des Herunterladens, Verwaltens und Ausführens von KI-Modellen. Unser technisches Team hat bestätigt, dass die Installation mit nur einer Zeile Code unter Ubuntu 22.04 einwandfrei funktioniert.

curl -fsSL https://ollama.com/install.sh | Sch
Installation von Ollama auf dem VPS

Überprüfen Sie nach der Installation, ob Ollama ausgeführt wird:

ollama –versionsystemctl status ollama

Nehmen Sie nun Ihr erstes Modell. Beginnen Sie mit dem Llama 3 8B für ein gutes Verhältnis von Qualität zu RAM:

ollama pull llama3

Testen Sie es direkt im Terminal! Dafür gibt es nun zwei Möglichkeiten:

Option 1) Interaktiver Modus (empfohlen für Anfänger):

Ollama renne Lama3

Geben Sie dann Ihre Eingabeaufforderung ein, wenn >>> erscheint.

Option 2) Einzeiler mit Inline-Aufforderung:

ollama run llama3 „Hallo, wer bist du?“

Sie können Llama 3 im interaktiven Modus starten, indem Sie „ollama run llama3“ eingeben und Ihre Eingabeaufforderung hinzufügen, oder Sie können, wie oben gezeigt, direkt eine kurze Einzeiler-Anweisung übergeben.

ollama run llama3 „Hallo, wer bist du?“

Um alle heruntergeladenen Modelle aufzulisten:

Ollama-Liste

Ollama installiert sich automatisch als systemd-Dienst. Es startet beim Systemstart und läuft im Hintergrund. Nach einem Neustart ist kein manueller Start erforderlich.

Ollama auf dem VPS

Um leichtere Modelle für einen günstigen VPS zu verwenden:

ollama pull phi3ollama pull gemma:2bollama pull tinyllama

Einrichten einer ChatGPT-ähnlichen Weboberfläche

Die Kommunikation mit Ollama über das Terminal eignet sich zwar für Testzwecke, ist aber für den täglichen Gebrauch nicht praktikabel. Open WebUI bietet Ihnen eine vollwertige, browserbasierte Chat-Oberfläche. 

Hier erfahren Sie, wie Sie es mit Docker installieren.

Docker run -d \  -p 3000:8080 \  –add-host=host.docker.internal:host-gateway \  -v open-webui:/app/backend/data \  –name open-webui \  –restart always \  ghcr.io/open-webui/open-webui:main

Öffnen Sie Ihren Browser >> Gehen Sie zu http://your_server_ip:3000 >> Erstellen Sie beim ersten Start ein Administratorkonto. Wählen Sie dann Ihr Ollama-Modell aus dem Dropdown-Menü aus und beginnen Sie mit dem Chatten.

Hinweis
  • Port 3000 sollte nicht ohne Passwort oder vorgeschalteten Reverse-Proxy für das öffentliche Internet zugänglich sein. 
  • Weitere Informationen im Abschnitt „Sicherung Ihres KI-Assistenten“ unten, bevor Sie dies externen Benutzern zugänglich machen.

Zu den Open WebUI-Funktionen gehören die lokale Speicherung des Konversationsverlaufs, das Hochladen von Dateien für Dokumentfragen und -antworten, die Unterstützung mehrerer Ollama-Modelle in einer Benutzeroberfläche, Benutzerkonten und Mehrbenutzerunterstützung sowie ein übersichtliches, mobilfreundliches Design.

Hinzufügen Ihrer eigenen Wissensdatenbank (RAG)

Ein herkömmliches KI-Modell kennt nur die Daten, mit denen es trainiert wurde. RAG (Retrieval-Augmented Generation) ermöglicht es Ihnen, Ihre eigenen Dokumente einzubinden, sodass die KI Fragen zu Ihren spezifischen Inhalten beantworten kann. 

So erstellt man einen internen Firmen-Chatbot oder einen Dokumentationsassistenten.

Was ist RAG?

RAG funktioniert in zwei Schritten. Zuerst werden Ihre Dokumente in Teile zerlegt und als Vektoreinbettungen in einer Datenbank gespeichert. 

Wenn Sie eine Frage stellen, extrahiert das System die relevantesten Informationen und stellt sie der KI als Kontext zur Verfügung. Die KI antwortet dann mithilfe ihres Trainingswissens und des Inhalts Ihres Dokuments. 

Das Ergebnis sind präzise, ​​fundierte Antworten anstelle von Halluzinationen.

Werkzeuge für RAG

Diese Tools vereinfachen den Aufbau von RAG-Pipelines durch die Übernahme der Dokumentenverarbeitung und Einbettung. Dadurch können Sie sich effizient auf die Erstellung präziser KI-Anwendungen konzentrieren.

  • LangChain: Python-Framework zur Verkettung von Abruf- und Generierungsschritten. Funktioniert mit Ollama und den meisten Vektordatenbanken.
  • LamaIndex: Spezialisiert auf die Dokumentenerfassung und -abfrage. In vielen Fällen einfacher einzurichten als LangChain für Dokumenten-Fragen und -Antworten.
  • ChromaDB: Leichtgewichtige Open-Source-Vektordatenbank, die lokal ausgeführt wird. Kein externer Dienst erforderlich. Guter Ausgangspunkt für kleine Wissensdatenbanken.
  • Qdrant: Hochleistungsfähige Vektordatenbank, die in Docker läuft. Besser geeignet für große Dokumentensammlungen.

Dokumente hochladen

Durch das Hochladen von Dokumenten kann Ihr KI-System aus Ihren Daten lernen. Es wandelt statische Dateien in durchsuchbares Wissen um, das sofort über Fragen in natürlicher Sprache abgefragt werden kann.

  • Open WebUI verfügt über eine integrierte Funktion zum Hochladen von Dokumenten. 
  • Sie können Dateien per Drag & Drop direkt in die Chat-Oberfläche ziehen. Unterstützte Formate sind unter anderem PDFs, Markdown-Dateien, Word-Dokumente (.docx) und reine Textdateien. 
  • Für Website-Inhalte können Sie Text direkt einfügen oder den Web Loader von LangChain verwenden, um Seiten automatisch zu scrapen und zu indexieren.

Beispielanwendungsfälle

RAG ermöglicht praktische Lösungen für Teams, indem es verstreute Informationen in einen einheitlichen, durchsuchbaren Assistenten umwandelt, der die Suchzeit verkürzt und die Genauigkeit der Entscheidungsfindung verbessert.

  • Interner Firmen-Chatbot: Laden Sie Ihre Standardarbeitsanweisungen, Personalrichtlinien und Produktdokumentationen hoch. Ermöglichen Sie Ihrem Team, Fragen in einfacher Sprache zu stellen.
  • Dokumentationsassistent: Laden Sie Ihre technischen Dokumente hoch und ermöglichen Sie es Entwicklern, Fragen zu stellen, ohne dass diese manuell durch die Seiten navigieren müssen.
  • Wissenschaftlicher Mitarbeiter: Laden Sie Dokumente, Berichte und Notizen hoch. Bitten Sie die KI, Zusammenhänge herzustellen, Ergebnisse zusammenzufassen und spezifische Fragen zu beantworten.

Ihren KI-Assistenten absichern

Eine selbstgehostete KI auf einem öffentlichen VPS ohne Sicherheitsvorkehrungen zu betreiben, ist, als würde man die Haustür offen lassen. Dieser Abschnitt beschreibt die Maßnahmen, die unser Team vor dem Livegang ergreift.

Aktivieren Sie HTTPS

Installieren Sie Nginx als Reverse-Proxy, damit Ihre KI-Oberfläche über HTTPS anstatt über eine einfache IP-Adresse und einen Port erreichbar ist.

apt install nginx certbot python3-certbot-nginx -y

Erstellen Sie eine Nginx-Konfiguration für Ihren domain:

server {    Servername Ihrdomain.mit;    Lage /        Proxy_Pass http://localhost:3000;        Proxy_set_header Host $host;        Proxy_set_header X-Real-IP $remote_addr;    }}

Erhalten Sie ein kostenloses SSL-Zertifikat mit Let's Encrypt:

certbot –nginx -d yourdomain.com €XNUMX

Certbot erneuert Ihr Zertifikat automatisch und aktualisiert die Nginx-Konfiguration automatisch.

Authentifizierung

Open WebUI beinhaltet integrierte Benutzerkonten und Passwortschutz. 

Aktivieren Sie diese Funktion in den Administratoreinstellungen. Für Teams können Sie die OAuth-Anmeldung mit Google oder GitHub einrichten oder Mehrbenutzerrollen konfigurieren, sodass verschiedene Personen unterschiedliche Zugriffsebenen haben. 

Bei einer privaten Einzelbenutzerumgebung stellt die auf Nginx-Ebene hinzugefügte einfache HTTP-Authentifizierung eine starke Schutzebene dar.

Bewährte Sicherheitspraktiken für VPS

Die Sicherheit Ihres VPS zu gewährleisten, sollte zu Ihrer täglichen Routine gehören. Zusammen schaffen diese Maßnahmen eine sicherere und zuverlässigere Umgebung für die Ausführung von KI-Workloads.

  • Automatische Backups: Aktivieren Sie wöchentliche Snapshots im Dashboard Ihres VPS-Anbieters. DigitalOcean und Vultr bieten diesen Service gegen eine geringe monatliche Gebühr an.
  • Monitoring: Installieren Sie htop oder richten Sie eine kostenlose Uptime-Instanz ein, um den Zustand Ihres Servers zu überwachen und Benachrichtigungen zu erhalten, wenn etwas nicht funktioniert.
  • Ratenbegrenzung: Fügen Sie Ihrer Nginx-Konfiguration eine Ratenbegrenzung hinzu, um Brute-Force-Anmeldeversuche auf Ihrer KI-Schnittstelle zu verhindern.
  • Ressourcenisolierung: Führen Sie Open WebUI und Ollama in separaten Docker-Containern aus, damit ein Absturz des einen nicht den anderen beeinträchtigt.

Leistung optimieren

Ein Modell zum Laufen zu bringen, ist der erste Schritt. Es schnell und effizient zum Laufen zu bringen, erfordert etwas mehr Aufwand. Hier erfahren Sie, was den Unterschied ausmacht.

Verwenden Sie quantisierte Modelle

Die Quantisierung komprimiert ein Modell, indem sie die Genauigkeit seiner Zahlen verringert, zum Beispiel von 16-Bit-Gleitkommazahlen auf 4-Bit-Ganzzahlen. A Das Modell 7B (Q4) benötigt in voller Präzision etwa 8 GB RAM. 

Das gleiche Modell benötigt in 4-Bit-Quantisierung (Q4) etwa 5 GB. Man verliert zwar etwas an Ausgabequalität, erzielt aber eine massive Reduzierung des RAM-Verbrauchs und eine deutliche Geschwindigkeitssteigerung. 

Ollama lädt standardmäßig quantisierte Modelle herunter.

GPU-Beschleunigung

Verfügt Ihr VPS über eine NVIDIA-GPU, nutzt Ollama diese automatisch für die Inferenz. Die GPU-Inferenz ist für dasselbe Modell 5- bis 20-mal schneller als die reine CPU-Inferenz. 

So richten Sie die GPU-Unterstützung ein:

ubuntu-drivers autoinstallnvidia-smi
# NVIDIA Container Toolkit installierencurl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg –dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpgcurl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.listsudo apt update && sudo apt install -y nvidia-container-toolkitsudo nvidia-ctk runtime configure –runtime=dockersudo systemctl Neustart Docker
Ollama renne Lama3
Bitte beachten Sie

Um die GPU tatsächlich zu nutzen (insbesondere beim Ausführen von Open WebUI über Docker), müssen Sie außerdem das NVIDIA Container Toolkit zwischen nvidia-smi und ollama run llama3 installieren.

Tools zur Ressourcenüberwachung

Behalten Sie Ihren Server im Auge! Stellen Sie sich vor, Sie hätten einen Kontrollraum mit blinkenden Lichtern und Anzeigen, die Ihnen genau sagen, was passiert:

  • htop: Echtzeit-CPU- und RAM-Auslastung. Führen Sie htop in einer beliebigen Terminal-Sitzung aus.
  • nvtop: GPU-Auslastungsüberwachung. Führen Sie „apt install nvtop -y“ und anschließend nvtop aus, um die GPU-Auslastung während der Inferenz zu überwachen.
  • Prometheus und Grafana: Für ein aussagekräftiges Monitoring-Dashboard mit historischen Daten, Warnmeldungen und Diagrammen. Bietet Ihnen einen professionellen Überblick über den Serverzustand.

Effizientes Ausführen von KI-Modellen auf kleinen VPS-Servern

Nicht jeder kann sich sofort einen VPS mit 16 GB RAM leisten. Hier erfahren Sie, wie Sie das Beste aus einem kleineren Server herausholen.

Beste Modelle für wenig RAM (unter 8 GB)

Leichtgewichtige Modelle wie das Llama 3 8B laufen dank effizienter Quantisierungstechniken auch mit weniger als 8 GB RAM reibungslos.

  • Phi-3 Mini: Bestes Verhältnis von Qualität zu RAM für einen kleinen VPS. Ungefähr 2.3 GB in quantisierter Form.
  • TinyLlama: Nur 638 MB. Läuft auf jedem VPS mit mindestens 2 GB RAM. Eingeschränkte Qualität, aber schnell.
  • Gemma 2B: Etwa 1.5 GB. Solider Allzweckassistent für grundlegende Aufgaben.

Auslagerungsspeicher-Konfiguration

Der Swap-Speicher ermöglicht es Ihrem Server, Festplattenspeicher als zusätzlichen Arbeitsspeicher (RAM) zu nutzen, wenn der physische RAM knapp wird. Er ist zwar langsamer als der eigentliche RAM, verhindert aber Abstürze, wenn ein Modell den verfügbaren Speicher nur geringfügig überschreitet.

fallocate -l 8G /swapfilechmod 600 /swapfilemkswap /swapfileswapon /swapfileecho '/swapfile none swap sw 0 0' | tee -a /etc/fstab
Hinweis

Swap-Speicher dient als Sicherheitsnetz, nicht zur Leistungssteigerung. Wenn Ihr Modell stark auf Swap-Speicher angewiesen ist, wird die Inferenz extrem langsam sein. Nutzen Sie Swap-Speicher, um Abstürze zu vermeiden, aber kaufen Sie mehr RAM für tatsächliche Geschwindigkeit.

Performance-Verbesserungen

Durch die Feinabstimmung der Threads und die Reduzierung der Kontextgröße wird RAM geschont, die Reaktionszeiten werden beschleunigt und eine reibungslose Performance auf dem VPS gewährleistet.

  • CPU-Thread-Optimierung: Ollama erkennt und nutzt automatisch alle verfügbaren CPU-Threads. Bei langsamen Antwortzeiten sollte die Größe des Modellkontexts reduziert werden.
  • Anpassung der Kontextgröße: Um bei ressourcenschonenden Systemen weniger RAM zu verbrauchen und schnellere Reaktionszeiten zu erzielen, sollte OLLAMA_NUM_CTX=2048 anstelle des Standardwerts 4096 eingestellt werden.
  • Modellquantisierung: Verwenden Sie auf VPS-Systemen stets Q4- oder Q5-quantisierte Modelle. Vermeiden Sie Modelle mit voller Präzision (FP16), es sei denn, Sie verfügen über einen GPU-VPS mit mindestens 24 GB VRAM.

Erweiterte Funktionen

Durch die Integration von Sprach- und Multiagentensystemen wird Ihre KI zu einem leistungsstarken Assistenten, der zur Interaktion und zur Ausführung komplexer Aufgaben fähig ist.

Integration des Sprachassistenten

Sie können Sprach-zu-Text- und Text-zu-Sprache-Funktionen hinzufügen, um Ihren KI-Assistenten vollständig sprachfähig zu machen.

  • Whisper STT: Das Open-Source-Spracherkennungsmodell von OpenAI. Läuft lokal und transkribiert Audio präzise in mehreren Sprachen. Die offene WebUI unterstützt Whisper nativ.
  • Piper TTS: Eine schnelle, lokale Text-zu-Sprache-Engine. Erzeugt natürlich klingende Stimmen, ohne Audio an externe Dienste zu senden.

 AI-Automatisierung

Verbinden Sie Ihre selbstgehostete KI mit Automatisierungs-Workflows, damit sie Aktionen ausführen kann und nicht nur Fragen beantwortet.

  • Zapier: Verbinden Sie Ihren Ollama-API-Endpunkt über die HTTP-Aktion von Zapier mit Tausenden von Apps. Lösen Sie KI-Zusammenfassungen, Entwürfe und Klassifizierungen innerhalb bestehender Workflows aus.
  • n8n-Workflows: Selbstgehostete Zapier-Alternative. Erstellen Sie komplexe KI-Automatisierungspipelines, die auf Ihrer eigenen Infrastruktur verbleiben. Lässt sich optimal mit Ollama für vollständig private Automatisierung kombinieren.

 Multiagentensysteme

Für komplexere Aufgaben können mehrere KI-Agenten zusammenarbeiten, wobei einer plant, ein anderer recherchiert und ein weiterer schreibt.

  • AutoGen (Microsoft): Framework zum Erstellen von Multiagenten-Konversationen. Funktioniert mit lokalen Ollama-Modellen als Backend.
  • CrewKI: Python-Framework zur Orchestrierung eines Teams von KI-Agenten mit definierten Rollen und Aufgaben. Integriert sich in LangChain und Ollama.

API-Zugriff

Ollama stellt eine OpenAI-kompatible API unter http://your_server_ip:11434 bereit. Jedes Tool oder Skript, das das OpenAI Python SDK verwendet, kann mit Ihrem selbst gehosteten Modell kommunizieren, indem lediglich eine Zeile geändert wird:

Von openai importieren OpenAI

Führe dann Folgendes aus:

Kunde = OpenAI(    base_url=”http://your_server_ip:11434/v1″,    api_key=”ollama”) Antwort = Client.Chat.Completions.create(    model=”llama3″,    messages=[{“role”: “user”, “content”: “Hallo!”}])print(response.choices[0].message.content)

Häufige Probleme und Lösungen

Die meisten Probleme lassen sich auf begrenzte Ressourcen, falsch konfigurierte Container oder blockierte Ports zurückführen und können durch schnelle Überprüfungen und einfache Anpassungen behoben werden.

Modellabstürze

Wenn Ollama mitten in der Antwort abstürzt oder ein Modell nicht laden kann, liegt die häufigste Ursache in einem zu geringen Arbeitsspeicher (RAM). Überprüfen Sie den verfügbaren Speicher mit „free -h“. 

Wenn Sie an die Leistungsgrenze stoßen, richten Sie entweder Auslagerungsspeicher ein oder wechseln Sie zu einem kleineren quantisierten Modell. Vermeiden Sie es, mehrere große Modelle gleichzeitig auszuführen.

Langsame Reaktionen

Eine langsame Ausgabe deutet in der Regel darauf hin, dass das Modell zu groß für Ihre CPU oder Ihren Arbeitsspeicher ist. Wechseln Sie zunächst zu einem Q4-quantisierten Modell. 

Sollte das nicht helfen, versuchen Sie es mit einem kleineren Modell wie dem Phi-3 Mini anstelle des Mistral 7B. Für eine dauerhafte Lösung empfiehlt sich ein Upgrade auf einen VPS mit mehr RAM oder der Einbau einer zusätzlichen Grafikkarte.

Docker-Probleme

Wenn Open WebUI nicht mehr reagiert, überprüfen Sie den Containerstatus und die Protokolle:

Docker ps -adocker logs open-webui –tail 50docker restart open-webui

Probleme beim Portzugriff

Falls Sie Port 3000 von Ihrem Browser aus nicht erreichen können, überprüfen Sie Ihre Firewall-Regeln:

UFW-Statusufw erlauben 3000 / tcp

Prüfen Sie außerdem, ob die Cloud-Firewall Ihres VPS-Anbieters in dessen Kontrollpanel den Port auf Netzwerkebene blockiert. DigitalOcean, Vultr und Hetzner verwenden jeweils eine separate Cloud-Firewall, die über UFW liegt.

Kostenaufschlüsselung

Die monatlichen Kosten hängen davon ab, wie leistungsstark Ihre KI-Konfiguration sein soll. Das Spektrum reicht von einfachen CPU-Lösungen bis hin zu High-End-GPU-Systemen, die in der Lage sind, große Modelle zu verarbeiten.

Setup-TypMonatliche Kosten (USD)Was Sie erhalten
Starter (Kleine Modelle)$ 5 bis $ 104 vCPUs, 8 GB RAM, TinyLlama oder Phi-3, nur CPU
Mittelklasse (7B-Modelle)$ 15 bis $ 408 vCPUs, 16 GB RAM, Mistral 7B oder Llama 3 8B, nur CPU
Leistung (13B+ Modelle)$ 50 bis $ 1008+ vCPUs, 32 GB RAM, Mixtral oder DeepSeek, CPU
GPU VPS (beliebiges Modell)$ 80 bis $ 300 +NVIDIA A100/L40S, schnelle Inferenz, über 70 Milliarden Modelle möglich

Selbsthosting vs. OpenAI API-Kosten

Bei einer typischen Nutzung von 100 Token pro Tag kostet OpenAIs GPT-4o etwa 150 US-Dollar pro Monat. 

Selbsthosting vs. OpenAI API-Kosten

A Hetzner VPS Mit 16 GB RAM kostet Llama 3 8B etwa 16 bis 21 EUR pro Monat und kann unbegrenzt Token verwalten. 

Hetzner VPS

Die Gewinnschwelle für mittlere Nutzung liegt üblicherweise bei 2 bis 3 Monaten. Danach spart das Selbsthosting jeden Monat Geld, da es keine Datenlimits und volles Datenvolumen gibt.ivacy.

Ein Team, das täglich 5 Millionen Tokens nutzt, zahlt mit der OpenAI-API monatlich 700 US-Dollar oder mehr. Dieselbe Arbeitslast auf einem selbst gehosteten 32-GB-VPS kostet hingegen nur 40 bis 80 US-Dollar pro Monat. 

Jährliche Einsparungen: Über 7,000 US-Dollar.

Die besten Anwendungsfälle für selbstgehostete KI

Selbst gehostete KI funktioniert gut dort, wo privacy und die Anpassbarkeit ist von größter Bedeutung. Dies ermöglicht einen sicheren, automatisierten Arbeitsablauf, den Zugriff auf internes Wissen, Unterstützung bei der Codierung und das Experimentieren.

  • KI für Privatunternehmen: Sensible Geschäftsdaten und interne Prozesse sollten vollständig von KI-Servern Dritter ferngehalten werden.
  • Co-Pilot für die Programmierung: Nutzen Sie DeepSeek Coder oder Llama 3 als private Alternative zu GitHub Copilot. Verbinden Sie es über die Continue-Erweiterung mit VS Code.
  • KI-Kundensupport: Sie können mithilfe von RAG einen Support-Bot für den First-Level-Support erstellen, der mit Ihrer Produktdokumentation trainiert wird. Alle Kundenanfragen können über Ihre eigene Infrastruktur abgewickelt werden.
  • Wissenschaftlicher Mitarbeiter: Sie können sogar Dokumente und Notizen hochladen. Stellen Sie komplexe Fragen und erhalten Sie Antworten, die auf Ihren eigenen Unterlagen basieren.
  • Interner Wissens-Bot des Unternehmens: Ersetzen Sie interne Wikis durch einen KI-Assistenten, der Ihre Notion-, Confluence- oder Markdown-Dateien liest und in einfacher Sprache antwortet.
  • Heimlaborprojekte: Sie können mit Modellen experimentieren und Automatisierungs-Workflows erstellen, ohne Gebühren pro Token zu zahlen.

Alternativen zum VPS-Selbsthosting

Ein VPS ist nicht die einzige Möglichkeit, Ihre Website selbst zu hosten. Hier sind die wichtigsten Alternativen und wann sie sinnvoll sind. Wir halten es einfach und kommen direkt zum Punkt.

  • Lokales PC-Hosting: Ollama läuft direkt auf Ihrem Laptop oder Desktop-PC. Ideal für den persönlichen Gebrauch. Nicht geeignet für den Teamzugriff oder die 24/7-Verfügbarkeit.
  • NAS-Hosting: Synology- und QNAP-Geräte mit mindestens 16 GB RAM können kleinere Modelle ausführen. Leise, energieeffizient, immer betriebsbereit. Die Leistung des NAS-Prozessors begrenzt die Leistung.
  • Kubernetes-Cluster: Für Teams, die mehrere KI-Dienste in großem Umfang betreiben. Komplexere Einrichtung, ermöglicht aber automatische Skalierung und besseres Ressourcenmanagement über mehrere Knoten hinweg.
  • Serverlose KI-Plattformen: Dienste wie Cloudflare Workers AI oder Replicate ermöglichen die Ausführung von Open-Source-Modellen über eine API, ohne dass ein Server verwaltet werden muss. Die Einrichtung ist einfacher, allerdings geht die vollständige Datenkontrolle verloren und es fallen erneut Token-Gebühren an.

Häufig gestellte Fragen: Wie Sie Ihren eigenen KI-Assistenten auf einem VPS hosten

Kann ich KI auf einem 10-Dollar-VPS ausführen?

Ja, aber mit einigen Einschränkungen. Ein VPS für 10 $ bietet 4 vCPUs und 8 GB RAM. Phi-3 Mini (3.8 B) oder TinyLlama lassen sich darauf problemlos ausführen. Mistral 7 B ist mit 4-Bit-Quantisierung und Auslagerungsspeicher möglich, die Reaktionszeiten sind jedoch langsam.

Welches KI-Modell eignet sich am besten für Anfänger?

Für Einsteiger ist Llama 3 8B das beste KI-Modell, wenn Ihr VPS über 16 GB RAM verfügt. Bei 8 GB RAM empfiehlt sich Phi-3 Mini. Vermeiden Sie den Umstieg auf größere Modelle wie Mixtral 8x7B, bevor Sie sichergestellt haben, dass Ihr Server die kleineren Modelle problemlos verarbeiten kann.

Benötige ich einen GPU-VPS?

Nein! CPU-basierte Inferenz mit quantisierten Modellen ist für Einzelnutzer oder kleine Teams völlig ausreichend. Die Antwortzeiten pro Nachricht betragen je nach Modellgröße und VPS-Spezifikationen 2 bis 10 Sekunden. Ein GPU-VPS (ca. 80 US-Dollar pro Monat) ist für den Einstieg nicht erforderlich.

Ist selbstgehostete KI sicher?

Richtig konfiguriert? Ja! Ihre Daten verlassen niemals Ihren Server. Richten Sie HTTPS mit Let's Encrypt ein, nutzen Sie die integrierte Authentifizierung von Open WebUI, betreiben Sie Ollama hinter einem Reverse-Proxy und aktivieren Sie UFW und Fail2Ban.

Kann ich meine eigenen Dokumente verwenden?

Ja, Sie können Ihre eigenen Dokumente verwenden. Dies nennt man RAG (Retrieval-Augmented Generation). Open WebUI bietet integrierte Unterstützung für den Dokumenten-Upload. Sie können PDFs, Markdown-Dateien und Word-Dokumente hochladen.

Wie viel RAM benötigen KI-Modelle?

Ein 7B-Modell benötigt etwa 5 bis 6 GB. Ein 13B-Modell benötigt etwa 16 bis 18 GB. Ein 70B-Modell benötigt 40 GB oder mehr. Rechnen Sie immer 2 bis 3 GB zusätzlichen Speicherplatz für das Betriebssystem und Ollama selbst ein.

Kann ich eine ChatGPT-Alternative erstellen?

Ja, Sie können eine ChatGPT-Alternative erstellen. Ollama in Kombination mit Open WebUI bietet Ihnen eine vollständig private, selbstgehostete Alternative mit einer nahezu identischen Chat-Oberfläche. Sie erhalten mehrstufige Konversationen, Dokumenten-Uploads, Konversationsverlauf, Benutzerkonten und Spracheingabe. Sie haben die Kontrolle über das Modell und den Server.

Endgültiges Urteil: So hosten Sie Ihren eigenen KI-Assistenten auf einem VPS

Das Selbsthosting eines eigenen KI-Assistenten auf einem VPS ist kein Projekt mehr für Experten (Sie können es alleine erledigen, und das auch noch in wenigen Minuten).

Da Ollama das Modellmanagement übernimmt und Open WebUI eine elegante Benutzeroberfläche bietet, bestätigte unser technisches Team, dass die Einrichtung eines leistungsfähigen privaten KI-Assistenten auf jedem Ubuntu 22.04 VPS mit 8 GB RAM oder mehr 30 bis 60 Minuten dauert.

Beginnen Sie mit einem günstigen VPS von Hetzner oder Vultr, laden Sie Llama 3 8B oder Phi-3 Mini über Ollama herunter, fügen Sie Open WebUI für die Browserschnittstelle hinzu, sichern Sie sie mit Let's Encrypt und Sie erhalten einen vollständig privaten KI-Assistenten, der nur einen Bruchteil jeder kostenpflichtigen API kostet.

Je länger Sie warten, desto höher sind Ihre API-Gebühren. Die Einsparungen halten so lange an, wie Sie den Dienst nutzen.

Avatar von Mamta Goswami
Mamta Goswami
Lernen Sie Mamta Goswami kennen, eine bahnbrechende Webhosting-Expertin seit 2021. Mit Leidenschaft für die Überbrückung der Geschlechterkluft in der Technologie unterstützt sie Unternehmen und Einzelpersonen mit aufschlussreichen blogs. Ihre nachvollziehbaren Inhalte vereinfachen komplexe Webhosting-Konzepte, machen sie für alle zugänglich und inspirieren gleichzeitig mehr Frauen, in die Branche einzusteigen.

Hinterlasse einen Kommentar

E-Mail-Adresse wird nicht veröffentlicht. Pflichtfelder sind MIT * gekennzeichnet. *

GoogieHost Wir betreiben zwei völlig unabhängige Geschäftsbereiche: einen kostenlosen Hosting-Service seit 2012 und ein unabhängiges Hosting-Verzeichnis mit Bewertungen. Beide arbeiten strikt getrennt. Unser kostenloser Tarif wird weder bewertet noch mit anderen Anbietern verglichen. Jeder gelistete Anbieter wird anhand derselben Kriterien mit öffentlich erworbenen Accounts getestet. Die Ergebnisse werden unabhängig vom Ergebnis veröffentlicht. Einige Anbieter zahlen Provisionen für Neuanmeldungen; diese finanzieren Test-Accounts, Überwachungstools und unser Bewertungsteam. Sie beeinflussen jedoch niemals eine Bewertung, ein Ranking oder eine Platzierung in der Liste.

Nach oben scrollen