Bagaimana cara menghosting sendiri asisten AI Anda di VPS? Panduan Lengkap
Setiap bulan Anda mengirimkan ribuan permintaan ke layanan AI berbasis cloud. Setiap kali Anda membayar server orang lain dan menyerahkan data Anda, serta berharap bahwa ini adalah pilihan yang paling terjangkau.
Sebenarnya ada cara yang lebih cerdas.
Anda dapat menjalankan asisten AI pribadi Anda sendiri di Virtual Private Server (VPS) hanya dengan harga $5 hingga $20 per bulan, tanpa batasan penggunaan, tanpa kebocoran data, dan Anda akan mendapatkan kendali penuh atas model AI mana yang Anda gunakan.
Tim teknis kami telah menghabiskan waktu berminggu-minggu untuk menguji pengaturan ini secara menyeluruh dan panduan ini memberikan setiap langkahnya dalam bahasa Inggris yang sederhana sehingga Anda dapat langsung menggunakannya hari ini.
Pengembang, pemilik usaha kecil, peneliti, dan humasivacy-pengguna yang berfokus pada privasi & chatbot AI yang dihosting sendiri di VPS dan mereka tidak mempercayai OpenAI, Anthropic, atau API berbayar apa pun.
Apa yang Anda Butuhkan Sebelum Memulai?
Sebelum Anda menulis satu perintah pun, pastikan VPS Anda memenuhi spesifikasi perangkat keras yang tepat.
Mohon dipahami bahwa model AI membutuhkan banyak memori.
Jika Anda memuat Q4 (versi terkuantisasi 4), dalam hal ini, RAM 6GB hingga 8GB sudah cukup. Namun, jika Anda memuat model parameter 7B, dibutuhkan sekitar 13GB hingga 14GB RAM, sebelum sistem operasi dan layanan lain menggunakan bagiannya.
RAM yang lemah berarti sering terjadi crash dan respons yang lambat.
Tim kami menguji konfigurasi minimum dan yang direkomendasikan di berbagai penyedia VPS. Inilah yang benar-benar berhasil.
Persyaratan Perangkat Keras dan VPS
Kami telah menambahkan daftar di bawah ini yang berisi persyaratan minimum dan yang direkomendasikan untuk perangkat keras dan VPS agar asisten AI Anda dapat di-hosting sendiri dan dapat menjalankan beban kerja dengan benar tanpa hambatan.
Harap perhatikan persyaratan ini saat menyewa server VPS untuk hosting mandiri asisten AI.
| Spec | Minimum (Model Kecil) | Direkomendasikan (Model 7B, 13B & Lebih Tinggi) |
| vCPU | 4vCPU | 8+ vCPU |
| RAM | 8 GB | 16 GB hingga 32 GB |
| Storage | 100 GB SSD | SSD NVMe 200 GB+ |
| OS | Ubuntu LTS 22.04 | Ubuntu LTS 22.04 |
| GPU | Tidak diperlukan | Opsional (mempercepat inferensi) |
| Bandwidth | 1 TB per bulan | 2 TB+ per bulan |
Jika VPS Anda memiliki RAM kurang dari 8 GB, bahkan model ringan seperti TinyLlama akan melambat. Selalu sesuaikan ukuran model AI Anda dengan RAM yang tersedia. Model 7B (Q4) membutuhkan sekitar 8 GB. Model 13B membutuhkan 16 GB hingga 18 GB. Model 70B membutuhkan 40+ GB atau VPS GPU.
Penyedia VPS yang Direkomendasikan (VPS Hemat Biaya)
Tim riset kami membandingkan puluhan penyedia VPS. Berikut empat VPS terbaik untuk hosting mandiri asisten AI yang memiliki harga terbaik dan menawarkan kemudahan penggunaan saat menjalankan asisten AI.
# 1. Kamatera
Kamatera Telah menjalankan infrastruktur cloud sejak tahun 1995. Platform ini memungkinkan Anda membangun VPS yang sepenuhnya kustom dengan memilih inti CPU, RAM, SSD, dan lokasi pusat data yang tepat.

Harga mulai dari $4 per bulan dan termasuk uji coba gratis 30 hari dengan kredit server hingga $100. Ini sangat cocok untuk tim yang menginginkan kontrol yang lebih detail tanpa harga tetap.
- Konfigurasi VPS yang sepenuhnya dapat disesuaikan: Pilih CPU, RAM, SSD, dan OS secara terpisah, bukan memilih dari paket yang sudah ditentukan.
- Uji coba gratis 30 hari: Termasuk nilai server hingga $100 dan 1 TB trafik untuk menguji pengaturan AI Anda tanpa biaya.
- Skalabilitas instan: Tambahkan RAM atau inti CPU dalam waktu kurang dari 60 detik pada server yang sedang berjalan tanpa waktu henti.
- Pusat data global: Lokasi di seluruh Amerika Utara, Eropa, Asia, dan Australia untuk latensi rendah di mana pun Anda membutuhkannya.
- Penagihan per jam yang transparan: Bayar hanya untuk apa yang Anda gunakan tanpa kontrak jangka panjang.
# 2. Vultr
Vultr adalah penyedia layanan cloud yang berfokus pada pengembang, didirikan pada tahun 2014 dan berkantor pusat di AS. Perusahaan ini menawarkan komputasi awan mulai dari $2.50 per bulan dan mengoperasikan 32 lokasi pusat data di 19 negara.

Platform VX1 mereka, yang diluncurkan baru-baru ini pada Oktober 2025, menggunakan inti AMD EPYC khusus dengan kinerja hingga 80% lebih baik per dolar dibandingkan dengan penyedia layanan cloud besar.
- Paket dasar mulai dari $2.50 per bulan: Titik awal paling terjangkau untuk model AI ringan seperti TinyLlama atau Phi-3.
- Komputasi Awan VX1: Core EPYC khusus dengan jaringan hingga 50 Gbps dan penyimpanan NVMe untuk inferensi yang membutuhkan banyak daya komputasi.
- 32 lokasi global: Salah satu penyedia layanan cloud independen yang paling tersebar secara geografis.
- Paket NVMe berkinerja tinggi: Mulai dari $6 per bulan dengan SSD NVMe cepat, sangat penting untuk memuat file model berukuran besar dengan cepat.
- Penagihan per jam: Aktifkan GPU atau instance dengan RAM tinggi hanya saat Anda membutuhkannya dan bayar berdasarkan penggunaan aktual.
# 3. Awan Hetzner
Hetzner adalah penyedia asal Jerman dengan pusat data yang beroperasi sejak tahun 1997.
Produk cloud mereka diluncurkan pada tahun 2017 dan menjadi populer karena menawarkan beberapa harga terendah di industri ini. Instance dengan 4 vCPU dan 8 GB RAM saat ini dimulai dari sekitar EUR 8.49 per bulan.

Mereka mengikuti standar perlindungan data Uni Eropa yang ketat, yang merupakan nilai tambah yang besar bagi perusahaan.ivacypengaturan AI yang berfokus pada -.
- Rasio harga-kinerja terbaik di Eropa: CX33 dengan 4 vCPU dan 8 GB RAM harganya sekitar 6.49 EUR per bulan, jauh lebih murah daripada paket serupa di tempat lain.
- Kedaulatan data Uni Eropa: Server-server tersebut beroperasi di Jerman dan Finlandia di bawah hukum perlindungan data Eropa yang ketat, ideal untuk beban kerja AI yang sensitif terhadap GDPR.
- Instansi CAX berbasis ARM: Server Ampere Altra hemat energi mulai dari 3.79 EUR per bulan untuk inferensi model ringan.
- Termasuk lalu lintas bulanan sebesar 20 TB: Alokasi dana yang besar sehingga asisten AI Anda dapat menangani penggunaan yang intensif tanpa tagihan tak terduga.
- Dapatkan kredit gratis 20 EUR saat mendaftar: cukup untuk menguji seluruh pengaturan AI Anda selama sebulan tanpa biaya.
# 4. DigitalOcean
DigitalOcean adalah penyedia cloud yang mengutamakan pengalaman pengembang sejak dulu. Droplet mereka dapat diinstal dalam waktu kurang dari 60 detik dan dimulai dari $4 per bulan.

Mereka memperkenalkan sistem penagihan per detik, yang mengurangi pemborosan pada instance pengujian berumur pendek. DigitalOcean dikenal memiliki dokumentasi pemula terbaik di industri ini, dengan lebih dari 350 tutorial komunitas.
- Droplet mulai dari $4 per bulan: Paket CPU bersama memberi Anda titik awal yang solid untuk model AI kecil dengan biaya awal minimal.
- Droplet NVMe Premium mulai dari $7 per bulan: Penyimpanan SSD yang lebih cepat dan generasi CPU terbaru untuk pemuatan model yang lebih responsif.
- Penagihan per detik: Mulai Januari 2026, Anda hanya membayar untuk waktu penggunaan aktual, sehingga siklus pengembangan dan pengujian menjadi lebih murah.
- Penyebaran sekali klik dan pencadangan snapshot: Pencadangan mingguan otomatis dengan biaya 20% dari harga Droplet melindungi data model dan konfigurasi Anda.
- Koleksi tutorial yang sangat lengkap: Lebih dari 350 panduan yang mencakup Nginx, Docker, firewall, dan banyak lagi, sehingga pemula dapat melakukan pengaturan dengan aman tanpa kebingungan.
Informasi harga akurat per tahun 2026. Harga VPS sering berubah. Selalu periksa situs web resmi penyedia untuk tarif terbaru sebelum membeli.
Memilih Model AI yang Tepat
Model yang Anda pilih menentukan berapa banyak RAM yang Anda butuhkan, seberapa cepat respons yang diterima, dan seberapa baik jawaban yang diberikan. Tidak ada satu jawaban yang benar.
Itu tergantung pada ukuran VPS Anda dan apa yang Anda inginkan agar AI lakukan.
Model Kecil dan Ringan (RAM 4 GB atau kurang)
Model-model ini berjalan pada paket VPS hemat biaya dengan RAM 4 hingga 8 GB. Model-model ini merespons dengan cepat dan merupakan titik awal yang bagus.
- TinyLlama (1.1B): Model dengan 1.1 miliar parameter yang dilatih menggunakan 3 triliun token. Dapat dijalankan di hampir semua VPS. Cocok untuk tanya jawab sederhana, ringkasan teks, dan asisten cepat.
- Phi-3 Mini (3.8B): Model ringkas Microsoft yang memiliki performa jauh melebihi ukurannya. Kemampuan penalaran dan pengkodean yang baik dengan memori kurang dari 2 GB.
- Gemma 2B: Model terbuka Google yang dilatih menggunakan 2 triliun token. Output bersih, inferensi cepat, dan berfungsi pada server dengan RAM rendah.
Model Seimbang (RAM 8 hingga 16 GB)
Inilah server andalannya. Server ini memberikan kualitas mendekati GPT 3.5 pada VPS kelas menengah.
- Mistral 7B: Salah satu model open-source yang paling populer. Kinerjanya lebih baik daripada Llama 2 13B pada banyak benchmark, namun menggunakan setengah memori. Sangat baik untuk obrolan, pemrograman, dan peringkasan.
- Llama 3 8B: Model generasi terbaru Meta. Kemampuan mengikuti instruksi yang kuat, percakapan multi-putaran, dan pembangkitan kode. Membutuhkan sekitar 8 GB RAM dalam bentuk terkuantisasi 4-bit.
Model Tingkat Lanjut (RAM 16 hingga 32 GB)
Untuk tim atau pengguna tingkat lanjut yang membutuhkan kualitas terbaik dari pengaturan yang dihosting sendiri.
- DeepSeek (7B / 67B): Model pengkodean dan penalaran yang kuat. Versi 7B berjalan dengan nyaman di VPS 16 GB. Varian yang lebih besar membutuhkan VPS GPU atau RAM 32+ GB.
- Mixtral 8x7B: Model gabungan para ahli dari Mistral AI. Efisien untuk kualitasnya, berperilaku seperti model 47B tetapi hanya mengaktifkan 12B parameter per token. Membutuhkan sekitar 24 GB RAM.
- Qwen 2.5 (7B / 14B / 72B): Model multibahasa Alibaba dengan performa kuat dalam bahasa Inggris, Mandarin, dan bahasa lainnya. Versi 7B adalah model andal untuk penggunaan sehari-hari.
Tabel Perbandingan Model AI
Ini dia tabel perbandingannya! Kami telah mencantumkan semua model di bawah satu judul agar Anda dapat memperoleh gambaran yang tepat tentangnya.
| Pilih Model | RAM yang Dibutuhkan | Kecepatan | Kualitas | terbaik Untuk |
| TinyLlama 1.1B | 2 GB | Sangat cepat | Dasar | Tanya Jawab Sederhana, VPS Hemat Biaya |
| Phi-3 Mini 3.8B | 3 GB | Cepat | baik | Pemrograman, penalaran pada VPS kecil |
| Permata 2B | 2 GB | Cepat | baik | Obrolan umum, pengaturan RAM rendah |
| Mistral 7B (Q4) | 5 GB | Medium | Sangat Bagus | Obrolan, peringkasan, pengkodean |
| Llama 3 8B (Q4) | 6 GB | Medium | Sangat Bagus | Mengikuti instruksi, obrolan |
| Mixtral 8x7B (Q4 terkuantisasi) | 24 GB | Lebih lambat | Sangat baik | Penalaran kompleks, kewirausahaan |
| DeepSeek 7B | 6 GB | Medium | Sangat Bagus | Pemrograman, tugas-tugas teknis |
| Qwen 2.5 14B | 12 GB | Medium | Sangat baik | Multibahasa, penelitian |
Alat Hosting Mandiri Terbaik untuk Asisten AI
Model AI hanyalah otaknya. Anda juga membutuhkan alat untuk menjalankannya dan antarmuka web untuk berkomunikasi dengannya. Berikut adalah alat-alat yang telah diuji dan direkomendasikan oleh tim kami.
Ollama
Ollama adalah cara termudah untuk menjalankan model bahasa berskala besar di server Linux. Anda menginstalnya dengan satu perintah, mengambil model apa pun dengan perintah lain, dan AI Anda pun berjalan.
Layanan ini menyediakan API yang kompatibel dengan OpenAI pada port 11434, sehingga aplikasi apa pun yang berkomunikasi dengan OpenAI juga dapat berkomunikasi dengan Ollama. Layanan ini mendukung Llama 3, Mistral, Gemma, DeepSeek, Qwen, Phi, dan lebih dari 100 model lainnya.
Fitur utama Ollama meliputi kemudahan pemasangan, pengaturan yang ramah bagi pemula, dan instalasi model hanya dengan satu perintah.
Buka WebUI
Open WebUI memberi Anda antarmuka browser mirip ChatGPT untuk model yang Anda host sendiri.
Aplikasi ini terhubung ke Ollama atau API yang kompatibel dengan OpenAI lainnya dan menambahkan fitur-fitur seperti riwayat percakapan, akun pengguna, peran multi-pengguna, unggahan dokumen untuk RAG, dan input suara.
Aplikasi ini berjalan sebagai kontainer Docker dan dapat diinstal dalam hitungan menit. Aplikasi ini mendukung akses multi-pengguna dan dirancang untuk beroperasi sepenuhnya secara offline.
AI Lokal
LocalAI adalah server yang kompatibel dengan API OpenAI yang berjalan secara lokal. Server ini berguna ketika Anda ingin mengganti panggilan API OpenAI dalam aplikasi yang sudah ada tanpa mengubah kode Anda.
Cukup arahkan URL dasar API ke instance LocalAI Anda. Mendukung LLM, pembuatan gambar, pengenalan suara ke teks, dan teks ke suara.
Antarmuka Web Pembuatan Teks
Disebut juga oobabooga, alat ini menawarkan opsi konfigurasi paling canggih untuk menjalankan model lokal. Anda mendapatkan kontrol yang sangat detail atas parameter pengambilan sampel, pengaturan kuantisasi model, dan metode pemuatan.
Platform ini lebih cocok untuk pengembang dan peneliti yang ingin bereksperimen secara mendalam dengan perilaku model.
LangChain
LangChain adalah kerangka kerja Python untuk membangun alur kerja AI dan jalur otomatisasi. Anda dapat menghubungkan model yang dihosting sendiri ke basis data, API, penyimpanan dokumen, dan alat eksternal.
Ini adalah kerangka kerja utama untuk membangun sistem tanya jawab dokumen, agen AI, dan aplikasi RAG di atas Ollama.
Panduan Pengaturan VPS Langkah demi Langkah
Setelah VPS Anda berjalan Ubuntu 22.04, ikuti langkah-langkah ini secara berurutan. Langkah-langkah di bawah ini mencakup cara menghubungkan dan mempersiapkan server untuk Ollama dan Open WebUI.
Kami telah menuliskan perintah-perintah tersebut dengan huruf tebal. Anda cukup menyalin dan menempelkannya di terminal Anda untuk menjalankan prosesnya. Bersamaan dengan langkah-langkahnya, kami juga menambahkan tangkapan layar agar Anda dapat mengikuti perintah persis seperti yang telah kami lakukan:
Langkah 1: Hubungkan ke VPS Anda
Gunakan SSH untuk terhubung dari mesin lokal Anda >> Ganti your_server_ip dengan alamat IP VPS Anda yang sebenarnya.
| ssh root@ip_server_anda |

Jika Anda menggunakan kunci SSH, tambahkan flag -i yang mengarah ke file kunci pribadi Anda.
Langkah 2: Perbarui Server
Selalu jalankan pembaruan sistem lengkap sebelum menginstal apa pun >> Ini menambal kerentanan keamanan dan memastikan daftar paket Anda selalu terbaru.
| pembaruan apt && peningkatan apt -y |

Langkah 3: Instal Docker
Docker digunakan untuk menjalankan Open WebUI dan alat-alat lainnya dalam kontainer yang terisolasi.
| curl -fsSL https://get.docker.com | shsystemctl memungkinkan buruh pelabuhansystemctl mulai buruh pelabuhan |

Langkah 4: Instal Docker Compose
Untuk menginstal Docker Compose, silakan jalankan perintah berikut.
| apt install docker-compose-plugin -yversi docker compose |

Langkah 5: Amankan VPS Anda
Langkah ini tidak opsional >> VPS yang tidak aman akan diretas dalam beberapa jam setelah online >> Ubah port SSH (mengurangi serangan pemindaian otomatis):
| nano / etc / ssh / sshd_config# Ubah Port 22 menjadi Port 2222systemctl restart sshd |
Nonaktifkan login root. Di /etc/ssh/sshd_config, atur: >> PermitRootLogin no
Aktifkan firewall (UFW):
| ufw izinkan 2222/tcpufw izinkan 80/tcpufw izinkan 443/tcpufw aktifkan |
Instal Fail2Ban untuk memblokir upaya login paksa (brute-force):
| apt install fail2ban -ysystemctl mengaktifkan fail2bansistemctl mulai fail2ban |
Jika Anda mengikuti perintah yang diberikan di atas apa adanya, Anda akan dapat mengatur dan menjalankan sendiri asisten AI di VPS Anda. Prosesnya sangat sederhana. Anda hanya perlu mengikuti langkah-langkahnya secara berurutan.
Menginstal Ollama di VPS
Ollama menangani tugas-tugas berat seperti mengunduh, mengelola, dan menjalankan model AI. Tim teknis kami mengkonfirmasi bahwa instalasi satu baris tersebut berjalan dengan lancar di Ubuntu 22.04.
| curl -fsSL https://ollama.com/install.sh | SH |

Setelah instalasi, verifikasi apakah Ollama berjalan:
| ollama –versisystemctl status ollama |
Sekarang, pilih model pertama Anda. Mulailah dengan Llama 3 8B untuk keseimbangan kualitas dan RAM yang baik:
| ollama tarik llama3 |
Coba langsung dari terminal! Sekarang ada dua cara untuk melakukannya:
Opsi 1) Mode interaktif (direkomendasikan untuk pemula):
| ollama lari llama3 |
Kemudian ketikkan perintah Anda saat >>> muncul.
Opsi 2) Satu baris dengan perintah langsung:
| ollama run llama3 “Halo, siapa kamu?” |
Anda dapat menjalankan Llama 3 dalam mode interaktif dengan mengetik ollama run llama3 dan memasukkan perintah Anda, atau langsung memasukkan satu baris perintah singkat seperti yang ditunjukkan di atas.
| ollama run llama3 “Halo, siapa kamu?” |
Untuk menampilkan semua model yang telah Anda unduh:
| daftar ollama |
Ollama menginstal dirinya sendiri sebagai layanan systemd secara otomatis. Layanan ini berjalan saat booting dan berjalan di latar belakang. Anda tidak perlu menjalankannya secara manual setelah reboot.

Untuk memilih model yang lebih ringan untuk VPS dengan anggaran terbatas:
| ollama pull phi3ollama pull gemma:2bollama menarik tinyllama |
Menyiapkan Antarmuka Web Mirip ChatGPT
Berkomunikasi dengan Ollama melalui terminal memang bagus untuk pengujian, tetapi tidak praktis untuk penggunaan sehari-hari. Open WebUI memberi Anda antarmuka obrolan berbasis browser yang lengkap.
Berikut cara menginstalnya dengan Docker.
| menjalankan buruh pelabuhan -d \ -hal 3000:8080 \ –add-host=host.docker.internal:host-gateway \ -v buka-webui:/app/backend/data \ –nama open-webui \ –selalu mulai ulang \ ghcr.io/open-webui/open-webui:main |
Buka browser Anda >> Kunjungi http://your_server_ip:3000 >> Saat pertama kali diluncurkan, buat akun admin. Kemudian pilih model Ollama Anda dari menu tarik-turun dan mulailah mengobrol.
- Port 3000 tidak boleh dibuka untuk internet publik tanpa kata sandi atau reverse proxy di depannya.
- Lihat Bagian Mengamankan Asisten AI Anda Sebelum dipublikasikan kepada pengguna eksternal, silakan lihat di bawah ini.
Fitur Open WebUI mencakup riwayat percakapan yang tersimpan secara lokal, unggahan file untuk tanya jawab dokumen, dukungan untuk beberapa model Ollama dalam satu antarmuka, akun pengguna dan dukungan multi-pengguna, serta desain yang bersih dan ramah seluler.
Menambahkan Basis Pengetahuan Anda Sendiri (RAG)
Model AI standar hanya mengetahui apa yang telah dilatihnya. RAG (Retrieval-Augmented Generation) memungkinkan Anda menghubungkan dokumen Anda sendiri sehingga AI dapat menjawab pertanyaan tentang konten spesifik Anda.
Inilah cara membangun chatbot internal perusahaan atau asisten dokumentasi.
Apa itu RAG?
RAG bekerja dalam dua langkah. Pertama, dokumen Anda dibagi menjadi beberapa bagian dan disimpan sebagai embedding vektor dalam basis data.
Saat Anda mengajukan pertanyaan, sistem akan mengambil bagian-bagian yang paling relevan dan memberikannya kepada AI sebagai konteks. AI kemudian akan menjawab menggunakan pengetahuan yang telah dilatihnya dan isi dokumen Anda.
Hasilnya adalah jawaban yang akurat dan berdasarkan fakta, bukan jawaban yang mengada-ada.
Alat untuk RAG
Alat-alat ini menyederhanakan pembuatan pipeline RAG dengan menangani pemrosesan dokumen dan penyematan. Hal ini memungkinkan Anda untuk fokus pada pembuatan aplikasi AI yang akurat secara efisien.
- Rantai Lang: Kerangka kerja Python untuk menggabungkan langkah-langkah pengambilan dan pembuatan data. Bekerja dengan Ollama dan sebagian besar basis data vektor.
- Indeks Llama: Mengkhususkan diri dalam pemasukan dan pengambilan dokumen. Lebih mudah diatur untuk tanya jawab dokumen daripada LangChain dalam banyak kasus.
- ChromaDB: Basis data vektor sumber terbuka yang ringan dan berjalan secara lokal. Tidak memerlukan layanan eksternal. Titik awal yang baik untuk basis pengetahuan kecil.
- Qdrant: Basis data vektor berkinerja tinggi yang berjalan di Docker. Pilihan yang lebih baik untuk koleksi dokumen berukuran besar.
Mengunggah Dokumen
Mengunggah dokumen memungkinkan sistem AI Anda untuk belajar dari data Anda. Ini mengubah file statis menjadi pengetahuan yang dapat dicari dan diakses secara instan melalui pertanyaan bahasa alami.
- Open WebUI memiliki dukungan unggah dokumen bawaan.
- Anda dapat menyeret dan meletakkan file langsung ke antarmuka obrolan. Format yang didukung meliputi PDF, file Markdown, dokumen Word (.docx), dan file teks biasa.
- Untuk konten situs web, Anda dapat menempelkan teks secara langsung atau menggunakan web loader LangChain untuk mengikis dan mengindeks halaman secara otomatis.
Contoh Kasus Penggunaan
RAG menghadirkan solusi praktis di berbagai tim dengan mengubah informasi yang tersebar menjadi asisten terpadu yang dapat dicari, sehingga mengurangi waktu pencarian dan meningkatkan akurasi pengambilan keputusan.
- Chatbot internal perusahaan: Unggah SOP, kebijakan SDM, dan dokumentasi produk Anda. Biarkan tim Anda mengajukan pertanyaan dengan bahasa yang mudah dipahami.
- Asisten dokumentasi: Unggah dokumen teknis Anda dan biarkan pengembang mengajukan pertanyaan tanpa harus menelusuri halaman demi halaman secara manual.
- Asisten peneliti: Unggah makalah, laporan, dan catatan. Minta AI untuk menemukan keterkaitan, meringkas temuan, dan menjawab pertanyaan spesifik.
Mengamankan Asisten AI Anda
Menjalankan AI yang dihosting sendiri di VPS publik tanpa keamanan sama seperti membiarkan pintu depan rumah Anda terbuka. Bagian ini membahas apa yang tim kami lakukan sebelum diluncurkan.
Aktifkan HTTPS
Instal Nginx sebagai reverse proxy agar antarmuka AI Anda dapat diakses melalui HTTPS, bukan melalui IP dan port mentah.
| apt install nginx certbot python3-certbot-nginx -y |
Buat konfigurasi Nginx untuk Anda domain:
| server { nama_server Andadomain.dengan; lokasi / proxy_pass http://localhost:3000; proxy_set_header Host $ host; proxy_set_header X-Real-IP $ remote_addr; }} |
Dapatkan sertifikat SSL gratis dengan Let's Encrypt:
| certbot –nginx -d Andadomain.com |
Certbot akan memperbarui sertifikat Anda secara otomatis dan memperbarui konfigurasi Nginx secara otomatis.
Otentikasi
Open WebUI menyertakan akun pengguna bawaan dan perlindungan kata sandi.
Aktifkan di pengaturan admin. Untuk tim, Anda dapat mengatur login OAuth dengan Google atau GitHub, atau mengkonfigurasi peran multi-pengguna sehingga orang yang berbeda memiliki tingkat akses yang berbeda.
Untuk pengaturan privat pengguna tunggal, otentikasi HTTP dasar yang ditambahkan pada level Nginx merupakan lapisan perlindungan yang kuat.
Praktik Terbaik Keamanan VPS
Menjaga keamanan VPS Anda seharusnya menjadi kebiasaan sehari-hari. Bersama-sama, praktik-praktik ini menciptakan pengaturan yang lebih aman dan andal untuk menjalankan beban kerja AI.
- Pencadangan otomatis: Aktifkan snapshot mingguan di dasbor penyedia VPS Anda. DigitalOcean dan Vultr menawarkan fitur ini dengan biaya bulanan yang kecil.
- Monitoring: Instal htop atau siapkan instance Uptime gratis untuk memantau kesehatan server Anda dan mendapatkan peringatan saat terjadi masalah.
- Pembatasan tarif: Tambahkan pembatasan laju (rate limiting) ke konfigurasi Nginx Anda untuk mencegah upaya login paksa (brute-force) pada antarmuka AI Anda.
- Pengasingan sumber daya: Jalankan Open WebUI dan Ollama dalam kontainer Docker terpisah agar jika salah satu mengalami kerusakan, yang lainnya tidak ikut mati.
Mengoptimalkan Kinerja
Menjalankan sebuah model adalah langkah pertama. Menjalankannya dengan cepat dan efisien membutuhkan sedikit usaha lebih. Berikut adalah hal-hal yang benar-benar membuat perbedaan.
Gunakan Model Terkuantisasi
Kuantisasi mengkompresi sebuah model dengan mengurangi presisi angka-angkanya, misalnya dari bilangan floating point 16-bit menjadi bilangan bulat 4-bit. A Model 7B (Q4) dengan presisi penuh membutuhkan sekitar 8GB RAM.
Model yang sama dalam kuantisasi 4-bit (Q4) membutuhkan sekitar 5 GB. Anda kehilangan sedikit kualitas output tetapi mendapatkan penurunan besar dalam penggunaan RAM dan peningkatan kecepatan yang signifikan.
Ollama secara default mengunduh model terkuantisasi.
Akselerasi GPU
Jika VPS Anda memiliki GPU NVIDIA, Ollama akan menggunakannya secara otomatis untuk inferensi. Inferensi GPU 5 hingga 20 kali lebih cepat daripada hanya menggunakan CPU untuk model yang sama.
Untuk mengatur dukungan GPU:
| instalasi otomatis driver ubuntunvidia-smi # Instal NVIDIA Container Toolkitcurl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg –dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpgcurl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.listsudo apt update && sudo apt install -y nvidia-container-toolkitsudo nvidia-ctk runtime configure –runtime=dockersudo systemctl mulai ulang docker ollama lari llama3 |
Untuk benar-benar menggunakan GPU (terutama saat menjalankan Open WebUI melalui Docker), Anda juga perlu menginstal NVIDIA Container Toolkit di antara nvidia-smi dan ollama run llama3.
Alat Pemantauan Sumber Daya
Awasi server Anda! Ibarat memiliki ruang kendali dengan lampu berkedip dan tombol yang memberi tahu Anda persis apa yang sedang terjadi:
- htop: Penggunaan CPU dan RAM secara real-time. Jalankan htop di sesi terminal mana pun.
- nvtop: Monitor penggunaan GPU. Jalankan “apt install nvtop -y” lalu nvtop untuk memantau penggunaan GPU selama inferensi.
- Prometheus dan Grafana: Untuk dasbor pemantauan yang tepat dengan data historis, peringatan, dan grafik. Memberikan Anda tampilan profesional tentang kesehatan server.
Menjalankan Model AI Secara Efisien pada Server VPS Kecil
Tidak semua orang mampu membeli VPS dengan RAM 16 GB secara langsung. Berikut cara memaksimalkan server dengan kapasitas lebih kecil.
Model Terbaik untuk RAM Rendah (Di Bawah 8 GB)
Model ringan seperti Llama 3 8B, berjalan lancar dengan RAM di bawah 8GB menggunakan teknik kuantisasi secara efisien.
- Phi-3 Mini: Rasio kualitas terhadap RAM terbaik untuk VPS kecil. Sekitar 2.3 GB dalam bentuk terkuantisasi.
- TinyLlama: Hanya 638 MB. Dapat dijalankan di VPS mana pun dengan RAM 2 GB atau lebih. Kualitas terbatas tetapi cepat.
- Gemma 2B: Sekitar 1.5 GB. Asisten umum yang handal untuk tugas-tugas dasar.
Pengaturan Memori Swap
Swap memungkinkan server Anda menggunakan ruang disk sebagai RAM tambahan ketika RAM fisik habis. Ini lebih lambat daripada RAM sungguhan, tetapi mencegah kerusakan saat model sedikit melebihi memori yang tersedia.
| fallocate -l 8G /swapfilechmod 600 /swapfilemkswap /swapfileswapon /swapfileecho '/swapfile none swap sw 0 0' | tee -a /etc/fstab |
Swap adalah jaring pengaman, bukan alat peningkatan performa. Jika model Anda sangat bergantung pada swap, inferensi akan sangat lambat. Gunakan swap untuk mencegah crash, tetapi beli lebih banyak RAM untuk kecepatan yang sebenarnya.
Tweaks kinerja
Penyempurnaan thread dan pengurangan ukuran konteks membantu menghemat RAM, mempercepat respons, dan menjaga kinerja yang lancar pada VPS.
- Optimalisasi thread CPU: Ollama secara otomatis mendeteksi dan menggunakan semua thread CPU yang tersedia. Jika respons lambat, kurangi ukuran konteks model.
- Penyesuaian ukuran konteks: Atur OLLAMA_NUM_CTX=2048 untuk konfigurasi ringan, alih-alih nilai default 4096, agar menggunakan lebih sedikit RAM dan merespons lebih cepat.
- Kuantisasi model: Selalu gunakan model kuantisasi Q4 atau Q5 pada pengaturan VPS. Hindari model presisi penuh (FP16) kecuali Anda memiliki VPS GPU dengan VRAM 24+ GB.
Fitur Lanjutan
Menambahkan sistem suara dan multi-agen mengubah AI Anda menjadi asisten yang ampuh yang mampu berinteraksi dan mengeksekusi tugas-tugas kompleks.
Integrasi Asisten Suara
Anda dapat menambahkan fitur pengenalan suara ke teks dan teks ke suara untuk membuat asisten AI Anda sepenuhnya mampu berkomunikasi melalui suara.
- Bisikkan STT: Model pengenalan suara sumber terbuka dari OpenAI. Berjalan secara lokal, mentranskripsikan audio secara akurat dalam berbagai bahasa. Open WebUI mendukung Whisper secara native.
- Piper TTS: Mesin text-to-speech lokal yang cepat. Menghasilkan suara yang terdengar alami tanpa mengirim audio ke layanan eksternal.
Otomasi AI
Hubungkan AI yang Anda host sendiri ke alur kerja otomatisasi sehingga dapat mengambil tindakan, bukan hanya menjawab pertanyaan.
- Zapier: Hubungkan endpoint API Ollama Anda ke ribuan aplikasi melalui aksi HTTP Zapier. Picu ringkasan, draf, dan klasifikasi AI di dalam alur kerja yang sudah ada.
- Alur kerja n8n: Alternatif Zapier yang dapat dihosting sendiri. Bangun alur kerja otomatisasi AI yang kompleks yang tetap berada di infrastruktur Anda sendiri. Berpadu sempurna dengan Ollama untuk otomatisasi yang sepenuhnya privat.
Sistem Multi-Agen
Untuk tugas yang lebih kompleks, beberapa agen AI dapat bekerja sama di mana satu agen merencanakan, agen lain melakukan riset, dan agen lainnya menulis.
- AutoGen (Microsoft): Kerangka kerja untuk membangun percakapan multi-agen. Bekerja dengan model Ollama lokal sebagai backend.
- CrewAI: Kerangka kerja Python untuk mengatur tim agen AI dengan peran dan tugas yang telah ditentukan. Terintegrasi dengan LangChain dan Ollama.
Akses API
Ollama mengekspos API yang kompatibel dengan OpenAI di http://your_server_ip:11434. Alat atau skrip apa pun yang menggunakan OpenAI Python SDK dapat berkomunikasi dengan model yang Anda host sendiri dengan mengubah satu baris:
Dari openai impor OpenAI
Kemudian jalankan ini,
| klien = OpenAI( base_url=”http://your_server_ip:11434/v1″, api_key=”ollama”) respons = klien.chat.completions.create( model=”llama3″, pesan=[{“peran”: “pengguna”, “konten”: “Halo!”}])print(respons.pilihan[0].pesan.konten) |
Masalah Umum & Solusinya
Sebagian besar masalah bermuara pada keterbatasan sumber daya, konfigurasi kontainer yang salah, atau port yang diblokir dan dapat diselesaikan dengan pemeriksaan cepat dan penyesuaian sederhana.
Model Crashes
Jika Ollama mengalami crash di tengah proses atau gagal memuat model, penyebab paling umum adalah kehabisan RAM. Periksa memori yang tersedia dengan perintah “free -h”.
Jika Anda sudah mencapai batasnya, siapkan memori swap atau beralih ke model terkuantisasi yang lebih kecil. Hindari menjalankan beberapa model besar secara bersamaan.
Respons Lambat
Output yang lambat biasanya berarti model terlalu besar untuk CPU atau RAM Anda. Beralihlah ke model kuantisasi Q4 terlebih dahulu.
Jika itu tidak membantu, coba model yang lebih kecil seperti Phi-3 Mini sebagai pengganti Mistral 7B. Untuk solusi permanen, tingkatkan ke VPS dengan RAM yang lebih besar atau tambahkan GPU.
Masalah Docker
Jika Open WebUI berhenti merespons, periksa status kontainer dan log:
| buruh pelabuhan ps -adocker logs open-webui –tail 50docker restart open-webui |
Masalah Akses Pelabuhan
Jika Anda tidak dapat mengakses port 3000 dari browser Anda, periksa aturan firewall Anda:
| status ufwufw izinkan 3000/tcp |
Periksa juga apakah firewall cloud penyedia VPS Anda di panel kontrol mereka tidak memblokir port di tingkat jaringan. DigitalOcean, Vultr, dan Hetzner semuanya memiliki firewall cloud terpisah yang berada di atas UFW.
Rincian biaya
Biaya bulanan Anda bergantung pada seberapa canggih pengaturan AI yang Anda inginkan, mulai dari penerapan CPU ringan hingga sistem GPU kelas atas yang mampu menangani model besar.
| Jenis Pengaturan | Biaya Bulanan (USD) | Apa yang Anda Dapatkan |
| Pemula (Model kecil) | $ 5 sampai $ 10 | 4 vCPU, 8 GB RAM, TinyLlama atau Phi-3, hanya CPU |
| Kelas Menengah (model 7B) | $ 15 sampai $ 40 | 8 vCPU, 16 GB RAM, Mistral 7B atau Llama 3 8B, hanya CPU |
| Performa (model 13B+) | $ 50 sampai $ 100 | 8+ vCPU, 32 GB RAM, Mixtral atau DeepSeek, CPU |
| VPS GPU (model apa pun) | $80 hingga $300 + | NVIDIA A100/L40S, inferensi cepat, model 70B+ dimungkinkan |
Biaya Hosting Mandiri vs API OpenAI
Dengan penggunaan tipikal 100 token per hari, GPT-4o dari OpenAI berharga sekitar $150 per bulan.

A VPS Hetzner Dengan RAM 16 GB yang menjalankan Llama 3, 8B harganya sekitar 16 hingga 21 EUR per bulan dan menangani token tanpa batas.

Titik impas untuk penggunaan menengah biasanya 2 hingga 3 bulan. Setelah itu, hosting sendiri menghemat uang setiap bulannya, tanpa batasan kuota dan kuota data penuh.ivacy.
Sebuah tim yang menggunakan 5 juta token per hari akan membayar $700 atau lebih per bulan dengan API OpenAI. Beban kerja yang sama pada VPS 32 GB yang dihosting sendiri hanya membutuhkan biaya $40 hingga $80 per bulan.
Penghematan tahunan: Lebih dari $7,000.
Kasus Penggunaan Terbaik untuk AI yang Dihosting Sendiri
AI yang dihosting sendiri berfungsi dengan baik di mana privacy dan kustomisasi adalah yang terpenting. Hal ini memungkinkan alur kerja otomatis yang aman, akses pengetahuan internal, bantuan pengkodean, dan eksperimen.
- AI bisnis swasta: Jauhkan data bisnis sensitif dan proses internal dari server AI pihak ketiga sepenuhnya.
- Kopilot pemrograman: Jalankan DeepSeek Coder atau Llama 3 sebagai alternatif GitHub Copilot pribadi. Hubungkan ke VS Code melalui ekstensi Continue.
- Dukungan pelanggan berbasis AI: Anda dapat membangun bot dukungan lini pertama yang dilatih berdasarkan dokumentasi produk Anda menggunakan RAG. Simpan semua pertanyaan pelanggan di infrastruktur Anda sendiri.
- Asisten peneliti: Anda bahkan dapat mengunggah makalah dan catatan. Ajukan pertanyaan kompleks dan dapatkan jawaban yang didasarkan pada dokumen Anda sendiri.
- Bot pengetahuan internal perusahaan: Gantikan wiki internal dengan asisten AI yang membaca dari file Notion, Confluence, atau markdown Anda dan menjawab dalam bahasa yang mudah dipahami.
- Proyek lab rumahan: Anda dapat bereksperimen dengan model dan membangun alur kerja otomatisasi tanpa membayar biaya per token.
Alternatif untuk VPS Self-Hosting
VPS bukanlah satu-satunya cara untuk melakukan self-hosting. Berikut adalah alternatif utama dan kapan alternatif tersebut lebih masuk akal. Mari kita bahas secara sederhana dan langsung ke intinya.
- Hosting PC Lokal: Jalankan Ollama langsung di laptop atau komputer desktop Anda. Cocok untuk penggunaan pribadi. Tidak cocok untuk akses tim atau ketersediaan 24/7.
- Hosting NAS: Perangkat Synology dan QNAP dengan RAM 16+ GB dapat menjalankan model kecil. Senyap, hemat energi, selalu aktif. Dibatasi oleh kinerja CPU NAS.
- Klaster Kubernetes: Untuk tim yang menjalankan banyak layanan AI dalam skala besar. Pengaturan lebih kompleks tetapi memungkinkan penskalaan otomatis dan manajemen sumber daya yang lebih baik di beberapa node.
- Platform AI Tanpa Server: Layanan seperti Cloudflare Workers AI atau Replicate memungkinkan Anda menjalankan model sumber terbuka melalui API tanpa perlu mengelola server. Pengaturannya lebih mudah, tetapi Anda kehilangan kendali penuh atas data dan harus membayar per token lagi.
FAQ: Cara menghosting sendiri asisten AI Anda di VPS
Bisakah saya menjalankan AI di VPS seharga $10?
Ya, tetapi dengan beberapa keterbatasan. VPS seharga $10 memberi Anda 4 vCPU dan 8 GB RAM. Anda dapat menjalankan Phi-3 Mini (3.8B) atau TinyLlama dengan nyaman di sana. Mistral 7B dimungkinkan dengan kuantisasi 4-bit dan memori swap, tetapi responsnya akan lambat.
Model AI mana yang terbaik untuk pemula?
Llama 3 8B adalah model AI terbaik untuk pemula, jika VPS Anda memiliki RAM 16 GB, atau Phi-3 Mini jika memiliki RAM 8 GB. Hindari beralih ke model yang lebih besar seperti Mixtral 8x7B sampai Anda memastikan server Anda dapat menangani model yang lebih kecil tanpa masalah.
Apakah saya membutuhkan VPS GPU?
Tidak! Inferensi hanya CPU dengan model terkuantisasi sangat cocok untuk pengaturan pribadi atau tim kecil. Respons membutuhkan waktu 2 hingga 10 detik per pesan, tergantung pada ukuran model dan spesifikasi VPS. VPS GPU (sekitar $80 per bulan) tidak diperlukan untuk memulai.
Apakah hosting mandiri AI aman?
Jika dikonfigurasi dengan benar, ya! Data Anda tidak pernah meninggalkan server Anda sendiri. Siapkan HTTPS dengan Let's Encrypt, gunakan otentikasi bawaan Open WebUI, tempatkan Ollama di belakang reverse proxy, dan aktifkan UFW dan Fail2Ban.
Bisakah saya menggunakan dokumen saya sendiri?
Ya, Anda dapat menggunakan dokumen Anda sendiri. Ini disebut RAG (Retrieval-Augmented Generation). Open WebUI memiliki dukungan unggah dokumen bawaan. Anda dapat mengunggah PDF, file markdown, dan dokumen Word.
Berapa banyak RAM yang dibutuhkan model AI?
Model 7B membutuhkan sekitar 5 hingga 6 GB. Model 13B membutuhkan sekitar 16 hingga 18 GB. Model 70B membutuhkan lebih dari 40 GB. Selalu tambahkan 2 hingga 3 GB sebagai cadangan untuk sistem operasi dan Ollama itu sendiri.
Bisakah saya membuat alternatif ChatGPT?
Ya, Anda dapat membuat alternatif ChatGPT. Ollama plus Open WebUI memberi Anda alternatif yang sepenuhnya privat dan dihosting sendiri dengan antarmuka obrolan yang hampir identik. Anda mendapatkan percakapan multi-giliran, unggahan dokumen, riwayat percakapan, akun pengguna, dan input suara. Anda mengontrol model dan servernya.
Kesimpulan Akhir: Cara menghosting sendiri asisten AI Anda di VPS
Menghosting sendiri asisten AI Anda di VPS bukan lagi proyek ahli (Anda sendiri dapat melakukannya dan itu pun hanya dalam beberapa menit).
Dengan Ollama yang menangani manajemen model dan Open WebUI yang menghadirkan antarmuka yang rapi, tim teknis kami mengkonfirmasi bahwa asisten AI pribadi yang mumpuni dapat disiapkan dalam waktu 30 hingga 60 menit pada VPS Ubuntu 22.04 apa pun dengan RAM 8 GB atau lebih.
Mulailah dengan VPS hemat biaya dari Hetzner atau Vultr, unduh Llama 3 8B atau Phi-3 Mini melalui Ollama, tambahkan Open WebUI untuk antarmuka peramban, amankan dengan Let's Encrypt, dan Anda akan memiliki asisten AI yang sepenuhnya privat dengan biaya yang jauh lebih murah daripada API berbayar mana pun.
Semakin lama Anda menunggu, semakin banyak biaya API yang harus Anda bayarkan. Penghematan tersebut akan bertahan selama Anda menjalankannya.