Setiap pesan yang dikirim ke ChatGPT atau Claude meninggalkan gedung. Bagi sebagian besar orang, pertukaran itu baik-baik saja. Bagi jumlah pemilik lab rumah yang terus bertambah, hal itu tidak, dan server Proxmox yang sudah menjalankan Plex, Home Assistant, dan Pi-hole memiliki persis CPU, RAM, dan (sering kali) GPU yang dibutuhkan model bahasa lokal. Satu laporan terbaru dari pemilik rumah yang berhenti menggunakan AI cloud untuk LLM lokal di Proxmox merangkum daya tarik dengan baik: perangkat keras sudah dibayar, jadi model menjadi hal yang akhirnya membuat seluruh lab rumah layak. Kami mengumpulkan tujuh aplikasi yang sebanding untuk dijalankan di VM atau kontainer LXC untuk mencapai ini, diberi peringkat berdasarkan usaha setup, efisiensi perangkat keras, dan seberapa dekat pengalaman sehari-hari dengan ChatGPT. Ini adalah aplikasi terbaik untuk hosting LLM lokal di Proxmox tahun ini.
Apa yang dicari di host LLM Proxmox
Tidak setiap proyek LLM lokal dibangun untuk berjalan tanpa kepala di hypervisor. Beberapa hal membedakan yang sebanding dengan diinstal dari yang akan melawan Anda.
- VM vs kontainer LXC. Kontainer LXC lebih ringan di RAM dan disk serta memulai lebih cepat; VM penuh lebih aman untuk passthrough GPU dan mengisolasi masalah driver dari host Proxmox itu sendiri.
- Dukungan passthrough GPU. Apa pun yang menjalankan model lebih besar dari beberapa miliar parameter menginginkan GPU khusus. Periksa apakah aplikasi bermain dengan baik dengan kartu NVIDIA yang diteruskan melalui vGPU atau passthrough PCI, atau apakah berkinerja baik pada perangkat keras CPU saja.
- Titik akhir yang kompatibel dengan API. API REST yang kompatibel dengan OpenAI adalah apa yang memungkinkan layanan lain di jaringan, seperti Home Assistant atau editor koding, berbicara dengan model tanpa kode lem khusus.
- Manajer model. Menarik, menukar, dan mengkuantisasi model dari baris perintah atau UI sederhana mengalahkan pengeditan file konfigurasi manual setiap kali model baru turun.
- Antarmuka web. Antarmuka obrolan berbasis browser adalah apa yang membuat server terasa seperti pengganti ChatGPT daripada layanan backend yang hanya dapat dijangkau perangkat lunak lain.
- Dukungan kuantisasi. Format GGUF dan serupa yang dikuantisasi adalah apa yang memungkinkan model 7B atau 13B pas di 8 hingga 16 GB VRAM, atau berjalan di CPU dengan kecepatan yang dapat digunakan.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Penerapan | Tingkat gratis | Dukungan GPU |
|---|---|---|---|---|
| Ollama | Host Proxmox secara keseluruhan | Linux VM, LXC, Docker | Gratis, open-source | NVIDIA, AMD (ROCm), CPU |
| Open WebUI | UI terbaik di atas Ollama | Docker pada VM/LXC yang sama | Gratis, open-source | Mewarisi GPU backend |
| LM Studio | Penemuan model di desktop | Aplikasi desktop (bukan tanpa kepala) | Gratis | NVIDIA, Apple Silicon |
| text-generation-webui | Format model canggih dan lebih lama | Linux VM, Docker | Gratis, open-source | NVIDIA, AMD, CPU |
| vLLM | Layanan throughput tinggi, produksi | Linux VM, Docker | Gratis, open-source | NVIDIA (terbaik), AMD (sebagian) |
| llama.cpp server | Paling ringan, native GGUF | Linux VM, LXC, Docker | Gratis, open-source | NVIDIA, AMD, Apple Silicon, CPU |
| LocalAI | Pengganti drop-in OpenAI-API | Linux VM, LXC, Docker | Gratis, open-source | NVIDIA, CPU |
7 aplikasi yang diberi peringkat
1. Ollama — Terbaik secara keseluruhan
Ollama adalah aplikasi yang paling sering mendarat oleh pemilik lab rumah Proxmox terlebih dahulu, dan biasanya yang mereka tetap gunakan. Instalasi adalah perintah shell tunggal di dalam VM Debian atau Ubuntu (atau kontainer LXC berprivilese dengan modul kernel yang tepat), dan menarik model semudah ollama run llama3. Itu mengekspos API yang kompatibel dengan OpenAI pada port 11434 secara default, yang berarti Home Assistant, Continue.dev, dan puluhan alat lainnya terhubung ke sana tanpa konfigurasi tambahan.
Di mana ia tertinggal: Antarmuka bundel adalah obrolan baris perintah, bukan UI web, jadi sebagian besar orang memasangkannya dengan Open WebUI atau frontend serupa. Passthrough GPU ke kontainer LXC memerlukan driver NVIDIA yang cocok persis antara host dan kontainer, yang mengganggu pemula lebih dari rute VM.
Harga: Gratis, open-source.
Platform: Linux VM, LXC, Docker, juga asli di Windows dan macOS untuk pengujian lokal di luar lab.
Unduh: ollama.com
Garis bawah: Pilihan default untuk host LLM Proxmox, dan backend yang dibangun oleh sebagian besar aplikasi lain di daftar ini.
2. Open WebUI — UI terbaik di atas Ollama
Open WebUI mengubah Ollama menjadi sesuatu yang benar-benar terlihat dan terasa seperti ChatGPT: riwayat obrolan, percakapan berganda, pergantian model dari dropdown, unggah dokumen dengan jawaban yang ditingkatkan retrieval, dan login multi-pengguna dengan izin per-pengguna. Itu berjalan di kontainer Docker sendiri tepat di samping Ollama, jadi keduanya bersama-sama pas nyaman di satu kontainer LXC atau VM kecil.
Penerapan keluarga atau rumah tangga mendapat manfaat paling banyak di sini. Setiap orang mendapat login mereka sendiri, riwayat obrolan mereka sendiri, dan admin dapat mengatur model mana yang tersedia untuk siapa.
Di mana ia tertinggal: Ini adalah frontend, bukan server model, jadi sepenuhnya tergantung pada Ollama (atau backend yang kompatibel dengan OpenAI lainnya) yang sudah berjalan di bawahnya. Layar manajemen izin dan pengguna memerlukan beberapa menit untuk terbiasa pertama kali.
Harga: Gratis, open-source.
Platform: Docker di VM Linux atau kontainer LXC, bersama Ollama.
Unduh: github.com/open-webui/open-webui
Garis bawah: Pilihan bagi siapa pun yang menginginkan rumah tangga benar-benar menggunakan LLM lokal daripada hanya orang yang menyiapkannya.
3. LM Studio — Terbaik untuk penemuan model
LM Studio adalah aplikasi desktop yang dipoles untuk Windows, macOS, dan Linux yang membuat browsing, mengunduh, dan menguji model Hugging Face menyakitkan, dengan katalog built-in, estimasi RAM dan VRAM sebelum Anda mengunduh, dan mode server lokal yang mengekspos API yang kompatibel dengan OpenAI yang sama dengan aplikasi lain di daftar ini. Ini kurang Proxmox-native daripada Ollama, karena dirancang untuk berjalan dengan GUI di stasiun kerja daripada tanpa kepala di kontainer, tetapi itu memperoleh tempat di sini karena ini adalah cara tercepat untuk mengetahui model mana yang benar-benar pas dengan perangkat keras Anda sebelum berkomitmen pada penerapan Proxmox.
Beberapa pemilik lab rumah menjalankan LM Studio di mesin desktop murni untuk penelitian model, kemudian menarik model pemenang ke Ollama di kotak Proxmox untuk server always-on.
Di mana ia tertinggal: Menjalankannya tanpa kepala di dalam VM berfungsi tetapi kehilangan poin aplikasi, karena GUI adalah daya tarik utama. Itu tidak dibangun untuk jenis operasi unattended, boot-and-forget yang diinginkan server lab rumah.
Harga: Gratis.
Platform: Desktop Windows, macOS, Linux (bukan native kontainer).
Unduh: lmstudio.ai
Garis bawah: Berguna sebagai alat pengintaian sebelum penerapan, bukan sebagai host Proxmox itu sendiri.
4. text-generation-webui — Terbaik untuk format model canggih dan lebih lama
text-generation-webui, sering disebut “oobabooga” setelah pembuatnya, adalah veteran dari daftar ini dan masih aplikasi dengan dukungan format terluas: GGUF, GPTQ, AWQ, dan EXL2 semua memuat melalui antarmuka yang sama, bersama dengan dukungan fine-tune LoRA dan mode penyelesaian gaya notebook. Bagi siapa pun yang menjalankan model yang lebih lama atau lebih tidak jelas yang alat yang lebih baru telah menghentikan dukungan, ini biasanya di mana ia masih bekerja.
UI web mencakup kartu karakter, preset obrolan, dan ekstensi untuk hal-hal seperti memori jangka panjang dan suara, fitur yang ditujukan lebih pada tinkering hobi daripada pengalaman kotak obrolan bersih sehari-hari.
Di mana ia tertinggal: Antarmuka menunjukkan usianya di samping Open WebUI, dan jumlah pengaturan dan ekstensi yang besar dapat membanjiri seseorang yang hanya menginginkan kotak obrolan yang berfungsi. Pembaruan sesekali memecahkan kompatibilitas dengan format kuantisasi tertentu.
Harga: Gratis, open-source.
Platform: Linux VM, Docker, juga berjalan di Windows dan macOS.
Unduh: github.com/oobabooga/text-generation-webui
Garis bawah: Pilihan yang tepat untuk tinkerer yang menjalankan format model tidak biasa atau fine-tune yang server lain tidak mendukung.
5. vLLM — Terbaik untuk throughput tinggi dan layanan produksi
vLLM dibangun untuk masalah yang berbeda daripada sebagian besar daftar ini: melayani banyak permintaan bersamaan dengan cepat, menggunakan PagedAttention untuk menjaga memori GPU efisien di bawah beban. Pada kotak Proxmox dengan GPU yang tepat diteruskan, vLLM akan melampaui Ollama dengan margin yang luas ketika beberapa orang atau beberapa aplikasi menabur model sekaligus, yang penting untuk lab rumah yang menjalankan LLM di belakang beberapa layanan (asisten koding, UI obrolan, dan saluran otomasi, semuanya pada saat yang sama).
Ini berbicara API OpenAI secara native, jadi itu cocok dengan alat yang sama yang berbicara dengan Ollama.
Di mana ia tertinggal: Setup lebih berat, persyaratan GPU lebih ketat, dan kinerja obrolan pengguna tunggal tidak jauh lebih baik daripada opsi yang lebih sederhana di sini. Lab rumah CPU-only atau low-VRAM mendapatkan manfaat kecil darinya.
Harga: Gratis, open-source.
Platform: Linux VM dengan passthrough GPU, Docker.
Unduh: github.com/vllm-project/vllm
Garis bawah: Overkill untuk penggantian ChatGPT pengguna tunggal, tetapi alat yang tepat setelah lab rumah mulai melayani model lokal ke beberapa aplikasi atau orang sekaligus.
6. llama.cpp server — Paling ringan, native GGUF
llama.cpp adalah mesin inferensi C++ yang kebanyakan aplikasi di daftar ini jalankan di bawah tenda, dan server bundel-nya sendiri (llama-server) adalah cara paling ringan untuk mengekspos model GGUF melalui API yang kompatibel dengan OpenAI tanpa lapisan tambahan apa pun. Penggunaan sumber daya adalah yang terendah dalam daftar ini, yang membuatnya cocok kuat untuk kontainer LXC kecil atau host Proxmox yang juga perlu menjalankan layanan lain pada perangkat keras yang sama.
Ini mencakup antarmuka obrolan web built-in minimal, fungsional tetapi biasa, yang cukup untuk penggunaan dasar tanpa menambahkan Open WebUI di atas.
Di mana ia tertinggal: Tidak ada manajer model, tidak ada akun multi-pengguna, dan konfigurasi terjadi melalui bendera baris perintah daripada layar pengaturan. Ini memberi penghargaan kepada seseorang yang nyaman dengan terminal lebih dari seseorang yang menginginkan setup point-and-click.
Harga: Gratis, open-source.
Platform: Linux VM, LXC, Docker, juga membangun di Windows, macOS, dan Apple Silicon.
Unduh: github.com/ggerganov/llama.cpp
Garis bawah: Pilihan untuk memeras model ke perangkat keras minimal atau kontainer LXC yang dibatasi sumber daya.
7. LocalAI — Pengganti drop-in OpenAI-API terbaik
LocalAI bertujuan untuk menjadi pengganti drop-in yang hampir total untuk API OpenAI, mencakup tidak hanya penyelesaian obrolan tetapi pembuatan gambar, text-to-speech, dan embeddings di belakang antarmuka yang sama. Bagi lab rumah yang sudah memiliki aplikasi atau otomasi berkabel untuk memanggil API OpenAI, LocalAI memungkinkan titik integrasi itu tetap tidak berubah sementara inferensi aktual terjadi secara lokal di kotak Proxmox.
Ini mendukung berbagai backend, termasuk llama.cpp, jadi server yang sama dapat menjalankan beberapa format model berbeda tergantung pada apa yang diminta permintaan yang diberikan.
Di mana ia tertinggal: Luasnya jenis model yang didukung menambah kompleksitas konfigurasi dibandingkan dengan server tunggal tujuan seperti Ollama, dan proyek bergerak cukup cepat bahwa dokumentasi sesekali tertinggal dari rilis terbaru.
Harga: Gratis, open-source.
Platform: Linux VM, LXC, Docker.
Unduh: localai.io
Garis bawah: Pilihan yang tepat ketika tooling yang ada sudah dibangun melawan API OpenAI dan menukar titik akhir, bukan menulis ulang integrasi, adalah tujuannya.
Cara memilih yang benar
Bagi satu orang yang mengganti ChatGPT untuk penggunaan sehari-hari, Ollama yang dipasangkan dengan Open WebUI mencakup hampir semuanya: antarmuka obrolan, pergantian model, dan titik akhir API untuk apa pun di jaringan. Rumah tangga yang berbagi satu kotak Proxmox mendapat manfaat dari pasangan yang sama, karena login per-pengguna Open WebUI menjaga riwayat obrolan terpisah tanpa memerlukan VM ganda.
Seorang hobis yang ingin menggoda fine-tune, preset karakter, atau format kuantisasi yang lebih lama mendapat jarak yang lebih besar dari text-generation-webui, bahkan dengan kurva pembelajaran yang lebih curam. Seseorang yang masih memutuskan model mana yang pas dengan perangkat keras mereka harus mulai dengan LM Studio di desktop sebelum berkomitmen pada VM Proxmox pada setup tertentu.
Rig kaya GPU yang melayani beberapa aplikasi atau pengguna sekaligus adalah satu-satunya kasus di mana vLLM mendapatkan biaya setup tambahannya, karena keuntungan throughput-nya hanya menunjukkan di bawah beban bersamaan. Kotak CPU-only, atau host Proxmox dengan RAM terbatas untuk disimpan, lebih baik dilayani oleh server llama.cpp secara langsung, yang membawa overhead paling sedikit dari apa pun di daftar ini. Dan lab dengan otomasi yang ada sudah memanggil API OpenAI adalah satu kasus jelas untuk LocalAI, karena itu memungkinkan titik integrasi itu tetap persis seperti sebelumnya.
Pertanyaan yang sering diajukan
Bisakah Proxmox menjalankan LLM tanpa GPU? Ya. Ollama, server llama.cpp, dan LocalAI semuanya berjalan hanya CPU, dan model 7B atau 8B yang dikuantisasi dapat digunakan untuk obrolan pada CPU multi-core modern, meskipun respons datang secara signifikan lebih lambat daripada di GPU. Model yang dikuantisasi lebih kecil (3B dan lebih rendah) tetap responsif bahkan di perangkat keras sederhana.
LLM lokal mana yang paling dekat dengan kualitas ChatGPT? Kualitas model tergantung pada bobot mana yang dimuat, bukan server mana yang menjalankannya, jadi salah satu aplikasi ini dapat menjalankan model yang sama. Model terbuka yang lebih besar dalam rentang 70B-plus, berjalan dalam kuantisasi yang baik, paling dekat dengan respons tingkat ChatGPT, meskipun mereka memerlukan VRAM substansial atau fallback CPU lambat untuk berjalan dengan baik.
Apakah Ollama gratis? Ya. Ollama gratis dan open-source, tanpa tingkat berbayar, langganan, atau batas penggunaan, karena inferensi terjadi sepenuhnya pada perangkat keras tempat ia berjalan.
Haruskah saya menggunakan VM atau kontainer LXC untuk Ollama? Kontainer LXC lebih ringan dan dimulai lebih cepat, yang cocok untuk setup CPU-only atau lab ketat pada RAM. VM adalah pilihan yang lebih aman untuk passthrough GPU, karena mengisolasi tumpukan driver NVIDIA dari host Proxmox dan menghindari masalah pencocokan versi yang muncul ketika kontainer berbagi kernel dan driver host.
Model apa yang berjalan pada 16 GB VRAM? Model 13B dalam kuantisasi GGUF 4-bit atau 5-bit cocok nyaman dalam 16 GB VRAM dengan ruang untuk jendela konteks yang wajar. Beberapa kuantisasi 34B yang dioptimalkan dengan baik juga pas dengan panjang konteks yang berkurang, meskipun 13B dan di bawahnya memberikan ruang kepala paling banyak untuk percakapan yang lebih lama.