
Gemma 4 di laptop sangat responsif. GPU melakukan tugasnya, jawaban datang dalam hitungan detik, dan model terasa seperti asisten nyata. Pindahkan ke NAS dan model akan melambat cukup untuk membuat pertanyaan menjadi komitmen kecil. Perbedaan itulah yang penting. Ketika model berada di penyimpanan bersama, seluruh keluarga atau tim dapat memanggilnya, dan latensi tambahan satu detik mengubahnya kembali menjadi alat alih-alih refleks.
Kami memilih delapan aplikasi yang kami jalankan di NAS untuk menjalankan LLM lokal hari ini. Beberapa adalah server, beberapa adalah front-end, beberapa adalah lapisan penyebaran. Bersama-sama, mereka mencakup alur kerja dari mengunduh model hingga keluarga klien memanggil titik akhir bersama.
Apa yang harus diperhatikan dalam aplikasi LLM yang dihosting di NAS
- Berjalan tanpa kepala. NAS tidak memiliki monitor dan sering kali tidak memiliki GPU.
- Membuka API HTTP yang stabil sehingga klien apa pun dapat berbicara dengannya.
- Mengelola model tanpa mengemas ulang gambar Docker.
- Streaming token, karena model yang dihosting di NAS lebih lambat dan streaming membuatnya dapat digunakan.
- Lapisan kontrol akses, bahkan token sederhana, karena titik akhir berada di LAN.
Kedelapan di bawah memenuhi setidaknya empat dari lima. Peringkat mengurutkan mereka berdasarkan seberapa mudah untuk menjalankannya di Synology, QNAP, atau NAS yang dibangun sendiri.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Berjalan di | Dukungan GPU | Lisensi |
|---|---|---|---|---|
| Ollama | Server NAS termudah | Linux, macOS, Windows | CUDA, Metal, ROCm | MIT |
| LM Studio | Host model titik dan klik | Linux, macOS, Windows | CUDA, Metal, ROCm | Proprietary (free) |
| Open WebUI | Front-end web bersama | Docker | Melalui backend | MIT |
| LocalAI | Drop-in kompatibel OpenAI | Docker | CUDA, ROCm, CPU | MIT |
| Text Generation WebUI | Penyetelan pengguna power | Linux, macOS, Windows | CUDA, ROCm, CPU | AGPL |
| Jan | Klien desktop lokal-pertama | Windows, macOS, Linux | CUDA, Metal, CPU | AGPL |
| vLLM | Inferensi throughput tinggi | Linux | CUDA (GPU server) | Apache 2 |
| llama.cpp | Inferensi CPU bare-metal | Apa saja | Apa saja | MIT |
1. Ollama, terbaik untuk server NAS termudah
Ollama adalah hal terdekat dengan pemasangan satu perintah untuk NAS. Gambar Docker, port 11434, dan setiap klien yang berbicara dengan Ollama atau API OpenAI dapat berbicara dengannya. Perpustakaan model mencakup Llama, Gemma, Mistral, Qwen, dan daftar varian instruct yang berkembang.
Di mana terjadi kekurangan: kontrol sampling butir halus disembunyikan di balik bendera. Siapa pun yang ingin menukar template prompt dengan tangan berakhir dalam sintaks modelfile.
Harga:
- Gratis, MIT.
Platform: Linux, macOS, Windows (semuanya sebagai Docker atau asli).
Unduh: ollama.com
Garis bawah: Rekomendasi standar untuk siapa pun yang memberdirikan LLM NAS untuk pertama kali.
2. LM Studio, terbaik untuk host model titik dan klik
LM Studio adalah aplikasi desktop yang juga menjalankan server yang kompatibel dengan OpenAI. Arahkan ke folder model yang dipasang di NAS, aktifkan server, dan klien di LAN dapat memanggilnya. GUI menyembunyikan bagian dari llama.cpp yang menakutkan orang.
Di mana terjadi kekurangan: itu adalah aplikasi desktop pertama-tama, jadi instalasi headless di NAS berarti menjalankannya di dalam server X ringan atau memilih NAS dengan layar untuk penyetelan.
Harga:
- Gratis untuk penggunaan pribadi.
Platform: Windows, macOS, Linux.
Unduh: lmstudio.ai
Garis bawah: Pilihan yang tepat ketika anggota keluarga ingin mengubah model dan tidak ingin menyentuh terminal.
3. Open WebUI, terbaik untuk front-end web bersama
Open WebUI adalah antarmuka web bergaya ChatGPT untuk backend yang dihosting di NAS. Arahkan ke Ollama, LM Studio, atau LocalAI, tambahkan pengguna, dan setiap anggota rumah tangga mendapat obrolan mereka sendiri dan perpustakaan prompt bersama. RAG di atas file lokal dikirimkan dalam kotak.
Di mana terjadi kekurangan: itu adalah front-end, bukan runtime. Ollama atau LocalAI masih melakukan pekerjaan model.
Harga:
- Gratis, MIT.
Platform: Docker di Linux, plus instalasi asli NAS melalui Portainer.
Unduh: openwebui.com
Garis bawah: Pasangan yang tepat dengan Ollama ketika tujuannya adalah obrolan keluarga yang dihosting bersama dan berbasis browser.
4. LocalAI, terbaik untuk drop-in kompatibel OpenAI
LocalAI membuka titik akhir yang kompatibel dengan OpenAI (chat, embeddings, images, TTS) terhadap model lokal. Aplikasi apa pun yang berbicara dengan API OpenAI dapat berbicara dengannya tanpa perubahan. Backend mencakup llama.cpp, whisper.cpp, dan stable-diffusion.cpp.
Di mana terjadi kekurangan: file konfigurasi sangat padat dan setiap model memerlukan entri tersendiri. Ollama menangani pemetaan untuk Anda.
Harga:
- Gratis, MIT.
Platform: Docker di Linux, plus build asli untuk Windows dan macOS.
Unduh: localai.io
Garis bawah: Server yang tepat ketika kliennya adalah SDK OpenAI dan menukar URL dasar adalah seluruh migrasi.
5. Text Generation WebUI, terbaik untuk penyetelan pengguna power
Text Generation WebUI (oobabooga) adalah front-end yang lebih tua dan lebih kaya yang juga menjalankan server. Parameter sampling, pemuatan LoRA, dan template prompt gaya kartu karakter semuanya terbuka. Siapa pun yang ingin menyetel model di luar default duduk di sini.
Di mana terjadi kekurangan: UI telah dibangun kembali dua kali dan masih menunjukkan akar pengguna power-nya. Itu bukan alat yang Anda berikan kepada anggota keluarga.
Harga:
- Gratis, AGPL.
Platform: Windows, macOS, Linux.
Unduh: github.com/oobabooga/text-generation-webui
Garis bawah: Pilihan untuk siapa pun yang menginginkan tombol sampling yang Ollama dan LM Studio sembunyikan.
6. Jan, terbaik untuk klien desktop lokal-pertama
Jan adalah klien ChatGPT lokal-pertama. Dikirimkan dengan runtime-nya sendiri untuk NAS hanya CPU, tetapi juga berbicara dengan server Ollama atau LocalAI jarak jauh. Chat dan prompt tetap di disk, sehingga seluruh riwayat adalah file lokal.
Di mana terjadi kekurangan: sebagai server NAS, itu bukan kecocokan terkuat. Gunakan sebagai klien, dan biarkan Ollama atau LocalAI melakukan penyajian.
Harga:
- Gratis, AGPL.
Platform: Windows, macOS, Linux.
Unduh: jan.ai
Garis bawah: Pendamping desktop yang tepat ke server NAS untuk siapa pun yang tidak menginginkan tab web.
7. vLLM, terbaik untuk inferensi throughput tinggi
vLLM adalah server tingkat produksi. Perhatian bersifat halaman, paralelisme tensor, dan pengelompokan berkelanjutan membuatnya cara tercepat untuk melayani model besar kepada banyak klien. Tangkapannya adalah membutuhkan GPU nyata (Ampere atau lebih baru).
Di mana terjadi kekurangan: itu bukan instalasi yang ramah NAS. Chassis NAS tanpa GPU pusat data tidak dapat menjalankannya dengan cara yang diasumsikan doc.
Harga:
- Gratis, Apache 2.
Platform: Linux (biasanya Docker dengan toolkit kontainer NVIDIA).
Unduh: github.com/vllm-project/vllm
Garis bawah: Pilihan ketika “NAS” adalah kotak Linux dengan GPU nyata yang melayani lab rumah klien.
8. llama.cpp, terbaik untuk inferensi CPU bare-metal
llama.cpp adalah runtime tingkat rendah yang semuanya di daftar ini bungkus. Berjalan pada build NAS hanya CPU di mana GPU nyata tidak ada, dengan model yang terkuantisasi yang menyusutkan model parameter 8B menjadi beberapa gigabyte.
Di mana terjadi kekurangan: tidak ada UI. Itu adalah biner server dan CLI. Pasangkan dengan Open WebUI atau Ollama.
Harga:
- Gratis, MIT.
Platform: Apa saja (Linux, macOS, Windows, ARM termasuk Raspberry Pi dan Apple Silicon).
Unduh: github.com/ggerganov/llama.cpp
Garis bawah: Pilihan yang tepat ketika NAS hanya CPU dan setiap gigabyte RAM penting.
Cara memilih yang tepat
- Instalasi satu perintah di NAS: Ollama.
- Obrolan web bersama untuk rumah tangga: Ollama ditambah Open WebUI.
- Titik akhir yang kompatibel dengan OpenAI yang dapat dipanggil SDK apa pun: LocalAI.
- Penukaran model titik dan klik: LM Studio.
- Kontrol sampling dan LoRA: Text Generation WebUI.
- Klien desktop lokal mengenai NAS: Jan.
- Throughput GPU serius untuk banyak klien: vLLM.
- NAS hanya CPU: llama.cpp.
Pertanyaan yang Sering Diajukan
Model mana yang berjalan di NAS tanpa GPU?
Versi terkuantisasi Gemma, Llama, atau Mistral dalam kisaran 3B-8B berjalan pada CPU NAS modern dengan beberapa token per detik. Itu lambat untuk obrolan interaktif, baik untuk ringkasan sekali jalan atau pekerjaan malam hari.
Apakah saya memerlukan GPU di NAS saya?
Hanya untuk kecepatan interaktif. NAS hanya CPU masih menjalankan model kecil; waktu respons duduk pada beberapa detik per kalimat daripada token per detik.
Bisakah saya menjaga model yang dihosting NAS pribadi ke LAN saya?
Ya. Ollama, LM Studio, dan LocalAI mengikat ke antarmuka LAN secara default. Tambahkan auth dasar atau proxy terbalik untuk apa pun lebih dari LAN rumah.
Berapa banyak ruang disk yang dibutuhkan model lokal?
Model 8B yang terkuantisasi duduk di sekitar 5 GB. Model 70B yang terkuantisasi duduk lebih dekat ke 40 GB. NAS dengan volume senggang 500 GB menampung perpustakaan penuh.
Bisakah beberapa orang menggunakan model pada saat yang sama?
Ollama, LocalAI, dan Text Generation WebUI semuanya menserialisasi secara default. vLLM menangani permintaan bersamaan secara asli. Untuk keluarga kecil, serialisasi baik-baik saja.
Bagaimana dengan privasi?
Setiap aplikasi di daftar ini menjalankan model secara lokal. Tidak ada prompt atau respons yang dikirim ke pihak ketiga kecuali aplikasi dikonfigurasi untuk melakukannya.