Ollama, salah satu aplikasi yang digunakan untuk menjalankan LLM lokal di NAS

Gemma 4 di laptop sangat responsif. GPU melakukan tugasnya, jawaban datang dalam hitungan detik, dan model terasa seperti asisten nyata. Pindahkan ke NAS dan model akan melambat cukup untuk membuat pertanyaan menjadi komitmen kecil. Perbedaan itulah yang penting. Ketika model berada di penyimpanan bersama, seluruh keluarga atau tim dapat memanggilnya, dan latensi tambahan satu detik mengubahnya kembali menjadi alat alih-alih refleks.

Kami memilih delapan aplikasi yang kami jalankan di NAS untuk menjalankan LLM lokal hari ini. Beberapa adalah server, beberapa adalah front-end, beberapa adalah lapisan penyebaran. Bersama-sama, mereka mencakup alur kerja dari mengunduh model hingga keluarga klien memanggil titik akhir bersama.

Apa yang harus diperhatikan dalam aplikasi LLM yang dihosting di NAS

Kedelapan di bawah memenuhi setidaknya empat dari lima. Peringkat mengurutkan mereka berdasarkan seberapa mudah untuk menjalankannya di Synology, QNAP, atau NAS yang dibangun sendiri.

Perbandingan cepat

Aplikasi Terbaik untuk Berjalan di Dukungan GPU Lisensi
Ollama Server NAS termudah Linux, macOS, Windows CUDA, Metal, ROCm MIT
LM Studio Host model titik dan klik Linux, macOS, Windows CUDA, Metal, ROCm Proprietary (free)
Open WebUI Front-end web bersama Docker Melalui backend MIT
LocalAI Drop-in kompatibel OpenAI Docker CUDA, ROCm, CPU MIT
Text Generation WebUI Penyetelan pengguna power Linux, macOS, Windows CUDA, ROCm, CPU AGPL
Jan Klien desktop lokal-pertama Windows, macOS, Linux CUDA, Metal, CPU AGPL
vLLM Inferensi throughput tinggi Linux CUDA (GPU server) Apache 2
llama.cpp Inferensi CPU bare-metal Apa saja Apa saja MIT

1. Ollama, terbaik untuk server NAS termudah

Ollama adalah hal terdekat dengan pemasangan satu perintah untuk NAS. Gambar Docker, port 11434, dan setiap klien yang berbicara dengan Ollama atau API OpenAI dapat berbicara dengannya. Perpustakaan model mencakup Llama, Gemma, Mistral, Qwen, dan daftar varian instruct yang berkembang.

Di mana terjadi kekurangan: kontrol sampling butir halus disembunyikan di balik bendera. Siapa pun yang ingin menukar template prompt dengan tangan berakhir dalam sintaks modelfile.

Harga:

Platform: Linux, macOS, Windows (semuanya sebagai Docker atau asli).

Unduh: ollama.com

Garis bawah: Rekomendasi standar untuk siapa pun yang memberdirikan LLM NAS untuk pertama kali.

2. LM Studio, terbaik untuk host model titik dan klik

LM Studio adalah aplikasi desktop yang juga menjalankan server yang kompatibel dengan OpenAI. Arahkan ke folder model yang dipasang di NAS, aktifkan server, dan klien di LAN dapat memanggilnya. GUI menyembunyikan bagian dari llama.cpp yang menakutkan orang.

Di mana terjadi kekurangan: itu adalah aplikasi desktop pertama-tama, jadi instalasi headless di NAS berarti menjalankannya di dalam server X ringan atau memilih NAS dengan layar untuk penyetelan.

Harga:

Platform: Windows, macOS, Linux.

Unduh: lmstudio.ai

Garis bawah: Pilihan yang tepat ketika anggota keluarga ingin mengubah model dan tidak ingin menyentuh terminal.

3. Open WebUI, terbaik untuk front-end web bersama

Open WebUI adalah antarmuka web bergaya ChatGPT untuk backend yang dihosting di NAS. Arahkan ke Ollama, LM Studio, atau LocalAI, tambahkan pengguna, dan setiap anggota rumah tangga mendapat obrolan mereka sendiri dan perpustakaan prompt bersama. RAG di atas file lokal dikirimkan dalam kotak.

Di mana terjadi kekurangan: itu adalah front-end, bukan runtime. Ollama atau LocalAI masih melakukan pekerjaan model.

Harga:

Platform: Docker di Linux, plus instalasi asli NAS melalui Portainer.

Unduh: openwebui.com

Garis bawah: Pasangan yang tepat dengan Ollama ketika tujuannya adalah obrolan keluarga yang dihosting bersama dan berbasis browser.

4. LocalAI, terbaik untuk drop-in kompatibel OpenAI

LocalAI membuka titik akhir yang kompatibel dengan OpenAI (chat, embeddings, images, TTS) terhadap model lokal. Aplikasi apa pun yang berbicara dengan API OpenAI dapat berbicara dengannya tanpa perubahan. Backend mencakup llama.cpp, whisper.cpp, dan stable-diffusion.cpp.

Di mana terjadi kekurangan: file konfigurasi sangat padat dan setiap model memerlukan entri tersendiri. Ollama menangani pemetaan untuk Anda.

Harga:

Platform: Docker di Linux, plus build asli untuk Windows dan macOS.

Unduh: localai.io

Garis bawah: Server yang tepat ketika kliennya adalah SDK OpenAI dan menukar URL dasar adalah seluruh migrasi.

5. Text Generation WebUI, terbaik untuk penyetelan pengguna power

Text Generation WebUI (oobabooga) adalah front-end yang lebih tua dan lebih kaya yang juga menjalankan server. Parameter sampling, pemuatan LoRA, dan template prompt gaya kartu karakter semuanya terbuka. Siapa pun yang ingin menyetel model di luar default duduk di sini.

Di mana terjadi kekurangan: UI telah dibangun kembali dua kali dan masih menunjukkan akar pengguna power-nya. Itu bukan alat yang Anda berikan kepada anggota keluarga.

Harga:

Platform: Windows, macOS, Linux.

Unduh: github.com/oobabooga/text-generation-webui

Garis bawah: Pilihan untuk siapa pun yang menginginkan tombol sampling yang Ollama dan LM Studio sembunyikan.

6. Jan, terbaik untuk klien desktop lokal-pertama

Jan adalah klien ChatGPT lokal-pertama. Dikirimkan dengan runtime-nya sendiri untuk NAS hanya CPU, tetapi juga berbicara dengan server Ollama atau LocalAI jarak jauh. Chat dan prompt tetap di disk, sehingga seluruh riwayat adalah file lokal.

Di mana terjadi kekurangan: sebagai server NAS, itu bukan kecocokan terkuat. Gunakan sebagai klien, dan biarkan Ollama atau LocalAI melakukan penyajian.

Harga:

Platform: Windows, macOS, Linux.

Unduh: jan.ai

Garis bawah: Pendamping desktop yang tepat ke server NAS untuk siapa pun yang tidak menginginkan tab web.

7. vLLM, terbaik untuk inferensi throughput tinggi

vLLM adalah server tingkat produksi. Perhatian bersifat halaman, paralelisme tensor, dan pengelompokan berkelanjutan membuatnya cara tercepat untuk melayani model besar kepada banyak klien. Tangkapannya adalah membutuhkan GPU nyata (Ampere atau lebih baru).

Di mana terjadi kekurangan: itu bukan instalasi yang ramah NAS. Chassis NAS tanpa GPU pusat data tidak dapat menjalankannya dengan cara yang diasumsikan doc.

Harga:

Platform: Linux (biasanya Docker dengan toolkit kontainer NVIDIA).

Unduh: github.com/vllm-project/vllm

Garis bawah: Pilihan ketika “NAS” adalah kotak Linux dengan GPU nyata yang melayani lab rumah klien.

8. llama.cpp, terbaik untuk inferensi CPU bare-metal

llama.cpp adalah runtime tingkat rendah yang semuanya di daftar ini bungkus. Berjalan pada build NAS hanya CPU di mana GPU nyata tidak ada, dengan model yang terkuantisasi yang menyusutkan model parameter 8B menjadi beberapa gigabyte.

Di mana terjadi kekurangan: tidak ada UI. Itu adalah biner server dan CLI. Pasangkan dengan Open WebUI atau Ollama.

Harga:

Platform: Apa saja (Linux, macOS, Windows, ARM termasuk Raspberry Pi dan Apple Silicon).

Unduh: github.com/ggerganov/llama.cpp

Garis bawah: Pilihan yang tepat ketika NAS hanya CPU dan setiap gigabyte RAM penting.

Cara memilih yang tepat

Pertanyaan yang Sering Diajukan

Model mana yang berjalan di NAS tanpa GPU?

Versi terkuantisasi Gemma, Llama, atau Mistral dalam kisaran 3B-8B berjalan pada CPU NAS modern dengan beberapa token per detik. Itu lambat untuk obrolan interaktif, baik untuk ringkasan sekali jalan atau pekerjaan malam hari.

Apakah saya memerlukan GPU di NAS saya?

Hanya untuk kecepatan interaktif. NAS hanya CPU masih menjalankan model kecil; waktu respons duduk pada beberapa detik per kalimat daripada token per detik.

Bisakah saya menjaga model yang dihosting NAS pribadi ke LAN saya?

Ya. Ollama, LM Studio, dan LocalAI mengikat ke antarmuka LAN secara default. Tambahkan auth dasar atau proxy terbalik untuk apa pun lebih dari LAN rumah.

Berapa banyak ruang disk yang dibutuhkan model lokal?

Model 8B yang terkuantisasi duduk di sekitar 5 GB. Model 70B yang terkuantisasi duduk lebih dekat ke 40 GB. NAS dengan volume senggang 500 GB menampung perpustakaan penuh.

Bisakah beberapa orang menggunakan model pada saat yang sama?

Ollama, LocalAI, dan Text Generation WebUI semuanya menserialisasi secara default. vLLM menangani permintaan bersamaan secara asli. Untuk keluarga kecil, serialisasi baik-baik saja.

Bagaimana dengan privasi?

Setiap aplikasi di daftar ini menjalankan model secara lokal. Tidak ada prompt atau respons yang dikirim ke pihak ketiga kecuali aplikasi dikonfigurasi untuk melakukannya.