Tulisan XDA minggu lalu berakhir di tempat setiap utas home-lab berakhir: hanya satu dari tujuh LLM lokal yang bertahan sebagai otak smart home ketika otomasi menjadi menarik. Sisanya baik halusinasi pada panggilan alat, melewatkan maksud “matikan lampu beranda”, atau berjalan begitu panas sehingga kipas NAS berputar selama berjam-jam. Model lokal di NAS adalah jawaban yang sah untuk kontrol suara, tetapi pilihan runtime lebih penting daripada pilihan model.
Kami menguji 7 aplikasi desktop yang berjalan di NAS rumah atau mini PC di LAN yang sama, mengekspos titik akhir yang kompatibel dengan OpenAI, dan berintegrasi dengan bersih dengan pipeline suara berbasis LLM Home Assistant. Semuanya di bawah ini berjalan offline setelah bobot diunduh, dan semuanya memiliki gambar Docker yang terdokumentasi.
Yang harus dicari
- API kompatibel OpenAI. Home Assistant’s Assist mengharapkannya, dan setiap alat lain di bawah ini menghubungkan dengan cara yang sama.
- Dukungan panggilan alat. Model yang tidak dapat mengeluarkan panggilan fungsi terstruktur tidak dapat mengalihkan cahaya.
- Dukungan model GGUF atau GPTQ. Jika NAS tidak memiliki GPU, Q4 GGUF di CPU adalah titik awal yang jujur.
- Jejak memori yang masuk akal. Model 7B Q4 harus tetap di bawah 6 GB RAM saat istirahat.
- Mulai hangat. Memuat dingin model 7B pada setiap perintah suara adalah lag lima detik yang Anda perhatikan.
- Pengelola proses yang stabil. NAS reboot mingguan untuk pembaruan; model harus kembali secara otomatis.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Platform | Paket gratis | Fitur unggulan |
|---|---|---|---|---|
| Ollama | Pelari default yang ditargetkan oleh sebagian besar panduan Home Assistant | Linux, macOS, Windows | Ya (open source) | Katalog model dan titik akhir OpenAI-kompatibel yang stabil |
| LocalAI | Drop-in all-in-one untuk API OpenAI, termasuk audio | Linux, macOS, Windows (Docker) | Ya (open source) | Menangani chat, embeddings, TTS, dan STT dari satu kontainer |
| LM Studio | GUI di host NAS dan server untuk LAN | Windows, macOS, Linux | Ya | Penemuan model dan toggle server satu klik |
| Open WebUI | Frontend chat web yang juga berbicara dengan Home Assistant | Linux, macOS, Windows (Docker) | Ya (open source) | Chat multi-pengguna dengan Ollama, LocalAI, atau backend kompatibel OpenAI apa pun |
| Home Assistant | Konsumen titik akhir | Windows, macOS, Linux (HAOS, Docker) | Ya | Integrasi Assist LLM asli dengan perutean panggilan alat |
| vLLM | Throughput terbaik di NAS dengan GPU | Linux (Docker) | Ya (open source) | Batching berkelanjutan dan perhatian berpaging untuk penggunaan multi-pengguna |
| llama.cpp | Pelari bare-metal C++ di balik sebagian besar di atas | Linux, macOS, Windows | Ya (open source) | Menjalankan GGUF di CPU di hampir semua hardware |
7 aplikasi terbaik untuk LLM smart home lokal di NAS
1. Ollama — pelari default terbaik dan yang paling ditargetkan panduan
Ollama membungkus llama.cpp dengan CLI yang bersih, perpustakaan model, dan server HTTP yang kompatibel dengan OpenAI yang terintegrasi dari kotak oleh integrasi Assist LLM Home Assistant. Instal di NAS, ollama pull qwen2.5:7b-instruct, dan arahkan Home Assistant ke http://<nas-ip>:11434. Pengelola layanan menjaganya tetap hangat di seluruh reboot.
Di mana itu kurang: Concurrency multi-pengguna adalah single-lane; permintaan paralel antri daripada batch. Dukungan Windows tiba baru-baru ini dan tertinggal Linux di stabilitas.
Harga:
- Gratis: open source di bawah MIT
- Berbayar: tidak ada untuk self-hosting
Platform: Linux, macOS, Windows (native dan Docker)
Unduh: ollama.com
Garis bawah: Pilih Ollama terlebih dahulu, dan hanya pergi ketika batasan tertentu mendorong Anda pergi.
2. LocalAI — terbaik jika Anda menginginkan chat, speech, dan embeddings dari satu kontainer
LocalAI adalah drop-in yang mencakup seluruh permukaan OpenAI: penyelesaian chat, embeddings, TTS, STT, dan pembuatan gambar, semuanya lokal. Protokol Wyoming Home Assistant dapat menunjuk ke titik akhir Whisper LocalAI untuk STT dan Piper untuk TTS, berarti seluruh loop suara hidup di NAS.
Di mana itu kurang: File config padat dan memerlukan bacaan pertama kali. Jalur akselerasi GPU (CUDA, ROCm, Vulkan) per-build dan memilih gambar yang salah memberikan fallback CPU yang senyap.
Harga:
- Gratis: open source di bawah MIT
- Berbayar: tidak ada
Platform: Linux, macOS, Windows (Docker)
Unduh: localai.io
Garis bawah: Pilih LocalAI jika tujuannya adalah tumpukan suara yang mandiri dengan STT, TTS, dan chat di bawah satu atap.
3. LM Studio — terbaik ketika UI yang lebih ramah memiliki bobot
LM Studio dimulai sebagai aplikasi chat desktop dan tumbuh menjadi mode server headless. Di NAS dengan tampilan atau sesi KVM jarak jauh, pemilih model dan pemilih quantisasi lebih pemaaf daripada CLI mentah. Server built-in mengekspos titik akhir kompatibel OpenAI yang diharapkan Home Assistant.
Di mana itu kurang: Aplikasi inti adalah sumber tertutup, yang merupakan penolakan tegas bagi beberapa setup home-lab. Mode headless tersedia tetapi masih warga negara kelas dua.
Harga:
- Gratis: aplikasi penuh
- Berbayar: tidak ada
Platform: Windows, macOS, Linux
Unduh: lmstudio.ai
Garis bawah: Pilih LM Studio jika Anda menginginkan UI untuk mencoba model sebelum menguncikan satu untuk peran smart-home.
4. Open WebUI — frontend chat terbaik yang menjaga manusia tetap terlibat
Open WebUI adalah frontend berbasis browser gaya ChatGPT yang berjalan terhadap Ollama, LocalAI, atau titik akhir yang kompatibel dengan OpenAI. Di NAS, berfungsi ganda sebagai permukaan pengujian: jalankan prompt terhadap model yang sama yang digunakan pipeline Assist, sesuaikan prompt sistem, kemudian perbarui Home Assistant. Dukungan multi-pengguna dengan peran menjaga keluarga tidak masuk ke konsol admin.
Di mana itu kurang: Ini adalah UI chat, bukan bagian dari path otomasi itu sendiri. Pengaturan memerlukan volume persisten dan proxy terbalik untuk akses LAN atau Tailscale.
Harga:
- Gratis: open source di bawah MIT
- Berbayar: tidak ada
Platform: Linux, macOS, Windows (Docker)
Unduh: openwebui.com
Garis bawah: Pilih Open WebUI sebagai chat menghadap manusia di atas runtime apa pun yang Anda tentukan.
5. Home Assistant — konsumen titik akhir terbaik
Home Assistant’s integrasi Assist LLM adalah apa yang mengubah “kitchen light on” menjadi panggilan alat. Arahkan ke Ollama, LocalAI, LM Studio, atau titik akhir kompatibel OpenAI apa pun, centang “expose to Assist” pada entitas yang ingin Anda kontrol model, dan suara berjalan sepenuhnya di LAN. Template prompt dapat diedit, yaitu bagaimana Anda menjaga model agar tidak hallusinasi ruangan.
Di mana itu kurang: Kualitas panggilan alat bergantung pada model, dan Home Assistant tidak akan memberi tahu Anda ketika model mengembalikan id entitas yang masuk akal tetapi salah. Debugging hidup di panel debug Assist dan membutuhkan waktu untuk menguasai.
Harga:
- Gratis: open source
- Berbayar: Cloud Nabu Casa opsional, tidak diperlukan untuk suara lokal
Platform: Windows, macOS, Linux (HAOS, Docker, VM)
Unduh: home-assistant.io
Garis bawah: Pilih Home Assistant karena LLM hanya menarik jika sesuatu bertindak atas outputnya, dan inilah sesuatunya.
6. vLLM — terbaik jika NAS memiliki GPU nyata
vLLM adalah runtime yang berfokus pada throughput. Batching berkelanjutan, perhatian berpaging, dan antrian multi-permintaan yang tepat mengubah kartu NVIDIA kecil menjadi titik akhir skala keluarga yang dapat melayani permintaan suara, tab Open WebUI, dan plugin Obsidian pada saat yang sama tanpa satu pun memblokir yang lain.
Di mana itu kurang: GPU saja, jadi NAS CPU-only keluar. Kompatibilitas model lebih sempit daripada Ollama dan menambahkan arsitektur baru adalah langkah build.
Harga:
- Gratis: open source di bawah Apache 2.0
- Berbayar: tidak ada
Platform: Linux (Docker)
Unduh: github.com/vllm-project/vllm
Garis bawah: Pilih vLLM jika NAS memiliki kartu NVIDIA yang didukung dan beberapa anggota keluarga akan memukul model secara bersamaan.
7. llama.cpp — pelari bare-metal terbaik untuk hardware terbatas
llama.cpp adalah proyek C++ yang mendukung sebagian besar runtime di atas. Menjalankannya langsung, dengan server HTTP built-in, adalah cara paling hemat untuk memeras model 7B ke Synology atau kotak ARM lama. Dukungan untuk Metal di Apple Silicon dan CUDA di NVIDIA membiarkan satu biner mencakup sebagian besar setup rumah.
Di mana itu kurang: Tidak ada manajemen model, tidak ada auto-update, tidak ada skrip layanan keluar dari kotak. Ini adalah toolkit, bukan produk.
Harga:
- Gratis: open source di bawah MIT
- Berbayar: tidak ada
Platform: Linux, macOS, Windows (source, binary, atau Docker)
Unduh: github.com/ggerganov/llama.cpp
Garis bawah: Pilih llama.cpp jika NAS kecil, OS tidak biasa, dan Anda menginginkan abstraksi paling sedikit atas file model.
Cara memilih
Jika Anda memulai dari awal, instal Ollama di NAS dan arahkan Home Assistant ke arah itu.
Jika stack suara membutuhkan STT dan TTS di kotak yang sama, tukar Ollama untuk LocalAI dan tarik gambar Whisper dan Piper.
Jika Anda menginginkan UI untuk membandingkan model sebelum berkomitmen, instal LM Studio dan gunakan mode server-nya.
Jika keluarga ingin mengobrol dengan model yang sama yang menjalankan otomasi, tambahkan Open WebUI di atas.
Jika NAS memiliki GPU NVIDIA dan lebih dari satu pengguna berat, beralih ke vLLM untuk concurrency.
Jika hardware tidak biasa kecil dan setiap megabita penting, jalankan llama.cpp langsung.
FAQ
Bisakah saya benar-benar menjalankan model yang berguna di NAS?
Ya. Model 7B Q4 di llama.cpp di CPU delapan inti modern menghasilkan kecepatan yang dapat dibaca untuk respons perintah suara pendek. Jika NAS memiliki 16 GB RAM dan cache NVMe, model dimuat dalam hitungan detik setelah start hangat. Untuk chat atau penalaran panjang, tambahkan GPU.
Model mana yang menangani panggilan alat Home Assistant terbaik?
Qwen 2.5 Instruct, Llama 3.1 8B Instruct, dan Hermes-3-Llama adalah opsi lokal yang andal pada ukuran 7B-8B. Di bawah 7B, pemformatan panggilan alat mulai rusak. Uji dengan panel debug Assist pada segelintir perintah realistis sebelum berkomitmen.
Apakah model melihat seluruh status rumah saya?
Hanya entitas yang Anda secara eksplisit ekspos ke Assist. Togel eksposur adalah per-entitas, jadi cahaya di kantor tidak harus bocor ke konteks model. Jaga set yang terekspos tetap kecil; prompt lebih murah dan model membuat lebih sedikit kesalahan.
Apa yang terjadi ketika internet turun?
Tidak ada yang berubah. STT, LLM, dan TTS semuanya berjalan di NAS, jadi kontrol suara terus bekerja. Satu-satunya path yang membutuhkan WAN adalah akses jarak jauh, dan Cloud Nabu Casa atau VPN self-hosted keduanya memperbaikinya secara terpisah.