Aplikasi smart speaker self-hosted

Sebuah artikel XDA baru-baru ini membuat poin kecil namun benar tentang smart home self-hosted: semuanya memiliki pilihan lokal yang baik, kecuali speaker. Google Nest dan Amazon Echo telah menjadi jalan yang paling mudah untuk kontrol suara, dan setiap lapisan rumah lainnya — lampu, sensor, kamera — memiliki alternatif terbuka yang jelas mengungguli mereka. Aplikasi terbaik untuk smart speaker self-hosted di desktop menutup celah terakhir ini.

Kami menguji tujuh aplikasi dan stack di Windows, macOS, dan Linux yang menambahkan kontrol suara lokal, deteksi wake-word, dan audio multi-room ke smart home self-hosted. Masing-masing mencakup bagian yang berbeda dari pipeline “hei speaker, lakukan sesuatu”: wake word, speech-to-text, penanganan intent, text-to-speech, dan pemutaran multi-room. Pilih berdasarkan bagian yang paling kita butuhkan untuk diselesaikan.

Apa yang harus dicari dalam stack smart speaker self-hosted

Speaker yang menggantikan Nest atau Echo memiliki lebih banyak bagian daripada sekadar “pasang satu aplikasi”. Aplikasi yang melakukan ini dengan baik memiliki beberapa properti:

Perbandingan cepat

Aplikasi Terbaik untuk Platform Paket gratis Harga mulai/bln Rating
Home Assistant Assist Pipeline suara end-to-end yang terikat ke Home Assistant Windows, macOS, Linux, Docker Sepenuhnya gratis, open source Gratis (cloud Nabu Casa opsional) 4.8 / 5
Rhasspy 3 Toolkit voice assistant modular Linux, Docker Sepenuhnya gratis, open source Gratis Referensi komunitas
Willow Berbasis ESP32 ditambah server untuk kontrol suara lokal yang murah Server Linux + perangkat ESP32 Sepenuhnya gratis, open source Gratis GitHub
openWakeWord Mesin wake-word kustom yang mengungguli yang komersial Windows, macOS, Linux Sepenuhnya gratis, open source Gratis GitHub
Snapcast Server audio multi-room yang tersinkronisasi Windows, macOS, Linux, Android Sepenuhnya gratis, open source Gratis 4.7 / 5
Music Assistant Server perpustakaan musik untuk Home Assistant Linux, Docker Sepenuhnya gratis, open source Gratis 4.6 / 5
Mycroft OVOS Fork komunitas Mycroft dengan stack asisten lengkap Linux, Docker Sepenuhnya gratis, open source Gratis Referensi komunitas

Piper TTS disertakan dalam bagian cara memilih sebagai pilihan suara terbaik saat ini untuk text-to-speech.

Aplikasi-aplikasi

1. Home Assistant Assist

Home Assistant Assist adalah lapisan asisten yang tersedia dengan Home Assistant, dan pada 2026 ini adalah stack smart speaker open-source yang paling lengkap. Assist menggabungkan deteksi wake-word (melalui openWakeWord), speech-to-text (melalui Whisper), penanganan intent (native, diperluas oleh add-on HA apa pun), dan text-to-speech (melalui Piper). Voice PE, perangkat Home Assistant Voice Preview Edition, adalah speaker siap pakai jika kami tidak ingin mencari perangkat keras. Speaker Satelit berbasis ESP32 atau yang mendukung protokol Wyoming juga berfungsi.

Kekurangan: Integrasi LLM Assist untuk pertanyaan open-ended masih memerlukan konfigurasi dan model cloud atau lokal. Mesin intent standar sangat baik untuk perintah smart-home dan kurang berguna untuk kueri pengetahuan umum.

Harga:

Platform: Windows, macOS, Linux, Docker (sebagai host HA)

Unduh: Home Assistant

Garis bawah: pilihan yang masuk akal untuk smart speaker self-hosted pada 2026.

2. Rhasspy 3

Rhasspy 3 adalah toolkit voice assistant modular yang dibangun oleh pengelola yang sekarang bekerja pada Home Assistant Assist. Desainnya adalah serangkaian tahapan (audio masuk, wake word, STT, intent, TTS, audio keluar) yang terhubung satu sama lain melalui event bus. Rhasspy berada di ujung “buat sendiri” dari spektrum dan memberi penghargaan kepada siapa pun yang menginginkan kontrol penuh atas model mana yang menjalankan setiap tahapan.

Kekurangan: pekerjaan setup itu nyata. Ini lebih merupakan toolkit daripada produk. Dokumentasi telah ditingkatkan pada 2026 tetapi masih mengasumsikan kenyamanan dengan terminal.

Harga:

Platform: Linux, Docker

Unduh: Rhasspy 3

Garis bawah: pilihan untuk seseorang yang ingin menyusun asisten sendiri.

3. Willow

Willow adalah stack perangkat keras plus server untuk kontrol suara lokal yang murah. Klien berjalan di papan pengembang ESP32-S3 dengan array mikrofon kecil, melakukan streaming audio ke Willow Inference Server lokal (yang berjalan di kotak x86 sederhana dengan atau tanpa GPU), dan terintegrasi dengan Home Assistant, openHAB, dan MQTT out of the box. Untuk penerapan multi-room terdistribusi, biaya satelit Willow per unit adalah sebagian kecil dari Nest Mini.

Kekurangan: tergantung pada perangkat keras ESP32 yang kami cari sendiri. Server inference dapat menguntungkan dari GPU, meskipun setup CPU-only berfungsi.

Harga:

Platform: Server Linux, klien ESP32-S3

Unduh: Willow

Garis bawah: pilihan untuk penerapan suara multi-room berbudget yang tinggal di LAN.

4. openWakeWord

openWakeWord adalah mesin wake-word yang digunakan Home Assistant Assist, Rhasspy 3, dan Mycroft OVOS dalam berbagai bentuk. Siapa pun yang menginginkan wake word kustom (“hei Jarvis,” “komputer,” nama keluarga) melatih model kecil dari beberapa puluh sampel dan memasukkannya ke dalam pipeline. False positives lebih rendah daripada mesin komersial karena model dilatih pada wake word spesifik kami daripada classifier umum.

Kekurangan: ini adalah library daripada aplikasi, jadi perlu ditanamkan ke dalam pipeline. Melatih wake word kustom yang bagus membutuhkan sekitar satu jam pengumpulan sampel.

Harga:

Platform: Windows, macOS, Linux, embedded

Unduh: openWakeWord

Garis bawah: pilihan ketika kami menginginkan wake word kustom yang tidak dapat ditawarkan Google dan Amazon.

5. Snapcast

Snapcast adalah server audio multi-room yang menjaga setiap speaker di LAN tersinkronisasi dalam beberapa milidetik. Arahkan sumber musik ke Snapcast (Music Player Daemon, Spotifyd, jembatan AirPlay, klien Squeezelite) dan audio distream ke setiap klien Snapcast — Raspberry Pi dengan DAC, ponsel, PC Windows, tablet Android lama yang menjalankan klien Snapcast Android. Untuk smart home self-hosted, Snapcast adalah bagian yang memungkinkan satu perintah suara memutar musik di setiap ruangan.

Kekurangan: setup adalah latihan file konfigurasi. Pengganti modern (Music Assistant, ekosistem gaya HomePod) menyembunyikan lebih banyak plumbing.

Harga:

Platform: Windows, macOS, Linux, klien Android, iOS

Unduh: Snapcast

Garis bawah: pilihan untuk audio multi-room tersinkronisasi tanpa langganan.

6. Music Assistant

Music Assistant adalah add-on Home Assistant yang menyatukan sumber musik (Spotify Connect, Tidal, Qobuz, YouTube Music, Plex, file lokal, SomaFM) ke dalam satu antrian dan merutekan pemutaran ke media player Home Assistant apa pun — satelit Snapcast, Google Cast, Sonos, AirPlay, speaker ESPHome. Ini adalah lapisan yang mengikat “hei Assist, putar Radiohead di dapur” ke mesin musik nyata.

Kekurangan: tergantung pada Home Assistant. Penggunaan standalone dimungkinkan tetapi nilai utama ada di dalam HA. Beberapa integrasi sumber streaming memerlukan kredensial per pengguna.

Harga:

Platform: Linux (sebagai add-on HA), Docker

Unduh: Music Assistant

Garis bawah: pilihan untuk menjawab perintah musik yang dipicu suara dengan sumber streaming nyata.

7. Mycroft OVOS

Mycroft OVOS (OpenVoiceOS) adalah fork komunitas Mycroft yang bertahan dari shutdown proyek asli dan sekarang memelihara stack asisten lengkap: wake word, STT, intent, TTS, dan marketplace keterampilan. OVOS berjalan di Raspberry Pi, Mycroft Mark II jika kita memilikinya, atau kotak Linux standar, dan berfederasi dengan Home Assistant melalui jembatan yang terdokumentasi.

Kekurangan: komunitas lebih kecil dari Home Assistant. Beberapa keterampilan lebih lama dan bergantung pada API yang telah berubah.

Harga:

Platform: Linux, Docker, Raspberry Pi

Unduh: OpenVoiceOS

Garis bawah: pilihan untuk stack asisten standalone lengkap ketika Home Assistant Assist bukan bentuk yang tepat.

Cara memilih stack smart speaker self-hosted yang tepat

Untuk suara text-to-speech itu sendiri, Piper TTS adalah pilihan open-source terbaik saat ini dan default di Home Assistant Assist. Ini dilengkapi dengan suara neural berkualitas tinggi dalam banyak bahasa dan berjalan di CPU sederhana apa pun.

Setup pemula 2026 yang paling kuat untuk sebagian besar orang adalah Home Assistant Assist dengan openWakeWord, Whisper untuk STT, Piper untuk TTS, Music Assistant untuk pemutaran, dan Snapcast untuk multi-room. Kombinasi itu menggantikan rumah tangga speaker Nest atau Echo dengan stack yang tinggal sepenuhnya di LAN.

FAQ

Bisakah smart speaker self-hosted menggantikan Google Nest atau Amazon Echo? Untuk perintah smart-home, ya. Untuk kueri open-ended (“siapa Marie Curie?”), tergantung apakah kami memasang LLM lokal (Ollama, LM Studio) atau model cloud. Celah dalam kontrol smart-home telah menutup; celah dalam pengetahuan umum adalah pilihan konfigurasi.

Apakah smart speaker self-hosted berfungsi offline? Ya. Home Assistant Assist dengan Whisper lokal, Piper, dan openWakeWord berjalan sepenuhnya tanpa koneksi internet untuk perintah smart-home. Beberapa keterampilan (cuaca, berita) masih memerlukan akses internet untuk menjangkau sumber data mereka.

Perangkat keras apa yang saya butuhkan untuk smart speaker self-hosted? Minimum adalah Raspberry Pi 4 atau 5 sebagai server, mikrofon USB, dan speaker bertenaga apa pun. Untuk multi-room, satelit ESP32-S3 Willow ditambah server inference x86 sederhana atau perangkat Home Assistant Voice PE adalah pilihan saat ini.

Apakah Home Assistant Assist gratis? Ya. Home Assistant Assist sepenuhnya gratis dan open source. Nabu Casa Cloud adalah langganan berbayar opsional yang menambahkan akses jarak jauh dan STT/TTS cloud sebagai kenyamanan; itu tidak diperlukan.

Bisakah saya menggunakan speaker Google atau Amazon saya dengan Home Assistant? Ya, sebagai media players. Home Assistant terintegrasi dengan Google Cast dan Alexa untuk pemutaran dan beberapa kontrol, tetapi voice assistant pada perangkat itu sendiri masih merutekan ke Google atau Amazon. Untuk memindahkan asisten dari Google atau Amazon, kami memerlukan speaker self-hosted.

Mesin text-to-speech mana yang terdengar paling baik? Piper adalah pilihan saat ini untuk TTS open-source pada 2026. Menawarkan berbagai suara neural per bahasa, berjalan cepat di CPU, dan terintegrasi langsung dengan Home Assistant Assist dan Rhasspy 3.