Minggu ini seorang penulis XDA memperhatikan bahwa build VS Code terbaru diam-diam mengirimkan model pengucapan lokal. Tidak ada putaran cloud, tidak ada kunci API OpenAI, tidak ada data yang meninggalkan mesin. Transkripsi itu, menurut kata-kata mereka, “sangat bagus.” Cerita itu sejalan dengan apa yang terjadi di dunia pengucapan sumber terbuka yang lebih luas selama dua tahun terakhir: model kelas Whisper sekarang berjalan di laptop, secara real-time, tanpa mengirim audio ke mana pun.
Kami menguji tujuh aplikasi desktop untuk voice-to-code offline dan diktasi di 2026. Setiap satu dari mereka menyimpan audio di perangkat. Beberapa dibangun khusus untuk pembuat kode. Sisanya adalah alat diktasi umum yang terhubung ke editor.
Apa yang penting dalam aplikasi voice-to-code offline
- Semuanya di perangkat. Audio dan transkripsi keduanya tetap di mesin, dapat diverifikasi dengan kabel jaringan dicabut.
- Kesadaran kode nyata. Menamakan variabel “cammel case getUserId” harus menghasilkan
getUserId, bukan “camel case get user id”. - Mode perintah. Tata bahasa suara untuk perintah editor: “baris 42”, “hapus kata”, “jalankan tes”.
- Latensi rendah. Transkripsi streaming di bawah 500ms terasa dapat digunakan. Apa pun lebih dari satu detik dan kami berhenti mempercayainya.
- Akurasi lintas platform. Kualitas model turun pada bahasa non-Latin dan aksen berat. Aplikasi yang baik memungkinkan kami memilih model yang lebih besar ketika kami membutuhkannya.
- Integrasi editor. Dukungan VS Code, JetBrains, dan terminal mencakup sebagian besar alur kerja.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Paket gratis | Harga mulai | Platform |
|---|---|---|---|---|
| whisper.cpp | Transkripsi Whisper bare-metal di mana saja | Aplikasi lengkap | Gratis, sumber terbuka | Windows, macOS, Linux |
| Talon Voice | Coding hands-free dengan tata bahasa nyata | Tingkat gratis | Sekitar $15/bulan Pro (opsional) | Windows, macOS, Linux |
| Serenade | Perintah suara di dalam VS Code | Tingkat gratis | Sekitar $10/bulan Pro | Windows, macOS, Linux |
| Vosk | Model kecil yang dapat disematkan | Toolkit lengkap | Gratis, sumber terbuka | Windows, macOS, Linux |
| WhisperKit | Whisper native Apple Silicon | Framework lengkap | Gratis, sumber terbuka | macOS |
| Wispr Flow | Diktasi sistem luas dengan polish | Uji coba 7 hari | Sekitar $12/bulan | macOS, Windows |
| SuperWhisper | Menu-bar Whisper offline di macOS | Tingkat gratis | Sekitar $9 sekali atau lifetime tier | macOS |
Aplikasi-aplikasi
1. whisper.cpp — Transkripsi bare-metal offline terbaik
whisper.cpp adalah port C++ dari Whisper OpenAI oleh Georgi Gerganov. Berjalan di CPU, di Apple Silicon melalui Metal, dan di GPU Nvidia melalui CUDA. Transkripsi streaming real-time bekerja dengan model small.en atau medium.en di laptop mana pun dari lima tahun terakhir. Seluruh runtime adalah satu biner; Python tidak diperlukan.
Di mana ini jatuh pendek: ini adalah library, bukan GUI. Mendapatkan teks ke aplikasi target berarti menggunakan skrip yang mengalirkan ke wl-copy, xdotool, atau AppleScript.
Harga:
- Gratis: Kode sumber lengkap, lisensi MIT
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: whisper.cpp di GitHub
Kesimpulannya: Setiap alat diktasi offline dalam daftar ini baik menggunakan whisper.cpp di bawah tenda atau bersaing dengannya. Mulai di sini.
2. Talon Voice — Coding hands-free terbaik
Talon Voice adalah apa yang digunakan pengembang RSI jangka panjang untuk menulis kode sepenuhnya dengan suara. Sistem tata bahasa memahami camelCase, snake_case, SCREAMING_SNAKE, dan setiap gerakan editor yang bisa kami minta. Talon berjalan offline secara default dengan mesin pengucapan on-device miliknya sendiri (model Conformer, bukan Whisper).
Di mana ini jatuh pendek: kurva pembelajaran itu nyata. Menulis tata bahasa yang dipersonalisasi memerlukan sore sebelum aplikasi terbayar. Paket bahasa yang dikelola komunitas (talon-community) sangat penting.
Harga:
- Gratis: Aplikasi lengkap untuk penggunaan pribadi
- Berbayar: Tingkat pendukung sekitar $15/bulan membuka model yang lebih besar dan pembaruan prioritas (opsional)
Platform: Windows, macOS, Linux
Unduh: Unduhan Talon Voice
Kesimpulannya: Standar emas untuk coding hands-free. Jika kami menulis untuk menghasilkan uang, Talon layak untuk minggu setup.
3. Serenade — Pengeditan bersuara terbaik di VS Code
Serenade duduk di dalam VS Code, IDE JetBrains, dan terminal, mendengarkan perintah terstruktur (“add function foo taking user”), dan menghasilkan kode yang sesuai. Menjalankan model pengucapan lokal di perangkat keras modern.
Di mana ini jatuh pendek: tingkat gratis membatasi menit suara harian. Tata bahasa perintah lebih ketat daripada Talon; diktasi bentuk bebas bukan kekuatannya.
Harga:
- Gratis: Menit suara harian terbatas
- Berbayar: Pro sekitar $10/bulan
Platform: Windows, macOS, Linux
Unduh: Unduhan Serenade
Kesimpulannya: Untuk pengeditan suara ringan di IDE mainstream, Serenade memerlukan lebih sedikit setup daripada Talon.
4. Vosk — Toolkit pengucapan offline kecil terbaik
Vosk adalah toolkit pengenalan suara Alpha Cephei. Model dimulai pada 50MB (lebih kecil dari model kecil whisper.cpp) dan berjalan di perangkat keras Raspberry Pi. Binding native Python, Node, C#, Java, dan Go.
Di mana ini jatuh pendek: akurasi di bawah model kelas Whisper pada bahasa Inggris umum. Paling cocok untuk tata bahasa perintah, kata bangun, dan kosakata terbatas.
Harga:
- Gratis: Toolkit lengkap dan model default (Apache 2.0)
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux, Android, iOS
Unduh: Unduhan Vosk
Kesimpulannya: Bukan pilihan untuk diktasi gratis. Sempurna untuk skrip kata bangun atau tata bahasa perintah ketat ke aplikasi yang sudah ada.
5. WhisperKit — Stack Whisper Apple Silicon terbaik
WhisperKit adalah paket Swift dari Argmax yang menjalankan Whisper di Apple Neural Engine. Di Mac seri M, medium.en mentranskrip pada 30 hingga 60x waktu nyata menggunakan watt satu digit.
Di mana ini jatuh pendek: hanya macOS. Membangun di atasnya berarti menulis Swift.
Harga:
- Gratis: Kode sumber lengkap, MIT
- Berbayar: Tidak ada
Platform: macOS, iOS
Unduh: WhisperKit di GitHub
Kesimpulannya: Library yang setiap aplikasi diktasi Mac serius gunakan sekarang. Bukan sesuatu yang kami instal secara langsung, tetapi alasan mengapa SuperWhisper dan Wispr Flow terasa instan di Apple Silicon.
6. Wispr Flow — Diktasi sistem luas yang dipoles terbaik
Wispr Flow adalah hal terdekat dengan pengalaman “cukup bicara ke bidang teks apa pun”. Pemicu dengan hotkey, bicara, lepaskan, dan teks yang ditranskrip dimasukkan di mana kursor berada. Tanda baca, kapitalisasi, dan pemformatan ramah kode semuanya terjadi di perangkat.
Di mana ini jatuh pendek: berbayar setelah uji coba. macOS adalah build matang; Windows masih mengejar opsi model dan kontrol menu-bar.
Harga:
- Gratis: Uji coba 7 hari
- Berbayar: Sekitar $12/bulan
Platform: macOS, Windows
Unduh: Situs resmi Wispr Flow
Kesimpulannya: Jika diktasi harus terasa seperti bagian dari OS, ini adalah opsi berbayar dengan gesekan paling sedikit.
7. SuperWhisper — Menu-bar Whisper offline terbaik di macOS
SuperWhisper adalah aplikasi menu-bar mandiri yang menjalankan Whisper secara lokal, mentranskrip ke bidang teks aktif apa pun, dan dapat memproses ulang keluaran dengan LLM on-device (Ollama, LM Studio, atau model on-device Apple).
Di mana ini jatuh pendek: hanya macOS. Harga satu kali akan menjadi sederhana untuk aplikasi hanya Mac, tetapi tingkat “lifetime” upgrade masih ada dan layak biayanya untuk pengguna sehari-hari.
Harga:
- Gratis: Tingkat dasar dengan model default
- Berbayar: Sekitar $9 sekali atau lifetime tier untuk katalog model yang lebih besar
Platform: macOS
Unduh: Situs resmi SuperWhisper
Kesimpulannya: Pengguna Mac yang menginginkan diktasi offline tanpa pipa: instal ini dalam lima menit dan lewati sisanya.
Cara memilih yang tepat
- Kami menginginkan opsi gratis terbaik, lintas platform: whisper.cpp, didorong dari skrip wrapper kecil.
- Kami menulis kode sepenuhnya dengan suara: Talon Voice.
- Kami menginginkan perintah suara di dalam VS Code secara spesifik: Serenade.
- Kami menggunakan Mac dan menginginkan nol setup: SuperWhisper atau Wispr Flow.
- Kami menyematkan pidato ke aplikasi yang sudah ada: Vosk (jejak kecil) atau WhisperKit (Apple Silicon).
FAQ
Apakah pengucapan offline benar-benar sebaik diktasi cloud? Untuk bahasa Inggris, whisper-large-v3 yang berjalan secara lokal berada dalam jarak rambut dari apa yang dikembalikan layanan diktasi cloud. Bahasa non-Inggris masih tertinggal dari penawaran cloud, tetapi celah terus menyusut setiap rilis model.
Bisakah saya menjalankan ini di CPU tanpa GPU? Ya. whisper.cpp, Vosk, Talon, dan Serenade semuanya berjalan di CPU. Whisper-medium berjalan pada kecepatan waktu nyata di CPU laptop modern apa pun.
Apa perbedaan antara Whisper dan Vosk? Whisper adalah model berbasis transformer besar yang dilatih pada audio multibahasa; akurasi tinggi, model lebih berat. Vosk menggunakan model yang lebih kecil, dioptimalkan untuk streaming; akurasi lebih rendah untuk diktasi umum tetapi latensi dan jejak lebih baik untuk penggunaan embedded.
Apakah ada di antara ini yang menyimpan audio di perangkat selamanya? Ya. whisper.cpp, Vosk, WhisperKit, Talon (dalam konfigurasi default), dan SuperWhisper semuanya offline. Serenade dan Wispr Flow default ke model on-device tetapi periksa pengaturan jika kami menangani audio sensitif.
Apakah diktasi lebih cepat daripada mengetik? Untuk prosa, ya, setelah kami beradaptasi. Untuk kode, ini cocok dengan mengetik sentuh setelah beberapa jam latihan dengan Talon atau Serenade. Kemenangan yang lebih besar adalah dapat bekerja melalui cedera pergelangan tangan tanpa kehilangan hari.