
Aplikasi terbaik untuk menjalankan LLM terukuantisasi on-device di Android tahun 2026
Q4_K_M, Q5_K_S, Q8_0. Jika label-label itu belum bermakna bagi Anda, inilah alasan mengapa model dengan 7 miliar parameter kini pas di ponsel 6 GB. Kuantisasi mengurangi bobot model dari 16-bit float menjadi 4-bit integer, yang menyusutkan model chat dari 14 GB menjadi di bawah 5 GB dan memungkinkan ponsel Anda menjalankannya tanpa tagihan API cloud.
Kami menguji tujuh aplikasi di Pixel 8 dan tablet Snapdragon 8 Gen 2. Yang kami perhatikan: aplikasi mana yang memuat bobot GGUF dan MLC terukuantisasi tanpa laptop di tengah-tengahnya, mana yang berjalan offline dalam mode pesawat, dan mana yang tetap lancar tanpa thermal-throttling.
Apa yang harus dicari di aplikasi LLM on-device
- Dukungan format kuantisasi umum: GGUF (gaya llama.cpp) atau MLC (kernel terkompilasi).
- Katalog model yang bisa Anda telusuri tanpa menempel URL Hugging Face.
- Riwayat chat persisten disimpan secara lokal, bukan dialirkan ke server.
- Pembacaan token-per-detik, sehingga Anda tahu kapan model terlalu berat untuk ponsel.
- Toggle inferensi CPU vs GPU vs NPU, karena NPU Snapdragon 8-series dapat menggandakan throughput.
- Operasi mode pesawat. Jika membutuhkan Wi-Fi untuk menjawab “halo”, itu bukan on-device.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Paket gratis | Harga mulai/bulan | Rating |
|---|---|---|---|---|
| MLC Chat | Kernel MLC terkompilasi, throughput terbaik | Ya (open source) | Gratis | 4,4 |
| PocketPal AI | Model GGUF dengan katalog yang ramah | Ya (open source) | Gratis | 4,6 |
| Layla | Chat roleplay dan konteks panjang | Tier gratis | $9,99 sekali beli | 4,5 |
| Sherpa | Shell llama.cpp minimal | Ya (open source) | Gratis | 4,2 |
| LLMFarm Companion | Sinkronisasi model lintas perangkat | Ya | $4,99 sekali beli | 4,3 |
| ChatterUI | Frontend chat multi-model | Ya (open source) | Gratis | 4,5 |
| Enchanted | Frontend untuk server Ollama rumah | Ya (open source) | Gratis | 4,4 |
Aplikasinya
1. MLC Chat — Terbaik untuk kernel MLC terkompilasi dan throughput teratas
MLC Chat dilengkapi dengan model pra-kompilasi yang disesuaikan untuk GPU Adreno atau Mali spesifik di ponsel Anda. Langkah kompilasi itulah yang memungkinkan model Phi dengan 3 miliar parameter berjalan pada 15+ token/detik di Pixel 8, kira-kira dua kali lipat dari apa yang dicapai runtime GGUF generik. Katalog dalam aplikasi ini pendek namun dikurasi: Llama, Phi, Gemma, Mistral, RedPajama.
Kekurangannya: Tidak ada dukungan untuk file GGUF arbitrer. Jika Anda sudah memiliki model yang diunduh, Anda tidak dapat memuatnya di sini tanpa mengkompilasi ulang untuk MLC.
Harga:
- Gratis: Apache 2.0 open source.
- Berbayar: N/A.
Platform: Android 8.0 dan lebih tinggi.
Kesimpulannya: Dapatkan MLC Chat ketika token-per-detik maksimal penting dan Anda bisa hidup dengan katalog tetap.
2. PocketPal AI — Terbaik untuk model GGUF dengan katalog ramah
PocketPal AI memuat GGUF apa pun yang Anda tunjukkan. Pencarian dalam aplikasi menjelajahi Hugging Face tanpa beralih ke browser, dan layar unduhan menampilkan tier kuantisasi, ukuran, dan estimasi token-per-detik kasar untuk perangkat Anda sebelum Anda berkomitmen 4 GB ke disk. Riwayat chat tetap di perangkat.
Kekurangannya: Akselerasi GPU tertinggal MLC di ponsel yang sama. Percakapan konteks panjang dengan cepat menghabiskan RAM di perangkat 6 GB.
Harga:
- Gratis: Open source berlisensi MIT.
- Berbayar: N/A.
Platform: Android 9.0 dan lebih tinggi.
Kesimpulannya: Cara paling ramah untuk pemula baru di kuantisasi GGUF di Android.
3. Layla — Terbaik untuk roleplay dan chat konteks panjang
Layla menargetkan komunitas roleplay dan penulisan cerita panjang. Dilengkapi dengan template prompt, impor character-card, dan jendela konteks default yang lebih besar disesuaikan untuk menjaga kontinuitas cerita di banyak putaran. Menjalankan GGUF secara lokal; tier berbayar menambahkan input suara dan model premium.
Kekurangannya: UI ramai. Beberapa karakter pra-bangun bernada dewasa; filter keamanan perlu penyesuaian manual untuk penggunaan keluarga.
Harga:
- Gratis: Chat dasar dengan beberapa model preset.
- Berbayar: $9,99 sekali beli (Pro) membuka kunci suara, model lebih besar, dan sinkronisasi cloud.
Platform: Android 9.0 dan lebih tinggi.
Kesimpulannya: Pilih Layla jika alasan Anda menginginkan model lokal adalah penulisan fiksi yang akan ditolak model cloud.
4. Sherpa — Terbaik untuk shell llama.cpp minimal
Sherpa adalah aplikasi untuk orang-orang yang sudah tahu apa yang mereka inginkan. Arahkan ke file GGUF di kartu SD, atur panjang konteks dan jumlah thread, dan selesai. Tidak ada katalog, tidak ada sinkronisasi, tidak ada kemasan.
Kekurangannya: Tidak ada panduan. Pemula mungkin memuat model yang tidak akan muat dan crash aplikasi.
Harga:
- Gratis: Lisensi MIT.
- Berbayar: N/A.
Platform: Android 8.0 dan lebih tinggi.
Kesimpulannya: Untuk pengguna power yang menginginkan runtime llama.cpp tanpa bungkus aplikasi chat.
5. LLMFarm Companion — Terbaik untuk sinkronisasi model lintas perangkat
LLMFarm dimulai di iOS dan memiliki companion Android yang mencerminkan katalog dan perpustakaan prompt yang sama. Praktis jika Anda membagi waktu antara iPad dan tablet Android dan ingin karakter serta system prompt yang sama di keduanya.
Kekurangannya: Lebih sedikit toggle format daripada PocketPal. Dukungan GPU di Adreno masih tertinggal.
Harga:
- Gratis: Chat dasar.
- Berbayar: $4,99 sekali beli menghapus batasan ukuran model.
Platform: Android 10 dan lebih tinggi.
Kesimpulannya: Pilih ini jika Anda sudah menggunakan LLMFarm di iOS dan menginginkan keselarasan prompt.
6. ChatterUI — Frontend chat multi-model terbaik
ChatterUI memperlakukan setiap backend sama, baik Anda menjalankan llama.cpp di ponsel, KoboldCpp di laptop, atau Ollama di server rumah. Beralih di tengah percakapan dari model lokal kecil ke yang lebih besar tanpa kehilangan benang merah.
Kekurangannya: Konfigurasi berat saat peluncuran pertama. Tidak ada pendapat tentang model mana yang harus dipilih, jadi pemula berhenti di selektor.
Harga:
- Gratis: Open source GPLv3.
- Berbayar: N/A.
Platform: Android 8.0 dan lebih tinggi.
Unduh: GitHub Releases
Kesimpulannya: Pilihan yang tepat ketika ponsel hanya satu dari beberapa tempat Anda menjalankan inferensi.
7. Enchanted — Frontend terbaik untuk server Ollama rumah
Enchanted bukan mesin on-device itu sendiri. Ini adalah aplikasi chat yang dipoles yang berbicara dengan instance Ollama yang Anda jalankan di laptop atau server rumah. Saat bepergian, gunakan model lokal terukuantisasi di salah satu aplikasi di atas; di rumah, lompat ke Enchanted untuk model yang lebih besar yang tidak bisa dihost ponsel Anda.
Kekurangannya: Memerlukan mesin di mana pun yang menjalankan Ollama. Memerlukan tunnel atau aksesibilitas LAN untuk penggunaan jarak jauh.
Harga:
- Gratis: Open source MIT.
- Berbayar: N/A.
Platform: Android 9.0 dan lebih tinggi.
Unduh: GitHub Releases
Kesimpulannya: Pasangkan dengan aplikasi on-device apa pun untuk hari-hari ketika ponsel Anda tidak bisa menampung model yang Anda inginkan.
Cara memilih yang tepat
- Jika Anda menginginkan token/detik tercepat dan bisa hidup dengan katalog tetap: pilih MLC Chat.
- Jika Anda ingin menjelajahi dan mengunduh model GGUF dari Hugging Face di dalam aplikasi: pilih PocketPal AI.
- Jika tujuan Anda adalah penulisan fiksi dan chat konteks panjang: pilih Layla.
- Jika Anda sudah mengenal llama.cpp dan menginginkan shell minimal: pilih Sherpa.
- Jika Anda membagi waktu antara iOS dan Android: pilih LLMFarm Companion.
- Jika Anda ingin beralih antara backend lokal dan jarak jauh di tengah chat: pilih ChatterUI.
- Jika server Ollama rumah adalah host model utama Anda: pasangkan Enchanted dengan salah satu di atas untuk hari-hari offline.
Akronimnya menjadi kurang menakutkan setelah Anda menggunakannya. Kuant Q4_K_M dari Llama 3.1 8B pas nyaman di ponsel 8 GB apa pun; Q8_0 dari Phi-3 Mini berjalan mengejutkan di ponsel 6 GB. Mulai dari sana, perhatikan token/detik, dan naik atau turun.
FAQ
Apa arti Q4_K_M sebenarnya?
Q4 berarti kuantisasi 4-bit dari bobot model. K mengacu pada k-quants, pengelompokan yang lebih cerdas yang diperkenalkan oleh llama.cpp. M adalah varian medium, yang mencampur beberapa tensor 5-bit untuk kualitas. Dalam praktik: Q4_K_M adalah tier “cukup baik default”.
Berapa banyak RAM yang dibutuhkan model on-device?
Aturan praktis: ukuran file model ditambah 30% untuk runtime dan cache konteks. Model 4 GB membutuhkan sekitar 5,5 GB gratis. Ponsel dengan 8 GB atau lebih RAM menangani model 7B parameter di Q4; ponsel 6 GB tetap pada 3B.
Apakah ponsel saya akan panas berlebihan?
Inferensi berkelanjutan di ponsel tier menengah akan thermal-throttle dalam beberapa menit. Lebih suka perangkat Snapdragon 8 Gen 2/3 atau Tensor G4 yang lebih baru, dan jaga ponsel dari permukaan lembut saat berjalan.
Apakah aplikasi ini mengirim prompt saya ke mana pun?
Inferensi on-device tetap on-device. Enchanted dan ChatterUI adalah pengecualian saat dikonfigurasi untuk berbicara dengan backend jarak jauh. Baca prompt jaringan setiap aplikasi saat peluncuran pertama.
Model mana yang harus saya mulai?
Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M, atau Gemma 2 2B adalah titik awal yang aman untuk ponsel Android modern. Naik ke Llama 3.1 8B jika perangkat memiliki 12 GB RAM atau lebih.