Ponsel Android modern dengan 8 GB RAM dapat menampung model 3B dalam memori dan menjawab pertanyaan dalam beberapa detik, offline. Poin bukan menggantikan GPT atau Claude untuk masalah sulit. Poin adalah obrolan pribadi tanpa jaringan yang bertahan dalam penerbangan, penyeberangan perbatasan, atau Wi-Fi hotel yang buruk. Aplikasi terbaik untuk menjalankan LLM on-device di Android berbeda dalam tiga cara: format model terukur mana yang mereka muat, berapa banyak RAM yang mereka butuhkan untuk tetap stabil, dan seberapa dapat digunakan antarmuka obrolan di layar kecil. Kami menguji tujuh selama sebulan penggunaan sehari-hari.
Apa yang dicari dalam aplikasi LLM on-device
Enam hal membedakan aplikasi obrolan yang tetap terpasang dari aplikasi yang dihapus dalam seminggu:
- Dukungan format model. GGUF adalah yang paling umum; MLC dan ONNX berikutnya. Format apa pun yang didukung aplikasi menentukan model mana yang tersedia.
- Opsi kuantisasi. Q4_K_M adalah titik manis untuk model 3B pada 8 GB; Q3 lebih kecil tetapi jauh lebih buruk.
- Penanganan jendela konteks. Apakah aplikasi menyimpan riwayat berjalan atau mengatur ulang di setiap putaran.
- Token per detik pada perangkat keras sederhana. Ponsel Snapdragon 8 Gen 2 menjalankan 3B Q4 kira-kira 15 hingga 25 tok/s.
- Perilaku baterai. Pembuatan panjang memanaskan ponsel. Bendera latar atau pengatur waktu yang membatasi sesi membantu.
- Biaya dan status sumber tertutup. Beberapa opsi adalah freemium dengan fallback cloud yang perlu dimatikan.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Format model | Tingkat gratis | Menonjol |
|---|---|---|---|---|
| PocketPal AI | Obrolan on-device umum | GGUF | Gratis, sumber terbuka | UX unduhan terbaik untuk model GGUF |
| MLC Chat | Kecepatan di Snapdragon 8 | MLC | Gratis, sumber terbuka | Tok/s tercepat dari semua yang di sini |
| Layla | Obrolan karakter dan roleplay | GGUF | Tingkat gratis, langganan | UI dipoles, perpustakaan karakter |
| MyDeviceAI | Asisten dengan alat | GGUF, ONNX | Gratis, sumber terbuka | Dasar pencarian web, tetap on-device |
| SmolChat | Ponsel kecil (4 hingga 6 GB) | GGUF (small) | Gratis, sumber terbuka | Menjalankan model 1B dan 1.5B dengan bersih |
| Private AI Chat | Tanpa akun, tanpa telemetri | GGUF | Gratis | Dikirim dengan daftar model yang dikurasi |
| Enchanted | Ollama di server rumah | Remote ke Ollama | Gratis, sumber terbuka | Terbaik ketika ponsel berbicara dengan LLM rumah |
Aplikasi
1. PocketPal AI, obrolan on-device umum terbaik
PocketPal AI mengunduh model GGUF dari Hugging Face di dalam aplikasi dan mengelolanya dalam perpustakaan. Preset untuk Phi-3.5, Gemma 3, Llama 3.2, dan Qwen 2.5 memberikan kuantisasi awal yang masuk akal. UI obrolan mendukung prompt sistem, suhu, top-p, dan penalti pengulangan per model, yang merupakan kontrol lebih dari sebagian besar aplikasi di sini.
Di mana ia jatuh pendek: Pengguna kali pertama perlu pemahaman kasar tentang model mana yang harus dipilih. Tidak ada rekomendasi in-app.
Harga: Gratis, sumber terbuka (MIT).
Platform: Android, iOS.
Unduh: GitHub · Google Play
Garis bawah: Mulai di sini. Ini adalah opsi gratis paling lengkap dan tidak mendorong tingkat berbayar.
2. MLC Chat, kecepatan baku terbaik di Snapdragon 8
MLC Chat mengompilasi model ke format MLC sebelumnya dan menjalankannya melalui TVM. Di ponsel Snapdragon 8 Gen 2, Gemma 2B MLC berjalan pada kira-kira dua kali tok/s dari model yang sama dalam GGUF pada llama.cpp. Opsi model lebih sempit karena setiap model dibangun sebelumnya.
Di mana ia jatuh pendek: Menambahkan model baru memerlukan toolchain MLC di laptop. Bukan alur kerja “unduh dan lanjutkan”.
Harga: Gratis, lisensi Apache.
Platform: Android, iOS.
Unduh: MLC Chat · Google Play
Garis bawah: Pilihan jika ponsel adalah flagship terbaru dan tujuannya adalah respons on-device tercepat yang mungkin.
3. Layla, terbaik untuk obrolan karakter dan roleplay
Layla membungkus llama.cpp dalam UI obrolan yang dipoles dengan karakter, input suara, dan perpustakaan persona komunitas. Tingkat gratis mencakup unduhan model lokal; langganan menambahkan model yang dihosting cloud dan pembuatan gambar, keduanya opsional. Karena aplikasi on-device secara default, perpustakaan karakter bekerja offline.
Di mana ia jatuh pendek: Fokus RP ditunjukkan dalam prompt default. Mengubahnya menjadi asisten generik berarti menimpa prompt sistem setiap sesi.
Harga:
- Tingkat gratis: hanya model lokal
- Pro: dari biaya bulanan sederhana menambahkan model yang dihosting dan gambar
Platform: Android, iOS.
Unduh: Layla
Garis bawah: Untuk siapa pun yang menginginkan obrolan yang cenderung kreatif daripada utilitas.
4. MyDeviceAI, asisten terbaik dengan alat
MyDeviceAI menjalankan model GGUF lokal, kemudian menambahkan langkah pencarian web yang membaca cuplikan dan mengembalikannya ke model sebagai konteks. Tetap pribadi karena kueri pencarian adalah satu-satunya hal yang meninggalkan ponsel. Ini adalah hal terdekat dengan asisten gaya Perplexity dengan penalaran lokal.
Di mana ia jatuh pendek: Integrasi pencarian web bergantung pada backend pencarian yang berubah. Panggilan alat yang rusak sesekali adalah untuk operator perhatikan.
Harga: Gratis, sumber terbuka.
Platform: Android.
Unduh: GitHub
Garis bawah: Pilihan ketika asisten membutuhkan informasi terkini, bukan hanya apa yang pas dalam bobot model.
5. SmolChat, terbaik untuk ponsel kecil
SmolChat menargetkan ponsel dengan 4 hingga 6 GB RAM. Ini dikirim dengan pengaturan yang disesuaikan untuk model 1B dan 1.5B (Phi-3-mini, Gemma 2 2B, Llama 3.2 1B) dan menolak membuka yang lebih besar. Hasilnya adalah aplikasi obrolan yang tetap responsif di ponsel midrange berusia dua tahun.
Di mana ia jatuh pendek: Sengaja terbatas. Jika ponsel dapat menjalankan model 3B, gunakan PocketPal AI sebagai gantinya.
Harga: Gratis, sumber terbuka.
Platform: Android.
Unduh: GitHub · Google Play
Garis bawah: Untuk ponsel midrange yang akan membeku di model 7B.
6. Private AI Chat, terbaik “tanpa akun, tanpa telemetri”
Private AI Chat dikirim dengan daftar kecil model GGUF yang sudah diverifikasi, mengunduhnya saat pertama kali dijalankan, dan tidak pernah meminta akun. Riwayat obrolan tetap dalam database on-device. Kebijakan privasi cocok di satu layar karena aplikasi tidak mengumpulkan data.
Di mana ia jatuh pendek: Tidak ada fallback cloud jika model tidak cukup untuk pertanyaan sulit. Model yang ditambahkan pengguna tidak ada di luar daftar yang dikurasi.
Harga: Gratis.
Platform: Android.
Unduh: Google Play
Garis bawah: Pilihan ketika seluruh poin adalah “tidak ada data yang meninggalkan ponsel” dan memilih model bukanlah bagian yang menyenangkan.
7. Enchanted, terbaik jika Anda sudah menjalankan Ollama di rumah
Enchanted adalah klien ponsel untuk Ollama yang berjalan di server rumah. Ini bukan fully on-device (model berjalan di mesin rumah, yang menangani komputasi), tetapi obrolan tetap di LAN atau melalui terowongan Tailscale. Bagi siapa pun yang memiliki kotak rumah yang kuat sudah menampung Ollama, ini adalah jalur terpendek ke model 70B dari ponsel.
Di mana ia jatuh pendek: Memerlukan instans Ollama rumah. Penggunaan seluler membutuhkan terowongan seperti Tailscale untuk menjangkau server.
Harga: Gratis, sumber terbuka.
Platform: Android, iOS.
Unduh: GitHub
Garis bawah: Pilihan ketika ponsel adalah klien tipis ke model lokal yang jauh lebih besar.
Cara memilih yang tepat
Jika ponsel memiliki 8 GB RAM atau lebih, mulai dengan PocketPal AI dan model 3B Q4. UI paling ramah dan perpustakaan model paling luas.
Jika ponsel adalah flagship terbaru dan kecepatan penting lebih dari pilihan model, beralih ke MLC Chat.
Jika ponsel memiliki 4 hingga 6 GB RAM, gunakan SmolChat dengan model 1.5B atau 2B.
Jika tujuannya adalah asisten pribadi yang dapat mencari, gunakan MyDeviceAI.
Jika hari melibatkan obrolan kreatif atau roleplay, gunakan Layla.
Jika server rumah yang kuat sudah menjalankan Ollama, gunakan Enchanted dan perlakukan ponsel sebagai klien tipis.
FAQ
Ponsel Android mana yang dapat menjalankan model 7B? Ponsel dengan minimal 12 GB RAM (Pixel 9 Pro XL, Galaxy S25 Ultra, OnePlus 13). Model 7B Q4 ditambah OS cocok dengan baik di 12 GB dan bergerak. Pada 8 GB ponsel bertukar dan aplikasi crash dalam beberapa menit.
Apakah aplikasi ini menguras baterai? Ya, selama generasi. Model 3B pada 20 tok/s di SoC modern menarik 4 hingga 6 W. Percakapan sepuluh menit kira-kira satu persen baterai. Generasi panjang memanaskan ponsel.
Dapatkah saya menggunakan ini offline? Ya, itu intinya. PocketPal AI, MLC Chat, SmolChat, Layla, dan Private AI Chat berjalan sepenuhnya on-device setelah model diunduh. Mode pesawat tidak mempengaruhi mereka.
Apakah data saya pribadi? Di enam aplikasi on-device, ya. Enchanted mengirim obrolan ke server Ollama Anda sendiri. Tidak satu pun dari mereka mengirim prompt ke cloud pihak ketiga dalam mode default.
Model mana yang harus saya mulai? Phi-3.5-mini di Q4_K_M adalah default teraman di 8 GB. Ini menjawab pertanyaan umum dengan baik dan cocok di sekitar 2,5 GB RAM. Beralih ke Gemma 2 2B atau Llama 3.2 3B jika ponsel dapat menanganinya.
Dapatkah ini menggantikan ChatGPT? Untuk pertanyaan cepat, draf teks pendek, dan cuplikan kode di bawah 200 baris, ya. Untuk penalaran panjang, peristiwa terkini, dan kode kompleks, tidak. Perlakukan on-device sebagai lapisan pribadi, offline, bukan seluruh toolbox.