MLC Chat menjalankan LLM terukuantisasi di Android

Aplikasi terbaik untuk menjalankan LLM terukuantisasi on-device di Android tahun 2026

Q4_K_M, Q5_K_S, Q8_0. Jika label-label itu belum bermakna bagi Anda, inilah alasan mengapa model dengan 7 miliar parameter kini pas di ponsel 6 GB. Kuantisasi mengurangi bobot model dari 16-bit float menjadi 4-bit integer, yang menyusutkan model chat dari 14 GB menjadi di bawah 5 GB dan memungkinkan ponsel Anda menjalankannya tanpa tagihan API cloud.

Kami menguji tujuh aplikasi di Pixel 8 dan tablet Snapdragon 8 Gen 2. Yang kami perhatikan: aplikasi mana yang memuat bobot GGUF dan MLC terukuantisasi tanpa laptop di tengah-tengahnya, mana yang berjalan offline dalam mode pesawat, dan mana yang tetap lancar tanpa thermal-throttling.

Apa yang harus dicari di aplikasi LLM on-device

Perbandingan cepat

Aplikasi Terbaik untuk Paket gratis Harga mulai/bulan Rating
MLC Chat Kernel MLC terkompilasi, throughput terbaik Ya (open source) Gratis 4,4
PocketPal AI Model GGUF dengan katalog yang ramah Ya (open source) Gratis 4,6
Layla Chat roleplay dan konteks panjang Tier gratis $9,99 sekali beli 4,5
Sherpa Shell llama.cpp minimal Ya (open source) Gratis 4,2
LLMFarm Companion Sinkronisasi model lintas perangkat Ya $4,99 sekali beli 4,3
ChatterUI Frontend chat multi-model Ya (open source) Gratis 4,5
Enchanted Frontend untuk server Ollama rumah Ya (open source) Gratis 4,4

Aplikasinya

1. MLC Chat — Terbaik untuk kernel MLC terkompilasi dan throughput teratas

MLC Chat dilengkapi dengan model pra-kompilasi yang disesuaikan untuk GPU Adreno atau Mali spesifik di ponsel Anda. Langkah kompilasi itulah yang memungkinkan model Phi dengan 3 miliar parameter berjalan pada 15+ token/detik di Pixel 8, kira-kira dua kali lipat dari apa yang dicapai runtime GGUF generik. Katalog dalam aplikasi ini pendek namun dikurasi: Llama, Phi, Gemma, Mistral, RedPajama.

Kekurangannya: Tidak ada dukungan untuk file GGUF arbitrer. Jika Anda sudah memiliki model yang diunduh, Anda tidak dapat memuatnya di sini tanpa mengkompilasi ulang untuk MLC.

Harga:

Platform: Android 8.0 dan lebih tinggi.

Unduh: Aptoide

Kesimpulannya: Dapatkan MLC Chat ketika token-per-detik maksimal penting dan Anda bisa hidup dengan katalog tetap.

2. PocketPal AI — Terbaik untuk model GGUF dengan katalog ramah

PocketPal AI memuat GGUF apa pun yang Anda tunjukkan. Pencarian dalam aplikasi menjelajahi Hugging Face tanpa beralih ke browser, dan layar unduhan menampilkan tier kuantisasi, ukuran, dan estimasi token-per-detik kasar untuk perangkat Anda sebelum Anda berkomitmen 4 GB ke disk. Riwayat chat tetap di perangkat.

Kekurangannya: Akselerasi GPU tertinggal MLC di ponsel yang sama. Percakapan konteks panjang dengan cepat menghabiskan RAM di perangkat 6 GB.

Harga:

Platform: Android 9.0 dan lebih tinggi.

Unduh: Google Play

Kesimpulannya: Cara paling ramah untuk pemula baru di kuantisasi GGUF di Android.

3. Layla — Terbaik untuk roleplay dan chat konteks panjang

Layla menargetkan komunitas roleplay dan penulisan cerita panjang. Dilengkapi dengan template prompt, impor character-card, dan jendela konteks default yang lebih besar disesuaikan untuk menjaga kontinuitas cerita di banyak putaran. Menjalankan GGUF secara lokal; tier berbayar menambahkan input suara dan model premium.

Kekurangannya: UI ramai. Beberapa karakter pra-bangun bernada dewasa; filter keamanan perlu penyesuaian manual untuk penggunaan keluarga.

Harga:

Platform: Android 9.0 dan lebih tinggi.

Unduh: Google Play

Kesimpulannya: Pilih Layla jika alasan Anda menginginkan model lokal adalah penulisan fiksi yang akan ditolak model cloud.

4. Sherpa — Terbaik untuk shell llama.cpp minimal

Sherpa adalah aplikasi untuk orang-orang yang sudah tahu apa yang mereka inginkan. Arahkan ke file GGUF di kartu SD, atur panjang konteks dan jumlah thread, dan selesai. Tidak ada katalog, tidak ada sinkronisasi, tidak ada kemasan.

Kekurangannya: Tidak ada panduan. Pemula mungkin memuat model yang tidak akan muat dan crash aplikasi.

Harga:

Platform: Android 8.0 dan lebih tinggi.

Unduh: F-Droid

Kesimpulannya: Untuk pengguna power yang menginginkan runtime llama.cpp tanpa bungkus aplikasi chat.

5. LLMFarm Companion — Terbaik untuk sinkronisasi model lintas perangkat

LLMFarm dimulai di iOS dan memiliki companion Android yang mencerminkan katalog dan perpustakaan prompt yang sama. Praktis jika Anda membagi waktu antara iPad dan tablet Android dan ingin karakter serta system prompt yang sama di keduanya.

Kekurangannya: Lebih sedikit toggle format daripada PocketPal. Dukungan GPU di Adreno masih tertinggal.

Harga:

Platform: Android 10 dan lebih tinggi.

Unduh: Google Play

Kesimpulannya: Pilih ini jika Anda sudah menggunakan LLMFarm di iOS dan menginginkan keselarasan prompt.

6. ChatterUI — Frontend chat multi-model terbaik

ChatterUI memperlakukan setiap backend sama, baik Anda menjalankan llama.cpp di ponsel, KoboldCpp di laptop, atau Ollama di server rumah. Beralih di tengah percakapan dari model lokal kecil ke yang lebih besar tanpa kehilangan benang merah.

Kekurangannya: Konfigurasi berat saat peluncuran pertama. Tidak ada pendapat tentang model mana yang harus dipilih, jadi pemula berhenti di selektor.

Harga:

Platform: Android 8.0 dan lebih tinggi.

Unduh: GitHub Releases

Kesimpulannya: Pilihan yang tepat ketika ponsel hanya satu dari beberapa tempat Anda menjalankan inferensi.

7. Enchanted — Frontend terbaik untuk server Ollama rumah

Enchanted bukan mesin on-device itu sendiri. Ini adalah aplikasi chat yang dipoles yang berbicara dengan instance Ollama yang Anda jalankan di laptop atau server rumah. Saat bepergian, gunakan model lokal terukuantisasi di salah satu aplikasi di atas; di rumah, lompat ke Enchanted untuk model yang lebih besar yang tidak bisa dihost ponsel Anda.

Kekurangannya: Memerlukan mesin di mana pun yang menjalankan Ollama. Memerlukan tunnel atau aksesibilitas LAN untuk penggunaan jarak jauh.

Harga:

Platform: Android 9.0 dan lebih tinggi.

Unduh: GitHub Releases

Kesimpulannya: Pasangkan dengan aplikasi on-device apa pun untuk hari-hari ketika ponsel Anda tidak bisa menampung model yang Anda inginkan.

Cara memilih yang tepat

Akronimnya menjadi kurang menakutkan setelah Anda menggunakannya. Kuant Q4_K_M dari Llama 3.1 8B pas nyaman di ponsel 8 GB apa pun; Q8_0 dari Phi-3 Mini berjalan mengejutkan di ponsel 6 GB. Mulai dari sana, perhatikan token/detik, dan naik atau turun.

FAQ

Apa arti Q4_K_M sebenarnya?

Q4 berarti kuantisasi 4-bit dari bobot model. K mengacu pada k-quants, pengelompokan yang lebih cerdas yang diperkenalkan oleh llama.cpp. M adalah varian medium, yang mencampur beberapa tensor 5-bit untuk kualitas. Dalam praktik: Q4_K_M adalah tier “cukup baik default”.

Berapa banyak RAM yang dibutuhkan model on-device?

Aturan praktis: ukuran file model ditambah 30% untuk runtime dan cache konteks. Model 4 GB membutuhkan sekitar 5,5 GB gratis. Ponsel dengan 8 GB atau lebih RAM menangani model 7B parameter di Q4; ponsel 6 GB tetap pada 3B.

Apakah ponsel saya akan panas berlebihan?

Inferensi berkelanjutan di ponsel tier menengah akan thermal-throttle dalam beberapa menit. Lebih suka perangkat Snapdragon 8 Gen 2/3 atau Tensor G4 yang lebih baru, dan jaga ponsel dari permukaan lembut saat berjalan.

Apakah aplikasi ini mengirim prompt saya ke mana pun?

Inferensi on-device tetap on-device. Enchanted dan ChatterUI adalah pengecualian saat dikonfigurasi untuk berbicara dengan backend jarak jauh. Baca prompt jaringan setiap aplikasi saat peluncuran pertama.

Model mana yang harus saya mulai?

Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M, atau Gemma 2 2B adalah titik awal yang aman untuk ponsel Android modern. Naik ke Llama 3.1 8B jika perangkat memiliki 12 GB RAM atau lebih.