Termux dan alat lainnya untuk menjalankan LLM lokal di Android

XDA mengubah ponsel lama menjadi server LLM lokal dan berhasil menjalankan Gemma 4 dengan cukup baik untuk pekerjaan produktivitas nyata. Ini adalah penggunaan yang sangat baik untuk Android lama yang tertidur di laci, dan berkat optimisasi ARM llama.cpp, Snapdragon 8 Gen 1 atau yang lebih baru dapat menghosting model terkuantisasi 3B hingga 7B yang menjawab perangkat lain di Wi-Fi kami. Tujuh aplikasi menangani tanah, beberapa adalah klien obrolan yang juga mengekspos API kompatibel OpenAI, beberapa adalah terminal yang memungkinkan kami menjalankan llama.cpp atau ollama secara langsung.

Apa yang harus dicari dalam aplikasi Android LLM lokal

Perbandingan cepat

Aplikasi Terbaik untuk Gratis Server API Rating
Termux llama.cpp atau ollama lengkap di terminal Ya Ya, via llama-server 4.7
PocketPal AI GUI obrolan dengan toggle server Ya Ya, eksperimental 4.5
Layla Obrolan yang dipoles plus bermain peran Ya Trial Pro API 4.4
MLC Chat Model yang dioptimalkan MLC Ya Lokal saja di stabil 4.3
ChatterUI Antarmuka seperti SillyTavern Ya Ya, via server bawaan 4.4
SmolChat Klien obrolan minimal Ya Tidak 4.3
llama.cpp Android Build referensi Ya Ya, via llama-server 4.5

Tujuh aplikasi

1. Termux, llama.cpp atau ollama lengkap terbaik di terminal

Termux adalah toolkit Linux-di-saku-kami yang memungkinkan kami membangun dan menjalankan llama.cpp atau ollama secara langsung. pkg install cmake python git, klon llama.cpp, kompilasi dengan LLAMA_VULKAN=1, dan mulai llama-server terikat pada IP LAN kami. Ponsel lama sekarang melayani API kompatibel OpenAI ke perangkat mana pun di Wi-Fi.

Di mana ia tertinggal: Bukan untuk yang takut terminal. Penyiapan awal membutuhkan waktu satu jam manajemen paket.

Penetapan harga:

Platform: Android

Unduh: F-Droid · Aptoide

Termux untuk hosting LLM lokal menang dalam fleksibilitas. Apa pun yang didukung llama.cpp, Termux mendukungnya.

Garis bawah: Pilihan untuk pembaca yang nyaman di terminal. Langit-langit jauh lebih tinggi daripada GUI mana pun dalam daftar ini.

2. PocketPal AI, GUI terbaik dengan toggle server

PocketPal AI adalah klien obrolan Android sumber terbuka yang memuat model GGUF dari Hugging Face dan menjalankannya di perangkat. Build terbaru menambahkan toggle server eksperimental yang mengekspos model yang sama di LAN kami melalui titik akhir kompatibel OpenAI.

Di mana ia tertinggal: Toggle server masih ditandai eksperimental dan tidak memiliki TLS.

Penetapan harga:

Platform: Android, iOS

Unduh: Google Play · F-Droid

PocketPal AI untuk hosting LLM lokal menang dalam kesederhanaan GUI. Pilih model dari Hugging Face, ketuk muat, mulai mengobrol.

Garis bawah: Pilihan untuk pembaca yang menginginkan GUI terlebih dahulu dan API kedua.

3. Layla, obrolan yang dipoles terbaik plus bermain peran

Layla adalah klien obrolan Android yang ramah pembayaran yang menjalankan model terkuantisasi di perangkat dengan UI halus. Bermain peran karakter, memori persisten, dan mode suara disertakan. Tingkat Pro menambahkan mode server API yang mengekspos model yang dimuat.

Di mana ia tertinggal: Tingkat gratis membatasi panjang konteks. Fitur karakter menambah kompleksitas UI.

Penetapan harga:

Platform: Android

Unduh: Google Play

Layla untuk hosting LLM lokal menang dalam pemolesan obrolan dan alat bermain peran.

Garis bawah: Pilihan untuk pembaca yang menginginkan UI yang berfokus pada obrolan, bukan alat dev.

4. MLC Chat, model yang dioptimalkan MLC terbaik

MLC Chat dari tim MLC dilengkapi dengan model pra-kompilasi yang disesuaikan untuk GPU Qualcomm Adreno dan MediaTek. Token per detik adalah yang terbaik dalam daftar ini untuk ponsel yang didukung aplikasi secara resmi, dengan harga perpustakaan model yang lebih kecil daripada llama.cpp.

Di mana ia tertinggal: Mode server API ada di peta jalan, belum dalam rilis stabil.

Penetapan harga:

Platform: Android, iOS

Unduh: GitHub · Aptoide

MLC Chat untuk hosting LLM lokal menang dalam kecepatan inferensi mentah ketika ponsel kami berada dalam daftar yang didukung.

Garis bawah: Pilihan untuk pembaca yang perangkatnya ada dalam daftar yang didukung MLC dan menginginkan token maksimal per detik secara lokal.

5. ChatterUI, antarmuka seperti SillyTavern terbaik

ChatterUI adalah klien obrolan Android yang dimodelkan pada SillyTavern. Kartu karakter, cabang obrolan, dan server bawaan yang dapat dihit perangkat lain di LAN kami sebagai titik akhir kompatibel OpenAI.

Di mana ia tertinggal: Format kartu karakter adalah intinya, tetapi itu membuat ChatterUI lebih berat daripada PocketPal untuk Q&A langsung.

Penetapan harga:

Platform: Android

Unduh: GitHub

ChatterUI untuk hosting LLM lokal menang jika tumpukan obrolan yang ada adalah bentuk SillyTavern.

Garis bawah: Pilihan untuk pembaca yang sudah menggunakan SillyTavern.

6. SmolChat, klien obrolan minimal terbaik

SmolChat adalah klien Android minimalis untuk model llama.cpp GGUF. Itu tidak melayani API, tetapi jejaknya cukup kecil sehingga ponsel yang lebih tua dengan RAM 4 GB masih dapat menyesuaikan model terkuantisasi 3B.

Di mana ia tertinggal: Obrolan lokal saja, tidak ada mode server.

Penetapan harga:

Platform: Android

Unduh: GitHub

SmolChat untuk hosting LLM lokal menang sebagai opsi paling ringan untuk perangkat 4 GB.

Garis bawah: Pilihan ketika ponsel target benar-benar tua dan terbatas RAM.

7. llama.cpp Android, build referensi terbaik

llama.cpp Android adalah build referensi resmi dari ggerganov. Tidak ada di toko mana pun, kami mengunduh APK dari rilis GitHub. Menjalankan llama-server secara langsung dengan bendera yang sama yang akan kami gunakan di Linux.

Di mana ia tertinggal: Nol pemolesan UI, dan kami harus mengetahui bendera llama.cpp sebelum kami mulai.

Penetapan harga:

Platform: Android

Unduh: GitHub

llama.cpp Android untuk hosting LLM lokal menang sebagai implementasi referensi.

Garis bawah: Pilihan untuk pembaca yang menginginkan alat yang sama yang mereka jalankan di laptop, di Android.

Cara memilih yang tepat

Pertanyaan yang sering diajukan

Bisakah ponsel Android lama benar-benar menjalankan LLM?

Ya, di Snapdragon 855 dan yang lebih baru, dengan 6 GB atau lebih RAM. Harapkan 3 hingga 5 token per detik pada model terkuantisasi 3B pada perangkat keras yang lebih tua, dan 10 hingga 20 token per detik pada ponsel yang lebih baru.

Model mana yang berjalan paling baik di Android?

Gemma 2B, Phi-3 Mini, Llama 3.2 3B, dan Qwen 2.5 3B semuanya cocok nyaman pada kuantisasi Q4_K_M. Gemma 4 berjalan di ponsel yang lebih baru dengan 8 GB atau lebih RAM.

Bisakah saya menggunakan ponsel saya sebagai server API LLM untuk laptop saya?

Ya. Termux menjalankan llama-server yang terikat pada IP LAN kami bekerja. Arahkan klien obrolan laptop kami ke http://<phone-ip>:8080/v1 untuk titik akhir kompatibel OpenAI.

Akankah menjalankan LLM membunuh baterai ponsel saya?

Inferensi berkelanjutan menguras dengan cepat, rencanakan untuk tenaga dinding. Juga harapkan ponsel untuk menjalankan hangat, angkat untuk aliran udara.

Apakah llama.cpp gratis?

Ya, berlisensi MIT. Setiap aplikasi dalam daftar ini yang menggunakannya adalah sumber terbuka atau dibayar di atas dasar llama.cpp gratis.