
XDA mengubah ponsel lama menjadi server LLM lokal dan berhasil menjalankan Gemma 4 dengan cukup baik untuk pekerjaan produktivitas nyata. Ini adalah penggunaan yang sangat baik untuk Android lama yang tertidur di laci, dan berkat optimisasi ARM llama.cpp, Snapdragon 8 Gen 1 atau yang lebih baru dapat menghosting model terkuantisasi 3B hingga 7B yang menjawab perangkat lain di Wi-Fi kami. Tujuh aplikasi menangani tanah, beberapa adalah klien obrolan yang juga mengekspos API kompatibel OpenAI, beberapa adalah terminal yang memungkinkan kami menjalankan llama.cpp atau ollama secara langsung.
Apa yang harus dicari dalam aplikasi Android LLM lokal
- Mode server API. Untuk “ponsel lama sebagai server LLM,” aplikasi harus mengekspos titik akhir HTTP yang dapat dipanggil oleh perangkat lain, idealnya kompatibel dengan OpenAI.
- Dukungan format model. GGUF melalui llama.cpp adalah standar, format llama.cpp sendiri dari MLC adalah pilihan lain.
- Offload GPU. Vulkan atau backend OpenCL yang menggunakan GPU Adreno atau Mali ponsel kami mengubah token per detik sebesar 3x hingga 5x.
- Kontrol baterai dan termal. Inferensi berkelanjutan memasak ponsel. Cari kontrol layanan latar depan dan pembatasan termal.
- Jejak RAM. Ponsel lama dengan RAM 4 hingga 6 GB tidak dapat menampung model yang lebih besar bahkan dengan kuantisasi agresif.
- Persistensi latar belakang. Aplikasi harus bertahan dari manajer memori Android yang agresif pada OEM murah.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Gratis | Server API | Rating |
|---|---|---|---|---|
| Termux | llama.cpp atau ollama lengkap di terminal | Ya | Ya, via llama-server | 4.7 |
| PocketPal AI | GUI obrolan dengan toggle server | Ya | Ya, eksperimental | 4.5 |
| Layla | Obrolan yang dipoles plus bermain peran | Ya | Trial Pro API | 4.4 |
| MLC Chat | Model yang dioptimalkan MLC | Ya | Lokal saja di stabil | 4.3 |
| ChatterUI | Antarmuka seperti SillyTavern | Ya | Ya, via server bawaan | 4.4 |
| SmolChat | Klien obrolan minimal | Ya | Tidak | 4.3 |
| llama.cpp Android | Build referensi | Ya | Ya, via llama-server | 4.5 |
Tujuh aplikasi
1. Termux, llama.cpp atau ollama lengkap terbaik di terminal
Termux adalah toolkit Linux-di-saku-kami yang memungkinkan kami membangun dan menjalankan llama.cpp atau ollama secara langsung. pkg install cmake python git, klon llama.cpp, kompilasi dengan LLAMA_VULKAN=1, dan mulai llama-server terikat pada IP LAN kami. Ponsel lama sekarang melayani API kompatibel OpenAI ke perangkat mana pun di Wi-Fi.
Di mana ia tertinggal: Bukan untuk yang takut terminal. Penyiapan awal membutuhkan waktu satu jam manajemen paket.
Penetapan harga:
- Gratis: Toolkit lengkap
- Berbayar: Tidak ada
Platform: Android
Termux untuk hosting LLM lokal menang dalam fleksibilitas. Apa pun yang didukung llama.cpp, Termux mendukungnya.
Garis bawah: Pilihan untuk pembaca yang nyaman di terminal. Langit-langit jauh lebih tinggi daripada GUI mana pun dalam daftar ini.
2. PocketPal AI, GUI terbaik dengan toggle server
PocketPal AI adalah klien obrolan Android sumber terbuka yang memuat model GGUF dari Hugging Face dan menjalankannya di perangkat. Build terbaru menambahkan toggle server eksperimental yang mengekspos model yang sama di LAN kami melalui titik akhir kompatibel OpenAI.
Di mana ia tertinggal: Toggle server masih ditandai eksperimental dan tidak memiliki TLS.
Penetapan harga:
- Gratis: Sumber terbuka di bawah MIT
- Berbayar: Tidak ada
Platform: Android, iOS
Unduh: Google Play · F-Droid
PocketPal AI untuk hosting LLM lokal menang dalam kesederhanaan GUI. Pilih model dari Hugging Face, ketuk muat, mulai mengobrol.
Garis bawah: Pilihan untuk pembaca yang menginginkan GUI terlebih dahulu dan API kedua.
3. Layla, obrolan yang dipoles terbaik plus bermain peran
Layla adalah klien obrolan Android yang ramah pembayaran yang menjalankan model terkuantisasi di perangkat dengan UI halus. Bermain peran karakter, memori persisten, dan mode suara disertakan. Tingkat Pro menambahkan mode server API yang mengekspos model yang dimuat.
Di mana ia tertinggal: Tingkat gratis membatasi panjang konteks. Fitur karakter menambah kompleksitas UI.
Penetapan harga:
- Gratis: Obrolan dasar
- Berbayar: Langganan Pro untuk konteks diperpanjang dan mode API
Platform: Android
Unduh: Google Play
Layla untuk hosting LLM lokal menang dalam pemolesan obrolan dan alat bermain peran.
Garis bawah: Pilihan untuk pembaca yang menginginkan UI yang berfokus pada obrolan, bukan alat dev.
4. MLC Chat, model yang dioptimalkan MLC terbaik
MLC Chat dari tim MLC dilengkapi dengan model pra-kompilasi yang disesuaikan untuk GPU Qualcomm Adreno dan MediaTek. Token per detik adalah yang terbaik dalam daftar ini untuk ponsel yang didukung aplikasi secara resmi, dengan harga perpustakaan model yang lebih kecil daripada llama.cpp.
Di mana ia tertinggal: Mode server API ada di peta jalan, belum dalam rilis stabil.
Penetapan harga:
- Gratis: Sumber terbuka
- Berbayar: Tidak ada
Platform: Android, iOS
MLC Chat untuk hosting LLM lokal menang dalam kecepatan inferensi mentah ketika ponsel kami berada dalam daftar yang didukung.
Garis bawah: Pilihan untuk pembaca yang perangkatnya ada dalam daftar yang didukung MLC dan menginginkan token maksimal per detik secara lokal.
5. ChatterUI, antarmuka seperti SillyTavern terbaik
ChatterUI adalah klien obrolan Android yang dimodelkan pada SillyTavern. Kartu karakter, cabang obrolan, dan server bawaan yang dapat dihit perangkat lain di LAN kami sebagai titik akhir kompatibel OpenAI.
Di mana ia tertinggal: Format kartu karakter adalah intinya, tetapi itu membuat ChatterUI lebih berat daripada PocketPal untuk Q&A langsung.
Penetapan harga:
- Gratis: Sumber terbuka
- Berbayar: Tidak ada
Platform: Android
Unduh: GitHub
ChatterUI untuk hosting LLM lokal menang jika tumpukan obrolan yang ada adalah bentuk SillyTavern.
Garis bawah: Pilihan untuk pembaca yang sudah menggunakan SillyTavern.
6. SmolChat, klien obrolan minimal terbaik
SmolChat adalah klien Android minimalis untuk model llama.cpp GGUF. Itu tidak melayani API, tetapi jejaknya cukup kecil sehingga ponsel yang lebih tua dengan RAM 4 GB masih dapat menyesuaikan model terkuantisasi 3B.
Di mana ia tertinggal: Obrolan lokal saja, tidak ada mode server.
Penetapan harga:
- Gratis: Sumber terbuka
- Berbayar: Tidak ada
Platform: Android
Unduh: GitHub
SmolChat untuk hosting LLM lokal menang sebagai opsi paling ringan untuk perangkat 4 GB.
Garis bawah: Pilihan ketika ponsel target benar-benar tua dan terbatas RAM.
7. llama.cpp Android, build referensi terbaik
llama.cpp Android adalah build referensi resmi dari ggerganov. Tidak ada di toko mana pun, kami mengunduh APK dari rilis GitHub. Menjalankan llama-server secara langsung dengan bendera yang sama yang akan kami gunakan di Linux.
Di mana ia tertinggal: Nol pemolesan UI, dan kami harus mengetahui bendera llama.cpp sebelum kami mulai.
Penetapan harga:
- Gratis: Sumber terbuka di bawah MIT
- Berbayar: Tidak ada
Platform: Android
Unduh: GitHub
llama.cpp Android untuk hosting LLM lokal menang sebagai implementasi referensi.
Garis bawah: Pilihan untuk pembaca yang menginginkan alat yang sama yang mereka jalankan di laptop, di Android.
Cara memilih yang tepat
- Nyaman di terminal, ingin fleksibilitas maksimal: Termux
- Ingin GUI plus toggle API: PocketPal AI
- Ingin pemolesan obrolan dengan bermain peran: Layla
- Ponsel ada dalam daftar yang didukung MLC dan ingin kecepatan maksimal: MLC Chat
- Sudah jalankan SillyTavern: ChatterUI
- Ponsel hanya memiliki RAM 4 GB: SmolChat
- Ingin build referensi llama.cpp: llama.cpp Android
Pertanyaan yang sering diajukan
Bisakah ponsel Android lama benar-benar menjalankan LLM?
Ya, di Snapdragon 855 dan yang lebih baru, dengan 6 GB atau lebih RAM. Harapkan 3 hingga 5 token per detik pada model terkuantisasi 3B pada perangkat keras yang lebih tua, dan 10 hingga 20 token per detik pada ponsel yang lebih baru.
Model mana yang berjalan paling baik di Android?
Gemma 2B, Phi-3 Mini, Llama 3.2 3B, dan Qwen 2.5 3B semuanya cocok nyaman pada kuantisasi Q4_K_M. Gemma 4 berjalan di ponsel yang lebih baru dengan 8 GB atau lebih RAM.
Bisakah saya menggunakan ponsel saya sebagai server API LLM untuk laptop saya?
Ya. Termux menjalankan llama-server yang terikat pada IP LAN kami bekerja. Arahkan klien obrolan laptop kami ke http://<phone-ip>:8080/v1 untuk titik akhir kompatibel OpenAI.
Akankah menjalankan LLM membunuh baterai ponsel saya?
Inferensi berkelanjutan menguras dengan cepat, rencanakan untuk tenaga dinding. Juga harapkan ponsel untuk menjalankan hangat, angkat untuk aliran udara.
Apakah llama.cpp gratis?
Ya, berlisensi MIT. Setiap aplikasi dalam daftar ini yang menggunakannya adalah sumber terbuka atau dibayar di atas dasar llama.cpp gratis.