LLM lokal dulu terasa seperti kompromi. Anda mengorbankan kualitas model untuk privasi dan tanpa tagihan per-token. Model reasoning telah membalikkan skalanya. DeepSeek R1 melakukan distilasi, Qwen 3 dengan thinking mode, dan GPT-OSS semua menghasilkan jejak chain-of-thought yang terlihat sebelum jawaban akhir mereka, dan yang lebih kecil berjalan di laptop 16GB. Bottleneck tidak lagi pada model. Ini adalah aplikasi desktop yang Anda gunakan untuk memuat, menjalankan, dan mengobrol dengannya. Kami menguji delapan aplikasi pada perangkat keras yang sama, dan berikut tujuh yang layak diinstal.
Apa yang harus diperhatikan dalam aplikasi untuk LLM reasoning
- Tampilan thinking mode kelas pertama. Model reasoning mengeluarkan blok
<think>. Aplikasi yang baik membiarkan Anda menampilkan atau menyembunyikan blok-blok ini per percakapan. - Katalog model dan manajemen quant. Anda ingin mencari, menarik, dan menghapus bobot terkuantisasi tanpa mengedit file konfigurasi dengan tangan.
- Berjalan offline. Intinya adalah tumpukan inferensi lokal. Tidak ada login cloud yang diperlukan.
- API yang kompatibel dengan OpenAI. Jadi model yang sama memberdayakan jendela obrolan Anda dan editor, agen, atau skrip apa pun.
- Fallback GPU dan CPU. Menangani NVIDIA CUDA, Apple Metal, AMD ROCm di Linux, dan jalur CPU-only untuk mesin tanpa GPU.
- Default yang masuk akal. Model reasoning mengonsumsi konteks. Aplikasi harus mengatur jendela konteks besar tanpa Anda harus tahu itu.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Platform | Paket gratis | Harga mulai/bln | Catatan |
|---|---|---|---|---|---|
| Ollama | Pengembang yang hidup di terminal | Windows, macOS, Linux | Ya | Gratis | Melayani model apa pun melalui endpoint kompatibel OpenAI |
| LM Studio | Browsing model GUI | Windows, macOS, Linux | Ya | Gratis | Katalog model interaktif terbaik |
| Jan | Pengganti ChatGPT pribadi | Windows, macOS, Linux | Ya | Gratis | Sepenuhnya lokal secara default, tanpa telemetri |
| Msty | Obrolan multi-model berdampingan | Windows, macOS, Linux | Ya | $9 seumur hidup untuk Pro | Mengobrol dengan beberapa model secara paralel |
| Open WebUI | UI self-hosted untuk tim | Docker di mana saja | Ya | Gratis | Mengubah Ollama menjadi ruang kerja bersama |
| GPT4All | Pemula absolut | Windows, macOS, Linux | Ya | Gratis | Instalasi sekali klik, daftar model yang dikurasi |
| Text Generation WebUI | Power user dan fine-tuner | Windows, macOS, Linux | Ya | Gratis | Kontrol sampling dan LoRA paling mendalam |
Aplikasinya
1. Ollama - Terbaik untuk pengembang yang hidup di terminal
Ollama adalah lapisan dasar yang paling banyak digunakan aplikasi lain di daftar ini terhubung. Ini berjalan sebagai layanan latar belakang, mengekspos API kompatibel OpenAI di localhost:11434, dan menarik model dengan perintah tunggal seperti ollama pull deepseek-r1:14b. Model reasoning adalah warga negara kelas pertama: CLI menampilkan keluaran <think> secara langsung, dan ada toggle /set think untuk mengaktifkan thinking mode di Qwen 3 dan GPT-OSS.
Di mana ia jatuh pendek: UI obrolan adalah terminal, yang bagus untuk pengembang dan tidak berguna untuk orang lain. Ini tidak mengelola dokumentasi kartu model atau perbandingan.
Harga:
- Gratis: semuanya
- Berbayar: tidak ada
Platform: Windows, macOS, Linux, Docker
Unduh: ollama.com
Garis bawah: instal ini terlebih dahulu, kemudian tambahkan GUI di atas. Lewatkan jika Anda tidak pernah ingin melihat baris perintah.
2. LM Studio - GUI terbaik untuk browsing dan menguji model
LM Studio adalah aplikasi untuk dibuka saat Anda ingin melihat apa yang tersedia. Katalog in-app-nya membungkus daftar model Hugging Face dengan filter yang masuk akal, pratinjau, dan rekomendasi quant. Jendela obrolan menampilkan blok pemikiran di bagian yang dapat diruntuhkan, dan mode server lokal mengekspos endpoint kompatibel OpenAI yang sama seperti Ollama sehingga alat seperti Cursor atau Continue menunjuknya tanpa perbedaan.
Di mana ia jatuh pendek: aplikasi ini closed-source. Jika itu penting bagi Anda, gunakan Jan saja.
Harga:
- Gratis: aplikasi lengkap untuk penggunaan pribadi
- Berbayar: LM Studio for Work, quote-based, untuk penerapan tim
Platform: Windows, macOS, Linux
Unduh: lmstudio.ai
Garis bawah: cara tercepat untuk mencoba lima model reasoning sebelum malam.
3. Jan - Terbaik untuk orang yang ingin klon ChatGPT pribadi
Jan terlihat dan terasa seperti ChatGPT, kecuali setiap pesan tetap di disk Anda. Aplikasi ini open-source di bawah Apache 2.0, mengirimkan server kompatibel OpenAI, dan menarik dari hub model in-app dengan tag reasoning-model di entri DeepSeek dan Qwen teratas. Ekstensi menambahkan perilaku pencarian web atau penafsir kode tanpa apa pun dari itu mengenai endpoint cloud secara default.
Di mana ia jatuh pendek: katalog model lebih kecil dari LM Studio. Parameter sampling tingkat lanjut tersembunyi di belakang toggle.
Harga:
- Gratis: aplikasi lengkap
- Berbayar: tidak ada
Platform: Windows, macOS, Linux
Unduh: jan.ai
Garis bawah: pilihan yang tepat ketika privasi adalah alasan Anda meninggalkan ChatGPT.
4. Msty - Terbaik untuk membandingkan model reasoning berdampingan
Msty mengirimkan obrolan split-view yang menjalankan prompt yang sama melalui dua atau tiga model sekaligus. Ketika Anda mencoba memutuskan apakah DeepSeek R1 14B layak VRAM lebih dari Qwen 3 8B, melihat kedua jawaban, kedua jejak <think>, dan kedua waktu di layar yang sama mengompresi jam pengujian menjadi menit. Itu juga mendukung API jarak jauh, jadi model reasoning lokal dapat dibandingkan dengan model frontier cloud dalam percakapan yang sama.
Di mana ia jatuh pendek: split view menggunakan lebih banyak RAM. Fitur Pro gerbang di belakang lisensi sekali kali.
Harga:
- Gratis: obrolan model tunggal, model lokal tidak terbatas
- Berbayar: $9 sekali untuk Msty Pro, menambahkan split multi-model dan knowledge stack
Platform: Windows, macOS, Linux
Unduh: msty.app
Garis bawah: beli $9 unlock pertama kali Anda menyesal tidak memilikinya.
5. Open WebUI - Terbaik untuk berbagi LLM lokal dengan tim
Open WebUI mengubah Ollama menjadi ruang kerja bersama dengan akun pengguna, riwayat obrolan, dan RAG. Model reasoning ditampilkan dengan bersih, <think> runtuh secara default, dan admin dapat membatasi model mana yang dapat digunakan setiap pengguna. Berjalan di Docker dalam satu baris, mengekspos UI yang sama melalui LAN, dan berpasangan dengan baik dengan workstation yang menghosting model sementara laptop terhubung melalui browser.
Di mana ia jatuh pendek: setup lebih berat dari aplikasi desktop. Anda membutuhkan Docker dan proxy reverse atau port khusus.
Harga:
- Gratis: berlisensi MIT, self-hosted
- Berbayar: tidak ada
Platform: Docker di Windows, macOS, Linux
Unduh: openwebui.com
Garis bawah: pilihan ketika lebih dari satu orang membutuhkan model lokal yang sama.
6. GPT4All - Terbaik untuk instalasi pertama tanpa kurva pembelajaran
GPT4All dari Nomic AI adalah cara paling bebas gesekan untuk menjalankan model reasoning. Instal aplikasi, klik model, klik obrolan. Katalog dikurasi (sekitar selusin model daripada ratusan), yang merupakan fitur bagi orang yang tidak ingin memikirkan quant. LocalDocs menambahkan RAG di atas folder file dalam tiga klik.
Di mana ia jatuh pendek: katalog yang dikurasi meninggalkan model yang diinginkan power user. Kinerja ketinggalan Ollama di GPU.
Harga:
- Gratis: aplikasi lengkap
- Berbayar: tidak ada
Platform: Windows, macOS, Linux
Unduh: gpt4all.io
Garis bawah: aplikasi untuk diinstal di mesin orang tua atau rekan kerja.
7. Text Generation WebUI - Terbaik untuk power user dan fine-tuning
Text Generation WebUI (oobabooga) adalah aplikasi untuk pengotak. Ini mengekspos setiap parameter sampling, mendukung pemuatan LoRA, dan beralih backend antara llama.cpp, ExLlamaV2, Transformers, dan vLLM. Jika Anda ingin membandingkan format quant atau menjalankan model reasoning dengan stop token kustom, ini adalah aplikasi yang memungkinkan Anda melakukannya tanpa patching source.
Di mana ia jatuh pendek: UI adalah banyak. Setiap prompt model reasoning membutuhkan template instruksi yang kompatibel dipilih secara manual.
Harga:
- Gratis: AGPL v3
- Berbayar: tidak ada
Platform: Windows, macOS, Linux
Unduh: github.com/oobabooga/text-generation-webui
Garis bawah: aplikasi untuk orang yang membaca kartu model Hugging Face untuk kesenangan.
Cara memilih yang tepat
- Jika Anda hanya menginginkan obrolan model reasoning tercepat di laptop Anda: LM Studio.
- Jika Anda menginginkan klon ChatGPT yang tidak menyimpan apa pun di cloud: Jan.
- Jika Anda membangun alat di sekitar model lokal dan membutuhkan server kompatibel OpenAI: Ollama.
- Jika Anda berbagi model dengan tim: Open WebUI di atas Ollama.
- Jika Anda ingin membandingkan dua model reasoning pada prompt yang sama: Msty.
- Jika Anda menginstal ini pada mesin seseorang yang tidak pernah menggunakan model lokal: GPT4All.
- Jika Anda ingin bermain dengan quant dan LoRA: Text Generation WebUI.
Pertanyaan yang sering diajukan
Apa aplikasi gratis terbaik untuk menjalankan DeepSeek R1 secara lokal?
Ollama dengan LM Studio atau Jan sebagai klien obrolan. Ollama menarik distil R1 dan melayaninya, dan baik LM Studio maupun Jan menampilkan blok <think> dengan rapi.
Bisakah saya menjalankan LLM reasoning pada laptop tanpa GPU? Ya, pada model yang lebih kecil. GPT4All dan Ollama keduanya jatuh kembali ke CPU. Harapkan 3 hingga 8 token per detik pada laptop modern untuk distil reasoning 7B atau 8B.
Aplikasi LLM lokal mana yang menampilkan chain of thought?
LM Studio, Msty, Jan, dan Open WebUI semuanya merender blok <think> di bagian yang dapat diruntuhkan. Ollama menampilkannya di terminal secara default.
Apakah aplikasi ini bekerja offline? Ketujuhnya. Ollama, Jan, GPT4All, dan Text Generation WebUI tidak memerlukan jaringan sama sekali setelah download model. LM Studio dan Msty hanya menelepon rumah untuk update katalog opsional.
Apakah Msty senilai $9 untuk tingkat Pro? Jika Anda membandingkan model lebih dari sekali seminggu, ya. Tampilan split multi-model saja membenarkan harga pertama kali Anda menggunakannya untuk melewati spreadsheet benchmark.