
Semua orang terobsesi dengan jumlah parameter. Model lebih besar, jawaban lebih baik — sampai token mulai meluncur dengan kecepatan tiga per detik dan kipas di GPU Anda terdengar seperti peniup daun. Setengah dari peningkatan kecepatan yang orang cari dengan pindah dari model 7B ke 70B akan datang dari benar-benar menyetel runtime yang sudah Anda miliki.
LLM inference lokal pada tahun 2026 adalah tumpukan keputusan: skema kuantisasi, dtype KV cache, ukuran batch, prompt cache, speculative decoding, strategi offload. Kami menguji delapan aplikasi desktop untuk optimasi LLM inference lokal, dari runtime tingkat rendah yang mengekspos setiap penggeser hingga alat yang dibungkus yang memilih default yang masuk akal untuk Anda. Pilih yang sesuai dengan seberapa dalam Anda ingin melangkah.
Apa yang harus dicari dalam aplikasi optimasi LLM inference lokal
Tidak setiap runtime mengoptimalkan hal yang sama. Sebelum memilih, ketahui mana dari ini yang Anda benar-benar butuhkan:
- Dukungan kuantisasi. Runtime harus membaca format GGUF, EXL2, AWQ, atau MLC dan membiarkan Anda memilih lebar bit per model. 4-bit adalah standar modern; beberapa beban kerja baik-baik saja pada 3-bit.
- Kontrol KV cache. Dtype cache (fp16 vs q8_0 vs q4_0) dan ukuran cache keduanya mengubah penggunaan VRAM secara substansial. Runtime harus membiarkan Anda mengaturnya.
- Penggunaan ulang prompt cache. Untuk chat dan RAG, penggunaan ulang KV cache dari pesan sebelumnya adalah perbedaan antara follow-up instan dan prefill penuh.
- Speculative decoding. Memasangkan model draft kecil dengan model target besar dapat menggandakan throughput pada hardware yang sama untuk beban kerja chat.
- Multi-GPU dan offload. Offload layer-by-layer ke CPU RAM, tensor split antar GPU, dan alokasi yang menyadari NUMA penting ketika model menjadi besar.
- Batching dan penanganan permintaan konkuren. Jika Anda melayani lebih dari satu klien, throughput pada ukuran batch 8 atau 16 lebih penting daripada latensi pada batch 1.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Platform | Paket gratis | Fitur unggulan |
|---|---|---|---|---|
| llama.cpp | Kuantisasi mendalam + kontrol KV cache | Windows, macOS, Linux | Sepenuhnya gratis, open source | Ekosistem GGUF, offload per-layer |
| Ollama | Runtime tanpa konfigurasi dengan default yang masuk akal | Windows, macOS, Linux | Gratis | Penukaran model satu baris |
| LM Studio | GUI untuk penyesuaian tanpa terminal | Windows, macOS, Linux | Gratis | Pengaturan runtime visual untuk GGUF |
| vLLM | Batched serving dengan PagedAttention | Linux, Windows via WSL | Gratis, open source | Continuous batching untuk banyak klien |
| MLC LLM | Compiled inference di GPU | Windows, macOS, Linux | Gratis, open source | Kernel TVM-compiled, Metal + Vulkan |
| KoboldCpp | Tuning roleplay dan creative writing | Windows, macOS, Linux | Gratis, open source | UI penyesuaian KV cache per-prompt |
| ExLlamaV2 | Fast EXL2 inference di Nvidia | Windows, Linux | Gratis, open source | EXL2 quant + speculative decoding |
| TabbyAPI | Server ExLlamaV2 kompatibel OpenAI | Windows, Linux | Gratis, open source | Jatuh di belakang klien OpenAI apa pun |
Aplikasi
1. llama.cpp — Terbaik untuk kuantisasi mendalam dan kontrol KV cache
llama.cpp adalah runtime yang paling banyak ekosistem dibangun. Ia membaca kuantisasi GGUF dari 8-bit hingga 2-bit, offload per-layer ke CPU ketika model tidak pas di VRAM, dan mengekspos pengaturan dtype cache sehingga Anda dapat menukar kualitas untuk headroom.
Permukaan penyesuaian adalah di mana kecepatan tinggal. Mengatur --n-gpu-layers dengan benar untuk GPU Anda, mencocokkan dtype cache dengan kuant, mengaktifkan --flash-attn, dan menggunakan prompt cache file dapat menggandakan throughput pada hardware yang sama.
Di mana ia kurang: CLI padat dan daftar flag berubah cepat. Penyesuaian pertama kali membutuhkan satu sore membaca dokumen.
Harga:
- Gratis, open source.
Platform: Windows, macOS, Linux — CPU, CUDA, Metal, Vulkan, ROCm.
Unduh: llama.cpp di GitHub
Intinya: Runtime untuk dijangkau ketika kecepatan lebih penting daripada kenyamanan.
2. Ollama — Terbaik untuk runtime tanpa konfigurasi dengan default yang masuk akal
Ollama membungkus llama.cpp dan memilih default yang membawa sebagian besar orang ke throughput yang dapat diterima tanpa menyentuh bendera. Tarik model, jalankan, selesai. Format Modelfile memungkinkan Anda mengatur prompt sistem, parameter sampling, dan panjang konteks per model.
Untuk workstation yang menjalankan beberapa model secara bergantian, ini adalah jalur tercepat dari “terinstal” ke “dapat digunakan.” Penyesuaian lanjutan terjadi melalui parameter Modelfile daripada flag baris perintah.
Di mana ia kurang: Abstraksi menyembunyikan beberapa tuas yang menekan 30% terakhir dari throughput. Pengguna power sering berakhir dengan Ollama untuk penggunaan santai dan llama.cpp untuk pekerjaan berat.
Harga:
- Gratis.
Platform: Windows, macOS, Linux.
Unduh: Ollama untuk desktop
Intinya: Pilihan default untuk seseorang yang baru mengenal LLM lokal yang menginginkan kecepatan tanpa manual.
3. LM Studio — Terbaik untuk penyesuaian tanpa terminal
LM Studio mengekspos knob optimasi llama.cpp melalui GUI yang sebenarnya. Pemilihan quant, n_gpu_layers, panjang konteks, dtype cache, dan ukuran batch semuanya mendapat slider dan dropdown daripada flag.
Itu menjadikannya pilihan terbaik untuk orang yang memahami apa yang dilakukan knob tetapi tidak ingin mengingat sintaks CLI. Chat bawaan dan server API bekerja sebagai harness pengujian saat Anda menyesuaikan.
Di mana ia kurang: Hanya GUI berarti scripting terbatas. Untuk server headless, kembalilah ke llama.cpp atau Ollama.
Harga:
- Gratis untuk penggunaan pribadi dan hobi.
- Berbayar: Rencana tim untuk penyebaran komersial.
Platform: Windows, macOS, Linux.
Unduh: LM Studio untuk desktop
Intinya: GUI penyesuaian yang akhirnya membuat llama.cpp dapat diakses.
4. vLLM — Terbaik untuk batched serving dengan PagedAttention
vLLM bersinar ketika Anda melayani beberapa permintaan bersamaan. PagedAttention mengelola KV cache seperti allocator memori, mengemas banyak urutan aktif ke dalam VRAM yang sama tanpa fragmentasi. Continuous batching berarti permintaan baru masuk di antara generasi token daripada menunggu yang saat ini selesai.
Untuk home lab yang menjalankan endpoint kompatibel OpenAI untuk beberapa aplikasi sekaligus, kurva throughput vLLM pada batch 8 menghancurkan runtime permintaan tunggal.
Di mana ia kurang: Nvidia-first, kurang matang di AMD dan Metal. Tradeoff adalah Anda mungkin menginginkan GPU nyata untuk itu bagaimanapun.
Harga:
- Gratis, open source.
Platform: Linux natively, Windows via WSL.
Unduh: vLLM di GitHub
Intinya: Runtime untuk siapa pun yang melayani lebih dari satu klien dari kotak yang sama.
5. MLC LLM — Terbaik untuk compiled inference di GPU
MLC LLM membuat taruhan yang berbeda: kompilasi kernel model dengan TVM untuk hardware target yang tepat. Itu memberinya dukungan Metal, Vulkan, dan WebGPU yang kuat, yang penting jika desktop Anda adalah Mac Studio atau kotak AMD di mana runtime CUDA-first berjuang.
Hasilnya adalah prefill dan decode yang cepat pada hardware yang llama.cpp baik-baik saja tetapi tidak cepat. Kompilasi menambahkan langkah satu kali per model per target.
Di mana ia kurang: Zoo model lebih kecil dari GGUF, dan workflow lebih berat untuk pengguna pertama kali.
Harga:
- Gratis, open source.
Platform: Windows, macOS, Linux, plus WebGPU di browser.
Unduh: MLC LLM di GitHub
Intinya: Pilihan terkuat jika GPU utama Anda bukan kartu Nvidia.
6. KoboldCpp — Terbaik untuk roleplay dan tuning creative writing
KoboldCpp adalah llama.cpp di bawah dengan UI yang menargetkan penulisan bentuk panjang dan roleplay. Beban kerja itu sangat bergantung pada KV cache — konteks panjang, re-reads berulang dari cerita yang sama sejauh ini — jadi KoboldCpp mengekspos kontrol penggunaan ulang cache dan context-shift secara menonjol.
Alat skenario, informasi dunia, dan fitur memori menjadikannya pilihan kuat di luar audiens target juga. Siapa pun yang menjalankan prompt konteks panjang mendapat manfaat dari penyesuaian cache.
Di mana ia kurang: UI fungsional daripada dipoles. Mode server baik-baik saja tetapi pengalaman utama adalah chat bawaan.
Harga:
- Gratis, open source.
Platform: Windows, macOS, Linux.
Unduh: Rilis KoboldCpp di GitHub
Intinya: Front end yang paling tertala untuk pekerjaan konteks panjang.
7. ExLlamaV2 — Terbaik untuk fast EXL2 inference di Nvidia
ExLlamaV2 adalah mesin inference CUDA-first yang membaca format kuantisasi EXL2. Pada GPU Nvidia yang sama, biasanya mengalahkan llama.cpp pada token-per-second untuk anggaran kualitas bit efektif yang sama. Speculative decoding dengan model draft kecil memberinya lompatan lagi.
Untuk workstation dengan 3090, 4090, atau 5090 sebagai satu-satunya akselerator, di sini kecepatan tinggal. Pasangkan dengan TabbyAPI untuk mendapatkan endpoint kompatibel OpenAI.
Di mana ia kurang: Hanya Nvidia. Tidak ada Metal, tidak ada cerita ROCm.
Harga:
- Gratis, open source.
Platform: Windows, Linux dengan GPU Nvidia.
Unduh: ExLlamaV2 di GitHub
Intinya: Runtime untuk mengeluarkan token paling per detik dari GPU Nvidia.
8. TabbyAPI — Terbaik untuk server ExLlamaV2 kompatibel OpenAI
TabbyAPI membungkus ExLlamaV2 dalam REST API kompatibel OpenAI, sehingga apa pun yang sudah berbicara dengan OpenAI — Cursor, Continue, Aider, LibreChat — dapat menjatuhkannya dengan perubahan URL dasar. Streaming, function calling, dan speculative decoding semuanya bekerja melalui permukaan API yang sama.
Untuk seseorang yang stack-nya sudah mengasumsikan endpoint OpenAI, TabbyAPI adalah jalur terpendek dari “model lokal di disk” ke “semuanya berbicara dengannya.”
Di mana ia kurang: Konfigurasi adalah file TOML, bukan UI. Debugging setup pertama membutuhkan kesabaran.
Harga:
- Gratis, open source.
Platform: Windows, Linux dengan GPU Nvidia.
Unduh: TabbyAPI di GitHub
Intinya: Jembatan yang memungkinkan alat yang ada menggunakan ExLlamaV2 tanpa mengubah apa pun yang lain.
Bagaimana memilih yang tepat
Pilih llama.cpp ketika Anda menginginkan kontrol maksimum dan bersedia mempelajari flag. Semuanya di daftar ini baik menggunakannya atau diukur terhadapnya.
Pilih Ollama ketika Anda menginginkan kecepatan tanpa file konfigurasi. Ini membawa Anda 80% dari jalan dalam satu perintah.
Pilih LM Studio ketika flag llama.cpp terlihat seperti Cina dan Anda menginginkan permukaan penyesuaian yang sama dengan slider.
Pilih vLLM ketika beban kerja adalah banyak permintaan bersamaan. Batching menang dalam skala.
Pilih MLC LLM ketika GPU utama adalah Apple Silicon atau AMD. Runtime CUDA-first kurang efektif pada hardware itu.
Pilih KoboldCpp ketika prompt panjang dan cerita penting. Penanganan konteks adalah seluruh permainannya.
Pilih ExLlamaV2 (dengan TabbyAPI) ketika kotak adalah Nvidia dan setiap milidetik penting.
Tetap di cloud hanya jika model yang Anda butuhkan tidak memiliki bobot lokal, atau volume permintaan cukup besar sehingga A100 yang disewa lebih murah daripada listrik untuk menjalankan yang lokal.
FAQ
Apakah kuantisasi benar-benar membuat LLM lokal lebih cepat?
Ya, dan jauh lebih banyak daripada yang diperkirakan kebanyakan orang. Pindah dari fp16 ke Q5_K_M pada model yang sama biasanya memotong penggunaan VRAM menjadi dua dan meningkatkan token per detik pada beban kerja terikat GPU, dengan kehilangan kualitas cukup kecil sehingga kebanyakan pengguna tidak dapat mendeteksinya dalam tes buta.
Apa itu speculative decoding?
Speculative decoding menjalankan model “draft” kecil untuk menebak beberapa token di muka, kemudian memverifikasinya dalam satu pass model besar. Ketika draft benar, Anda mendapatkan beberapa token per panggilan model besar. Pada beban kerja chat, dapat hampir menggandakan throughput.
Apa itu PagedAttention dan mengapa penting untuk LLM lokal?
PagedAttention adalah teknik manajemen KV cache vLLM. Daripada mengalokasikan slot cache ukuran tetap per permintaan, ia memperlakukan memori cache sebagai halaman yang dapat dialokasikan secara dinamis. Pada server yang sibuk, itu berarti banyak lebih banyak permintaan bersamaan muat dalam VRAM yang sama.
Runtime LLM lokal mana yang tercepat di Apple Silicon?
Kernel Metal yang dikompilasi MLC LLM biasanya opsi pengguna tunggal tercepat di Mac. Backend Metal llama.cpp dekat dan lebih mudah dijalankan — pilih MLC jika 10 hingga 20% ekstra penting, llama.cpp sebaliknya.
Bisakah saya menjalankan LLM lokal tanpa GPU diskrit?
Ya. llama.cpp dan Ollama keduanya berjalan di CPU dengan model GGUF apa pun. Kecepatan di laptop modern berkisar dari beberapa token per detik pada model 7B hingga merangkak lambat pada 70B — dapat digunakan untuk chat, menyakitkan untuk generasi panjang.