Menjalankan beberapa LLM lokal kecil di desktop

XDA menerbitkan artikel bulan ini yang berpendapat bahwa dua model lokal 2 GB yang berjalan secara paralel mengalahkan satu model 8 GB di hampir setiap tugas nyata, dan penulis itu benar. Model kecil yang disesuaikan untuk kode ditambah model kecil yang disesuaikan untuk obrolan, berjalan beriringan, menggunakan lebih sedikit VRAM, merespons lebih cepat, dan memungkinkan Anda mengarahkan pertanyaan yang tepat ke alat yang tepat. Kesulitannya adalah tooling: sebagian besar aplikasi LLM lokal mengasumsikan satu model sekaligus dan satu jendela obrolan. Kedelapan aplikasi untuk menjalankan beberapa LLM lokal secara bersamaan di desktop di bawah ini semua menangani model yang bersamaan, baik secara native atau dengan mengekspos endpoint yang kompatibel dengan OpenAI yang dapat ditunjukkan oleh aplikasi kedua.

Yang harus dicari dalam penjalan multi-model LLM

Kriteria nyata untuk menjalankan lebih dari satu model:

Perbandingan cepat

Aplikasi Terbaik untuk Multi-model Paket gratis Harga awal GUI
Ollama CLI-first, OpenAI endpoint Ya (pemuatan paralel) Gratis Gratis Tidak (CLI)
LM Studio Manajer model dengan sekali klik Ya Gratis Gratis Ya
Jan Obrolan fully offline + backend Ya Gratis Gratis Ya
llama.cpp server Kontrol paling mentah, jejak terkecil Ya (per-proses) Gratis Gratis Tidak
LiteLLM Rute ke 100+ backends Perute Gratis Gratis (opt-in cloud) UI Web
Open WebUI Frontend multi-model chat Ya Gratis Gratis Ya (web)
vLLM Throughput tingkat produksi Ya (paralelisme tensor) Gratis Gratis Tidak
Msty Lokal + cloud dalam satu aplikasi desktop Ya (Split Chat) Gratis 8,99 USD/bulan Ya

Aplikasi

1. Ollama, runtime default

Ollama memuat dan membongkar model sesuai permintaan dan mengekspos API yang kompatibel dengan OpenAI di port 11434. Atur OLLAMA_NUM_PARALLEL=2 dan OLLAMA_MAX_LOADED_MODELS=3 di env Anda, mulai ulang layanan, dan Anda dapat menekan dua model secara paralel dari klien mana pun. Pada M2 Pro dengan memori terpadu 32 GB, kami menjalankan Qwen2.5-Coder 3B dan Llama 3.2 3B beriringan dengan ruang kepala untuk model visi kecil.

Ke mana pun itu jatuh pendek: Tidak ada GUI native. Panjang konteks default (2048) kecil untuk pekerjaan nyata, jadi sesuaikan. Proses ollama serve tidak secara otomatis menyematkan model ke GPU tertentu pada rig multi-GPU.

Harga:

Platform: macOS, Windows, Linux.

Unduh: Ollama | GitHub

Bottom line: Lapisan dasar. Hampir setiap alat lain dalam daftar ini membungkus Ollama atau berbagi arsitekturnya. Instal terlebih dahulu.

2. LM Studio, GUI yang dipoles

LM Studio adalah aplikasi yang paling banyak orang instal terlebih dahulu. Ini dilengkapi dengan browser model penuh, UI obrolan, dan, sejak rilis 0.3, server lokal bawaan yang menjalankan beberapa model secara bersamaan. Katalog model ditarik langsung dari Hugging Face dan difilter berdasarkan apa yang akan sesuai dengan mesin Anda. Mode Split Chat memungkinkan Anda membandingkan dua model pada prompt yang sama secara real-time.

Ke mana pun itu jatuh pendek: Bukan open source (gratis untuk penggunaan pribadi, hubungi mereka untuk penggunaan pekerjaan). Versi llama.cpp yang disertakan dapat tertinggal dari upstream.

Harga:

Platform: Windows, macOS, Linux.

Unduh: LM Studio

Bottom line: Titik masuk terbaik jika Anda menginginkan GUI. Pasangkan dengan Ollama untuk scripting.

3. Jan, LM Studio open-source

Jan adalah alternatif open-source untuk LM Studio: ide yang sama, dilisensikan MIT, dan tujuan yang dinyatakan untuk berjalan sepenuhnya offline. Utas obrolan multi-model memungkinkan setiap utas untuk dikunci ke model yang berbeda. Ini menjalankan backend llama.cpp sendiri dan dapat proxy ke Ollama jarak jauh atau API yang kompatibel dengan OpenAI ketika Anda menginginkan model yang lebih besar.

Ke mana pun itu jatuh pendek: Proyek yang lebih muda daripada LM Studio. Ekstensi yang kurang banyak dikemas.

Harga:

Platform: Windows, macOS, Linux.

Unduh: Jan | GitHub

Bottom line: Pilih ini jika open source penting. Secara fungsional sangat mirip dengan LM Studio.

4. llama.cpp server, primitif dasar

llama.cpp dilengkapi dengan server HTTP stateless yang Anda luncurkan per model. Dua perintah shell, dua port, dua model. Ini adalah cara paling ketat untuk menahan dua kuantisasi GGUF di RAM: tidak ada pembungkus, tidak ada penjadwal, tidak ada telemetri, dan overhead memori terkecil dari apa pun di sini.

Ke mana pun itu jatuh pendek: Anda menghubungkan ruting Anda sendiri. Tidak ada GUI. Tidak ada manajer model. Hanya baris perintah untuk penyiapan.

Harga:

Platform: Windows, macOS, Linux (juga Docker).

Unduh: GitHub

Bottom line: Untuk orang-orang yang ingin memahami apa yang disembunyikan lapisan abstraksi. Sempurna untuk rig scripting.

5. LiteLLM, perute

LiteLLM tidak menghosting model; itu merutenya. Arahkan ke instans Ollama Anda, server LM Studio, kunci API Anthropic, dan endpoint Azure, lalu kirim setiap permintaan melalui satu URL yang kompatibel dengan OpenAI dan biarkan perute memutuskan. File konfigurasi YAML dengan fallback per-model dan batas laju memungkinkan asisten pengkodean untuk kembali ke model lokal yang lebih kecil ketika yang besar sibuk.

Ke mana pun itu jatuh pendek: Menambahkan proses ekstra untuk dikelola. Keputusan ruting debug memerlukan beberapa bacaan log.

Harga:

Platform: Windows, macOS, Linux (Python, Docker).

Unduh: GitHub

Bottom line: Lem antara multiple runners. Lewati jika Anda hanya menjalankan satu backend, wajib jika Anda menjalankan tiga.

6. Open WebUI, frontend seperti ChatGPT

Open WebUI adalah interface obrolan yang dipoles untuk model lokal. Hubungkan ke Ollama (atau endpoint apa pun yang kompatibel dengan OpenAI), dan ini memberi Anda auth multi-pengguna, riwayat obrolan, switching model pertengahan percakapan, dan perbandingan model berdampingan dalam satu tab browser. Berguna untuk rumah tangga di mana empat orang berbagi satu mesin.

Ke mana pun itu jatuh pendek: Berjalan di Docker untuk pengalaman yang lancar; instalasi native dimungkinkan tetapi lebih rumit. Menggunakan sekitar 500 MB RAM sebelum model apa pun dimuat.

Harga:

Platform: Windows, macOS, Linux (Docker).

Unduh: GitHub

Bottom line: Frontend terbaik jika Anda sudah memiliki Ollama berjalan. Mode Split Chat adalah fitur pembunuh.

7. vLLM, mesin throughput

vLLM adalah apa yang Anda instal ketika alat desktop berhenti diskalakan. Manajemen memori PagedAttention menyimpan beberapa model dengan utilisasi VRAM lebih baik daripada runner model-tunggal apa pun. Paralelisme tensor membagi satu model di seluruh GPU; beberapa deployment di server yang sama menghosting model yang berbeda secara bersamaan. Overkill untuk laptop, penting untuk workstation dengan dua GPU.

Ke mana pun itu jatuh pendek: Linux-first (Windows melalui WSL2). Memerlukan Python dan pengaturan CUDA. Tidak ditujukan untuk pengguna kasual.

Harga:

Platform: Linux, Windows (WSL2), macOS (Apple Silicon sebagian).

Unduh: GitHub

Bottom line: Hanya capai ini jika Anda memiliki GPU serius. Di satu 4090, Ollama lebih mudah dan hampir secepat.

8. Msty, aplikasi desktop lokal+cloud

Msty dilengkapi sebagai satu biner desktop tunggal yang menjalankan model lokal melalui runtime bundel dan model cloud melalui kunci API Anda sendiri, beriringan di jendela yang sama. Split Chat membandingkan hingga empat model per prompt. Fitur Knowledge Stacks mengindeks dokumen lokal dan berbagi indeks di seluruh model.

Ke mana pun itu jatuh pendek: Tier gratis sangat murah hati tetapi membatasi split chat menjadi dua model. Tier berbayar untuk split empat arah di sisi pricey.

Harga:

Platform: Windows, macOS, Linux.

Unduh: Msty

Bottom line: Cara termudah untuk membandingkan model lokal vs. cloud berdampingan. Bayar untuk itu hanya jika Anda memerlukan split empat arah.

Cara memilih yang tepat

FAQ

Bisakah saya menjalankan dua LLM pada satu GPU?

Ya, jika kedua versi terkuantisasi cocok di VRAM. Model 3B pada Q4_K_M menggunakan sekitar 2 GB; dua di antaranya cocok nyaman pada kartu 8 GB. Atur OLLAMA_MAX_LOADED_MODELS di atas 1 untuk menjaganya tetap hangat.

Apakah LLM lokal kecil benar-benar bagus?

Sejak Qwen 2.5 dan Llama 3.2 di kisaran 3B-7B, model kecil menangani ringkasan, penyelesaian kode, ekstraksi, dan obrolan bentuk pendek pada kualitas mendekati GPT-3.5. Mereka gagal pada penalaran konteks panjang dan tugas multi-langkah kompleks. Rute di sekitar ini dengan model yang lebih besar untuk prompt sulit.

Apa perbedaan antara Ollama dan LM Studio?

Ollama adalah runtime CLI-first dengan API HTTP. LM Studio adalah aplikasi desktop GUI-first yang menjalankan server llama.cpp yang disertakan. Mereka dapat berjalan paralel di mesin yang sama.

Apakah saya memerlukan GPU untuk menjalankan LLM lokal?

Tidak, tetapi itu membantu. Model 3B berjalan dengan kecepatan yang dapat dibaca (10 hingga 20 token/detik) pada CPU Apple Silicon modern atau chip Intel/AMD dengan 16 GB RAM. GPU mendorong itu hingga 60 hingga 200 token/detik.

Aplikasi mana yang berjalan paling cepat?

Per token, vLLM di GPU NVIDIA modern. Per install, llama.cpp dengan quant yang baik. Per kenyamanan, Ollama.