Aplikasi terbaik untuk menjalankan beberapa model AI lokal di desktop adalah yang berhenti memperlakukan GPU Anda seperti konsol kartrid slot tunggal. Artikel XDA terbaru dari penulis yang berhenti mengejar model lokal yang lebih besar menyatakan ini dengan jelas: dua model 2GB berjalan beriringan mengalahkan satu model 8GB, karena setiap model kecil dipilih untuk pekerjaan tertentu. Model kode 3B menangani pelengkapan otomatis. Model chat 3B menangani percakapan. Tidak satupun dari mereka perlu menjadi serbaguna.
Itulah pola yang kami pedulikan di sini. Bukan mengejar benchmark. Routing. Kami menguji tujuh desktop runner dan orchestrator selama beberapa minggu terakhir, mengukur seberapa cepat mereka menukar model, memeriksa apakah mereka dapat menyimpan dua model yang dimuat sekaligus, dan menilai seberapa berguna routing dalam praktik. Daftar ini untuk siapa pun yang memiliki kartu 12GB hingga 24GB yang menginginkan asisten nyata ditambah model kode ditambah mungkin model visi, semuanya pada satu mesin.
Hal-hal yang perlu diperhatikan dalam runner multi-model lokal
Enam hal membedakan alat yang membuat alur kerja multi-model menyenangkan dari yang memaksa Anda ke dalam rut model tunggal.
- Kecepatan hot-swap. Ketika Anda mengganti model di tengah sesi, apakah aplikasi membongkar yang lama dan memuat yang baru dalam hitungan detik, atau apakah itu tersangkut pada cold start setiap kali.
- Slot konkuren. Beberapa alat dapat menyimpan dua atau tiga model resident sehingga respons terasa instan. Yang lain memuat satu, mengusirnya, memuat yang berikutnya.
- Routing. Bisakah Anda mengarahkan chat, pelengkapan otomatis, embeddings, dan visi ke backend berbeda tanpa mengedit config pada setiap permintaan.
- API kompatibel OpenAI. Aplikasi yang mengekspos endpoint gaya OpenAI terhubung langsung ke ekstensi IDE, alat catatan, dan orchestrator.
- Chat paralel. Mampu mengirim prompt yang sama ke dua model dan membandingkan output dalam satu jendela sangat berguna untuk memilih spesialis.
- Desktop lintas platform. Dukungan Windows, macOS, dan Linux dengan set fitur yang sama penting jika setup Anda mencampur mesin.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Platform | Paket gratis | Tingkat berbayar | Cerita multi-model |
|---|---|---|---|---|---|
| Ollama | Runner foundational dan lapisan API | Windows, macOS, Linux | Sepenuhnya gratis, open source | Tidak ada | Hot-swap on demand, menjaga model terakhir tetap hangat |
| LM Studio | GUI tab multi-model | Windows, macOS, Linux | Gratis untuk penggunaan pribadi | Lisensi tim untuk pekerjaan | Memuat beberapa model sekaligus, tukar tab |
| Msty | Chat paralel di seluruh model | Windows, macOS, Linux | Tingkat gratis | Lisensi seumur hidup Aurum | Respons berdampingan dari hingga delapan model |
| Jan | Chat multi-model open source | Windows, macOS, Linux | Sepenuhnya gratis, open source | Tidak ada | Swap per percakapan, server kompatibel OpenAI |
| Open WebUI | Lapisan routing pipa di atas Ollama | UI web, self-hosted | Sepenuhnya gratis, open source | Tidak ada | Pilihan model per permintaan, scripting pipa |
| LocalAI | Router API drop-in | Windows, macOS, Linux, Docker | Sepenuhnya gratis, open source | Tidak ada | Satu endpoint merutekan ke banyak backend dan format |
| LiteLLM | Proxy lintas backend | Windows, macOS, Linux | Sepenuhnya gratis, open source | Tingkat cloud terkelola | Rute menurut nama model ke penyedia lokal atau jarak jauh mana pun |
Aplikasi
1. Ollama, terbaik untuk hot-swapping model lokal
Ollama adalah aplikasi yang sebagian besar dari daftar ini tergantung, dan untuk alasan yang baik. CLI dan API-nya di sekitar llama.cpp membuat manajemen model terasa seperti docker pull, dan perilakunya dengan multiple model adalah alasan mengapa alur kerja dua model kecil bekerja sama sekali. Jalankan ollama run llama3.2:3b untuk chat dan ollama run qwen2.5-coder:3b untuk pelengkapan otomatis, dan daemon menjaga yang baru digunakan tetap hangat sambil memuat yang lain. Keep-alive default adalah lima menit, jadi switch kembali cepat tidak membayar ulang biaya muat. Atur OLLAMA_KEEP_ALIVE lebih tinggi dan model tetap resident sampai tekanan VRAM memaksa pengusiran.
Endpoint kompatibel OpenAI di http://localhost:11434/v1 berarti setiap plugin IDE, frontend chat, dan kerangka agent yang kami uji terhubung tanpa adaptor. Pada kartu 24GB kami menyimpan model chat 7B dan model kode 3B resident bersama dengan ruang yang cukup.
Di mana ia tertinggal: Tidak ada GUI. Penemuan model adalah file teks yang disebut Modelfile. Dukungan GPU Windows telah stabil sejak rilis native, tetapi masih tertinggal macOS untuk polish.
Harga:
- Gratis: semuanya, open source di bawah MIT.
- Berbayar: tidak ada.
Platform: Windows, macOS, Linux.
Unduh: Situs penerbit - GitHub
Garis bawah: Instal ini terlebih dahulu. Bahkan jika driver harian Anda adalah aplikasi GUI, Anda mungkin menginginkan Ollama sebagai backend.
2. LM Studio, GUI terbaik untuk menyimpan beberapa model sekaligus
LM Studio adalah aplikasi untuk diberikan kepada pengguna non-CLI yang masih menginginkan trik model kecil. Seri 0.3 menambahkan dukungan multi-model dalam jendela yang sama, jadi Anda dapat memuat model chat di satu tab, model kode di tab lain, dan beralih di antara keduanya tanpa menunggu muat setiap kali. Server built-in mengekspos endpoint kompatibel OpenAI per model yang dimuat, yang berarti ekstensi editor dapat menekan model kode sementara jendela chat Anda terus berbicara dengan model chat.
Penemuan model adalah kotak pencarian terhadap Hugging Face dengan pemilih kuantisasi dan estimator VRAM tertanam. UI menampilkan slider offload GPU per model, yang penting ketika Anda mencoba memasukkan dua model berukuran menengah pada satu kartu.
Di mana ia tertinggal: Bukan open source. Lisensi gratis mencakup penggunaan pribadi, dan ada lisensi terpisah untuk penggunaan pekerjaan yang diminta oleh alur download untuk diakui. Beberapa format kuantisasi dimuat lebih lambat daripada di raw llama.cpp.
Harga:
- Gratis: penggunaan pribadi, tidak ada batas waktu.
- Berbayar: lisensi pekerjaan terpisah dengan istilah per-seat, kontak diperlukan.
Platform: Windows, macOS, Linux.
Unduh: Situs penerbit - GitHub
Garis bawah: Pilihan terbaik jika Anda menginginkan GUI nyata, beberapa model yang dimuat, dan server API yang berfungsi tanpa menyentuh terminal.
3. Msty, terbaik untuk chat paralel dan perbandingan
Msty adalah aplikasi yang membuat kami berhenti A/B menguji model dengan copy-paste. Tampilan split-nya memungkinkan Anda mengirim satu prompt ke dua, empat, atau hingga delapan model sekaligus dan membaca respons berdampingan. Itulah alur kerja yang tepat yang Anda inginkan ketika Anda mencoba mengetahui model kecil mana yang layak untuk disimpan loaded. Arahkan ke Ollama dan ia mewarisi model lokal Anda secara otomatis. Arahkan ke kunci OpenAI atau Anthropic dan membandingkan lokal versus hosted dalam tampilan yang sama.
Fitur Knowledge Stack memungkinkan Anda melampirkan folder dokumen dan PDF dan membuat query di seluruh model, yang berpasangan dengan baik dengan model chat kecil ditambah model embedding kecil yang disimpan resident bersama.
Di mana ia tertinggal: Bukan open source. Tingkat gratis mencakup penggunaan pribadi, dan upgrade Aurum membuka split chat di atas dua model, sinkronisasi workspace, dan beberapa extras lainnya. UI berat fitur dan membutuhkan sesi untuk belajar.
Harga:
- Gratis: tier pribadi yang solid dengan split chat dua arah dan model lokal.
- Berbayar: lisensi seumur hidup Aurum membuka tampilan multi-model yang lebih luas dan sinkronisasi.
Platform: Windows, macOS, Linux.
Unduh: Situs penerbit
Garis bawah: Pilih ini ketika Anda benar-benar perlu melihat dua model menjawab pertanyaan yang sama pada waktu yang sama.
4. Jan, klien chat multi-model terbaik open source
Jan adalah alternatif open source jika Anda menginginkan GUI gaya LM Studio tanpa pertanyaan lisensi. Ini dilengkapi mesin inferensi sendiri, dapat berjalan terhadap server Ollama atau llama.cpp, dan memungkinkan Anda menukar model berdasarkan per-percakapan. Setiap thread mengingat model mana, prompt sistem mana, dan parameter mana yang digunakan, sehingga thread kode dan thread penulisan dapat menunjuk ke spesialis berbeda tanpa mencurahkan satu sama lain.
Server lokal built-in mengekspos endpoint kompatibel OpenAI, dan aplikasi itu sendiri dapat diperluas melalui API ekstensi kecil. Dalam pengujian kami, swap model antar dua thread hampir instan ketika target sudah dimuat dan sekitar tiga hingga delapan detik ketika harus dimuat dari disk pada NVMe.
Di mana ia tertinggal: Tidak dapat menyimpan beberapa model resident di mesin sendiri. Jika Anda menginginkan dua dimuat sekaligus, arahkan ke Ollama dan biarkan Ollama melakukan manajemen resident. Akselerasi GPU di Windows masih tertinggal dari build macOS untuk beberapa format kuantisasi.
Harga:
- Gratis: semuanya, open source di bawah AGPL.
- Berbayar: tidak ada.
Platform: Windows, macOS, Linux.
Unduh: Situs penerbit - GitHub
Garis bawah: Pilihan yang tepat jika open source penting dan Anda menginginkan routing model per-thread tanpa pekerjaan CLI.
5. Open WebUI, lapisan routing terbaik di atas Ollama
Open WebUI dulu dikenal sebagai Ollama WebUI, dan tetap menjadi frontend web paling lengkap untuk stack lokal self-hosted. Apa yang memperolehnya tempat di sini adalah sistem pipelinenya: Anda dapat menentukan skrip yang memilih model per permintaan berdasarkan konten prompt, riwayat pesan, atau file terlampir. Contoh klasiknya adalah pipeline routing yang mengirim apa pun yang dimulai dengan blok kode ke model coder Anda dan semuanya yang lain ke model chat Anda, semuanya dalam satu percakapan.
Ini juga mendukung respons model paralel dalam satu pesan, ditambah RAG dengan penyimpanan dokumen Anda sendiri, ditambah pemanggilan fungsi. Karena mengekspos semuanya melalui LAN Anda, satu kotak Ollama di ruang bawah tanah dapat melayani chat multi-model yang dirutekan ke setiap mesin di rumah.
Di mana ia tertinggal: Pertama web. Tidak ada klien desktop native, jadi Anda baik menjalankannya secara lokal di browser atau self-host di server. Setup meminta Docker atau Python, bukan double-click installer.
Harga:
- Gratis: semuanya, open source di bawah lisensi gaya BSD-3.
- Berbayar: tidak ada.
Platform: Berjalan di mana pun Docker atau Python berjalan. Akses melalui browser di Windows, macOS, Linux.
Unduh: Situs penerbit - GitHub
Garis bawah: Gunakan ini ketika Anda menginginkan routing yang dapat diprogram dan nyaman dengan instalasi Docker lima menit.
6. LocalAI, router API drop-in terbaik di seluruh keluarga model
LocalAI adalah jawaban untuk masalah tertentu. Anda memiliki model chat di GGUF, model whisper untuk transkripsi, model gambar untuk difusi, dan model embedding kecil, dan Anda menginginkan satu endpoint yang berbicara kompatibel OpenAI untuk semuanya. Ini menjalankan setiap backend di worker sendiri, merutekan permintaan menurut nama model, dan mengembalikan respons dalam bentuk yang sama yang akan dilakukan API hosted. Plugin Continue Anda, alat catatan Anda, dan skrip khusus Anda semua menunjuk ke URL yang sama dan memilih model mereka menurut nama.
Untuk pola dua model kecil, ini berarti alur kerja seperti Continue menanyakan qwen-coder-3b sementara aplikasi catatan Anda menanyakan llama-3.2-3b, keduanya dilayani dari proxy yang sama, keduanya dapat dimuat panas, keduanya terisolasi sehingga pekerjaan embed berat tidak membatalkan chat.
Di mana ia tertinggal: Setup lebih berat daripada Ollama. Konfigurasi model adalah YAML per backend. Akselerasi GPU berfungsi tetapi menginginkan beberapa pengetahuan tentang apa yang telah Anda instal. Dokumentasi lengkap tetapi mengasumsikan Anda sudah tahu seperti apa muatan kompatibel OpenAI.
Harga:
- Gratis: semuanya, open source di bawah MIT.
- Berbayar: tidak ada.
Platform: Windows, macOS, Linux, Docker.
Unduh: Situs penerbit - GitHub
Garis bawah: Pilihan yang tepat ketika Anda menginginkan satu API lokal yang berbicara ke teks, visi, audio, dan embeddings tanpa menempel server terpisah bersama.
7. LiteLLM, proxy lintas backend terbaik untuk routing tugas
LiteLLM dimulai sebagai Python SDK untuk memanggil seratus penyedia model dengan satu antarmuka, dan server proxy-nya adalah yang memperolehnya tempat dalam daftar berorientasi lokal-pertama. Jalankan di depan Ollama, LM Studio, LocalAI, atau campuran apa pun, dan klien berbicara dengannya dengan muatan kompatibel OpenAI. Ini menulis ulang permintaan untuk backend mana pun di balik nama model yang diminta. Itu berarti satu endpoint merutekan chat ke Llama lokal Anda dan code ke Qwen Coder lokal Anda, dengan alat yang sama mendapatkan keduanya tanpa mengetahui di mana keduanya tinggal.
Ini juga menangani fallback, percobaan ulang, batas kecepatan, dan anggaran per-kunci, yang penting saat Anda mulai membiarkan lebih dari satu aplikasi berbagi GPU Anda.
Di mana ia tertinggal: Ini adalah proxy, bukan runner. Anda masih memerlukan Ollama atau LocalAI di belakangnya untuk benar-benar melayani model. Konfigurasi adalah file YAML. Dashboard yang dipoles duduk dalam tier cloud terkelola, jadi self-hosters bergantung pada UI gratis ditambah file config.
Harga:
- Gratis: proxy open-source, penggunaan lokal unlimited.
- Berbayar: hosted control plane dengan fitur tim, ditagih per penggunaan.
Platform: Windows, macOS, Linux, Docker.
Unduh: Situs penerbit - GitHub
Garis bawah: Tambahkan ini pada hari Anda memiliki lebih dari satu aplikasi yang menekan lebih dari satu model lokal dan Anda menginginkan sumber kebenaran tunggal untuk nama, routing, dan batas.
Cara memilih yang tepat
Jika Anda menginginkan setup paling sedikit untuk trik model kecil, jalankan Ollama dan selesai. Tarik model chat 3B dan model kode 3B, biarkan daemon menjaga satu tetap hangat sementara Anda menggunakan yang lain, dan arahkan editor Anda ke endpoint lokal.
Jika Anda menginginkan GUI dan tanpa terminal, instal LM Studio. Muat dua model dalam dua tab dan gunakan server built-innya untuk apa pun yang membutuhkan API.
Jika Anda benar-benar ingin membandingkan model sebelum melakukan komit VRAM ke mereka, gunakan Msty dan bagi prompt yang sama di seluruh kandidat sampai satu menang.
Jika Anda menginginkan GUI dan open source, jalankan Jan di atas Ollama.
Jika Anda ingin routing berdasarkan konten prompt daripada berdasarkan aplikasi, self-host Open WebUI di depan Ollama dan tulis pipeline.
Jika workload Anda mencakup visi, transkripsi, atau embeddings bersama chat, letakkan LocalAI di tengah dan biarkan satu API melayani semuanya.
Jika Anda sudah memiliki tiga alat yang menekan dua model dan menjadi berantakan, jatuhkan LiteLLM di depan dan beri nama ulang semuanya sesuai peran.
FAQ
Bisakah saya benar-benar menjalankan dua model AI lokal pada saat yang bersamaan?
Ya, pada GPU apa pun dengan cukup VRAM untuk menampung keduanya. Dua model 3B atau 4B yang dikuantisasi cocok nyaman di kartu 12GB. Ollama dan LM Studio dapat menyimpan keduanya resident, dan permintaan ke yang mana pun menganggur kembali segera tanpa cold load. Artikel XDA yang menginspirasi artikel ini adalah contoh kerja, bukan teori.
Apakah satu model AI lokal besar selalu lebih baik daripada dua yang kecil?
Tidak untuk alur kerja nyata. Model 8B tunggal harus menjadi generalis, yang berarti itu coder biasa-biasa saja dan penulis rata-rata. Dua model 3B yang dipilih untuk spesialisasi mereka (model coder ditambah model chat, katakan) sering mengalahkan model tunggal yang lebih besar di setiap tugas spesialis, terutama dengan routing yang tepat. Satu tempat model tunggal yang lebih besar masih menang adalah penalaran mendalam pada satu pertanyaan keras tunggal yang membutuhkan konteks panjang.
Apa aplikasi gratis terbaik untuk menjalankan beberapa model lokal di desktop?
Ollama, untuk daemon dan API. Tambahkan Jan atau Open WebUI di atas ketika Anda menginginkan GUI atau routing yang dapat diprogram. Ketiga-tiganya open source dan gratis tanpa cap tempat duduk.
Apakah LM Studio membiarkan Anda menjalankan dua model pada saat yang bersamaan?
Ya, sejak seri 0.3 mendukung pemuatan beberapa model dalam sesi yang sama dengan tab, dan server kompatibel OpenAI built-in mengekspos setiap model yang dimuat sebagai endpoint terpisah. Batasan utama adalah VRAM.
Berapa banyak VRAM yang saya butuhkan untuk menjalankan dua model AI lokal?
Minimum nyaman untuk dua model 3B atau 4B yang dikuantisasi adalah 12GB. Pada kartu 8GB Anda dapat baru saja menjalankan dua model yang sangat kecil di Q4, tetapi Anda akan kehilangan beberapa ruang headroom konkuren. Untuk 7B ditambah 3B disimpan resident bersama, rencanakan pada 16GB dan ke atas.
Apa perbedaan antara Ollama dan LocalAI?
Ollama adalah runner terfokus di sekitar llama.cpp dengan CLI bersih, katalog model teks, dan endpoint kompatibel OpenAI. LocalAI adalah lapisan API yang lebih luas yang dapat memfrontkan banyak backend sekaligus, termasuk teks, gambar, audio, dan embeddings, dengan config YAML per backend. Ollama lebih mudah dimulai. LocalAI adalah apa yang Anda jangkau setelah alur kerja Anda lebih dari sekadar chat.