XDA menerbitkan artikel bulan ini yang berpendapat bahwa tumpukan AI lokal yang lebih kecil adalah tumpukan AI lokal yang lebih produktif. Penulis telah mengumpulkan kekacauan biasa: dua pelari model, tiga antarmuka pengguna, basis data vektor yang tidak digunakan oleh siapa pun, dan folder adapter yang telah mereka lupakan. Mengurangi ke set minimal membuat pengaturan lebih mudah dirawat dan lebih mudah dijangkau. Kami menguji delapan aplikasi terbaik untuk tumpukan AI lokal minimal di desktop, di MacBook Pro M3, stasiun kerja Windows dengan RTX 4070, dan kotak Debian dengan AMD 7800 XT, berfokus pada bagaimana masing-masing berperilaku sebagai satu-satunya alat di tumpukan daripada satu dari banyak.
Apa yang harus dicari dalam aplikasi AI lokal minimalis
- Instalasi biner tunggal atau mendekatinya. Alat yang merupakan
brew installatau.msimengalahkan alat yang memerlukan Docker ditambah Python ditambah file konfigurasi. - Manajemen model yang tetap tidak mengganggu. Mengunduh GGUF harus menjadi satu perintah. Menghapus satu tidak harus memerlukan pencarian folder tersembunyi.
- Kompatibilitas API. Titik akhir yang kompatibel dengan OpenAI adalah apa yang memungkinkan Anda mengarahkan setiap alat yang ada ke model lokal Anda tanpa menulis ulang kedua sisi.
- Deteksi GPU dan CPU otomatis. Tumpukan harus mengetahui apakah Anda memiliki Metal, CUDA, ROCm, atau hanya CPU dan menggunakan yang tepat. Pemilihan backend manual adalah kekacauan yang seharusnya dihilangkan oleh alat-alat ini.
- Disiplin RAM. Alat yang menganggur pada 2 GB RAM untuk melayani model yang cocok di 8 GB melakukan sesuatu dengan salah.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Platform | Paket gratis | Harga mulai | Fitur menonjol |
|---|---|---|---|---|---|
| llama.cpp | Runtime referensi | Windows, macOS, Linux | Gratis, sumber terbuka | Gratis | Inference biner tunggal portabel |
| llamafile | Satu file, tidak ada instalasi | Windows, macOS, Linux | Gratis, sumber terbuka | Gratis | Model ditambah runtime dalam satu file yang dapat dieksekusi |
| Ollama | CLI paling sederhana ditambah API | Windows, macOS, Linux | Gratis, sumber terbuka | Gratis | ollama run dan Anda memiliki titik akhir OpenAI |
| Jan | UI desktop asli dengan API | Windows, macOS, Linux | Gratis, sumber terbuka | Gratis | Obrolan desktop lintas platform |
| KoboldCpp | UI biner tunggal ditambah API | Windows, macOS, Linux | Gratis, sumber terbuka | Gratis | Pelari GGUF dengan UI web bawaan |
| Msty | UI komersial yang dipoles pada model lokal | Windows, macOS, Linux | Tingkat gratis | Langganan Msty untuk fitur canggih | Antarmuka obrolan multi-model |
| GPT4All | Obrolan desktop paling sederhana | Windows, macOS, Linux | Gratis, sumber terbuka | Gratis | Ramah pemula, tidak ada CLI |
| LM Studio | Pelari lokal berfitur lengkap | Windows, macOS, Linux | Gratis untuk penggunaan pribadi | Lisensi bisnis | UI penemuan model, dukungan backend luas |
Aplikasinya
1. llama.cpp — Terbaik untuk runtime referensi yang dibangun oleh semua orang
llama.cpp adalah runtime yang membungkus sebagian besar daftar ini dalam satu cara atau lainnya. Ini adalah server inference C++ yang portabel dan bebas ketergantungan yang menjalankan model GGUF di CPU, Metal, CUDA, dan ROCm. Sebagai tumpukan minimal sendiri, llama-server memberikan Anda titik akhir yang kompatibel dengan OpenAI, dan llama-cli memberikan Anda REPL. Itu cukup untuk sebagian besar pekerjaan AI lokal.
Kemana kelemahannya: Tidak ada UI yang dipoles. Anda mengompilasi atau mengunduh biner rilis. Manajemen model bersifat manual.
Harga:
- Gratis: Sumber terbuka sepenuhnya
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: github.com/ggerganov/llama.cpp
Intinya: llama.cpp adalah pilihan ketika Anda menginginkan bagian yang bergerak paling sedikit dan nyaman di terminal.
2. llamafile — Terbaik untuk runtime dan model dalam satu file yang dapat dieksekusi
llamafile oleh proyek Mozilla Ocho menggabungkan model dan runtime llama.cpp ke dalam satu biner Cosmopolitan-libc yang berjalan di Windows, macOS, dan Linux tanpa instalasi. Unduh file, chmod itu, jalankan. Itu membuka UI browser dan mengekspos API yang kompatibel dengan OpenAI di localhost. Ini adalah interpretasi paling literal dari “AI lokal minimalis” di daftar.
Kemana kelemahannya: File biner portabel tunggal dapat memicu peralatan keamanan host. Mengunduh model baru berarti mengunduh llamafile baru.
Harga:
- Gratis: Sumber terbuka sepenuhnya
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: github.com/Mozilla-Ocho/llamafile
Intinya: llamafile adalah pilihan ketika instalasi harus menjadi satu file dan hanya satu file.
3. Ollama — Terbaik untuk alur kerja CLI paling sederhana ditambah API
Ollama membungkus llama.cpp dengan pengalaman instalasi dan perintah paling bersih dari yang ada di daftar ini. ollama pull llama3.2:8b mengunduh model. ollama run llama3.2:8b membuka obrolan. ollama serve mengekspos titik akhir yang kompatibel dengan OpenAI di port 11434 secara default. Format Modelfile memungkinkan Anda menyematkan prompt sistem dan parameter dengan satu file teks.
Kemana kelemahannya: Instalasi default menjalankan server sebagai layanan latar belakang yang mungkin tidak Anda inginkan. Kuantisasi model manual terbatas dibandingkan dengan llama.cpp mentah.
Harga:
- Gratis: Sumber terbuka sepenuhnya
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: ollama.com
Intinya: Ollama adalah pilihan ketika instalasi satu perintah dan jalankan satu perintah adalah standar minimum.
4. Jan — Terbaik untuk UI desktop asli yang Anda miliki
Jan adalah aplikasi desktop yang dibuat dari awal untuk model lokal, sumber terbuka, dengan server API yang kompatibel dengan OpenAI bawaan. Ini adalah apa yang Anda instal ketika Anda menginginkan UI obrolan desktop yang sebenarnya tanpa permukaan LM Studio. Tim mengirimkan build untuk ketiga OS dan menjaga alur penemuan model tetap sederhana.
Kemana kelemahannya: Proyek lebih muda daripada LM Studio atau Ollama. Beberapa fitur lanjutan (backend khusus, penyesuaian model mendalam) tertinggal.
Harga:
- Gratis: Sumber terbuka sepenuhnya
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: jan.ai
Intinya: Jan adalah pilihan ketika UI desktop yang tepat adalah faktor penentu.
5. KoboldCpp — Terbaik untuk UI biner tunggal ditambah API pada target portabel
KoboldCpp dimulai sebagai garpu llama.cpp yang ditargetkan untuk komunitas KoboldAI, dan telah berkembang menjadi pelari GGUF biner tunggal dengan UI browser, titik akhir API, dukungan masukan gambar dan audio, dan tidak ada langkah instalasi. Letakkan biner dan GGUF di sebelahnya, jalankan satu perintah, dan semuanya siap.
Kemana kelemahannya: Beberapa fitur khusus (integrasi Horde, prompt khusus KoboldAI) tidak penting untuk kasus penggunaan obrolan umum.
Harga:
- Gratis: Sumber terbuka sepenuhnya
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: github.com/LostRuins/koboldcpp
Intinya: KoboldCpp adalah pilihan ketika Anda menginginkan satu biner yang memberi Anda UI dan API tanpa aplikasi yang lebih berat.
6. Msty — Terbaik untuk UI komersial yang dipoles pada model lokal
Msty mengambil pendekatan LM Studio dan menghasilkan UI yang lebih bersih. Obrolan berdampingan dengan beberapa model, terhubung ke titik akhir Ollama atau Jan lokal, dan atur percakapan di folder. Tingkat gratis sangat murah hati; tingkat berbayar adalah yang membuka kunci fitur multi-pengguna dan ruang kerja.
Kemana kelemahannya: Sumber tertutup. Bukan di ujung minimalis “pasang satu biner sumber terbuka.” Untuk pengguna tunggal yang menginginkan kilau di atas prinsip, itu baik-baik saja.
Harga:
- Gratis: UI inti lengkap
- Berbayar: Langganan Msty untuk fitur ruang kerja canggih
Platform: Windows, macOS, Linux
Unduh: msty.app
Intinya: Msty adalah pilihan ketika kilau UI layak untuk menukar kendala sumber terbuka.
7. GPT4All — Terbaik untuk obrolan desktop yang ramah pemula
GPT4All oleh Nomic adalah cara paling ramah untuk menjalankan LLM lokal bagi seseorang yang tidak ingin menyentuh terminal. Instal aplikasi, telusuri daftar model yang dikurasi, pilih satu, obrolan. Itu juga mengekspos API lokal dan terintegrasi dengan Nomic Atlas untuk RAG berbasis dokumen jika Anda memutuskan untuk melampaui obrolan.
Kemana kelemahannya: Daftar model yang dikurasi adalah subset kecil dari apa yang tersedia di Hugging Face. Pengguna lanjutan tumbuh darinya.
Harga:
- Gratis: Sumber terbuka sepenuhnya
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: gpt4all.io
Intinya: GPT4All adalah pilihan untuk pengguna AI lokal pertama kali yang menginginkan aplikasi desktop yang hanya berfungsi.
8. LM Studio — Terbaik untuk pelari lokal berfitur lengkap
LM Studio adalah ujung maksimalis dari “masih satu aplikasi desktop.” Penemuan model dari Hugging Face, dukungan backend multi (llama.cpp, MLX pada Apple Silicon), UI obrolan lengkap, server API, dan permukaan konfigurasi model yang mengekspos segalanya. Ini adalah apa yang orang default ketika kesederhanaan Ollama terlalu terbatas.
Kemana kelemahannya: Bukan sumber terbuka. Jejak instalasi yang lebih besar daripada pilihan di atas. Permukaan fitur maksimalis adalah kebalikan dari tumpukan minimal yang diargumentasikan oleh potongan XDA, tetapi disertakan di sini sebagai titik referensi untuk apa yang terjadi ketika Anda menolak untuk memangkas.
Harga:
- Gratis: Penggunaan pribadi
- Berbayar: Lisensi bisnis untuk penyebaran komersial
Platform: Windows, macOS, Linux
Unduh: lmstudio.ai
Intinya: LM Studio adalah pilihan ketika pelari lokal berfitur lengkap bernilai instalasi yang lebih besar daripada yang di atas.
Cara memilih yang tepat
- Tumpukan yang dapat dilayani minimum: Ollama. Instal, tarik model, selesai. Semuanya else adalah opsional.
- Jika Anda lebih suka satu file dan tanpa instalasi: llamafile.
- Jika Anda menginginkan runtime referensi tanpa pembungkus: llama.cpp langsung.
- Jika Anda menginginkan UI obrolan desktop dan sumber terbuka: Jan.
- Jika Anda menginginkan satu biner yang juga UI: KoboldCpp.
- Jika kilau penting lebih dari sumber terbuka: Msty di atas titik akhir Ollama.
- Jika Anda tidak pernah memasang model lokal sebelumnya: GPT4All.
- Jika Anda telah tumbuh dari Ollama dan menginginkan lebih banyak knob: LM Studio.
FAQ
Model apa yang harus saya jalankan pada 16 GB RAM? Kuantisasi Q4 dari model 7B atau 8B berjalan dengan baik dalam amplop itu dan mencakup sebagian besar kasus penggunaan obrolan dan coding. Kuantisasi Q4 dari 13B dimungkinkan tetapi ketat.
Apakah aplikasi-aplikasi ini bekerja pada Apple Silicon? Ya. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio, dan Msty semuanya menggunakan Metal pada Apple Silicon dan mendapatkan kecepatan mendekati asli. llamafile dilengkapi dengan biner Apple Silicon.
Dapatkah saya menunjukkan alat gaya ChatGPT ke model lokal? Ya. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio, dan llamafile semuanya mengekspos titik akhir yang kompatibel dengan OpenAI di localhost. Arahkan alat apa pun yang menerima URL dasar khusus ke http://localhost:<port>/v1.
Bagaimana tumpukan minimalis berbeda dari tumpukan maksimalis? Bagian yang bergerak lebih sedikit. Satu runtime, satu model manager, satu UI. Tumpukan maksimalis menambahkan basis data vektor, lapisan orkestrasi, dan framework agen. Sebagian besar pengguna solo tidak membutuhkan salah satu dari itu sampai masalah tertentu menuntutnya.
Apakah ada yang mampu agen langsung dari kotak? Tidak. Ini adalah runtime inference dan UI obrolan. Untuk loop agen Anda menambahkan alat terpisah yang berbicara protokol OpenAI Chat Completions terhadap salah satu titik akhir ini.
Tumpukan mana yang paling kecil di disk? llamafile ditambah satu model yang dikuantisasi adalah instalasi yang paling ringan. Ollama ditambah toko modelnya adalah yang kedua dekat dan lebih mudah tumbuh ke dalam.