llama.cpp

XDA menerbitkan artikel bulan ini yang berpendapat bahwa tumpukan AI lokal yang lebih kecil adalah tumpukan AI lokal yang lebih produktif. Penulis telah mengumpulkan kekacauan biasa: dua pelari model, tiga antarmuka pengguna, basis data vektor yang tidak digunakan oleh siapa pun, dan folder adapter yang telah mereka lupakan. Mengurangi ke set minimal membuat pengaturan lebih mudah dirawat dan lebih mudah dijangkau. Kami menguji delapan aplikasi terbaik untuk tumpukan AI lokal minimal di desktop, di MacBook Pro M3, stasiun kerja Windows dengan RTX 4070, dan kotak Debian dengan AMD 7800 XT, berfokus pada bagaimana masing-masing berperilaku sebagai satu-satunya alat di tumpukan daripada satu dari banyak.

Apa yang harus dicari dalam aplikasi AI lokal minimalis

Perbandingan cepat

Aplikasi Terbaik untuk Platform Paket gratis Harga mulai Fitur menonjol
llama.cpp Runtime referensi Windows, macOS, Linux Gratis, sumber terbuka Gratis Inference biner tunggal portabel
llamafile Satu file, tidak ada instalasi Windows, macOS, Linux Gratis, sumber terbuka Gratis Model ditambah runtime dalam satu file yang dapat dieksekusi
Ollama CLI paling sederhana ditambah API Windows, macOS, Linux Gratis, sumber terbuka Gratis ollama run dan Anda memiliki titik akhir OpenAI
Jan UI desktop asli dengan API Windows, macOS, Linux Gratis, sumber terbuka Gratis Obrolan desktop lintas platform
KoboldCpp UI biner tunggal ditambah API Windows, macOS, Linux Gratis, sumber terbuka Gratis Pelari GGUF dengan UI web bawaan
Msty UI komersial yang dipoles pada model lokal Windows, macOS, Linux Tingkat gratis Langganan Msty untuk fitur canggih Antarmuka obrolan multi-model
GPT4All Obrolan desktop paling sederhana Windows, macOS, Linux Gratis, sumber terbuka Gratis Ramah pemula, tidak ada CLI
LM Studio Pelari lokal berfitur lengkap Windows, macOS, Linux Gratis untuk penggunaan pribadi Lisensi bisnis UI penemuan model, dukungan backend luas

Aplikasinya

1. llama.cpp — Terbaik untuk runtime referensi yang dibangun oleh semua orang

llama.cpp adalah runtime yang membungkus sebagian besar daftar ini dalam satu cara atau lainnya. Ini adalah server inference C++ yang portabel dan bebas ketergantungan yang menjalankan model GGUF di CPU, Metal, CUDA, dan ROCm. Sebagai tumpukan minimal sendiri, llama-server memberikan Anda titik akhir yang kompatibel dengan OpenAI, dan llama-cli memberikan Anda REPL. Itu cukup untuk sebagian besar pekerjaan AI lokal.

Kemana kelemahannya: Tidak ada UI yang dipoles. Anda mengompilasi atau mengunduh biner rilis. Manajemen model bersifat manual.

Harga:

Platform: Windows, macOS, Linux

Unduh: github.com/ggerganov/llama.cpp

Intinya: llama.cpp adalah pilihan ketika Anda menginginkan bagian yang bergerak paling sedikit dan nyaman di terminal.

2. llamafile — Terbaik untuk runtime dan model dalam satu file yang dapat dieksekusi

llamafile oleh proyek Mozilla Ocho menggabungkan model dan runtime llama.cpp ke dalam satu biner Cosmopolitan-libc yang berjalan di Windows, macOS, dan Linux tanpa instalasi. Unduh file, chmod itu, jalankan. Itu membuka UI browser dan mengekspos API yang kompatibel dengan OpenAI di localhost. Ini adalah interpretasi paling literal dari “AI lokal minimalis” di daftar.

Kemana kelemahannya: File biner portabel tunggal dapat memicu peralatan keamanan host. Mengunduh model baru berarti mengunduh llamafile baru.

Harga:

Platform: Windows, macOS, Linux

Unduh: github.com/Mozilla-Ocho/llamafile

Intinya: llamafile adalah pilihan ketika instalasi harus menjadi satu file dan hanya satu file.

3. Ollama — Terbaik untuk alur kerja CLI paling sederhana ditambah API

Ollama membungkus llama.cpp dengan pengalaman instalasi dan perintah paling bersih dari yang ada di daftar ini. ollama pull llama3.2:8b mengunduh model. ollama run llama3.2:8b membuka obrolan. ollama serve mengekspos titik akhir yang kompatibel dengan OpenAI di port 11434 secara default. Format Modelfile memungkinkan Anda menyematkan prompt sistem dan parameter dengan satu file teks.

Kemana kelemahannya: Instalasi default menjalankan server sebagai layanan latar belakang yang mungkin tidak Anda inginkan. Kuantisasi model manual terbatas dibandingkan dengan llama.cpp mentah.

Harga:

Platform: Windows, macOS, Linux

Unduh: ollama.com

Intinya: Ollama adalah pilihan ketika instalasi satu perintah dan jalankan satu perintah adalah standar minimum.

4. Jan — Terbaik untuk UI desktop asli yang Anda miliki

Jan adalah aplikasi desktop yang dibuat dari awal untuk model lokal, sumber terbuka, dengan server API yang kompatibel dengan OpenAI bawaan. Ini adalah apa yang Anda instal ketika Anda menginginkan UI obrolan desktop yang sebenarnya tanpa permukaan LM Studio. Tim mengirimkan build untuk ketiga OS dan menjaga alur penemuan model tetap sederhana.

Kemana kelemahannya: Proyek lebih muda daripada LM Studio atau Ollama. Beberapa fitur lanjutan (backend khusus, penyesuaian model mendalam) tertinggal.

Harga:

Platform: Windows, macOS, Linux

Unduh: jan.ai

Intinya: Jan adalah pilihan ketika UI desktop yang tepat adalah faktor penentu.

5. KoboldCpp — Terbaik untuk UI biner tunggal ditambah API pada target portabel

KoboldCpp dimulai sebagai garpu llama.cpp yang ditargetkan untuk komunitas KoboldAI, dan telah berkembang menjadi pelari GGUF biner tunggal dengan UI browser, titik akhir API, dukungan masukan gambar dan audio, dan tidak ada langkah instalasi. Letakkan biner dan GGUF di sebelahnya, jalankan satu perintah, dan semuanya siap.

Kemana kelemahannya: Beberapa fitur khusus (integrasi Horde, prompt khusus KoboldAI) tidak penting untuk kasus penggunaan obrolan umum.

Harga:

Platform: Windows, macOS, Linux

Unduh: github.com/LostRuins/koboldcpp

Intinya: KoboldCpp adalah pilihan ketika Anda menginginkan satu biner yang memberi Anda UI dan API tanpa aplikasi yang lebih berat.

6. Msty — Terbaik untuk UI komersial yang dipoles pada model lokal

Msty mengambil pendekatan LM Studio dan menghasilkan UI yang lebih bersih. Obrolan berdampingan dengan beberapa model, terhubung ke titik akhir Ollama atau Jan lokal, dan atur percakapan di folder. Tingkat gratis sangat murah hati; tingkat berbayar adalah yang membuka kunci fitur multi-pengguna dan ruang kerja.

Kemana kelemahannya: Sumber tertutup. Bukan di ujung minimalis “pasang satu biner sumber terbuka.” Untuk pengguna tunggal yang menginginkan kilau di atas prinsip, itu baik-baik saja.

Harga:

Platform: Windows, macOS, Linux

Unduh: msty.app

Intinya: Msty adalah pilihan ketika kilau UI layak untuk menukar kendala sumber terbuka.

7. GPT4All — Terbaik untuk obrolan desktop yang ramah pemula

GPT4All oleh Nomic adalah cara paling ramah untuk menjalankan LLM lokal bagi seseorang yang tidak ingin menyentuh terminal. Instal aplikasi, telusuri daftar model yang dikurasi, pilih satu, obrolan. Itu juga mengekspos API lokal dan terintegrasi dengan Nomic Atlas untuk RAG berbasis dokumen jika Anda memutuskan untuk melampaui obrolan.

Kemana kelemahannya: Daftar model yang dikurasi adalah subset kecil dari apa yang tersedia di Hugging Face. Pengguna lanjutan tumbuh darinya.

Harga:

Platform: Windows, macOS, Linux

Unduh: gpt4all.io

Intinya: GPT4All adalah pilihan untuk pengguna AI lokal pertama kali yang menginginkan aplikasi desktop yang hanya berfungsi.

8. LM Studio — Terbaik untuk pelari lokal berfitur lengkap

LM Studio adalah ujung maksimalis dari “masih satu aplikasi desktop.” Penemuan model dari Hugging Face, dukungan backend multi (llama.cpp, MLX pada Apple Silicon), UI obrolan lengkap, server API, dan permukaan konfigurasi model yang mengekspos segalanya. Ini adalah apa yang orang default ketika kesederhanaan Ollama terlalu terbatas.

Kemana kelemahannya: Bukan sumber terbuka. Jejak instalasi yang lebih besar daripada pilihan di atas. Permukaan fitur maksimalis adalah kebalikan dari tumpukan minimal yang diargumentasikan oleh potongan XDA, tetapi disertakan di sini sebagai titik referensi untuk apa yang terjadi ketika Anda menolak untuk memangkas.

Harga:

Platform: Windows, macOS, Linux

Unduh: lmstudio.ai

Intinya: LM Studio adalah pilihan ketika pelari lokal berfitur lengkap bernilai instalasi yang lebih besar daripada yang di atas.

Cara memilih yang tepat

FAQ

Model apa yang harus saya jalankan pada 16 GB RAM? Kuantisasi Q4 dari model 7B atau 8B berjalan dengan baik dalam amplop itu dan mencakup sebagian besar kasus penggunaan obrolan dan coding. Kuantisasi Q4 dari 13B dimungkinkan tetapi ketat.

Apakah aplikasi-aplikasi ini bekerja pada Apple Silicon? Ya. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio, dan Msty semuanya menggunakan Metal pada Apple Silicon dan mendapatkan kecepatan mendekati asli. llamafile dilengkapi dengan biner Apple Silicon.

Dapatkah saya menunjukkan alat gaya ChatGPT ke model lokal? Ya. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio, dan llamafile semuanya mengekspos titik akhir yang kompatibel dengan OpenAI di localhost. Arahkan alat apa pun yang menerima URL dasar khusus ke http://localhost:<port>/v1.

Bagaimana tumpukan minimalis berbeda dari tumpukan maksimalis? Bagian yang bergerak lebih sedikit. Satu runtime, satu model manager, satu UI. Tumpukan maksimalis menambahkan basis data vektor, lapisan orkestrasi, dan framework agen. Sebagian besar pengguna solo tidak membutuhkan salah satu dari itu sampai masalah tertentu menuntutnya.

Apakah ada yang mampu agen langsung dari kotak? Tidak. Ini adalah runtime inference dan UI obrolan. Untuk loop agen Anda menambahkan alat terpisah yang berbicara protokol OpenAI Chat Completions terhadap salah satu titik akhir ini.

Tumpukan mana yang paling kecil di disk? llamafile ditambah satu model yang dikuantisasi adalah instalasi yang paling ringan. Ollama ditambah toko modelnya adalah yang kedua dekat dan lebih mudah tumbuh ke dalam.