Ollama

XDA menjalankan model 8B yang sama pada laptop RTX 5070 dan mesin dengan grafis terintegrasi dan melaporkan bahwa celah token-per-detik lebih kecil daripada yang kebanyakan orang bayangkan. Itulah cerita LLM lokal tahun 2026: kuantisasi, backend Vulkan, dan Metal Apple telah menarik banyak beban kerja ke kisaran di mana iGPU atau dGPU kecil sudah cukup. Anda tidak memerlukan rig senilai $2.000 untuk menjalankan model yang berguna secara lokal.

Panduan ini mencakup delapan aplikasi untuk menjalankan LLM lokal pada grafis terintegrasi, diuji pada Intel Core Ultra 5 dengan Arc iGPU, AMD Ryzen 7 dengan Radeon 780M, dan Apple M2. Semua delapan menjalankan model dalam kisaran 7B hingga 14B dengan kecepatan yang dapat digunakan (10 token per detik atau lebih baik) dengan kuantisasi yang tepat. Kami memprioritaskan kemudahan setup, kompatibilitas model, dan performa yang jujur pada perangkat keras kelas iGPU.

Apa yang harus diperhatikan dalam local LLM runner untuk iGPU

Perbandingan cepat

Aplikasi Terbaik untuk Rencana gratis Harga awal Gaya UI
Ollama CLI + API untuk model lokal Ya Gratis (open source) Terminal atau klien pihak ketiga
LM Studio UI desktop yang dipoles Ya Gratis Desktop native
GPT4All Desktop ramah pemula Ya Gratis Desktop native
Jan Klon ChatGPT fully open-source Ya Gratis Desktop native (Electron)
Msty All-in-one dengan RAG Ya Basis gratis Desktop native
KoboldCpp Roleplay dan creative writing Ya Gratis (open source) Web UI
Text Generation WebUI Power-user tinkering Ya Gratis (open source) Web UI
AnythingLLM RAG lokal atas dokumen Ya Gratis (open source) Desktop native

Aplikasi-aplikasi

1. Ollama, CLI dan API runner terbaik

Ollama adalah yang paling dekat dengan standar untuk LLM lokal. Pasang, jalankan ollama run llama3.2:3b, dan Anda memiliki model yang bekerja dalam waktu kurang dari semenit. Di balik layar, ini menggunakan llama.cpp dengan perpustakaan model yang dikurasi, API kompatibel OpenAI di localhost:11434, dan manajemen memori per-model.

Di mana ia kekurangan: Tidak ada chat UI bawaan; Anda menggunakan ollama run di terminal atau berpasangan dengan klien (Open WebUI, Msty, atau Enchanted di Mac). Perpustakaan model di ollama.com dikurasi tetapi terbatas dibandingkan dengan akses Hugging Face mentah.

Harga:

Platform: Windows, macOS (Apple silicon dan Intel), Linux.

Unduh: ollama.com/download atau melalui Homebrew / apt.

Garis bawah: Backend terbaik, titik. Pasang bahkan jika Anda berencana menggunakan UI berbeda di atasnya.

2. LM Studio, UI desktop yang paling dipoles

LM Studio membungkus llama.cpp dalam aplikasi desktop native dengan browser model Hugging Face bawaan, unduhan sekali klik, tolok ukur kinerja per-model, dan server API kompatibel OpenAI. Pengaturan offload GPU diekspos dengan default yang masuk akal untuk Intel Arc, AMD, dan Apple silicon.

Di mana ia kekurangan: Closed-source (meskipun gratis). Beberapa pengguna melaporkan GUI mengkonsumsi lebih banyak RAM daripada model itu sendiri pada iGPU kelas bawah.

Harga:

Platform: Windows, macOS, Linux (beta).

Unduh: lmstudio.ai

Garis bawah: Titik awal terbaik untuk pengguna iGPU yang lebih suka GUI. Dilengkapi dengan default yang tepat untuk perangkat keras konsumen.

3. GPT4All, desktop ramah pemula terbaik

GPT4All oleh Nomic adalah yang paling mudah didekati dari paket. Pasang, pilih model dari sidebar, dan itu mengunduh dan menjalankan. Pane LocalDocs menambahkan RAG sederhana di atas folder file tanpa konfigurasi.

Di mana ia kekurangan: Katalog model lebih kecil daripada LM Studio. Lebih lambat di Windows daripada Ollama atau LM Studio dalam tes kami.

Harga:

Platform: Windows, macOS, Linux.

Unduh: nomic.ai/gpt4all

Garis bawah: Pilihan untuk anggota keluarga yang kurang teknis. Membuat mereka menjalankan model lokal tanpa menyentuh terminal.

4. Jan, klon ChatGPT fully open-source terbaik

Jan adalah aplikasi desktop fully open-source yang meniru antarmuka ChatGPT. Ini menjalankan model lokal melalui llama.cpp yang disertakan, terhubung ke API jarak jauh (OpenAI, Anthropic, Groq, Mistral) sebagai opsi, dan menyimpan setiap percakapan secara lokal.

Di mana ia kekurangan: Berbasis Electron, jadi jejak RAM lebih berat daripada aplikasi native. Percakapan multi-turn kadang-kadang kehilangan konteks di iGPU karena pemotongan konteks yang agresif.

Harga:

Platform: Windows, macOS, Linux.

Unduh: jan.ai

Garis bawah: Yang paling mirip ChatGPT open. Terbaik jika Anda menginginkan satu aplikasi untuk lokal plus opsional jarak jauh.

5. Msty, all-in-one terbaik dengan RAG

Msty menggabungkan model lokal, API jarak jauh, RAG di atas dokumen, dan percakapan split-view dalam satu aplikasi. Fitur “Knowledge Stacks” mengindeks folder PDF, dokumen Word, dan file teks sehingga Anda dapat mengobrol dengannya tanpa menyiapkan database vektor.

Di mana ia kekurangan: Closed-source. Tingkat gratis membatasi beberapa fitur RAG canggih.

Harga:

Platform: Windows, macOS, Linux.

Unduh: msty.app

Garis bawah: Pilihan jika Anda menginginkan chat dokumen tanpa membuat toko vektor terpisah.

6. KoboldCpp, terbaik untuk roleplay dan creative writing

KoboldCpp dimulai sebagai fork llama.cpp yang ditujukan untuk penulisan bentuk panjang dan roleplay. Ini memiliki web UI dengan info dunia, memori karakter, dan buku lore yang runner lain tidak ekspos. Backend mendukung Vulkan untuk iGPU.

Di mana ia kekurangan: UI padat dengan slider yang hanya berarti sesuatu untuk power user. Tidak benar-benar dirancang untuk alur kerja asisten chat.

Harga:

Platform: Windows, macOS, Linux.

Unduh: KoboldCpp GitHub releases.

Garis bawah: Pilihan niche untuk penulis dan pemain peran yang menginginkan karakter persisten.

7. Text Generation WebUI, power-user tinkering terbaik

Text Generation WebUI (oobabooga) adalah taman bermain tinkerer. Ini mendukung llama.cpp, ExLlama, Transformers, dan lebih banyak backend, mengekspos setiap parameter generasi, dan terintegrasi dengan LoRA dan fine-tuning.

Di mana ia kekurangan: Setup bukan untuk pemula; harapkan install 30 menit dengan Python venv yang berantakan. Web UI fungsional tetapi tidak dirancang.

Harga:

Platform: Windows, macOS, Linux via Python.

Unduh: oobabooga/text-generation-webui GitHub.

Garis bawah: Pilihan yang tepat saat Anda tahu apa yang ingin disetel dan tidak dapat mencapainya di aplikasi yang lebih baik.

8. AnythingLLM, RAG lokal terbaik di atas dokumen

AnythingLLM adalah aplikasi RAG yang dirancang khusus yang memasangkan LLM lokal (atau jarak jauh) dengan toko dokumen. Arahkan ke folder atau lepaskan file, dan itu mengindeksnya ke database vektor lokal. Ruang kerja multi-pengguna memisahkan konteks untuk proyek berbeda.

Di mana ia kekurangan: Fokus RAG; chat murni mungkin tetapi bukan intinya. Setup melibatkan pemilihan model embedding terpisah dari model chat, yang membingungkan pemula.

Harga:

Platform: Windows, macOS, Linux, plus deployment Docker untuk self-hosting.

Unduh: anythingllm.com atau Mintplex-Labs/anything-llm GitHub.

Garis bawah: Pilihan jika alasan Anda menginginkan AI lokal adalah untuk menanyakan koleksi dokumen Anda sendiri secara pribadi.

Cara memilih yang tepat

Setup berpasangan terbaik untuk sebagian besar pengguna iGPU: Ollama sebagai backend + LM Studio atau Open WebUI sebagai klien. Itu memberi Anda backend tercepat dengan antarmuka paling ramah.

FAQ

Apa aplikasi LLM lokal terbaik untuk Intel Arc iGPU?

LM Studio dan Ollama keduanya menggunakan Vulkan dan bekerja dengan baik pada Intel Arc iGPU (Xe, Xe2, Xe-LPG). Pilihan model lebih penting daripada pilihan aplikasi; kuantisasi Q4_K_M dari model 7B ke 8B adalah sweet spot.

Bisakah saya menjalankan LLM lokal pada Ryzen APU tanpa GPU diskrit?

Ya. Radeon 780M / 890M iGPU seri Ryzen 7000 dan 8000 menjalankan model 7B pada 10 hingga 20 token per detik dalam kuantisasi Q4 melalui Vulkan. Tingkatkan alokasi RAM sistem ke grafis di BIOS jika Anda ingin memuat konteks yang lebih besar.

Apa LLM lokal terbaik untuk MacBook dengan M2 atau M3?

Apple silicon menjalankan Llama 3.1 8B, Qwen 3 8B, dan Mistral 7B pada 20 hingga 40 token per detik di M2. LM Studio dan Ollama keduanya menggunakan Metal secara otomatis. Pada 16GB memori terpadu, berpegang pada Q4_K_M atau Q5_K_M.

Apakah saya perlu tahu Python untuk menjalankan model lokal?

Tidak. Ollama, LM Studio, GPT4All, Jan, dan Msty semuanya install sekali klik tanpa Python. Text Generation WebUI adalah pengecualian.

Aplikasi LLM lokal mana yang fully open source?

Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI, dan AnythingLLM semuanya open source. LM Studio dan Msty gratis tetapi closed source.

Berapa banyak RAM yang saya butuhkan untuk LLM lokal?

Untuk model 7B ke 8B dalam kuantisasi Q4, 16GB RAM sistem total dapat digunakan dan 32GB nyaman. iGPU berbagi RAM sistem, jadi anggaran sesuai kebutuhan. Untuk model 13B hingga 14B, rencanakan minimum 32GB.