Tidak ada yang membutuhkan kartu 24 GB untuk menjalankan model lokal yang berguna di 2026. Model terkuantisasi dengan 7 hingga 14 miliar parameter muat dalam 8 hingga 12 GB VRAM dengan kecepatan yang dihasilkan oleh GTX 1080 atau RTX 2080 bekas dengan nyaman, dan perbedaan antara “hanya cloud” dan “lokal sebagian besar waktu” sekarang hanya instalasi driver dan unduhan 4 GB. Triknya adalah waktu kerja. Beberapa aplikasi menganggap kartu RTX 50-series yang baru; yang lain dibangun khusus untuk perangkat keras lama yang duduk di casis server rumah.
Kami menguji 8 aplikasi desktop untuk menjalankan AI lokal pada GPU NVIDIA lama, fokus pada Pascal (seri GTX 10 dan Quadro P), Turing (seri RTX 20 dan Quadro T), dan awal Ampere (seri RTX 30 dan workstation seri A). Setiap aplikasi di daftar menjalankan Llama 3.1, Qwen 2.5, Mistral 7B, atau Gemma 2 pada 8 GB VRAM dengan tingkat token per detik yang dapat digunakan. Mana yang sesuai dengan setup kami tergantung pada apakah kami ingin jendela obrolan, layanan, atau waktu kerja tingkat rendah.
Apa yang harus dilihat dalam aplikasi AI lokal untuk GPU lama
Batasan perangkat keras penting lebih dari salinan pemasaran.
- Dukungan CUDA 11, bukan hanya CUDA 12 (Pascal batas pada CUDA 12.6 di Linux, lebih lambat di Windows).
- Format kuantisasi yang pas 7B dalam 8 GB (GGUF Q4_K_M, Q5_K_M, atau AWQ 4-bit).
- Offloading lapisan sehingga model 13B dapat menumpahkan lapisan kelebihan ke CPU tanpa menjadi tidak berguna.
- Instalasi satu klik yang tidak memerlukan pengompilan PyTorch dari sumber.
- API yang kompatibel dengan OpenAI sehingga klien apa pun dapat menunjuk ke localhost tanpa shim khusus.
- Unduhan model yang dapat dilanjutkan dan memverifikasi checksum (paranoia era dial-up masih membantu).
Perbandingan cepat
| Aplikasi | Terbaik untuk | Windows / Linux | Rencana gratis | Fitur menonjol | Lisensi |
|---|---|---|---|---|---|
| Ollama | Daemon headless dan skrip | Keduanya | Gratis | Tarik model satu baris, berorientasi CLI | MIT |
| LM Studio | Chat all-in-one | Keduanya | Gratis | Browser model + obrolan + server | Proprietary |
| KoboldCPP | Waktu kerja executable tunggal | Keduanya | Gratis | Tanpa instalasi, GGUF, TTS, gambar | AGPL 3.0 |
| text-generation-webui | Tinker pengguna power | Keduanya | Gratis | Format kuantisasi semua didukung | AGPL 3.0 |
| GPT4All | Model pertama di laptop sederhana | Keduanya | Gratis | Bilah sisi LocalDocs, preset VRAM rendah | MIT-seperti |
| Jan | Ekuivalen LM Studio open-source penuh | Keduanya | Gratis | Dukungan MCP, kompatibel OpenAI | Apache 2.0 |
| llama.cpp | Kecepatan bare-metal | Keduanya | Gratis | CPU tercepat + offload GPU sebagian | MIT |
| vLLM | Server API multi-pengguna | Linux (WSL di Windows) | Gratis | Perhatian paged, throughput terbaik | Apache 2.0 |
Aplikasi
1. Ollama – daemon headless terbaik pada kartu NVIDIA lama
Ollama adalah waktu kerja yang kebanyakan orang pasang terlebih dahulu karena alur kerja keseluruhannya adalah ollama pull llama3.1:8b kemudian ollama run llama3.1. Pada GTX 1080 Ti (11 GB), Llama 3.1 8B Q4_K_M berjalan pada 25 hingga 30 token per detik; pada RTX 2080 Super (8 GB), model yang sama berjalan sekitar 40. Ollama mengikat titik akhir yang kompatibel dengan OpenAI pada localhost:11434, dan depan apa pun yang berbicara OpenAI (Open WebUI, Msty, LibreChat) plug in dengan perubahan URL dasar.
Dimana kekurangannya: Klien obrolan adalah terminal. Ollama tidak dilengkapi dengan GUI; penggunaan grafis berarti menambahkan Open WebUI atau depan lain.
Harga:
- Gratis: Semuanya, berlisensi MIT
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: ollama.com
Garis bawah: Pilihan yang tepat ketika tujuannya adalah melayani model ke alat dan skrip lain, bukan obrolan dalam aplikasi.
2. LM Studio – all-in-one terbaik untuk instalasi pertama
LM Studio adalah opsi “unduh EXE dan berbicara dengan model dalam lima menit”. Aplikasi ini menggabungkan browser Hugging Face, panel obrolan, dan toggle untuk mengekspos server yang kompatibel dengan OpenAI pada localhost:1234. Deteksi VRAM akurat pada kartu lama, dan daftar model menandai build mana yang sesuai sepenuhnya dalam GPU kami versus yang memerlukan offload CPU.
Dimana kekurangannya: Klien adalah sumber tertutup. Penggunaan komersial memerlukan pengisian formulir lisensi LM Studio Team dan menunggu kutipan.
Harga:
- Gratis: Penggunaan pribadi
- Berbayar: Lisensi Tim berdasarkan permintaan
Platform: Windows, macOS, Linux
Unduh: lmstudio.ai
Garis bawah: Instalasi pertama yang paling ramah di perangkat keras NVIDIA lama, dengan jalur tercepat ke jendela obrolan yang berfungsi.
3. KoboldCPP – waktu kerja tanpa instalasi terbaik
KoboldCPP adalah executable tunggal (koboldcpp.exe di Windows, biner statis di Linux) yang menjalankan model GGUF, generasi gambar Stable Diffusion, dan transkripsi Whisper tanpa lingkungan Python apa pun. Pada GTX 1660 Super (6 GB), model 7B Q4 masih pas dengan beberapa lapisan yang dioffload ke CPU, dan executable yang sama menangani generasi gambar cepat tanpa beralih aplikasi.
Dimana kekurangannya: UI berbasis web (terbuka di tab browser) dan terasa fungsional daripada dipoles. Kedalaman fitur tinggi, discoverability rendah.
Harga:
- Gratis: Semuanya, AGPL 3.0
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: github.com/LostRuins/koboldcpp
Garis bawah: Pilihan ketika mesin target adalah laptop, homelab, atau PC teman di mana kami tidak ingin memasang Python di seluruh sistem.
4. text-generation-webui – yang terbaik untuk pengguna power
text-generation-webui (oobabooga) mendukung setiap format kuantisasi yang penting (GGUF, GPTQ, AWQ, exllamav2), memungkinkan kami mengalihkan loader pada saat kami, dan mengekspos tombol generasi tingkat rendah (penskalaan rope, mirostat, suhu dinamis) yang menyembunyikan aplikasi lain. Pada RTX 3060 (12 GB), dengan senang hati menjalankan model 14B pada Q4 dengan 20 hingga 30 token per detik.
Dimana kekurangannya: Installer menarik beberapa gigabyte dependensi Python. Peluncuran pertama memakan waktu 5 hingga 10 menit. Bukan alat bagi seseorang yang ingin mengklik satu hal dan obrolan.
Harga:
- Gratis: Semuanya, AGPL 3.0
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: github.com/oobabooga/text-generation-webui
Garis bawah: Ideal bagi pengguna yang ingin membandingkan kuantisasi model dan strategi generasi pada perangkat keras yang sama.
5. GPT4All – titik awal rendah-VRAM terbaik
GPT4All memiliki lantai terendah: katalog model bawaan bendera model 3B dan 4B yang berjalan pada kartu 4 GB, dan bilah sisi LocalDocs menangani pekerjaan RAG kecil tanpa database vektor terpisah. Pada GTX 1060 (6 GB), Mistral 7B Instruct berjalan pada 15 hingga 20 token per detik yang dapat digunakan.
Dimana kekurangannya: GUI dirancang untuk penggunaan individu; tidak ada API multi-pengguna bawaan. Katalog model lebih kecil dari LM Studio atau Ollama.
Harga:
- Gratis: Semuanya
- Berbayar: Tidak ada; dukungan enterprise adalah add-on berbayar
Platform: Windows, macOS, Linux
Unduh: gpt4all.io
Garis bawah: Instalasi pertama yang tepat pada laptop dengan 4 hingga 6 GB VRAM.
6. Jan – ekuivalen LM Studio open-source penuh terbaik
Jan adalah apa yang terlihat seperti LM Studio jika klien itu sendiri adalah Apache 2.0. Katalog model pihak pertama, server yang kompatibel dengan OpenAI pada localhost:1337, dukungan Model Context Protocol sehingga Claude Desktop dan Continue dapat mengakses model yang dihosting Jan, dan tanpa telemetri.
Dimana kekurangannya: Proyek lebih muda dari LM Studio; katalog lebih kecil dan beberapa kuantisasi Hugging Face tiba lebih lambat. Akselerasi GPU Windows pada perangkat keras non-CUDA masih tertinggal.
Harga:
- Gratis: Semuanya, Apache 2.0
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: jan.ai
Garis bawah: Pilihan open-source ketika menginginkan aplikasi gaya LM Studio yang lisensinya dapat dibaca dalam sore hari.
7. llama.cpp – waktu kerja bare-metal terbaik
llama.cpp adalah proyek C++ yang dibangun seluruh ekosistem. Ini berjalan di mana-mana, dikompilasi dalam lima menit di Linux, dan menghasilkan throughput pengguna tunggal tercepat di GPU lama karena tidak ada abstraksi Python antara driver dan model. Pada GTX 1080 Ti dengan -ngl 33, ia mencapai tingkat token mentah yang diikuti aplikasi tingkat lebih tinggi dengan beberapa persen.
Dimana kekurangannya: Tidak ada installer, tidak ada GUI. Kami mengompilasi dan menjalankan alat baris perintah. Setup pertama kali untuk pengguna Windows lebih banyak pekerjaan daripada aplikasi lain di daftar ini.
Harga:
- Gratis: Semuanya, MIT
- Berbayar: Tidak ada
Platform: Windows, macOS, Linux
Unduh: github.com/ggml-org/llama.cpp
Garis bawah: Untuk pengembang yang ingin tahu persis apa yang terjadi antara file model dan token pertama.
8. vLLM – server API multi-pengguna terbaik di Linux
vLLM adalah waktu kerja untuk mengubah workstation lama menjadi server inference tim kecil. Perhatian berpagi skala throughput mendekati linear dengan permintaan bersamaan, dan model yang terkuantisasi AWQ 4-bit memungkinkan kartu 24 GB melayani dua atau tiga orang mengetik sekaligus tanpa terhenti. Berjalan asli di Linux; pengguna Windows membutuhkan WSL 2 dengan CUDA passthrough.
Dimana kekurangannya: Bukan aplikasi obrolan. vLLM adalah server yang kompatibel dengan OpenAI dan mengharapkan klien untuk memukul. Dukungan model kecil bagus tetapi fokus optimasi proyek adalah penyebaran yang lebih besar.
Harga:
- Gratis: Semuanya, Apache 2.0
- Berbayar: Tidak ada
Platform: Linux (WSL di Windows)
Unduh: github.com/vllm-project/vllm
Garis bawah: Pilihan ketika tujuannya adalah klon OpenAI pribadi yang dibagikan beberapa orang.
Cara memilih yang tepat
- Jika menginginkan jendela obrolan dalam 10 menit ke depan: LM Studio atau GPT4All.
- Jika melayani model ke alat lain: Ollama.
- Jika menginginkan pengalaman open-source yang sama: Jan.
- Jika mesin kami tidak dapat memasang apa pun di seluruh sistem: KoboldCPP.
- Jika ingin menekan beberapa persen terakhir dari kinerja: llama.cpp.
- Jika ingin membandingkan build dan kuantisasi model: text-generation-webui.
- Jika tim kecil akan berbagi mesin: vLLM di Linux.
Pertanyaan yang sering diajukan
Berapa umur GPU terlalu tua untuk menjalankan AI lokal?
Kartu dengan 4 GB VRAM dan Compute Capability 6.0 atau lebih tinggi (Pascal dan seterusnya) dapat menjalankan model 3B dan 4B dengan nyaman. Di bawah 4 GB, jawaban praktisnya adalah inferensi CPU saja dengan model kecil.
Apakah GTX 1080 Ti masih masuk akal di 2026?
Ya untuk AI lokal. Memiliki 11 GB VRAM, dukungan CUDA 12 yang luas, dan cukup komputasi untuk model 7B dan 8B pada 25 hingga 30 token per detik. Tidak cukup untuk generasi gambar resolusi tinggi.
Format kuantisasi mana yang terbaik untuk kartu lama?
GGUF Q4_K_M atau Q5_K_M untuk kualitas obrolan, AWQ 4-bit untuk throughput maksimal saat menggunakan vLLM. GPTQ masih berfungsi tetapi format itu sedang dihapus dengan tenang.
Bisakah saya menjalankan aplikasi ini pada GPU AMD atau Intel?
Ollama, LM Studio, KoboldCPP, dan llama.cpp mendukung Vulkan atau ROCm di banyak kartu AMD. Intel Arc didukung melalui SYCL di llama.cpp dan OpenVINO dalam beberapa fork. Artikel ini berfokus pada NVIDIA karena itulah di mana percakapan kartu lama tinggal.
Apakah saya perlu khawatir tentang telemetri?
Ollama, KoboldCPP, Jan, llama.cpp, GPT4All, dan vLLM disertakan tanpa telemetri. LM Studio memiliki toggle telemetri di pengaturan; opt out pada run pertama.