Aplikasi terbaik untuk mengubah PC lama menjadi server AI lokal

PC gaming lama itu yang duduk di lemari masih punya banyak sisa umur. Mesin era 2018 dengan Ryzen atau Intel, 32 GB RAM, dan GPU bekas akan menjalankan model 7B pada kecepatan percakapan dan dengan nyaman menampung model 13B. Arahkan laptop keluarga ke sana dan Anda memiliki AI pribadi yang selalu aktif dan menjawab di LAN dalam beberapa detik. Aplikasi terbaik untuk mengubah PC lama menjadi server AI lokal memilih model dengan baik, mengirimkan API HTTP untuk alat lain, dan membiarkan mesin tidur di antara permintaan. Kami memilih tujuh aplikasi yang mengubah hardware berusia sepuluh tahun menjadi layanan AI yang berguna.

Apa yang dicari dalam aplikasi server AI lokal

Enam hal penting untuk AI di hardware lama:

Perbandingan cepat

Aplikasi Terbaik untuk Dukungan GPU API Fitur unggulan
Ollama Server paling sederhana Nvidia, AMD, Apple Kompatibel OpenAI Satu perintah menjalankan model
LM Studio UI yang ramah Nvidia, AMD, Apple Kompatibel OpenAI Penemuan model terbaik
Jan Clone ChatGPT sepenuhnya lokal Nvidia, AMD, Apple Kompatibel OpenAI Chat plus server dalam satu aplikasi
GPT4All Baseline CPU-only Nvidia, AMD, CPU API Lokal Berjalan di hardware kuno
llama.cpp Kontrol bare-metal Nvidia, AMD, Apple, CPU HTTP polos Engine yang membungkus sebagian besar daftar
Open WebUI Frontend web untuk Ollama Apa saja (klien) Berbicara ke Ollama UI mirip ChatGPT untuk LAN
LocalAI Pengganti OpenAI langsung Nvidia, AMD, CPU Kompatibel OpenAI Melayani gambar, audio, embeddings juga

Aplikasi-aplikasi

1. Ollama, terbaik untuk “menjalankan model dalam satu perintah”

Ollama mengirimkan layanan latar belakang yang menarik, mengkuantisasi, dan melayani model dari perpustakaan yang dikurasi. Satu perintah (ollama run llama3.2) mengunduh bobot, memuat model, dan menjatuhkan pengguna ke dalam chat. Layanan ini mengekspos endpoint yang kompatibel dengan OpenAI di localhost:11434, jadi alat apa pun yang berbicara dengan OpenAI dapat menunjuk ke PC lama dan mendapatkan perilaku yang sama.

Di mana ia kurang: Perpustakaan sendiri Ollama menggunakan format manifes kustom. Membawa GGUF acak dari Hugging Face memerlukan Modelfile kecil dan langkah impor.

Harga: Gratis, berlisensi MIT.

Platform: Windows, macOS, Linux.

Unduh: Ollama

Garis bawah: Mulai di sini. Instal, jalankan satu perintah, dan LAN memiliki server AI.

2. LM Studio, terbaik untuk UI yang ramah

LM Studio adalah aplikasi desktop yang menjelajahi Hugging Face, mengunduh model GGUF, dan menjalankannya secara lokal. Ini memiliki antarmuka chat dan sakelar “server lokal” yang mengekspos endpoint yang kompatibel dengan OpenAI. UI menunjukkan penggunaan RAM dan VRAM yang diprediksi sebelum unduhan, yang benar-benar berguna saat memilih kuantisasi.

Di mana ia kurang: Closed-source. Beberapa bagian aplikasi mengandalkan jangkauan internet bahkan untuk penggunaan lokal, meskipun model berjalan offline.

Harga: Gratis untuk penggunaan pribadi.

Platform: Windows, macOS, Linux.

Unduh: LM Studio

Garis bawah: Pilih ini ketika teman yang menjalankan PC lama tidak ingin menyentuh terminal.

3. Jan, terbaik untuk clone ChatGPT yang sepenuhnya lokal

Jan adalah aplikasi desktop yang dilengkapi sebagai klien berbentuk ChatGPT, manajer model, dan server API lokal dalam satu bundel. Unduhan model terlihat, dan “mode server” membuat model yang sama tersedia untuk aplikasi lain di LAN. Seluruh desain bersifat open-source dan privacy-first.

Di mana ia kurang: Lebih baru dari Ollama dan LM Studio; tepi kasar sesekali pada dukungan model.

Harga: Gratis, berlisensi AGPL.

Platform: Windows, macOS, Linux.

Unduh: Jan

Garis bawah: Pilihan jika tujuannya adalah satu aplikasi yang bertindak sebagai klien chat dan server di LAN.

4. GPT4All, terbaik untuk baseline CPU-only

GPT4All dibangun untuk kasus di mana tidak ada GPU sama sekali. Ini menjalankan model GGUF di CPU dengan kinerja yang dapat digunakan di mesin apa pun dari 2018 dan seterusnya. Aplikasi desktop mengelola model, dan server API lokal dapat dihidupkan dari pengaturan.

Di mana ia kurang: Kecepatan di CPU dibatasi oleh bandwidth memori. Harapkan 4 hingga 8 tok/detik di model 7B di CPU modern tanpa GPU.

Harga: Gratis, berlisensi MIT.

Platform: Windows, macOS, Linux.

Unduh: GPT4All

Garis bawah: Untuk PC kantor tanpa GPU. Itu masih menjalankan asisten.

5. llama.cpp, terbaik untuk kontrol bare-metal

llama.cpp adalah engine yang sebagian besar aplikasi di atas bungkus. Menjalankannya langsung adalah jalur tercepat di hardware lama karena tidak ada overhead. Biner llama-server mengekspos endpoint HTTP; biner llama-cli menjalankan chat interaktif. Semuanya adalah satu proyek C++ tanpa runtime.

Di mana ia kurang: Hanya command-line. Konfigurasi hidup dalam flag, bukan UI.

Harga: Gratis, berlisensi MIT.

Platform: Windows, macOS, Linux (build dari sumber di mana-mana).

Unduh: GitHub

Garis bawah: Pilihan ketika tujuannya adalah memeras setiap token terakhir per detik dari mesin lama.

6. Open WebUI, terbaik untuk frontend web

Open WebUI adalah UI web yang self-hosted yang berbicara dengan Ollama (atau endpoint yang kompatibel dengan OpenAI). Pasang di PC lama, dan setiap perangkat di LAN mendapatkan halaman mirip ChatGPT di http://server-ip:3000. Pengguna, izin, dokumen RAG, dan routing multi-model semuanya built-in.

Di mana ia kurang: Berjalan di atas backend model, jadi membutuhkan Ollama atau server yang kompatibel dengan OpenAI di belakangnya.

Harga: Gratis, self-hosted; BSD-3-Clause.

Platform: Docker di host apa pun.

Unduh: GitHub

Garis bawah: Antarmuka pengguna yang paling banyak diinginkan keluarga. Pasang langsung setelah Ollama.

7. LocalAI, terbaik untuk pengganti OpenAI langsung

LocalAI mengganti OpenAI API di LAN. Penyelesaian chat, embedding, generasi gambar (Stable Diffusion), text-to-speech, dan speech-to-text semuanya berada di balik endpoint HTTP yang sama yang digunakan OpenAI. Alat apa pun dengan SDK OpenAI bekerja melawan LocalAI dengan mengubah satu variabel env.

Di mana ia kurang: Cakupan luas berarti startup lebih lambat. Setiap modalitas memiliki pilihan model sendiri.

Harga: Gratis, berlisensi MIT.

Platform: Docker di Linux, Windows (WSL2), macOS.

Unduh: LocalAI · GitHub

Garis bawah: Pilih ini ketika tujuannya adalah menukar OpenAI dengan server lokal di banyak aplikasi sekaligus.

Cara memilih kombinasi yang tepat

Untuk setup home-lab yang hanya perlu bekerja: Ollama plus Open WebUI. Satu melayani model di LAN; yang lain memberi keluarga halaman untuk dikunjungi.

Untuk teman yang tidak akan menyentuh terminal: LM Studio di desktop dan biarkan mereka chat secara lokal.

Untuk kotak kantor CPU-only lama: GPT4All dengan model 3B. Atau llama.cpp dengan model yang sama jika terminal tidak apa-apa.

Untuk all-in-one yang memberikan chat dan server tanpa membagi menjadi dua aplikasi: Jan.

Untuk rumah tangga yang menjalankan banyak alat AI (asisten pribadi, IDE koding, aplikasi catatan): LocalAI jadi setiap alat melihat endpoint berbentuk OpenAI.

FAQ

Model mana yang harus saya jalankan terlebih dahulu? Llama 3.2 3B atau Qwen 2.5 3B di Q4_K_M. Keduanya pas dalam 4 GB RAM, berjalan pada 15 hingga 30 tok/detik di CPU modern saja, dan memberikan jawaban hampir flagship untuk pertanyaan umum.

Apakah saya membutuhkan GPU? Tidak, tetapi itu mengubah apa yang bisa Anda jalankan. Tanpa GPU, harapkan model 7B pada 5 hingga 10 tok/detik. Bahkan dengan Nvidia RTX 3060 bekas (12 GB), model 13B pada 30 hingga 50 tok/detik menjadi praktis.

Berapa banyak RAM yang saya butuhkan? 16 GB adalah dasar untuk model 7B. 32 GB membuka wilayah 13B. 64 GB atau lebih mulai menyimpan 34B dan 70B (dengan kuantisasi).

Bisakah saya mengaksesnya dari luar rumah? Ya, di atas mesh VPN seperti Tailscale. Jangan paparkan endpoint Ollama atau LocalAI ke internet publik. Tidak ada auth built-in secara default.

Berapa banyak daya yang ditarik PC lama saat idle? Desktop lama dengan GPU berdiam di 40 hingga 80 W. Itu adalah $50 hingga $100 setahun listrik di sebagian besar pasar. Jika mesin hanya diquery beberapa kali sehari, atur wake-on-LAN BIOS dan tidur di antara sesi.

Bagaimana perbandingannya dengan menjalankan Ollama di Mac mini? Mac mini Apple Silicon dengan 16 atau 24 GB memori terpadu adalah jalur paling hemat energi. Jika PC lama masih memiliki nilai di tempat lain, simpan. Jika dimulai dari awal, M1 mini bekas sering mengalahkan tower 2018 di watt per token.