Aplikasi benchmarking GPU AI lokal untuk desktop

Laporan XDA bahwa GPU kelas menengah dapat menutupi biaya langganan AI berbayar sangat akurat. RTX 4070 Ti atau Radeon RX 7900 XT menjalankan model dengan 13B dan 34B parameter pada kecepatan yang melampaui apa yang sebagian besar layanan cloud tarik untuk satu tingkat langganan. Namun memilih model, kuantisasi, dan runtime mana yang akan digunakan pada perangkat keras yang sudah ada memerlukan angka nyata, bukan asumsi.

Tujuh aplikasi di bawah mencakup dua jenis benchmarking. Tiga pertama adalah benchmark terintegrasi runtime yang melaporkan token-per-detik dan waktu ke token pertama untuk beban kerja nyata. Sisanya adalah rangkaian benchmark pihak ketiga yang memberikan skor yang dapat direproduksi untuk membandingkan perangkat keras. Setiap pilihan berjalan di Windows dan Linux; dua juga bekerja di macOS dengan Apple Silicon.

Apa yang harus diperhatikan dalam benchmark GPU AI

Tidak setiap benchmark AI memberi tahu Anda apa yang perlu Anda ketahui. Periksa lima hal ini:

Apa pun yang hanya melaporkan satu nomor throughput tunggal dalam satu konteks tidak berguna untuk pengubahan ukuran perangkat keras nyata.

Perbandingan Cepat

Aplikasi Terbaik untuk Paket Gratis Harga Awal Fitur Unggulan
llama-bench Throughput LLM yang dapat direproduksi Ya Gratis Disertakan dengan llama.cpp
LM Studio Benchmark GUI + belanja model Ya Gratis Katalog model built-in
Ollama benchmark Tes stress LLM satu perintah Ya Gratis Berjalan dengan model yang ditarik apa pun
UL Procyon AI Benchmark vendor standar industri Trial Lisensi Berbayar Jalur ONNX + DirectML
Geekbench AI Skor AI lintas platform Ya Tingkat gratis iOS, Android, Windows, macOS
MLPerf Client Benchmark referensi dari MLCommons Ya Gratis Profiling perangkat keras mendalam
koboldcpp benchmark Simulasi beban kerja roleplay/chat Ya Gratis Mensimulasikan sesi chat secara realistis

Aplikasinya

1. llama-bench – Throughput LLM yang paling dapat direproduksi

llama-bench disertakan sebagai bagian dari llama.cpp dan merupakan hal terdekat yang dimiliki dunia LLM lokal untuk standar pengukuran. Arahkan ke file GGUF, beri tahu ukuran konteks dan ukuran batch, dan laporan token prompt per detik, token generasi per detik, dan waktu ke token pertama. Berjalan pada backend CUDA, ROCm, Metal, atau CPU apa pun, jadi satu alat memberikan angka yang sebanding di seluruh rig Nvidia, build Radeon, dan MacBook.

Kekurangannya: Hanya command line. Tidak ada GUI. Beberapa opsi (BLAS, ukuran batch) memerlukan membaca dokumen.

Harga:

Platform: Windows, macOS, Linux.

Unduh: llama.cpp di GitHub

Garis Bawah: Benchmark default saat membandingkan kuantisasi atau model. Pelajari flagnya sekali.

2. LM Studio – Benchmark GUI terbaik dengan belanja model

LM Studio adalah aplikasi desktop yang membungkus llama.cpp dengan antarmuka grafis untuk mengunduh, menjalankan, dan sekarang melakukan benchmark model. Tab benchmark built-in menguji model yang diunduh apa pun di seluruh beban kerja yang telah ditentukan sebelumnya dan melaporkan metrik dengan cara yang dapat dibaca oleh non-ahli. Ini juga menunjukkan ruang headroom VRAM yang tersisa, yang membantu mengubah ukuran model berikutnya.

Kekurangannya: Sumber tertutup. Katalog model tumpang tindih dengan HuggingFace dan tidak lengkap.

Harga:

Platform: Windows, macOS (Apple Silicon), Linux.

Unduh: LM Studio

Garis Bawah: Cara paling ramah untuk benchmark model segar tanpa menyentuh terminal.

3. Ollama benchmark – Tes stress LLM perintah tunggal terbaik

Ollama dilengkapi dengan flag run --verbose yang menghasilkan waktu per-token. Dikombinasikan dengan skrip yang dipertahankan komunitas, ia berfungsi ganda sebagai alat benchmark. Karena Ollama menarik model berdasarkan nama, menjalankan benchmark yang sama di mesin kedua membutuhkan dua perintah.

Kekurangannya: Bukan suite benchmark lengkap. Fokus pada kecepatan penyelesaian; kurang berguna untuk beban kerja berat prompt.

Harga:

Platform: Windows, macOS, Linux.

Unduh: Ollama

Garis Bawah: Instal Ollama untuk penggunaan model harian; gunakan --verbose saat Anda menginginkan pembacaan throughput cepat.

4. UL Procyon AI – Benchmark vendor standar industri terbaik

UL Procyon AI Computer Vision Benchmark adalah UL yang sama yang menerbitkan 3DMark dan PCMark. Ini menjalankan model ONNX standar (MobileNet, ResNet, Inception) di seluruh backend TensorRT, DirectML, OpenVINO, dan CoreML dan menghasilkan skor. Vendor mengutip angka Procyon dalam ulasan, jadi skor secara langsung dapat dibandingkan di seluruh industri.

Kekurangannya: Fokus pada beban kerja visi; kurang berguna untuk throughput LLM. Lisensi berbayar untuk penggunaan komersial.

Harga:

Platform: Windows.

Unduh: UL Procyon AI

Garis Bawah: Beli ini jika Anda membuat keputusan pembelian menggunakan benchmark vendor. Lewati jika Anda hanya peduli tentang kecepatan LLM.

5. Geekbench AI – Skor AI lintas platform terbaik

Geekbench AI menghasilkan tiga angka per jalankan: FP32, FP16, dan INT8 yang dikuantisasi. Berjalan di Windows, macOS, Linux, iOS, dan Android, jadi perbandingan laptop-vs-ponsel untuk beban kerja yang sama hanya satu benchmark. Database hasil publik memungkinkan Anda membandingkan jalankan Anda dengan ribuan yang lain.

Kekurangannya: Bukan spesifik LLM. Tiga skor meruntuhkan banyak nuansa.

Harga:

Platform: Windows, macOS, Linux, iOS, Android.

Unduh: Geekbench AI

Garis Bawah: Nomor go-to untuk “seberapa baik perangkat keras AI-capable saya.”

6. MLPerf Client – Benchmark referensi MLCommons terbaik

MLPerf Client adalah benchmark referensi yang didukung MLCommons untuk AI pada perangkat keras klien. Ini menjalankan beban kerja LLM yang telah ditentukan sebelumnya (saat ini Llama 2 7B, pindah ke model yang lebih baru) dan melaporkan latensi, throughput, dan regresi kualitas terhadap implementasi referensi. Karena MLCommons mempublikasikan hasil secara transparan, membandingkan setup sangat mudah.

Kekurangannya: Pengaturan lebih terlibat daripada alternatif. Tidak ditujukan untuk pengguna akhir.

Harga:

Platform: Windows, Linux (native), macOS (build komunitas).

Unduh: MLPerf Client di GitHub

Garis Bawah: Benchmark yang berwenang. Layak dengan biaya pengaturan jika Anda berencana menerbitkan perbandingan perangkat keras.

7. koboldcpp benchmark – Simulasi beban kerja roleplay dan chat terbaik

koboldcpp adalah fork llama.cpp yang fokus pada roleplay dan chat konteks panjang. Mode benchmark-nya mensimulasikan sesi chat nyata dengan konteks bergulir, yang merupakan tes yang lebih jujur tentang bagaimana server LLM rumah akan terasa sehari-hari. Angka termasuk biaya pertukaran konteks dan perilaku overflow RAM sistem, yang llama-bench tunda.

Kekurangannya: Fokus pada beban kerja chat/RP; melewatkan metrik yang berfokus pada kode. Antarmuka terlihat sibuk pada pandangan pertama.

Harga:

Platform: Windows, macOS, Linux.

Unduh: koboldcpp di GitHub

Garis Bawah: Benchmark paling representatif bagi siapa saja yang kasus penggunaan sebenarnya adalah chat, bukan penyelesaian kode.

Cara memilih yang tepat

Mulai dengan llama-bench untuk angka yang dapat direproduksi di seluruh kuantisasi. Tambahkan tab benchmark built-in LM Studio jika Anda lebih suka GUI. Gunakan flag verbose Ollama untuk pemeriksaan akal sehat cepat pada mesin yang sudah menjalankan model. Tambahkan Geekbench AI saat Anda memerlukan skor portabel tunggal. Simpan UL Procyon atau MLPerf Client untuk perbandingan perangkat keras formal di mana legitimasi pihak ketiga penting. Gunakan benchmark koboldcpp ketika beban kerja sehari-hari Anda adalah chat daripada penyelesaian kode.

Lewati lembar spesifikasi “AI TOPS” vendor sebagai pengganti; angka-angka adalah puncak-teoritis dan jarang mencerminkan throughput inferensi nyata pada kuantisasi yang Anda gunakan.

Tanya Jawab

GPU apa yang memberikan kecepatan LLM lokal terbaik hari ini? Untuk kartu konsumen, RTX 4090, 4080 Super, dan 5080 memimpin di Nvidia; RX 7900 XTX memimpin di AMD. Apple M3 Max dan M4 Max menutup celah untuk model yang cocok di memori terpadu.

Berapa banyak token per detik yang benar-benar saya butuhkan? Chat real-time terlihat bagus di atas 20 t/s di output model. Apa pun di atas 40 t/s tidak dapat dibedakan dari API SaaS yang cepat.

Apakah lebih banyak VRAM membantu atau apakah komputasi menang? Untuk LLM, VRAM adalah kendala yang lebih sulit. Memasukkan model penuh di VRAM tanpa tumpah ke RAM sistem penting lebih dari compute murni di atas ambang batas.

Apakah benchmark di Windows sebanding dengan yang di Linux? Untuk tes berbasis CUDA, sebagian besar ya. Perbedaan driver menambah beberapa persen varians. Untuk DirectML vs ROCm perbedaannya jauh lebih besar dan angka Linux biasanya lebih tinggi.

Apa pilihan benchmark termurah? llama-bench dan Ollama keduanya tidak ada biaya. Keduanya berjalan pada GPU konsumen apa pun.

Apakah ini membantu saya memilih antara LM Studio dan Ollama? Ya. Benchmark model yang sama di keduanya dan bandingkan token per detik dan kecepatan pemrosesan prompt. Ollama cenderung menang pada kecepatan swap model; GUI LM Studio membantu untuk eksperimen.