Unsloth melakukan fine-tuning model Llama lokal di GPU desktop

Sebuah artikel XDA minggu ini menggambarkan pelatihan LLM lokal berdasarkan kegagalannya sendiri. Penulis mengumpulkan output model yang salah, memberikan anotasi manual beberapa puluh di antaranya, mengepaknya ke dataset kecil, dan menjalankan fine-tune yang ringan. Hasilnya adalah model yang jauh lebih baik untuk masalah-masalah yang versi dasar terus salah. Apa yang dahulu memerlukan kluster yang disewa kini berjalan di laptop dengan GPU 12 GB. Inilah tujuh aplikasi terbaik untuk fine-tuning LLM lokal di desktop pada 2026, semuanya gratis dan sumber terbuka, diurutkan berdasarkan kecepatan fine-tune pertama sebenarnya berjalan.

Yang harus dicari dalam aplikasi fine-tuning lokal

Perbandingan cepat

Aplikasi Terbaik untuk Backend LoRA/QLoRA Apple Silicon Kemudahan
Unsloth LoRA single-GPU tercepat CUDA Ya Beta Tertinggi
Axolotl Production runs yang dapat dikonfigurasi CUDA (+ROCm) Ya Tidak Sedang
LLaMA-Factory Fine-tuning web-UI CUDA (+ROCm) Ya Beta Tinggi
MLX-LM Fine-tune Apple Silicon MLX Ya Ya Tinggi
Torchtune Referensi resmi PyTorch CUDA Ya Terbatas Sedang
Hugging Face TRL RLHF/DPO/PPO di atas Transformers CUDA (+ROCm) Ya Tidak Sedang
LM Studio GUI all-in-one untuk inferensi + workflow fine-tune ringan CUDA/Metal Pemuatan adapter Ya Sangat tinggi

1. Unsloth, Terbaik untuk LoRA single-GPU tercepat

Unsloth adalah alat yang mengubah “fine-tune model 7B di laptop Anda” dari makalah penelitian menjadi notebook Colab dan pip install. Pada single RTX 4070 dengan 12 GB VRAM, jalankan 7B QLoRA pada konteks 2048 selesai dalam sekitar 30 menit untuk beberapa ratus contoh. Trik matematis adalah forward-backward pass yang efisien memori; manfaat praktisnya adalah fine-tune yang berjalan saat Anda membuat kopi.

Keterbatasannya: Fine-tuning multi-GPU adalah kelas dua dibandingkan Axolotl atau Torchtune. Beberapa arsitektur niche muncul lebih lambat daripada di stack referensi.

Harga: Gratis.

Platform: Linux (terbaik), Windows (via WSL2), Apple Silicon (beta).

Unduh: unsloth.ai / github.com/unslothai/unsloth

Garis bawah: Default pertama fine-tune untuk siapa saja dengan single GPU konsumen.

2. Axolotl, Terbaik untuk production runs yang dapat dikonfigurasi

Axolotl adalah apa yang digunakan tim ketika jalur bahagia Unsloth tidak cukup. Pendekatan berbasis file konfigurasi membuat proses dapat direproduksi: satu file YAML menggambarkan model dasar, dataset, LoRA rank, learning rate, evaluasi cadence, dan target ekspor. Multi-GPU dengan DeepSpeed dan FSDP bekerja. Komunitas telah menerbitkan puluhan preset config untuk tugas umum.

Keterbatasannya: Kurva pembelajaran lebih curam daripada Unsloth. Proses pertama berarti membaca config YAML dan memahami apa yang dilakukan setiap field.

Harga: Gratis.

Platform: Linux, Windows via WSL2.

Unduh: github.com/axolotl-ai-cloud/axolotl

Garis bawah: Alat untuk naik tingkat setelah fine-tune Unsloth pertama berhasil dan Anda menginginkan kontrol lebih.

3. LLaMA-Factory, Terbaik untuk web UI fine-tuning workflow

LLaMA-Factory membungkus matematika yang sama seperti Axolotl dan Unsloth di balik web UI. Muat model dasar, pilih dataset dari folder lokal, sesuaikan slider untuk LoRA rank, dan mulai proses. Kurva loss ditampilkan di browser. Bagi seseorang yang tidak ingin menyentuh terminal, ini adalah alat fine-tuning desktop yang paling ramah.

Keterbatasannya: Web UI bukan IDE penuh. Pipeline multi-tahap kompleks masih menginginkan config nyata. Tidak setiap optimizer ditampilkan di UI.

Harga: Gratis.

Platform: Linux, Windows via WSL2, macOS via Docker.

Unduh: github.com/hiyouga/LLaMA-Factory

Garis bawah: Pilihan terbaik jika workflow berbasis terminal membuat Anda ragu.

4. MLX-LM, Terbaik untuk fine-tune Apple Silicon

MLX-LM adalah stack model bahasa resmi Apple, dibangun di atas framework array MLX. Pada M2 Max atau M3 Max dengan 64 GB unified memory, fine-tune 7B LoRA berjalan dengan kecepatan kompetitif dengan GPU NVIDIA mid-range. Pada M2 Pro dengan 16 GB ia bekerja untuk model yang lebih kecil. MLX-LM mengekspor langsung ke format MLX untuk Ollama dan runtime inferensi Apple sendiri.

Keterbatasannya: Tidak setiap model dasar tersedia dalam format MLX; langkah konversi dari bobot Hugging Face menambah friction. Ekosistem lebih kecil daripada stack CUDA.

Harga: Gratis.

Platform: Hanya Apple Silicon macOS.

Unduh: github.com/ml-explore/mlx-lm

Garis bawah: Alat yang tepat di Mac. Tidak ada yang menggunakan Apple Silicon sebaik ini.

5. Torchtune, Terbaik untuk referensi resmi PyTorch

Torchtune adalah library fine-tuning PyTorch sendiri, dijalankan oleh tim Meta. Resep adalah Python yang dapat dibaca, bukan DSL config, yang cocok untuk engineer yang ingin melihat dan memodifikasi training loop. Dukungan untuk full fine-tune, LoRA, dan DPO. Multi-GPU bekerja dari kotak. Dokumentasi berkualitas engineering.

Keterbatasannya: Kurang “baterai disertakan” daripada Unsloth atau Axolotl. Postur implementasi referensi berarti lebih sedikit jalan pintas.

Harga: Gratis.

Platform: Linux, Windows via WSL2, macOS dengan fitur terbatas.

Unduh: github.com/pytorch/torchtune

Garis bawah: Pilih Torchtune jika Anda sudah menulis PyTorch dan ingin melihat training loop.

6. Hugging Face TRL, Terbaik untuk RLHF, DPO, dan reward modelling

TRL (Transformer Reinforcement Learning) adalah toolkit untuk langkah fine-tuning di luar plain supervised fine-tune: DPO (direct preference optimisation), PPO (proximal policy optimisation), pelatihan model reward. Pada workflow XDA “train on failures”, DPO adalah teknik aktual yang mengubah kegagalan beranotasi menjadi model yang lebih baik. TRL adalah yang menjalankannya.

Keterbatasannya: Lebih banyak matematika untuk dipahami. RLHF/DPO bisa salah dengan cara yang SFT tidak bisa; bersiaplah untuk beberapa proses gagal sebelum berhasil.

Harga: Gratis.

Platform: Linux, Windows via WSL2.

Unduh: github.com/huggingface/trl

Garis bawah: Alat untuk tahap kedua dari pipeline fine-tune nyata “learn from your mistakes”.

7. LM Studio, Terbaik untuk GUI all-in-one desktop

LM Studio bukan terutama aplikasi fine-tuning. Ini adalah GUI desktop untuk mengunduh, menjalankan, dan mengobrol dengan model lokal di Windows, macOS, dan Linux. Perannya dalam daftar ini adalah polish yang disediakannya di sekitar workflow fine-tune: muat model dasar, muat adapter LoRA yang dihasilkan oleh Unsloth atau Axolotl, obrol dengan model fine-tune, ulangi. Rilis 2026 menambahkan wrapper kenyamanan fine-tune ringan yang memanggil Unsloth di bawah hood.

Keterbatasannya: Sisi training tipis. LM Studio adalah chat dan frontend inferensi; gunakan untuk separuh inferensi loop, bukan separuh training.

Harga: Gratis.

Platform: Windows, macOS, Linux.

Unduh: lmstudio.ai

Garis bawah: Pilih LM Studio sebagai sisi inferensi loop fine-tune, bukan sisi training.

Cara memilih yang tepat

Pasangkan alat training mana pun yang Anda pilih dengan LM Studio untuk menguji adapter yang dihasilkan secara lokal sebelum mengirimnya ke stack inferensi.

FAQ

Berapa GPU minimum untuk fine-tune model 7B?

QLoRA pada konteks 2048 cocok di 8 GB VRAM untuk varian 7B terkecil dan 12 GB dengan nyaman. 8 GB bekerja untuk konteks lebih pendek dan rank lebih rendah; 24 GB membuka 13B QLoRA.

Dapatkah kami fine-tune tanpa GPU sama sekali?

Secara teknis ya, di CPU, tetapi terlalu lambat untuk praktis. Penyewaan cloud selama beberapa jam sering lebih murah daripada listrik untuk menjalankan fine-tune CPU hingga selesai.

Format data apa yang diterima alat ini?

JSON Lines dengan field instruction dan output (Alpaca-style) adalah standar universal. Sebagian besar alat juga menerima format ShareGPT dan format pesan chat OpenAI.

Apakah model fine-tune berjalan di Ollama, LM Studio, atau llama.cpp?

Ya, setelah mengekspor ke GGUF (untuk llama.cpp dan Ollama) atau MLX (untuk stack Apple). Setiap alat di atas mengekspor ke setidaknya satu format tersebut.

Hanya untuk model yang lisensinya memungkinkannya. Llama 3 dan 4, model Mistral, Qwen, Gemma, dan setiap model open-weight dalam daftar ini memungkinkan fine-tuning di bawah lisensi mereka. Model tertutup (kelas GPT-4) tidak memiliki bobot yang dapat diunduh, jadi fine-tune lokal tidak mungkin.