Sebuah artikel XDA minggu ini menggambarkan pelatihan LLM lokal berdasarkan kegagalannya sendiri. Penulis mengumpulkan output model yang salah, memberikan anotasi manual beberapa puluh di antaranya, mengepaknya ke dataset kecil, dan menjalankan fine-tune yang ringan. Hasilnya adalah model yang jauh lebih baik untuk masalah-masalah yang versi dasar terus salah. Apa yang dahulu memerlukan kluster yang disewa kini berjalan di laptop dengan GPU 12 GB. Inilah tujuh aplikasi terbaik untuk fine-tuning LLM lokal di desktop pada 2026, semuanya gratis dan sumber terbuka, diurutkan berdasarkan kecepatan fine-tune pertama sebenarnya berjalan.
Yang harus dicari dalam aplikasi fine-tuning lokal
- Dukungan LoRA dan QLoRA. Fine-tune penuh terikat pada perangkat keras. Adaptor low-rank (LoRA) dan LoRA kuantisasi 4-bit (QLoRA) adalah satu-satunya cara realistis untuk fine-tune model 7B atau 13B di GPU konsumen.
- Berjalan di perangkat keras yang Anda miliki. NVIDIA CUDA adalah standar; ROCm di AMD adalah kelas dua. Apple Silicon (M-series) memiliki jalur sendiri melalui MLX. Aplikasi “fine-tune” hanya berguna jika berjalan di GPU atau NPU Anda.
- Format dataset yang tidak menakutkan. JSON Lines dengan field
instructiondanoutputadalah standar modern. Jika aplikasi menginginkan format biner khusus, akan sulit digunakan. - Evaluasi dan checkpointing. Fine-tuning bisa salah. Alat yang membuat snapshot setiap N langkah dan menampilkan kurva loss memungkinkan Anda kembali dari proses yang salah sebelum terlambat.
- Ekspor ke GGUF atau MLX. Setelah fine-tune, model perlu dimuat ke stack inferensi. GGUF untuk llama.cpp; MLX untuk Apple. Jika alat mengunci bobot ke format miliknya sendiri, hasil tidak dapat digunakan.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Backend | LoRA/QLoRA | Apple Silicon | Kemudahan |
|---|---|---|---|---|---|
| Unsloth | LoRA single-GPU tercepat | CUDA | Ya | Beta | Tertinggi |
| Axolotl | Production runs yang dapat dikonfigurasi | CUDA (+ROCm) | Ya | Tidak | Sedang |
| LLaMA-Factory | Fine-tuning web-UI | CUDA (+ROCm) | Ya | Beta | Tinggi |
| MLX-LM | Fine-tune Apple Silicon | MLX | Ya | Ya | Tinggi |
| Torchtune | Referensi resmi PyTorch | CUDA | Ya | Terbatas | Sedang |
| Hugging Face TRL | RLHF/DPO/PPO di atas Transformers | CUDA (+ROCm) | Ya | Tidak | Sedang |
| LM Studio | GUI all-in-one untuk inferensi + workflow fine-tune ringan | CUDA/Metal | Pemuatan adapter | Ya | Sangat tinggi |
1. Unsloth, Terbaik untuk LoRA single-GPU tercepat
Unsloth adalah alat yang mengubah “fine-tune model 7B di laptop Anda” dari makalah penelitian menjadi notebook Colab dan pip install. Pada single RTX 4070 dengan 12 GB VRAM, jalankan 7B QLoRA pada konteks 2048 selesai dalam sekitar 30 menit untuk beberapa ratus contoh. Trik matematis adalah forward-backward pass yang efisien memori; manfaat praktisnya adalah fine-tune yang berjalan saat Anda membuat kopi.
Keterbatasannya: Fine-tuning multi-GPU adalah kelas dua dibandingkan Axolotl atau Torchtune. Beberapa arsitektur niche muncul lebih lambat daripada di stack referensi.
Harga: Gratis.
Platform: Linux (terbaik), Windows (via WSL2), Apple Silicon (beta).
Unduh: unsloth.ai / github.com/unslothai/unsloth
Garis bawah: Default pertama fine-tune untuk siapa saja dengan single GPU konsumen.
2. Axolotl, Terbaik untuk production runs yang dapat dikonfigurasi
Axolotl adalah apa yang digunakan tim ketika jalur bahagia Unsloth tidak cukup. Pendekatan berbasis file konfigurasi membuat proses dapat direproduksi: satu file YAML menggambarkan model dasar, dataset, LoRA rank, learning rate, evaluasi cadence, dan target ekspor. Multi-GPU dengan DeepSpeed dan FSDP bekerja. Komunitas telah menerbitkan puluhan preset config untuk tugas umum.
Keterbatasannya: Kurva pembelajaran lebih curam daripada Unsloth. Proses pertama berarti membaca config YAML dan memahami apa yang dilakukan setiap field.
Harga: Gratis.
Platform: Linux, Windows via WSL2.
Unduh: github.com/axolotl-ai-cloud/axolotl
Garis bawah: Alat untuk naik tingkat setelah fine-tune Unsloth pertama berhasil dan Anda menginginkan kontrol lebih.
3. LLaMA-Factory, Terbaik untuk web UI fine-tuning workflow
LLaMA-Factory membungkus matematika yang sama seperti Axolotl dan Unsloth di balik web UI. Muat model dasar, pilih dataset dari folder lokal, sesuaikan slider untuk LoRA rank, dan mulai proses. Kurva loss ditampilkan di browser. Bagi seseorang yang tidak ingin menyentuh terminal, ini adalah alat fine-tuning desktop yang paling ramah.
Keterbatasannya: Web UI bukan IDE penuh. Pipeline multi-tahap kompleks masih menginginkan config nyata. Tidak setiap optimizer ditampilkan di UI.
Harga: Gratis.
Platform: Linux, Windows via WSL2, macOS via Docker.
Unduh: github.com/hiyouga/LLaMA-Factory
Garis bawah: Pilihan terbaik jika workflow berbasis terminal membuat Anda ragu.
4. MLX-LM, Terbaik untuk fine-tune Apple Silicon
MLX-LM adalah stack model bahasa resmi Apple, dibangun di atas framework array MLX. Pada M2 Max atau M3 Max dengan 64 GB unified memory, fine-tune 7B LoRA berjalan dengan kecepatan kompetitif dengan GPU NVIDIA mid-range. Pada M2 Pro dengan 16 GB ia bekerja untuk model yang lebih kecil. MLX-LM mengekspor langsung ke format MLX untuk Ollama dan runtime inferensi Apple sendiri.
Keterbatasannya: Tidak setiap model dasar tersedia dalam format MLX; langkah konversi dari bobot Hugging Face menambah friction. Ekosistem lebih kecil daripada stack CUDA.
Harga: Gratis.
Platform: Hanya Apple Silicon macOS.
Unduh: github.com/ml-explore/mlx-lm
Garis bawah: Alat yang tepat di Mac. Tidak ada yang menggunakan Apple Silicon sebaik ini.
5. Torchtune, Terbaik untuk referensi resmi PyTorch
Torchtune adalah library fine-tuning PyTorch sendiri, dijalankan oleh tim Meta. Resep adalah Python yang dapat dibaca, bukan DSL config, yang cocok untuk engineer yang ingin melihat dan memodifikasi training loop. Dukungan untuk full fine-tune, LoRA, dan DPO. Multi-GPU bekerja dari kotak. Dokumentasi berkualitas engineering.
Keterbatasannya: Kurang “baterai disertakan” daripada Unsloth atau Axolotl. Postur implementasi referensi berarti lebih sedikit jalan pintas.
Harga: Gratis.
Platform: Linux, Windows via WSL2, macOS dengan fitur terbatas.
Unduh: github.com/pytorch/torchtune
Garis bawah: Pilih Torchtune jika Anda sudah menulis PyTorch dan ingin melihat training loop.
6. Hugging Face TRL, Terbaik untuk RLHF, DPO, dan reward modelling
TRL (Transformer Reinforcement Learning) adalah toolkit untuk langkah fine-tuning di luar plain supervised fine-tune: DPO (direct preference optimisation), PPO (proximal policy optimisation), pelatihan model reward. Pada workflow XDA “train on failures”, DPO adalah teknik aktual yang mengubah kegagalan beranotasi menjadi model yang lebih baik. TRL adalah yang menjalankannya.
Keterbatasannya: Lebih banyak matematika untuk dipahami. RLHF/DPO bisa salah dengan cara yang SFT tidak bisa; bersiaplah untuk beberapa proses gagal sebelum berhasil.
Harga: Gratis.
Platform: Linux, Windows via WSL2.
Unduh: github.com/huggingface/trl
Garis bawah: Alat untuk tahap kedua dari pipeline fine-tune nyata “learn from your mistakes”.
7. LM Studio, Terbaik untuk GUI all-in-one desktop
LM Studio bukan terutama aplikasi fine-tuning. Ini adalah GUI desktop untuk mengunduh, menjalankan, dan mengobrol dengan model lokal di Windows, macOS, dan Linux. Perannya dalam daftar ini adalah polish yang disediakannya di sekitar workflow fine-tune: muat model dasar, muat adapter LoRA yang dihasilkan oleh Unsloth atau Axolotl, obrol dengan model fine-tune, ulangi. Rilis 2026 menambahkan wrapper kenyamanan fine-tune ringan yang memanggil Unsloth di bawah hood.
Keterbatasannya: Sisi training tipis. LM Studio adalah chat dan frontend inferensi; gunakan untuk separuh inferensi loop, bukan separuh training.
Harga: Gratis.
Platform: Windows, macOS, Linux.
Unduh: lmstudio.ai
Garis bawah: Pilih LM Studio sebagai sisi inferensi loop fine-tune, bukan sisi training.
Cara memilih yang tepat
- Belum pernah fine-tune model, miliki single GPU NVIDIA: Unsloth. Ikuti notebook QLoRA dulu.
- Pada Mac dengan Apple Silicon: MLX-LM. Tidak ada yang menggunakan hardware sebaik ini.
- Ingin web UI dan tidak ada terminal: LLaMA-Factory.
- Membangun pipeline yang dapat direproduksi untuk tim: Axolotl dengan config YAML di Git.
- Melakukan workflow XDA “train on failures”: Unsloth untuk SFT awal, kemudian TRL untuk DPO pada kegagalan beranotasi.
- Ingin melihat training loop dalam PyTorch polos: Torchtune.
Pasangkan alat training mana pun yang Anda pilih dengan LM Studio untuk menguji adapter yang dihasilkan secara lokal sebelum mengirimnya ke stack inferensi.
FAQ
Berapa GPU minimum untuk fine-tune model 7B?
QLoRA pada konteks 2048 cocok di 8 GB VRAM untuk varian 7B terkecil dan 12 GB dengan nyaman. 8 GB bekerja untuk konteks lebih pendek dan rank lebih rendah; 24 GB membuka 13B QLoRA.
Dapatkah kami fine-tune tanpa GPU sama sekali?
Secara teknis ya, di CPU, tetapi terlalu lambat untuk praktis. Penyewaan cloud selama beberapa jam sering lebih murah daripada listrik untuk menjalankan fine-tune CPU hingga selesai.
Format data apa yang diterima alat ini?
JSON Lines dengan field instruction dan output (Alpaca-style) adalah standar universal. Sebagian besar alat juga menerima format ShareGPT dan format pesan chat OpenAI.
Apakah model fine-tune berjalan di Ollama, LM Studio, atau llama.cpp?
Ya, setelah mengekspor ke GGUF (untuk llama.cpp dan Ollama) atau MLX (untuk stack Apple). Setiap alat di atas mengekspor ke setidaknya satu format tersebut.
Apakah fine-tuning legal untuk bobot model tertutup?
Hanya untuk model yang lisensinya memungkinkannya. Llama 3 dan 4, model Mistral, Qwen, Gemma, dan setiap model open-weight dalam daftar ini memungkinkan fine-tuning di bawah lisensi mereka. Model tertutup (kelas GPT-4) tidak memiliki bobot yang dapat diunduh, jadi fine-tune lokal tidak mungkin.