LM Studio dan Ollama membuat menjalankan LLM lokal menjadi masalah sekali klik. Fine-tuning tetap menjadi pekerjaan pusat data selama bertahun-tahun, di luar jangkauan pada perangkat keras yang sama. Itu akhirnya berubah. Aplikasi desktop baru Unsloth adalah tanda yang terlihat, tetapi sebuah kelompok kecil kerangka kerja terbuka sekarang melatih adapter LoRA nyata pada satu GPU konsumen 12 GB atau 24 GB dalam waktu sore.
Kami menguji tujuh alat di seluruh RTX 4070, RTX 4090, dan Mac M2 Pro dasar. Pilihan di bawah ini adalah yang menyelesaikan run LoRA Llama 3.1 8B atau Mistral 7B tanpa kehabisan memori, tanpa memerlukan kluster, dan tanpa meminta Anda menulis loop pelatihan di PyTorch terlebih dahulu. Daftar ini menggabungkan alat dengan prioritas GUI dengan kerangka kerja dengan prioritas CLI sehingga Anda dapat memilih tingkat ergonomi yang Anda inginkan.
Yang perlu diperhatikan dalam fine-tuner GPU konsumen
- Dukungan LoRA dan QLoRA, sehingga model 7B melatih pada 12 GB dan 13B pada 24 GB.
- Pemuatan 4-bit dan 8-bit yang dikuantisasi, yang merupakan alasan semua ini cocok.
- Flash Attention atau kernel yang setara sehingga kecepatan pelatihan tidak turun drastis.
- Dukungan untuk keluarga model yang Anda pedulikan: Llama, Mistral, Qwen, Gemma, Phi.
- Format dataset yang mudah disiapkan, idealnya JSONL dengan bidang instruction/output.
- Checkpointing sehingga crash pada jam keempat tidak membuang seluruh run.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Platform | Paket gratis | Harga mulai/bulan | Lisensi |
|---|---|---|---|---|---|
| Unsloth | LoRA tercepat pada 12–24 GB | Windows, Linux | Aplikasi penuh | Gratis (Pro tier) | Apache 2.0 |
| Axolotl | Pengguna kuat file konfigurasi | Linux | Aplikasi penuh | Gratis | Apache 2.0 |
| LLaMA-Factory | Berbasis GUI, dukungan model luas | Windows, Linux | Aplikasi penuh | Gratis | Apache 2.0 |
| Text Generation WebUI | Lampirkan LoRA dan uji di tempat | Windows, macOS, Linux | Aplikasi penuh | Gratis | AGPLv3 |
| PEFT | Perpustakaan untuk loop pelatihan Anda sendiri | Windows, macOS, Linux | Aplikasi penuh | Gratis | Apache 2.0 |
| H2O LLM Studio | UI korporat dengan pelacakan eksperimen | Windows, Linux | Gratis (sumber terbuka) | Dukungan Enterprise | Apache 2.0 |
| MLX-LM | Fine-tuning native pada Apple Silicon | macOS | Aplikasi penuh | Gratis | MIT |
Aplikasi-aplikasi
1. Unsloth, LoRA tercepat pada 12–24 GB
Unsloth menulis ulang jalur panas dari fine-tuning Llama, Mistral, Qwen, Gemma, dan Phi menjadi sekitar dua hingga lima kali lebih cepat dan sekitar setengah memori dari Transformers standar. LoRA 7B cocok pada satu GPU 12 GB tunggal dan selesai pada dataset sederhana dalam sore. Aplikasi desktop baru menghilangkan langkah CLI terakhir untuk resep umum.
Di mana ia kekurangan: cakupan miring ke arah keluarga model paling populer; arsitektur yang tidak biasa memerlukan jalur Transformers upstream.
Harga:
- Gratis: Framework penuh dan aplikasi desktop.
- Berbayar: Pro tier untuk dukungan enterprise dan kernel multi-GPU lebih cepat.
Platform: Windows (via WSL2), Linux.
Unduh: unsloth.ai · GitHub
Kesimpulan: Pilihan default di 2026 untuk pelatihan LoRA pada satu kartu konsumen.
2. Axolotl, pengguna kuat file konfigurasi terbaik
Axolotl adalah kerangka kerja pelatihan berbasis konfigurasi yang dibangun di sekitar Hugging Face. Satu file YAML mendeskripsikan model, dataset, rank LoRA, dan argumen pelatihan, dan Axolotl menangani sisanya. Ini mendukung lebih sedikit optimasi kecepatan daripada Unsloth tetapi menang dalam fleksibilitas di seluruh model dan format dataset yang kurang umum.
Di mana ia kekurangan: tidak ada GUI; konfigurasi memiliki kurva pembelajaran; dokumentasi mengasumsikan Anda telah melatih sesuatu sebelumnya.
Harga:
- Gratis: Aplikasi penuh.
- Berbayar: Tidak berlaku.
Platform: Linux (Docker pada macOS/Windows).
Unduh: GitHub (axolotl-ai-cloud/axolotl)
Kesimpulan: Pilihan yang tepat ketika Unsloth tidak memiliki model Anda dan Anda masih menginginkan pipeline yang masuk akal.
3. LLaMA-Factory, pelatih berbasis GUI terbaik
LLaMA-Factory mengirimkan GUI berbasis Gradio di atas toolkit pelatihan yang luas. Pilih model, unggah dataset, atur rank LoRA dan learning rate, dan mulai. Ini mencakup 100+ keluarga model dari kotak dan grafiknya membuat penyetelan hyperparameter dapat didekati.
Di mana ia kekurangan: GUI menyembunyikan beberapa pilihan yang lebih keras; dalam kasus tepi VRAM, ia memerlukan CLI bagaimanapun.
Harga:
- Gratis: Aplikasi penuh.
- Berbayar: Tidak berlaku.
Platform: Windows, Linux.
Unduh: GitHub (hiyouga/LLaMA-Factory)
Kesimpulan: Titik masuk pertama berbasis GUI terbaik untuk siapa saja yang baru mengenal pelatihan LoRA.
4. Text Generation WebUI, terbaik untuk melampirkan dan menguji LoRA
Text Generation WebUI (“oobabooga”) adalah UI chat LLM lokal yang paling banyak pengguna antusias jalankan. Tab Pelatihannnya melakukan pelatihan LoRA di tempat, dan setelah run selesai, Anda dapat mengaktifkan adapter dan mengobrol dengan model untuk memeriksa hasil segera.
Di mana ia kekurangan: bukan pelatih tercepat di daftar ini; tab pelatihan adalah alat “hubungkan titik” yang baik, bukan pipeline production.
Harga:
- Gratis: Aplikasi penuh.
- Berbayar: Tidak berlaku.
Platform: Windows, macOS, Linux.
Unduh: GitHub (oobabooga/text-generation-webui)
Kesimpulan: Alat dengan gesekan terendah untuk melihat apakah fine-tuning data Anda mengubah sesuatu yang Anda pedulikan.
5. PEFT, perpustakaan terbaik untuk loop pelatihan Anda sendiri
PEFT adalah perpustakaan Parameter-Efficient Fine-Tuning Hugging Face. Ini adalah serangkaian blok bangunan Python, LoRA, IA3, prefix tuning, yang Anda jatuhkan ke dalam Trainer. Jika Anda ingin mengontrol loop, ini adalah level tempat Anda bekerja.
Di mana ia kekurangan: tidak ada UI; setiap eksperimen adalah skrip; Anda bertanggung jawab untuk ergonomi.
Harga:
- Gratis: Aplikasi penuh.
- Berbayar: Tidak berlaku.
Platform: Windows, macOS, Linux.
Unduh: GitHub (huggingface/peft)
Kesimpulan: Tingkat abstraksi yang tepat untuk peneliti atau hobbyist serius yang menginginkan kontrol penuh.
6. H2O LLM Studio, pelatih bergaya korporat terbaik
H2O LLM Studio membungkus kerangka kerja terbuka yang sama dalam UI React yang bersih, menambahkan pelacakan eksperimen, dan terintegrasi dengan bersih dengan alat cloud H2O ketika run tumbuh melebihi satu GPU. Pada workstation dengan 4090, ini nyaman.
Di mana ia kekurangan: UI adalah instalasi yang lebih berat daripada pilihan lain di sini; default opinionated dapat menyembunyikan kenop yang mendasar.
Harga:
- Gratis: Aplikasi sumber terbuka penuh.
- Berbayar: Dukungan Enterprise.
Platform: Windows, Linux.
Unduh: GitHub (h2oai/h2o-llmstudio)
Kesimpulan: Pilihan ketika eksperimen akan ke tim, bukan satu laptop.
7. MLX-LM, fine-tuning native terbaik pada Apple Silicon
MLX-LM adalah kerangka kerja LM native Apple yang dibangun di atas MLX. Pada Mac Studio atau Mac M2 Pro dasar dengan 32 GB memori unified, fine-tuning LoRA pada model 7B dan 13B sekarang adalah jalur yang didukung, dan model memori kerangka kerja menggunakan alokasi GPU/CPU bersama untuk memasukkan model yang CUDA tidak pernah bisa.
Di mana ia kekurangan: hanya macOS; katalog model lebih kecil dari CUDA; kurang matang daripada alat berbasis PyTorch.
Harga:
- Gratis: Aplikasi penuh.
- Berbayar: Tidak berlaku.
Platform: macOS (Apple Silicon).
Unduh: GitHub (ml-explore/mlx-lm)
Kesimpulan: Pilihan yang tepat pada Mac modern, pilihan yang salah di tempat lain.
Cara memilih yang tepat
Jika Anda memiliki satu GPU konsumen 12 GB atau 24 GB dan menginginkan kecepatan, instal Unsloth dan jalankan salah satu notebooknya. Tidak ada yang lain di daftar ini sampai ke adapter kerja lebih cepat.
Jika model atau format dataset Anda berada di luar jalur cepat Unsloth, pilih Axolotl untuk fleksibilitas berbasis konfigurasinya.
Jika Anda tidak pernah melatih apa pun sebelumnya, LLaMA-Factory memberikan GUI pada alat yang sama dan mempersingkat debat “learning rate mana”.
Jika Anda sudah menjalankan Text Generation WebUI, gunakan tab Pelatihannnya. Jangan tambahkan alat lain untuk run sekali jalan.
Untuk kontrol atas loop pelatihan, PEFT adalah perpustakaan yang tepat. Harapkan untuk menulis Python.
Jika eksperimen perlu ditinjau oleh manusia lain, H2O LLM Studio mengirimkan UI itu dalam tier sumber terbuka.
MLX-LM adalah pilihan yang benar pada Apple Silicon dan hanya di sana.
FAQ
Apakah saya memerlukan GPU 24 GB untuk fine-tune model 7B?
Tidak. Unsloth dan QLoRA cocok pada 8–12 GB LoRA 7B. 24 GB memberi Anda 13B dengan nyaman.
Bisakah saya fine-tune pada CPU?
Secara teknis ya, dengan cara Anda secara teknis dapat menyeberangi laut dengan perahu dayung. Gunakan GPU atau Apple Silicon.
Akankah fine-tuning membuat model lokal saya lebih baik untuk pekerjaan saya?
Untuk mengikuti instruksi dan kosa kata domain, ya. Untuk keuntungan penalaran sulit, sebagian besar tidak; plafon model dasar adalah plafon.
Seberapa besar dataset saya seharusnya?
Untuk LoRA yang berfokus pada tugas, 500 hingga 5.000 contoh berkualitas tinggi mengalahkan 100.000 contoh yang biasa saja. Kurasi tanpa ampun.
Bisakah saya berbagi adapter LoRA yang saya latih?
Ya; adapter kecil. Periksa lisensi model dasar terlebih dahulu, sebagian besar varian Llama dan Mistral permisif tetapi tidak identik.