Penyaringan adalah alasan mengapa hosting diri LLM terbuka akhirnya praktis. Model 7B yang disaring dari guru 400B kini dapat menangani tindak lanjut instruksi, pengkodean, dan penalaran pada level yang memerlukan rig pusat data dua tahun yang lalu. Bagian terbaru XDA tentang apa “penyaringan” berarti sebenarnya tepat tentang imbalan hasil: model kecil yang baik ada, dan sekarang Anda dapat menyesuaikannya di rumah. Pertanyaannya adalah alat desktop mana yang harus dijangkau. Kami menempatkan tujuh aplikasi penyesuaian yang paling banyak digunakan di workstation dengan satu RTX 4090 dan menjalankan LoRA yang sama pada baseline Llama 3.3 8B yang disaring untuk melihat bagaimana perbandingannya. Ini adalah aplikasi desktop terbaik untuk penyesuaian LLM terbuka pada 2026.
Apa yang harus dicari dalam alat penyesuaian
Penyesuaian berbeda dari melayani. Aplikasi desktop yang baik harus menyelesaikan empat hal yang tidak dilakukan python train.py biasa:
- Trik memori (QLoRA, 4-bit, gradient checkpointing) yang pas model nyata pada satu GPU konsumen
- Loader kumpulan data yang menangani format umum (ShareGPT, Alpaca, JSONL) tanpa skrip preprocessing
- Default yang masuk akal sehingga run pertama bukan pencarian hyperparameter
- Jalur ekspor ke GGUF, MLX, atau ONNX sehingga model yang disesuaikan benar-benar berjalan di suatu tempat yang berguna setelahnya
Tabel perbandingan cepat
| Aplikasi | Terbaik untuk | Perangkat keras | Paket gratis | Harga mulai/bln | Format ekspor |
|---|---|---|---|---|---|
| Unsloth | Penyesuaian GPU tunggal tercepat | NVIDIA, beberapa AMD | Sepenuhnya gratis | Gratis | GGUF, HF, ONNX |
| Axolotl | Pelatihan serius yang didorong konfigurasi | NVIDIA, AMD | Sepenuhnya gratis | Gratis | HF, GGUF (via pembantu) |
| LLaMA-Factory | Web UI untuk non-pengkode | NVIDIA, AMD, Ascend | Sepenuhnya gratis | Gratis | HF, GGUF, AWQ |
| Torchtune | PyTorch-native, minimal deps | NVIDIA, AMD, Apple | Sepenuhnya gratis | Gratis | HF, GGUF |
| HuggingFace TRL | Penguatan + penyesuaian preferensi | NVIDIA | Sepenuhnya gratis | Gratis | HF |
| MLX-LM | Penyesuaian Apple Silicon | Apple M-series | Sepenuhnya gratis | Gratis | MLX, GGUF |
| Ludwig | Pelatihan deklaratif gaya AutoML | NVIDIA, CPU | Sepenuhnya gratis | Gratis | HF, ONNX |
1. Unsloth, terbaik untuk penyesuaian GPU tunggal tercepat
Unsloth menulis ulang kernel perhatian di Triton dan mengeluarkan akselerasi 2x plus pengurangan memori 40% dari run LoRA dan QLoRA. Pada 4090 kami, penyesuaian Llama 3.3 8B yang membutuhkan 12 jam pada Transformers vanilla selesai dalam sekitar 5 jam pada Unsloth. Perpustakaan terintegrasi dengan Hugging Face TRL dan Axolotl, jadi Anda dapat mengadopsinya tanpa menulis ulang loop pelatihan Anda.
Kekurangannya: target utama adalah GPU NVIDIA. Dukungan AMD telah mendarat tetapi tertinggal dalam cakupan kernel; Apple Silicon tidak ada di roadmap.
Harga:
- Gratis: perpustakaan dan setiap kernel
Platform: Linux (lebih disukai), Windows via WSL2
Unduh: Unsloth
Garis bawah: pilihan pertama default untuk siapa saja dengan GPU NVIDIA modern.
2. Axolotl, terbaik untuk pelatihan serius yang didorong konfigurasi
Axolotl adalah apa yang toko model sebenarnya gunakan untuk melatih rilis berbobot terbuka yang serius. Alur kerja yang didorong file konfigurasi memaksa Anda untuk memikirkan run Anda sebelum dimulai, itulah mengapa menghasilkan artefak yang dapat direproduksi. Dukungan kumpulan data terbaik di kelasnya: ShareGPT, Alpaca, dan JSONL kustom semuanya berfungsi tanpa skrip preprocessing.
Kekurangannya: kurva pembelajaran itu nyata. Harapkan untuk membaca referensi konfigurasi dengan cermat sebelum run sukses pertama Anda.
Harga:
- Gratis
Platform: Linux (Docker direkomendasikan)
Unduh: Axolotl
Garis bawah: pilihan ketika output akan masuk ke produksi, bukan hanya eksperimen.
3. LLaMA-Factory, terbaik untuk web UI yang dapat Anda berikan kepada rekan kerja
LLaMA-Factory mengirimkan dasbor web lengkap, tidak ada kode yang diperlukan. Anda memilih model dasar, memuat kumpulan data dari disk atau Hugging Face Hub, memilih metode (SFT, DPO, PPO, KTO), dan klik Start Training. Untuk tim di mana satu orang nyaman dengan skrip dan yang lain tidak, ini adalah alat yang menjembatani mereka.
Kekurangannya: abstraksi menyembunyikan beberapa knob. Pengguna lanjutan masih akan turun ke file konfigurasi pada akhirnya.
Harga:
- Gratis
Platform: Linux (native), Windows via WSL2, macOS dengan backend MLX
Unduh: LLaMA-Factory
Garis bawah: pilihan ketika operator pelatihan bukan pengembang Python.
4. Torchtune, terbaik untuk PyTorch-native setup minimal
Torchtune adalah perpustakaan penyesuaian resmi Meta. PyTorch murni, beberapa ketergantungan eksternal, dan file resep yang jelas yang dibaca seperti tutorial. Rilis 2026 menambahkan dukungan native untuk FSDP2 dan keluarga Llama 4, jadi bergerak seiring dengan model dasar baru.
Kekurangannya: format kumpulan data ketat. Jika data Anda tidak dalam bentuk yang diharapkan resep, Anda menulis pass preprocessing.
Harga:
- Gratis
Platform: Linux (NVIDIA dan AMD), macOS (Apple Silicon)
Unduh: Torchtune
Garis bawah: pilihan ketika Anda menginginkan PyTorch first-party, keajaiban minimal.
5. Hugging Face TRL, terbaik untuk penyesuaian preferensi dan RL
Hugging Face TRL adalah implementasi referensi untuk DPO, PPO, GRPO, ORPO, dan setiap metode optimasi preferensi lainnya yang telah mendarat sejak ChatGPT. Ketika tujuan Anda bukan “mengajar model domain ini” tetapi “mengajar model untuk lebih memilih jawaban ini,” TRL adalah toolkit.
Kekurangannya: dukungan SFT ada tetapi bukan bintangnya. Untuk penyesuaian yang diawasi secara sederhana, Unsloth atau Axolotl lebih cepat.
Harga:
- Gratis
Platform: Linux (NVIDIA utama), Windows via WSL2
Unduh: TRL
Garis bawah: pilihan ketika tujuan pelatihan adalah penyelarasan, bukan injeksi pengetahuan.
6. MLX-LM, terbaik untuk penyesuaian Apple Silicon
MLX-LM adalah kerangka kerja resmi Apple untuk pelatihan dan inferensi LLM pada chip seri M. Pada Mac Studio M3 Ultra 128 GB, kami berhasil menyesuaikan model Qwen 2.5 32B semalaman tanpa ada perangkat keras NVIDIA dalam loop. Memori terpadu adalah keuntungan nyata: Anda dapat menyimpan model yang akan OOM pada kartu NVIDIA konsumen 24 GB.
Kekurangannya: dukungan ekosistem di luar Apple minimal. Segalanya yang Anda sesuaikan harus diekspor ulang untuk berjalan pada perangkat keras non-Apple.
Harga:
- Gratis
Platform: macOS pada Apple Silicon (M1 dan yang lebih baru)
Unduh: MLX-LM
Garis bawah: pilihan untuk pemilik Mac Studio yang ingin menyesuaikan tanpa membeli rig terpisah.
7. Ludwig, terbaik untuk run deklaratif gaya AutoML
Ludwig mengambil deklarasi YAML dari input, output, dan metrik target Anda dan mencari tahu loop pelatihan. Ini bukan pilihan tercepat, tetapi untuk penyesuaian pertama di mana Anda belum tahu hyperparameter mana yang penting, pendekatan deklaratif Ludwig mempersingkat loop.
Kekurangannya: itu menyembunyikan loop pelatihan. Ketika Anda akhirnya ingin menyelaraskan loop itu sendiri, Anda tumbuh dari Ludwig dengan cepat.
Harga:
- Gratis
Platform: Linux (NVIDIA dan CPU), macOS
Unduh: Ludwig
Garis bawah: pilihan untuk penyesuaian pertama, atau untuk ilmuwan data yang lebih memilih deklaratif daripada imperatif.
Bagaimana cara memilih yang tepat
Jika Anda memiliki GPU NVIDIA modern dan menginginkan kecepatan, mulai dengan Unsloth. Jika model Anda akan masuk ke produksi, pindah ke Axolotl. Jika operator bukan pembuat kode, instal LLaMA-Factory. Pilih Torchtune ketika Anda menginginkan PyTorch first-party tanpa keajaiban. Jangkau HuggingFace TRL ketika tujuannya adalah DPO atau PPO, bukan SFT. Gunakan MLX-LM pada Mac Apple Silicon apa pun. Coba Ludwig untuk penyesuaian pertama di mana Anda masih mempelajari knobnya.
FAQ
Apakah saya membutuhkan beberapa GPU untuk menyesuaikan LLM terbuka modern? Tidak. QLoRA pada model 7B atau 8B cocok pada GPU konsumen 12 GB. Model 13B membutuhkan 24 GB. Model 70B masih membutuhkan multi-GPU atau kartu kelas pusat data.
Apa perbedaan antara penyesuaian dan penyaringan? Penyaringan melatih model kecil untuk meniru output model besar. Penyesuaian mengajarkan model yang ada (dari ukuran apa pun) untuk khusus pada data Anda. Penyesuaian model dasar yang disaring adalah tempat manis saat ini untuk hosting diri dengan perangkat keras rendah.
Aplikasi mana yang memiliki ramp-up paling singkat? LLaMA-Factory untuk jalur UI-pertama, Unsloth untuk jalur skrip-pertama. Ludwig paling dekat dengan “konfigurasi saja” deklaratif dari tujuh.
Bisakah saya menyesuaikan pada CPU? Secara teknis ya dengan Ludwig atau Torchtune, tetapi hanya untuk model kecil (di bawah 1B parameter). Untuk apa pun yang berguna, GPU atau Apple Silicon diperlukan.
Di mana model yang disesuaikan harus berjalan setelahnya? Ekspor ke GGUF dan muat di Ollama, LM Studio, atau Jan untuk inferensi lokal. Ekspor ke Hugging Face untuk melayani cloud. Ekspor MLX-LM berjalan native pada Mac Apple Silicon apa pun.