Melatih model lokal pada kegagalannya sendiri bukan pra-pelatihan, tetapi jika dilakukan dengan benar, ini mengajarkan model kecil untuk berhenti mengulangi kesalahan yang mengganggu Anda kemarin. Itulah janji di balik loop “perbaikan diri” yang telah diiterasi komunitas LLM lokal sepanjang tahun ini: catat jawaban salah model, kurasi menjadi dataset umpan balik kecil, jalankan penyesuaian halus LoRA ringan, dan tonton tingkat kesalahan turun. Ini adalah aplikasi terbaik untuk perbaikan diri LLM lokal dari kegagalan di desktop, apakah Anda menjalankan model 7B di laptop atau 70B di workstation.
Apa yang perlu diperhatikan dalam stack perbaikan diri
- Penangkapan umpan balik tertanam. Alat yang mencatat prompt, respons, dan sinyal jempol ke atas/ke bawah (atau lebih baik, jawaban yang diperbaiki) adalah tempat loop dimulai.
- Kurasi dataset. Catatan kegagalan harus menjadi dataset penyesuaian instruksi yang bersih sebelum berguna.
- Penyesuaian halus yang efisien. LoRA dan QLoRA mengurangi penyesuaian halus 24 GB menjadi sesuatu yang dapat dijalankan GPU konsumen tunggal dalam semalam.
- Inferensi lokal untuk evaluasi. Alat yang sama yang melayani model ke agen Anda harus melayani versi yang disesuaikan sehingga Anda dapat membandingkan keduanya.
- Optimasi prompt programatik. Untuk banyak mode kegagalan, perbaikannya bukan penyesuaian halus tetapi prompt yang lebih baik. Framework optimasi membuat itu mekanis.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Platform | Paket gratis | Harga awal/bulan | Rating |
|---|---|---|---|---|---|
| LangChain | Menggabungkan penangkapan umpan balik ke alur kerja penyesuaian halus | Windows, macOS, Linux | Penuh | Gratis (open source) | 4.5 |
| LM Studio | Inferensi sehari-hari plus ekspor dataset | Windows, macOS, Linux | Penuh | Gratis | 4.6 |
| Ollama | Melayani model yang disesuaikan halus ke klien apa pun | Windows, macOS, Linux | Penuh | Gratis (open source) | 4.7 |
| Axolotl | Jalankan LoRA yang dapat direproduksi dan didorong YAML | Linux (Windows melalui WSL, macOS melalui kontainer) | Penuh | Gratis (open source) | 4.6 |
| Unsloth | 2-5x lebih cepat LoRA pada GPU tunggal | Windows, Linux | Penuh | Tingkat gratis, Pro tersedia | 4.8 |
| Text Generation WebUI | UI lokal untuk inferensi, evaluasi, dan pelabelan manual | Windows, macOS, Linux | Penuh | Gratis (open source) | 4.4 |
| DSPy | Mengoptimalkan prompt dan pipeline dari kegagalan berlabel | Windows, macOS, Linux | Penuh | Gratis (open source) | 4.7 |
Aplikasi
1. LangChain – terbaik untuk menggabungkan loop umpan balik
LangChain bukan penyesuai halus. Yang dilakukannya dengan baik adalah memberi Anda blok bangunan untuk menangkap setiap pasangan prompt-respons dari agen, menandai kegagalan, dan merutekannya ke dataset pelatihan. Lapisan Callbacks dan Tracing adalah persis apa yang dibutuhkan loop perbaikan diri: catatan tahan lama tentang apa yang dikatakan model, apa yang dilakukan pengguna dengan jawaban, dan bagaimana itu diperbaiki.
Di mana ini gagal: Permukaan API besar dan sering berubah. Sampel kode yang lebih tua di internet sering salah.
Harga:
- Gratis: Framework-nya.
- Berbayar: LangSmith adalah tracer yang dikelola berbayar jika Anda menginginkan dashboard yang dihost.
Platform: Windows, macOS, Linux.
Unduh: langchain.com — Sumber (GitHub)
Garis bawah: Mulai di sini untuk pipa antara model, aplikasi, dan data pelatihan.
2. LM Studio – terbaik untuk inferensi driver harian dan ekspor dataset
LM Studio adalah UI inferensi lokal paling mudah di desktop. Arahkan ke model Hugging Face, dapatkan jendela obrolan dan server lokal yang kompatibel dengan OpenAI, dan mulai mengumpulkan sesi. Rilis terbaru menambahkan fitur ekspor sesi yang membuang percakapan sebagai JSONL, yang merupakan bahan baku untuk dataset umpan balik.
Di mana ini gagal: Tidak ada penyesuaian halus bawaan. LM Studio adalah inferensi-pertama; pelatihan terjadi di tempat lain.
Harga:
- Gratis: Semuanya.
- Berbayar: Tidak ada.
Platform: Windows, macOS, Linux.
Unduh: lmstudio.ai
Garis bawah: Default untuk menangkap dan memeriksa keluaran model dalam perjalanan ke jalankan penyesuaian halus.
3. Ollama – terbaik untuk melayani model yang disesuaikan halus kemudian
Ollama adalah server model yang membosankan dan dapat diandalkan. Setelah Anda menyesuaikan halus LoRA, bungkusnya sebagai file model Ollama dan setiap klien yang berbicara ke endpoint lokal OpenAI mendapatkan versi Anda yang ditingkatkan secara instan. Rilis terbaru menambahkan pemuatan LoRA tingkat pertama, jadi Anda dapat menukar adaptor tanpa mengunduh ulang bobot dasar.
Di mana ini gagal: Tidak ada UI. Ini adalah daemon yang mengharapkan alat lain berada di atasnya.
Harga:
- Gratis: Semuanya.
- Berbayar: Tidak ada.
Platform: Windows, macOS, Linux.
Unduh: ollama.com — Sumber (GitHub)
Garis bawah: Pilihan yang tepat untuk menghost model yang disesuaikan pada mesin Anda.
4. Axolotl – terbaik untuk jalankan LoRA yang dapat direproduksi
Axolotl adalah pembungkus yang didorong YAML di sekitar stack pelatihan Hugging Face. Arahkan ke dataset, pilih model dasar, tetapkan peringkat LoRA dan tingkat pembelajaran Anda, dan pergi. Setiap jalankan dapat direproduksi dari file konfigurasi, yang penting ketika seluruh poin perbaikan diri adalah mengukur peningkatan di seluruh iterasi.
Di mana ini gagal: Native Linux. Berjalan di Windows melalui WSL dan di macOS melalui kontainer tetapi dengan tepi kasar.
Harga:
- Gratis: Semuanya.
- Berbayar: Tidak ada.
Platform: Terutama Linux; WSL untuk Windows.
Unduh: github.com/axolotl-ai-cloud/axolotl
Garis bawah: Pilihan yang tepat jika Anda menginginkan eksperimen dapat diulang sebulan kemudian.
5. Unsloth – terbaik untuk LoRA GPU tunggal cepat
Unsloth adalah perpustakaan penyesuaian halus yang memeras 2-5x kecepatan pada GPU konsumen tunggal dibandingkan dengan Trainer Hugging Face saham. Penggunaan VRAM kira-kira setengahnya. Pada 4090 itu berarti jalankan 7B LoRA dalam satu jam bukan empat; pada 3060 itu berarti jalankan selesai sama sekali.
Di mana ini gagal: Beberapa arsitektur di belakang rilis transformator dasar. Dukungan untuk model terbaru datang dalam versi atau dua kemudian.
Harga:
- Gratis: Semuanya pada GPU tunggal.
- Berbayar: Unsloth Pro untuk multi-GPU dan dukungan enterprise.
Platform: Windows, Linux.
Unduh: unsloth.ai — Sumber (GitHub)
Garis bawah: Pilihan yang tepat ketika GPU desktop tunggal adalah semua yang Anda miliki.
6. Text Generation WebUI – terbaik untuk pelabelan manual dan evaluasi
Text Generation WebUI (Oobabooga) adalah UI kuda kerja untuk inferensi lokal, dan itu juga berfungsi sebagai lingkungan pelabelan dan evaluasi. Muat model dasar dan yang disesuaikan berdampingan, jalankan prompt yang sama terhadap keduanya, dan tandai jawaban mana yang lebih baik. Setiap peringkat masuk ke log percakapan yang sama untuk putaran berikutnya.
Di mana ini gagal: UI default sudah usang. Pengaturan bisa rumit di Windows tanpa WSL.
Harga:
- Gratis: Semuanya.
- Berbayar: Tidak ada.
Platform: Windows, macOS, Linux.
Unduh: github.com/oobabooga/text-generation-webui
Garis bawah: Harness evaluasi untuk orang-orang yang suka UI.
7. DSPy – terbaik ketika kegagalan adalah prompt, bukan bobot
DSPy memperlakukan prompt sebagai parameter. Berikan itu dataset berlabel kecil dari kegagalan, tentukan metrik, dan itu mengoptimalkan prompt (dan beberapa contoh) agar sesuai. Untuk banyak mode kegagalan ini lebih cepat dan lebih murah daripada penyesuaian halus. Prompt yang dioptimalkan kemudian dapat umpan kembali ke agen produksi Anda.
Di mana ini gagal: Kurva pembelajaran. Abstraksi (Signature, Modul, Pengoptimal) kuat tetapi tidak jelas pada pembacaan pertama.
Harga:
- Gratis: Semuanya.
- Berbayar: Tidak ada.
Platform: Windows, macOS, Linux.
Unduh: dspy.ai — Sumber (GitHub)
Garis bawah: Coba DSPy sebelum penyesuaian halus. Prompt murah memperbaiki kegagalan murah.
Bagaimana cara memilih yang tepat
Jika Anda baru memulai dan menginginkan stack tunggal, LM Studio untuk inferensi ditambah LangChain untuk penangkapan ditambah Unsloth untuk penyesuaian halus LoRA jalankan adalah jalur termurah ke loop kerja.
Jika kegagalan Anda sebagian besar kesenjangan penalaran (model mengembara, melewatkan langkah), mulai dengan DSPy. Optimasi prompt sering kali menutup kesenjangan untuk sen bukan jam GPU.
Jika kegagalan Anda khusus domain (model tidak mengenal basis kode atau produk Anda), itu adalah penyesuaian halus. Gunakan Axolotl atau Unsloth di atas duo LM Studio dan Ollama.
Jika Anda berada di workstation dengan dua atau lebih GPU, Axolotl skala lebih jauh dari tingkat gratis Unsloth.
Gunakan Text Generation WebUI sebagai UI evaluasi Anda terlepas dari apa yang Anda latih. Tes A/B manual adalah cara tercepat untuk mengetahui penyesuaian benar-benar meningkatkan hal-hal.
FAQ
Bisakah saya perbaikan diri LLM lokal tanpa melatih data saya sendiri? Hanya sampai batas tertentu. Optimasi prompt dengan DSPy membawa Anda lebih jauh dari yang paling diharapkan, tetapi kegagalan khusus domain membutuhkan data khusus domain.
Berapa banyak data yang saya butuhkan untuk penyesuaian halus LoRA yang berguna? Untuk perbaikan bertarget, beberapa ratus contoh kegagalan berlabel sudah cukup. Penyesuaian instruksi model umum memerlukan puluhan ribu.
Mana yang lebih cepat pada 3060 atau 4060: Unsloth atau Axolotl? Unsloth, dengan margin lebar pada GPU tunggal. Axolotl lebih baik setelah Anda memiliki beberapa GPU atau menginginkan config YAML yang dapat direproduksi.
Apakah saya kehilangan kemampuan model dasar ketika saya menyesuaikan halus LoRA? Biasanya tidak. LoRA membekukan bobot dasar dan menambahkan adaptor kecil. Anda dapat mengeluarkan adaptor dan mendapatkan kembali model dasar.
Bisakah saya menjalankan semua ini di Apple Silicon Mac? Inferensi (LM Studio, Ollama, Text Generation WebUI) ya. Pelatihan berjalan lebih lambat di Metal daripada di CUDA; beberapa arsitektur masih memerlukan kotak GPU Linux untuk waktu pelatihan praktis.