LangChain

Melatih model lokal pada kegagalannya sendiri bukan pra-pelatihan, tetapi jika dilakukan dengan benar, ini mengajarkan model kecil untuk berhenti mengulangi kesalahan yang mengganggu Anda kemarin. Itulah janji di balik loop “perbaikan diri” yang telah diiterasi komunitas LLM lokal sepanjang tahun ini: catat jawaban salah model, kurasi menjadi dataset umpan balik kecil, jalankan penyesuaian halus LoRA ringan, dan tonton tingkat kesalahan turun. Ini adalah aplikasi terbaik untuk perbaikan diri LLM lokal dari kegagalan di desktop, apakah Anda menjalankan model 7B di laptop atau 70B di workstation.

Apa yang perlu diperhatikan dalam stack perbaikan diri

Perbandingan cepat

Aplikasi Terbaik untuk Platform Paket gratis Harga awal/bulan Rating
LangChain Menggabungkan penangkapan umpan balik ke alur kerja penyesuaian halus Windows, macOS, Linux Penuh Gratis (open source) 4.5
LM Studio Inferensi sehari-hari plus ekspor dataset Windows, macOS, Linux Penuh Gratis 4.6
Ollama Melayani model yang disesuaikan halus ke klien apa pun Windows, macOS, Linux Penuh Gratis (open source) 4.7
Axolotl Jalankan LoRA yang dapat direproduksi dan didorong YAML Linux (Windows melalui WSL, macOS melalui kontainer) Penuh Gratis (open source) 4.6
Unsloth 2-5x lebih cepat LoRA pada GPU tunggal Windows, Linux Penuh Tingkat gratis, Pro tersedia 4.8
Text Generation WebUI UI lokal untuk inferensi, evaluasi, dan pelabelan manual Windows, macOS, Linux Penuh Gratis (open source) 4.4
DSPy Mengoptimalkan prompt dan pipeline dari kegagalan berlabel Windows, macOS, Linux Penuh Gratis (open source) 4.7

Aplikasi

1. LangChain – terbaik untuk menggabungkan loop umpan balik

LangChain bukan penyesuai halus. Yang dilakukannya dengan baik adalah memberi Anda blok bangunan untuk menangkap setiap pasangan prompt-respons dari agen, menandai kegagalan, dan merutekannya ke dataset pelatihan. Lapisan Callbacks dan Tracing adalah persis apa yang dibutuhkan loop perbaikan diri: catatan tahan lama tentang apa yang dikatakan model, apa yang dilakukan pengguna dengan jawaban, dan bagaimana itu diperbaiki.

Di mana ini gagal: Permukaan API besar dan sering berubah. Sampel kode yang lebih tua di internet sering salah.

Harga:

Platform: Windows, macOS, Linux.

Unduh: langchain.com — Sumber (GitHub)

Garis bawah: Mulai di sini untuk pipa antara model, aplikasi, dan data pelatihan.

2. LM Studio – terbaik untuk inferensi driver harian dan ekspor dataset

LM Studio adalah UI inferensi lokal paling mudah di desktop. Arahkan ke model Hugging Face, dapatkan jendela obrolan dan server lokal yang kompatibel dengan OpenAI, dan mulai mengumpulkan sesi. Rilis terbaru menambahkan fitur ekspor sesi yang membuang percakapan sebagai JSONL, yang merupakan bahan baku untuk dataset umpan balik.

Di mana ini gagal: Tidak ada penyesuaian halus bawaan. LM Studio adalah inferensi-pertama; pelatihan terjadi di tempat lain.

Harga:

Platform: Windows, macOS, Linux.

Unduh: lmstudio.ai

Garis bawah: Default untuk menangkap dan memeriksa keluaran model dalam perjalanan ke jalankan penyesuaian halus.

3. Ollama – terbaik untuk melayani model yang disesuaikan halus kemudian

Ollama adalah server model yang membosankan dan dapat diandalkan. Setelah Anda menyesuaikan halus LoRA, bungkusnya sebagai file model Ollama dan setiap klien yang berbicara ke endpoint lokal OpenAI mendapatkan versi Anda yang ditingkatkan secara instan. Rilis terbaru menambahkan pemuatan LoRA tingkat pertama, jadi Anda dapat menukar adaptor tanpa mengunduh ulang bobot dasar.

Di mana ini gagal: Tidak ada UI. Ini adalah daemon yang mengharapkan alat lain berada di atasnya.

Harga:

Platform: Windows, macOS, Linux.

Unduh: ollama.com — Sumber (GitHub)

Garis bawah: Pilihan yang tepat untuk menghost model yang disesuaikan pada mesin Anda.

4. Axolotl – terbaik untuk jalankan LoRA yang dapat direproduksi

Axolotl adalah pembungkus yang didorong YAML di sekitar stack pelatihan Hugging Face. Arahkan ke dataset, pilih model dasar, tetapkan peringkat LoRA dan tingkat pembelajaran Anda, dan pergi. Setiap jalankan dapat direproduksi dari file konfigurasi, yang penting ketika seluruh poin perbaikan diri adalah mengukur peningkatan di seluruh iterasi.

Di mana ini gagal: Native Linux. Berjalan di Windows melalui WSL dan di macOS melalui kontainer tetapi dengan tepi kasar.

Harga:

Platform: Terutama Linux; WSL untuk Windows.

Unduh: github.com/axolotl-ai-cloud/axolotl

Garis bawah: Pilihan yang tepat jika Anda menginginkan eksperimen dapat diulang sebulan kemudian.

5. Unsloth – terbaik untuk LoRA GPU tunggal cepat

Unsloth adalah perpustakaan penyesuaian halus yang memeras 2-5x kecepatan pada GPU konsumen tunggal dibandingkan dengan Trainer Hugging Face saham. Penggunaan VRAM kira-kira setengahnya. Pada 4090 itu berarti jalankan 7B LoRA dalam satu jam bukan empat; pada 3060 itu berarti jalankan selesai sama sekali.

Di mana ini gagal: Beberapa arsitektur di belakang rilis transformator dasar. Dukungan untuk model terbaru datang dalam versi atau dua kemudian.

Harga:

Platform: Windows, Linux.

Unduh: unsloth.ai — Sumber (GitHub)

Garis bawah: Pilihan yang tepat ketika GPU desktop tunggal adalah semua yang Anda miliki.

6. Text Generation WebUI – terbaik untuk pelabelan manual dan evaluasi

Text Generation WebUI (Oobabooga) adalah UI kuda kerja untuk inferensi lokal, dan itu juga berfungsi sebagai lingkungan pelabelan dan evaluasi. Muat model dasar dan yang disesuaikan berdampingan, jalankan prompt yang sama terhadap keduanya, dan tandai jawaban mana yang lebih baik. Setiap peringkat masuk ke log percakapan yang sama untuk putaran berikutnya.

Di mana ini gagal: UI default sudah usang. Pengaturan bisa rumit di Windows tanpa WSL.

Harga:

Platform: Windows, macOS, Linux.

Unduh: github.com/oobabooga/text-generation-webui

Garis bawah: Harness evaluasi untuk orang-orang yang suka UI.

7. DSPy – terbaik ketika kegagalan adalah prompt, bukan bobot

DSPy memperlakukan prompt sebagai parameter. Berikan itu dataset berlabel kecil dari kegagalan, tentukan metrik, dan itu mengoptimalkan prompt (dan beberapa contoh) agar sesuai. Untuk banyak mode kegagalan ini lebih cepat dan lebih murah daripada penyesuaian halus. Prompt yang dioptimalkan kemudian dapat umpan kembali ke agen produksi Anda.

Di mana ini gagal: Kurva pembelajaran. Abstraksi (Signature, Modul, Pengoptimal) kuat tetapi tidak jelas pada pembacaan pertama.

Harga:

Platform: Windows, macOS, Linux.

Unduh: dspy.ai — Sumber (GitHub)

Garis bawah: Coba DSPy sebelum penyesuaian halus. Prompt murah memperbaiki kegagalan murah.

Bagaimana cara memilih yang tepat

Jika Anda baru memulai dan menginginkan stack tunggal, LM Studio untuk inferensi ditambah LangChain untuk penangkapan ditambah Unsloth untuk penyesuaian halus LoRA jalankan adalah jalur termurah ke loop kerja.

Jika kegagalan Anda sebagian besar kesenjangan penalaran (model mengembara, melewatkan langkah), mulai dengan DSPy. Optimasi prompt sering kali menutup kesenjangan untuk sen bukan jam GPU.

Jika kegagalan Anda khusus domain (model tidak mengenal basis kode atau produk Anda), itu adalah penyesuaian halus. Gunakan Axolotl atau Unsloth di atas duo LM Studio dan Ollama.

Jika Anda berada di workstation dengan dua atau lebih GPU, Axolotl skala lebih jauh dari tingkat gratis Unsloth.

Gunakan Text Generation WebUI sebagai UI evaluasi Anda terlepas dari apa yang Anda latih. Tes A/B manual adalah cara tercepat untuk mengetahui penyesuaian benar-benar meningkatkan hal-hal.

FAQ

Bisakah saya perbaikan diri LLM lokal tanpa melatih data saya sendiri? Hanya sampai batas tertentu. Optimasi prompt dengan DSPy membawa Anda lebih jauh dari yang paling diharapkan, tetapi kegagalan khusus domain membutuhkan data khusus domain.

Berapa banyak data yang saya butuhkan untuk penyesuaian halus LoRA yang berguna? Untuk perbaikan bertarget, beberapa ratus contoh kegagalan berlabel sudah cukup. Penyesuaian instruksi model umum memerlukan puluhan ribu.

Mana yang lebih cepat pada 3060 atau 4060: Unsloth atau Axolotl? Unsloth, dengan margin lebar pada GPU tunggal. Axolotl lebih baik setelah Anda memiliki beberapa GPU atau menginginkan config YAML yang dapat direproduksi.

Apakah saya kehilangan kemampuan model dasar ketika saya menyesuaikan halus LoRA? Biasanya tidak. LoRA membekukan bobot dasar dan menambahkan adaptor kecil. Anda dapat mengeluarkan adaptor dan mendapatkan kembali model dasar.

Bisakah saya menjalankan semua ini di Apple Silicon Mac? Inferensi (LM Studio, Ollama, Text Generation WebUI) ya. Pelatihan berjalan lebih lambat di Metal daripada di CUDA; beberapa arsitektur masih memerlukan kotak GPU Linux untuk waktu pelatihan praktis.