Keluarga Gemma dari Google adalah titik manis yang bagus untuk laptop. Checkpoint 4B pas dengan nyaman di 8GB VRAM, lisensinya cukup permisif untuk peralatan internal, dan Ollama menarik bobotnya dalam satu perintah. Ini juga bukan satu-satunya model kecil dengan bobot terbuka yang berjalan baik di desktop yang sederhana. Sejak Gemma 3 dirilis, kami telah menguji enam keluarga lain di laptop 16GB yang sama dan desktop 24GB, dan beberapa di antaranya mengalahkan Gemma pada tugas yang penting bagi kami. Di bawah ini adalah alternatif Gemma yang kami tinggalkan terus terpasang.
Perbandingan cepat
| Keluarga Model | Terbaik untuk | Paket gratis | Lisensi | Fitur unggulan |
|---|---|---|---|---|
| Llama 3 (Meta) | Obrolan umum, penggunaan alat | Ya, bobot di Hugging Face | Lisensi komunitas Meta | Dukungan perkakas dan kuantisasi terluas |
| Qwen 3 (Alibaba) | Penalaran multibahasa | Ya | Apache 2.0 | Mode pemikiran bawaan yang dapat Anda aktifkan |
| Phi-4 (Microsoft) | Laptop 8GB | Ya | MIT | Penalaran model kecil terbaik per gigabyte |
| Mistral 7B / Nemo | Kode dan obrolan cepat | Ya | Apache 2.0 | Pengiriman dengan pemanggilan fungsi langsung dari kotak |
| DeepSeek V3 / R1 distills | Matematika, kode, rantai pemikiran | Ya | MIT (distills) | Tag <think> eksplisit |
| IBM Granite 3.3 | Draf yang aman perusahaan | Ya | Apache 2.0 | Kuat pada ekstraksi terstruktur |
| SmolLM 3 | Raspberry Pi dan laptop lama | Ya | Apache 2.0 | Model 3B yang berjalan di bawah 4GB RAM |
Mengapa orang mencari alternatif Gemma
Gemma 3 mampu, tetapi beberapa kesenjangan nyata mendorong kami ke keluarga model lain:
- Checkpoint 27B adalah puncak keluarga, dan tidak ada saudara yang lebih besar untuk pekerjaan yang lebih berat. Qwen 3 32B dan Llama 3 70B mengambil alih tempat Gemma berhenti.
- Pemanggilan alat dan pemanggilan fungsi tiba terlambat, dan cakupan di runner lokal masih tidak merata. Mistral dan Llama telah menyempurnakannya selama berbulan-bulan.
- Gaya rantai pemikiran bersifat implisit daripada sakelar yang dapat Anda nyalakan. Qwen 3 dan DeepSeek R1 mengungkapkan penalaran mereka dalam blok
<think>yang dapat Anda catat atau sembunyikan. - Kualitas multibahasa di luar bahasa Inggris dan beberapa bahasa Eropa lebih tipis daripada Qwen 3, yang merupakan keluhan umum di r/LocalLLaMA.
- Lisensi Gemma tidak disetujui OSI. Jika tim hukum Anda memerlukan Apache 2.0 atau MIT, Gemma sudah habis dan Qwen, Mistral, dan DeepSeek kembali dalam permainan.
Alternatifnya
Llama 3 (Meta) - Terbaik untuk ekosistem terluas
Llama 3 adalah model lokal default bagi sebagian besar orang yang menjalankan AI mereka sendiri, dan alasannya membosankan: setiap runner mendukungnya, setiap format kuantisasi menargetkannya terlebih dahulu, dan setiap komunitas fine-tune menulis untuknya. Model 8B berjalan di laptop 16GB yang sama tempat Gemma 4B muat, dengan sedikit lebih banyak ruang kepala RAM, dan model 70B diskalakan ke GPU workstation.
Tempat kekurangannya: lisensi komunitas Meta memiliki pembatasan penggunaan yang tidak dimiliki Apache 2.0. Kualitas multibahasa tertinggal dari Qwen 3.
Harga:
- Gratis: bobot penuh di Hugging Face dan Ollama
- Berbayar: hosting cloud melalui Together, Groq, Fireworks dimulai sekitar $0.20 per juta token
- vs Gemma: jejak memori yang sebanding, ekosistem yang lebih besar, penalaran bawaan yang lebih lemah
Migrasi dari Gemma: ollama pull llama3.1:8b dan tukar nama model dalam konfigurasi Open WebUI atau LM Studio Anda. Permintaan port dengan bersih. Template obrolan berbeda, jadi jalankan ulang permintaan sistem apa pun sekali.
Unduh: ollama.com/library/llama3.1
Garis bawah: pilih Llama 3 ketika keluasan perkakas penting lebih dari benchmark mentah. Lewatkan jika Anda memerlukan Apache 2.0.
Qwen 3 (Alibaba) - Standar terbaik semua putaran
Qwen 3 telah menjadi rekomendasi tujuan umum paling aman untuk penggunaan lokal. Keluarga mencakup checkpoint padat 0.6B hingga 32B, plus varian MoE 30B dan 235B, jadi Anda dapat memilih berdasarkan VRAM dan menukar antara checkpoint tanpa mengubah gaya permintaan Anda. Kualitas penalaran pada matematika dan kode mengalahkan Gemma dengan jumlah parameter yang sama, dan ada mode pemikiran yang tepat yang dapat Anda aktifkan saat waktu inferensi.
Tempat kekurangannya: klausa lisensi Alibaba sekitar ambang batas jumlah pengguna mengecewakan beberapa perusahaan. Varian MoE memerlukan runner yang mendukung mixture-of-experts, yang tidak setiap aplikasi desktop menangani dengan baik.
Harga:
- Gratis: bobot di Hugging Face, Modelscope, Ollama
- Berbayar: API Alibaba Cloud, plus mirror DashScope dan OpenRouter
- vs Gemma: lebih murah di cloud, penalaran yang lebih bersih secara lokal, jejak serupa
Migrasi dari Gemma: alur Ollama yang identik. Jika Anda menggunakan heuristik permintaan sistem bawaan Gemma, Qwen menerima instruksi yang sama. Aktifkan mode pemikiran dengan /set think di CLI.
Unduh: ollama.com/library/qwen3
Garis bawah: model yang kami sarankan kepada siapa pun yang bertanya “apa yang harus saya jalankan secara lokal” tanpa konteks lebih lanjut.
Phi-4 (Microsoft) - Terbaik untuk perangkat keras lemah
Phi-4 dan rekan Phi-4-mini-nya menargetkan mesin kecil. Model 14B memukul di atas beratnya pada benchmark penalaran, dan Phi-4-mini pada 3.8B berjalan di 8GB RAM tanpa GPU sama sekali. Microsoft melisensikan semuanya di bawah MIT, jadi model ini cocok untuk proyek komersial tanpa kertas kerja.
Tempat kekurangannya: obrolan umum terasa lebih kering daripada Llama atau Qwen, dan penulisan kreatif lemah. Bukan model yang digunakan untuk salinan pemasaran atau bercerita.
Harga:
- Gratis: bobot di Hugging Face dan Ollama
- Berbayar: hosting Azure AI Foundry untuk tim yang menginginkan SLA
- vs Gemma: jejak memori yang lebih kecil, lisensi MIT, cerita perusahaan yang lebih bersih
Migrasi dari Gemma: penggantian langsung. Jendela konteks Phi-4-mini lebih kecil (128k pada model penuh, 32k pada mini), jadi audit permintaan dokumen panjang terlebih dahulu.
Unduh: ollama.com/library/phi4
Garis bawah: pilih Phi-4-mini untuk laptop lama dan Phi-4 ketika kualitas penalaran penting lebih dari kepribadian.
Mistral 7B dan Mistral Nemo - Terbaik untuk kode dan pemanggilan fungsi
Mistral 7B tetap tajam, dan model Nemo 12B yang lebih baru yang Mistral bangun dengan NVIDIA adalah keluarga yang kami andalkan ketika kami menginginkan penyelesaian kode cepat dan pemanggilan fungsi yang dapat diandalkan. Penggunaan alat Nemo berhasil pada percobaan pertama di setiap runner desktop yang kami uji. Apache 2.0, tanpa syarat.
Tempat kekurangannya: model dasar kurang banyak bicara daripada Llama 3, dan output dapat terasa ringkas. Model Mistral yang lebih besar dan lebih baru gated di balik API komersial mereka.
Harga:
- Gratis: bobot 7B dan Nemo di Hugging Face
- Berbayar: Mistral Le Plateforme API untuk model tertutup (Large, Medium)
- vs Gemma: kode yang lebih baik, pemanggilan fungsi langsung dari kotak, Apache 2.0
Migrasi dari Gemma: Ollama pull, sesuaikan template obrolan dengan format [INST] Mistral. Jika Anda menggunakan Gemma untuk agen pemanggilan alat, Nemo akan terasa seperti peningkatan pada kali pertama Anda menjalankannya.
Unduh: mistral.ai
Garis bawah: alternatif ketika dukungan alat Gemma telah mengecewakan Anda.
DeepSeek V3 dan R1 distills - Terbaik untuk penalaran
DeepSeek mengirimkan dua keluarga yang patut diketahui: V3, model MoE umum yang kuat, dan distill R1 yang fine-tune basis Llama dan Qwen menjadi mesin pemikiran. Distill R1 mengungkapkan rantai pemikiran mereka di dalam tag <think>, yang merupakan apa yang penulis XDA maksud dengan “LLM lokal yang benar-benar berpikir sebelum menjawab.” Pada soal kata matematika dan perubahan kode multi-langkah, distill R1 sering mengalahkan Gemma 3 27B sambil berjalan di VRAM lebih sedikit.
Tempat kekurangannya: mode pemikiran menghabiskan token, yang memperlambat latensi token pertama dan makan konteks. Model MoE V3 berat untuk sebagian besar desktop.
Harga:
- Gratis: bobot R1-distill di Hugging Face (lisensi MIT), bobot V3 juga terbuka
- Berbayar: API DeepSeek, plus mirror OpenRouter
- vs Gemma: transparansi penalaran yang lebih baik, biaya penyiapan yang sama
Migrasi dari Gemma: tarik deepseek-r1:14b dan minta persis seperti yang Anda lakukan untuk Gemma. Filter tag <think> dari UI Anda jika pengguna akhir tidak boleh melihatnya.
Unduh: ollama.com/library/deepseek-r1
Garis bawah: pilihan yang berpusat pada penalaran.
IBM Granite 3.3 - Terbaik untuk ekstraksi terstruktur
IBM Granite sunyi, tidak mengagumkan, dan sangat baik pada pekerjaan perusahaan sebagian besar LLM lokal sebenarnya digunakan untuk: mengekstraksi bidang dari dokumen, membuat draf email, mengklasifikasikan tiket. Lisensi Apache 2.0, perkakas Watsonx di sisi perusahaan, dan model 8B berjalan bersama Gemma di hardware yang sama.
Tempat kekurangannya: nada percakapan kaku. Tugas kreatif terasa seperti memo hukum.
Harga:
- Gratis: bobot di Hugging Face dan Ollama
- Berbayar: IBM Watsonx untuk inferensi yang dihost dan dukungan perusahaan
- vs Gemma: lebih kuat pada output JSON terstruktur, lebih lemah pada obrolan
Migrasi dari Gemma: penggantian langsung. Jika Anda menggunakan Gemma dengan pembungkus permintaan mode JSON, Granite menghormatinya dengan lebih andal.
Unduh: ollama.com/library/granite3.3
Garis bawah: jawaban benar yang membosankan untuk pipeline ekstraksi dan klasifikasi.
SmolLM 3 - Terbaik untuk laptop lama dan komputer papan tunggal
SmolLM 3 dari Hugging Face adalah model 3B yang dirancang untuk berjalan pada perangkat keras kecil. Itu cocok di bawah 4GB RAM, boot di Raspberry Pi 5, dan menggelar percakapan yang koheren. Itu tidak akan melampaui Gemma 4B pada penalaran, tetapi akan terus berjalan di mesin di mana Gemma akan bertukar ke disk.
Tempat kekurangannya: cutoff pengetahuan lebih tua, dan recall konteks panjang lebih lemah.
Harga:
- Gratis: bobot di Hugging Face di bawah Apache 2.0
- Berbayar: tidak ada
- vs Gemma: setengah memori, kira-kira setengah kualitas
Migrasi dari Gemma: tarik melalui Ollama atau jalankan melalui llama.cpp secara langsung. Harapkan untuk mengerjakan ulang permintaan apa pun yang mengasumsikan cutoff pengetahuan spesifik Gemma.
Unduh: huggingface.co/HuggingFaceTB/SmolLM3-3B
Garis bawah: fallback ketika mesin tidak dapat menangani apa pun yang lebih besar.
Cara memilih
Pilih berdasarkan memori terlebih dahulu, tugas kedua.
- Jika Anda memiliki 8GB VRAM atau laptop dengan memori bersatu 16GB: Phi-4-mini atau Gemma 3 4B. Keduanya cocok, Phi menang pada penalaran, Gemma menang pada multimodal.
- Jika Anda memiliki 12 hingga 16GB VRAM: Llama 3 8B untuk perkakas, Qwen 3 8B untuk penalaran, Mistral Nemo untuk kode.
- Jika Anda memiliki 24GB atau lebih: Qwen 3 32B adalah all-rounder terkuat, distill DeepSeek R1 32B adalah pilihan penalaran, Llama 3 70B terkuantisasi pas pada Q4.
- Jika tim kepatuhan Anda memerlukan lisensi yang disetujui OSI: singkirkan Gemma dan Llama, gunakan Apache 2.0 dengan Qwen atau Mistral, atau MIT dengan Phi-4 atau distill DeepSeek.
- Tetap di Gemma ketika masukan multimodal penting dan Anda menginginkan satu keluarga yang menangani gambar plus teks pada ukuran 4B dan 12B.
FAQ
Apa alternatif Gemma yang baik untuk laptop 16GB? Qwen 3 8B atau Phi-4-mini keduanya cocok dan keduanya melampaui Gemma 3 4B pada penalaran umum. Qwen 3 menang pada pekerjaan multibahasa, Phi menang pada matematika.
Apakah DeepSeek R1 lebih baik dari Gemma untuk pengkodean? Untuk tugas debugging multi-langkah dan refaktor, distill R1 pada 14B biasanya mengalahkan Gemma 3 27B, sebagian besar karena rantai pemikiran membantu menangkap kasus edge yang terlewatkan.
Bisakah saya menjalankan Llama 3 bersama Gemma di Ollama? Ya. Ollama menukar model sesuai permintaan. Tarik keduanya, beralih berdasarkan nama di CLI atau di Open WebUI.
Manakah LLM lokal ringan yang memiliki lisensi paling permisif? Qwen 3, Mistral 7B, IBM Granite, dan SmolLM 3 semuanya dikirim di bawah Apache 2.0. Phi-4 dan distill DeepSeek R1 adalah MIT.
Apakah ada alternatif Gemma dengan mode pemikiran bawaan?
Qwen 3 memiliki toggle pemikiran eksplisit, dan distill DeepSeek R1 membungkus penalaran dalam tag <think>. Gemma 3 tidak mengungkapkan baik yang satu maupun yang lain.