Keluarga model bobot terbuka Google Gemma

Keluarga Gemma dari Google adalah titik manis yang bagus untuk laptop. Checkpoint 4B pas dengan nyaman di 8GB VRAM, lisensinya cukup permisif untuk peralatan internal, dan Ollama menarik bobotnya dalam satu perintah. Ini juga bukan satu-satunya model kecil dengan bobot terbuka yang berjalan baik di desktop yang sederhana. Sejak Gemma 3 dirilis, kami telah menguji enam keluarga lain di laptop 16GB yang sama dan desktop 24GB, dan beberapa di antaranya mengalahkan Gemma pada tugas yang penting bagi kami. Di bawah ini adalah alternatif Gemma yang kami tinggalkan terus terpasang.

Perbandingan cepat

Keluarga Model Terbaik untuk Paket gratis Lisensi Fitur unggulan
Llama 3 (Meta) Obrolan umum, penggunaan alat Ya, bobot di Hugging Face Lisensi komunitas Meta Dukungan perkakas dan kuantisasi terluas
Qwen 3 (Alibaba) Penalaran multibahasa Ya Apache 2.0 Mode pemikiran bawaan yang dapat Anda aktifkan
Phi-4 (Microsoft) Laptop 8GB Ya MIT Penalaran model kecil terbaik per gigabyte
Mistral 7B / Nemo Kode dan obrolan cepat Ya Apache 2.0 Pengiriman dengan pemanggilan fungsi langsung dari kotak
DeepSeek V3 / R1 distills Matematika, kode, rantai pemikiran Ya MIT (distills) Tag <think> eksplisit
IBM Granite 3.3 Draf yang aman perusahaan Ya Apache 2.0 Kuat pada ekstraksi terstruktur
SmolLM 3 Raspberry Pi dan laptop lama Ya Apache 2.0 Model 3B yang berjalan di bawah 4GB RAM

Mengapa orang mencari alternatif Gemma

Gemma 3 mampu, tetapi beberapa kesenjangan nyata mendorong kami ke keluarga model lain:

Alternatifnya

Llama 3 (Meta) - Terbaik untuk ekosistem terluas

Llama 3 adalah model lokal default bagi sebagian besar orang yang menjalankan AI mereka sendiri, dan alasannya membosankan: setiap runner mendukungnya, setiap format kuantisasi menargetkannya terlebih dahulu, dan setiap komunitas fine-tune menulis untuknya. Model 8B berjalan di laptop 16GB yang sama tempat Gemma 4B muat, dengan sedikit lebih banyak ruang kepala RAM, dan model 70B diskalakan ke GPU workstation.

Tempat kekurangannya: lisensi komunitas Meta memiliki pembatasan penggunaan yang tidak dimiliki Apache 2.0. Kualitas multibahasa tertinggal dari Qwen 3.

Harga:

Migrasi dari Gemma: ollama pull llama3.1:8b dan tukar nama model dalam konfigurasi Open WebUI atau LM Studio Anda. Permintaan port dengan bersih. Template obrolan berbeda, jadi jalankan ulang permintaan sistem apa pun sekali.

Unduh: ollama.com/library/llama3.1

Garis bawah: pilih Llama 3 ketika keluasan perkakas penting lebih dari benchmark mentah. Lewatkan jika Anda memerlukan Apache 2.0.

Qwen 3 (Alibaba) - Standar terbaik semua putaran

Qwen 3 telah menjadi rekomendasi tujuan umum paling aman untuk penggunaan lokal. Keluarga mencakup checkpoint padat 0.6B hingga 32B, plus varian MoE 30B dan 235B, jadi Anda dapat memilih berdasarkan VRAM dan menukar antara checkpoint tanpa mengubah gaya permintaan Anda. Kualitas penalaran pada matematika dan kode mengalahkan Gemma dengan jumlah parameter yang sama, dan ada mode pemikiran yang tepat yang dapat Anda aktifkan saat waktu inferensi.

Tempat kekurangannya: klausa lisensi Alibaba sekitar ambang batas jumlah pengguna mengecewakan beberapa perusahaan. Varian MoE memerlukan runner yang mendukung mixture-of-experts, yang tidak setiap aplikasi desktop menangani dengan baik.

Harga:

Migrasi dari Gemma: alur Ollama yang identik. Jika Anda menggunakan heuristik permintaan sistem bawaan Gemma, Qwen menerima instruksi yang sama. Aktifkan mode pemikiran dengan /set think di CLI.

Unduh: ollama.com/library/qwen3

Garis bawah: model yang kami sarankan kepada siapa pun yang bertanya “apa yang harus saya jalankan secara lokal” tanpa konteks lebih lanjut.

Phi-4 (Microsoft) - Terbaik untuk perangkat keras lemah

Phi-4 dan rekan Phi-4-mini-nya menargetkan mesin kecil. Model 14B memukul di atas beratnya pada benchmark penalaran, dan Phi-4-mini pada 3.8B berjalan di 8GB RAM tanpa GPU sama sekali. Microsoft melisensikan semuanya di bawah MIT, jadi model ini cocok untuk proyek komersial tanpa kertas kerja.

Tempat kekurangannya: obrolan umum terasa lebih kering daripada Llama atau Qwen, dan penulisan kreatif lemah. Bukan model yang digunakan untuk salinan pemasaran atau bercerita.

Harga:

Migrasi dari Gemma: penggantian langsung. Jendela konteks Phi-4-mini lebih kecil (128k pada model penuh, 32k pada mini), jadi audit permintaan dokumen panjang terlebih dahulu.

Unduh: ollama.com/library/phi4

Garis bawah: pilih Phi-4-mini untuk laptop lama dan Phi-4 ketika kualitas penalaran penting lebih dari kepribadian.

Mistral 7B dan Mistral Nemo - Terbaik untuk kode dan pemanggilan fungsi

Mistral 7B tetap tajam, dan model Nemo 12B yang lebih baru yang Mistral bangun dengan NVIDIA adalah keluarga yang kami andalkan ketika kami menginginkan penyelesaian kode cepat dan pemanggilan fungsi yang dapat diandalkan. Penggunaan alat Nemo berhasil pada percobaan pertama di setiap runner desktop yang kami uji. Apache 2.0, tanpa syarat.

Tempat kekurangannya: model dasar kurang banyak bicara daripada Llama 3, dan output dapat terasa ringkas. Model Mistral yang lebih besar dan lebih baru gated di balik API komersial mereka.

Harga:

Migrasi dari Gemma: Ollama pull, sesuaikan template obrolan dengan format [INST] Mistral. Jika Anda menggunakan Gemma untuk agen pemanggilan alat, Nemo akan terasa seperti peningkatan pada kali pertama Anda menjalankannya.

Unduh: mistral.ai

Garis bawah: alternatif ketika dukungan alat Gemma telah mengecewakan Anda.

DeepSeek V3 dan R1 distills - Terbaik untuk penalaran

DeepSeek mengirimkan dua keluarga yang patut diketahui: V3, model MoE umum yang kuat, dan distill R1 yang fine-tune basis Llama dan Qwen menjadi mesin pemikiran. Distill R1 mengungkapkan rantai pemikiran mereka di dalam tag <think>, yang merupakan apa yang penulis XDA maksud dengan “LLM lokal yang benar-benar berpikir sebelum menjawab.” Pada soal kata matematika dan perubahan kode multi-langkah, distill R1 sering mengalahkan Gemma 3 27B sambil berjalan di VRAM lebih sedikit.

Tempat kekurangannya: mode pemikiran menghabiskan token, yang memperlambat latensi token pertama dan makan konteks. Model MoE V3 berat untuk sebagian besar desktop.

Harga:

Migrasi dari Gemma: tarik deepseek-r1:14b dan minta persis seperti yang Anda lakukan untuk Gemma. Filter tag <think> dari UI Anda jika pengguna akhir tidak boleh melihatnya.

Unduh: ollama.com/library/deepseek-r1

Garis bawah: pilihan yang berpusat pada penalaran.

IBM Granite 3.3 - Terbaik untuk ekstraksi terstruktur

IBM Granite sunyi, tidak mengagumkan, dan sangat baik pada pekerjaan perusahaan sebagian besar LLM lokal sebenarnya digunakan untuk: mengekstraksi bidang dari dokumen, membuat draf email, mengklasifikasikan tiket. Lisensi Apache 2.0, perkakas Watsonx di sisi perusahaan, dan model 8B berjalan bersama Gemma di hardware yang sama.

Tempat kekurangannya: nada percakapan kaku. Tugas kreatif terasa seperti memo hukum.

Harga:

Migrasi dari Gemma: penggantian langsung. Jika Anda menggunakan Gemma dengan pembungkus permintaan mode JSON, Granite menghormatinya dengan lebih andal.

Unduh: ollama.com/library/granite3.3

Garis bawah: jawaban benar yang membosankan untuk pipeline ekstraksi dan klasifikasi.

SmolLM 3 - Terbaik untuk laptop lama dan komputer papan tunggal

SmolLM 3 dari Hugging Face adalah model 3B yang dirancang untuk berjalan pada perangkat keras kecil. Itu cocok di bawah 4GB RAM, boot di Raspberry Pi 5, dan menggelar percakapan yang koheren. Itu tidak akan melampaui Gemma 4B pada penalaran, tetapi akan terus berjalan di mesin di mana Gemma akan bertukar ke disk.

Tempat kekurangannya: cutoff pengetahuan lebih tua, dan recall konteks panjang lebih lemah.

Harga:

Migrasi dari Gemma: tarik melalui Ollama atau jalankan melalui llama.cpp secara langsung. Harapkan untuk mengerjakan ulang permintaan apa pun yang mengasumsikan cutoff pengetahuan spesifik Gemma.

Unduh: huggingface.co/HuggingFaceTB/SmolLM3-3B

Garis bawah: fallback ketika mesin tidak dapat menangani apa pun yang lebih besar.

Cara memilih

Pilih berdasarkan memori terlebih dahulu, tugas kedua.

FAQ

Apa alternatif Gemma yang baik untuk laptop 16GB? Qwen 3 8B atau Phi-4-mini keduanya cocok dan keduanya melampaui Gemma 3 4B pada penalaran umum. Qwen 3 menang pada pekerjaan multibahasa, Phi menang pada matematika.

Apakah DeepSeek R1 lebih baik dari Gemma untuk pengkodean? Untuk tugas debugging multi-langkah dan refaktor, distill R1 pada 14B biasanya mengalahkan Gemma 3 27B, sebagian besar karena rantai pemikiran membantu menangkap kasus edge yang terlewatkan.

Bisakah saya menjalankan Llama 3 bersama Gemma di Ollama? Ya. Ollama menukar model sesuai permintaan. Tarik keduanya, beralih berdasarkan nama di CLI atau di Open WebUI.

Manakah LLM lokal ringan yang memiliki lisensi paling permisif? Qwen 3, Mistral 7B, IBM Granite, dan SmolLM 3 semuanya dikirim di bawah Apache 2.0. Phi-4 dan distill DeepSeek R1 adalah MIT.

Apakah ada alternatif Gemma dengan mode pemikiran bawaan? Qwen 3 memiliki toggle pemikiran eksplisit, dan distill DeepSeek R1 membungkus penalaran dalam tag <think>. Gemma 3 tidak mengungkapkan baik yang satu maupun yang lain.