Bot web Meta mendorong sembilan miliar permintaan dalam satu kuartal tahun ini, dan lalu lintas keluar hampir tidak pernah kembali ke situs yang dicrawl crawler. Cloudflare sekarang secara default memblokir bot pelatihan dan agen di halaman mana pun yang menampilkan iklan. Garis antara “kunjungan pencarian” dan “corpus pelatihan” telah bergeser, dan jika Anda menjalankan situs, Anda mungkin ingin berada di sisi “pemblokiran” darinya.
Aplikasi terbaik untuk memblokir web scraper AI di desktop pada 2026 terbagi menjadi tiga kategori: layanan edge yang memblokir di tepi jaringan sebelum permintaan mencapai origin Anda, firewall proof-of-work yang di-host sendiri yang berjalan berdampingan dengan aplikasi Anda, dan aturan di sisi origin yang memfilter permintaan setelah tiba. Kami memilih tujuh yang bekerja bersama, dari toggle Cloudflare sederhana hingga Anubis (sudah diterapkan oleh sumber Linux kernel, Codeberg, dan FFmpeg).
Apa yang harus dicari dalam alat pemblokir scraper AI
- Deteksi User-Agent dan perilaku gabungan. Alat apa pun yang hanya memeriksa string User-Agent adalah kecepatan bumpy, bukan tembok.
- Kemampuan membedakan bot pelatihan dari crawler pencarian. Anda ingin GPTBot diblokir, Googlebot diizinkan.
- Tingkat false positive rendah pada manusia nyata. Tantangan proof-of-work harus menurun dengan baik di ponsel lama dan pembaca layar.
- Visibilitas. Dasbor yang memberi tahu Anda bot mana yang mengunjungi Anda minggu lalu bernilai lebih dari klaim “kami memblokir barang” kotak hitam.
- Biaya yang sesuai dengan lalu lintas Anda. Blog pribadi tidak memerlukan kontrak WAF lima angka.
Perbandingan cepat
| Alat | Terbaik untuk | Paket Gratis | Berbayar | Penyebaran |
|---|---|---|---|---|
| Cloudflare AI Crawl Control | Situs apa pun di belakang Cloudflare | Termasuk di semua tingkatan | Terbundel dengan Cloudflare Pro/Biz | Toggle sekali klik |
| Dark Visitors (Known Agents) | Visibilitas bot AI mana yang mengunjungi Anda | Tingkat gratis | Paket tim dari biaya bulanan sederhana | robots.txt + pelacak agen |
| Anubis | Dinding proof-of-work yang di-host sendiri | Open source, gratis | Hanya gratis | Reverse proxy (biner Go) |
| Nepenthes | Secara aktif membuang-buang waktu scraper | Open source, gratis | Hanya gratis | Kontainer tarpit |
| Fail2Ban | Alat ban-by-log di sisi origin | Open source, gratis | Hanya gratis | Daemon server |
| ModSecurity + OWASP CRS | WAF berbasis aturan di origin | Open source, gratis | Gratis dengan set aturan komersial | Modul nginx/Apache |
| DataDome | Manajemen bot tingkat enterprise | Hanya uji coba | Kontrak enterprise | Integrasi Edge / API |
Alatnya
1. Cloudflare AI Crawl Control – Pemblokir sekali klik terbaik untuk situs apa pun
Cloudflare AI Crawl Control adalah cara tercepat untuk menghentikan bot pelatihan AI. Pelanggan apa pun di tingkat apa pun (termasuk gratis) dapat membuka Security → Bots di dasbor dan mengalihkan toggle “AI Crawls and Scrapers”. Ini menggunakan database sidik jari bot Cloudflare ditambah sinyal perilaku untuk mengidentifikasi GPTBot, ClaudeBot, Applebot Extended, PerplexityBot, dan ratusan lainnya. Mulai dari 15 September 2026, domain baru secara default memblokir bot pelatihan dan agen di halaman yang menampilkan iklan.
Karena berjalan di tepi jaringan, permintaan yang diblokir tidak pernah menyentuh origin Anda. Itu menghemat bandwidth dan CPU origin, dan tidak penting stack apa yang digunakan situs Anda. Anda juga dapat mengizinkan bot tertentu (Googlebot tetap hijau secara default), menagih akses melalui program pembayaran per crawl Cloudflare, atau menulis aturan kustom untuk kontrol lebih baik.
Di mana itu jatuh pendek: Hanya berguna jika situs Anda berada di belakang Cloudflare. Pengklasifikasi Cloudflare kadang salah memberi label crawler penelitian atau arsip yang sah, jadi periksa analitik sebelum membiarkannya berjalan autopilot untuk sesuatu yang penting.
Harga:
- Gratis: Toggle penuh, daftar blokir/izinkan, analitik
- Berbayar: Terbundel dengan Cloudflare Pro, Business, dan Enterprise
Platform: Situs apa pun di depan Cloudflare (origin Windows, macOS, Linux semuanya berfungsi)
Garis bawah: Jika Anda di Cloudflare, aktifkan ini sebelum Anda membaca sisa daftar.
2. Dark Visitors (Known Agents) – Terbaik untuk mengetahui bot mana yang sebenarnya mengunjungi Anda
Dark Visitors (dinamakan ulang Known Agents pada 2026) adalah lapisan visibilitas yang hilang dari sebagian besar situs. Ini mempertahankan database bot AI yang dikurasi (bot pelatihan, scraper RAG, agen browsing, copilot LLM) dan memberi Anda file robots.txt yang diperbarui secara langsung dan dasbor analitik yang menunjukkan mana yang sebenarnya mengetuk. Tambahkan cuplikan dan Anda mendapatkan angka nyata tentang GPTBot, ClaudeBot, PerplexityBot, dan puluhan agen yang lebih baru yang mungkin belum Anda dengar.
Tingkatan gratis mencakup hal-hal penting: daftar agen, file robots.txt, pelacakan kunjungan dasar. Tingkatan berbayar membuka analitik lengkap, beberapa situs, dan akses API. Ini berpasangan dengan baik dengan Cloudflare: Cloudflare memberi tahu Anda apa yang diblokir di tepi, Known Agents memberi tahu Anda apa yang mencoba dan (untuk apa pun yang belum dikenali Cloudflare) apa yang masih lolos.
Di mana itu jatuh pendek: robots.txt adalah permintaan, bukan aturan. Crawler yang berperilaku baik menghormatinya; aktor jahat mengabaikannya. Alat ini memberi tahu Anda kebenaran tentang siapa yang mengabaikan aturan, tetapi tidak memaksakan kepatuhan dengan sendirinya.
Harga:
- Gratis: File robots.txt, pelacak dasar, satu situs
- Berbayar: Paket tim dari biaya bulanan sederhana untuk multi-site, analitik lengkap, API
Platform: Situs apa pun (berbasis cuplikan)
Garis bawah: Instal ini bahkan jika Anda sudah memiliki Cloudflare, karena ini memberi tahu Anda bot mana yang menjadi masalah yang berkembang.
3. Anubis – Dinding terbaik yang di-host sendiri terhadap scraper AI
Anubis adalah Web AI Firewall yang di-host sendiri yang ditulis di Go oleh TecharoHQ. Ini duduk sebagai reverse proxy di depan aplikasi Anda dan mengeluarkan tantangan proof-of-work JavaScript sebelum melayani permintaan. Browser nyata menyelesaikan tantangan secara tidak terlihat dalam sebagian kecil detik; scraper naif terhenti karena mereka tidak menjalankan JS atau tidak ingin membakar siklus CPU dalam skala mereka.
Adopsi menceritakan kisahnya: Codeberg, FFmpeg, sumber Linux kernel, dan sebagian besar proyek non-Cloudflare FOSS menjalankannya. Konfigurasi adalah satu file YAML; Anda menunjukkan Anubis ke upstream Anda, menetapkan kesulitan tantangan per rute, dan menambahkan daftar yang diizinkan untuk bot bagus (Googlebot, IA_Archiver, dll.).
Di mana itu jatuh pendek: Scraper yang menjalankan JS (Chromium headless, Playwright) juga dapat menyelesaikan PoW; mereka hanya membayar biaya CPU yang sederhana. Anubis adalah penghalau yang kuat, bukan tembok yang tidak dapat ditembus. Ini juga menambahkan hopnya latensi kecil untuk setiap permintaan.
Harga:
- Gratis: Sepenuhnya sumber terbuka (MIT)
- Berbayar: Tidak ada; dukungan komersial tersedia secara terpisah
Platform: Linux (Docker, systemd), Windows, macOS (melalui biner Go)
Garis bawah: Pilihan yang tepat ketika Anda menjalankan infrastruktur Anda sendiri dan tidak ingin merutekan melalui Cloudflare.
4. Nepenthes – Terbaik untuk membuang-buang waktu scraper
Nepenthes mengambil pendekatan yang berlawanan: daripada memblokir scraper, ia menyeretnya ke labirin tak terbatas halaman yang dihasilkan secara prosedural dan terlihat masuk akal yang tidak pernah berakhir. Hasilnya adalah tarpit yang mengorbankan CPU dan bandwidth scraper sambil tidak mengembalikan data pelatihan yang berguna. Dibuat khusus sebagai respons terhadap crawler AI mengabaikan robots.txt, itu diambil oleh admin yang ingin secara aktif meningkatkan biaya scraping daripada secara pasif menolaknya.
Terapkan sebagai kontainer Docker di subdomain atau jalur, tambahkan direktif robots.txt menunjuk bot buruk ke sana, dan tonton crawler membuang-buang sumber dayanya. Ini juga sedikit meracuni data pelatihan: scraper apa pun yang menelan keluaran Nepenthes membawa teks yang berisik tetapi masuk akal tapi palsu kembali ke pipeline apa pun yang dipanggilnya.
Di mana itu jatuh pendek: Sedikit etis tepi untuk beberapa operator; Anda sengaja menyajikan data yang menyesatkan. Ini hanya mempengaruhi bot yang tidak menghormati robots.txt di tempat pertama, yang merupakan intinya tetapi juga patut dipertimbangkan.
Harga:
- Gratis: Open source
- Berbayar: Tidak ada
Platform: Linux (Docker) terutama; macOS dan Windows melalui Docker
Garis bawah: Tambahkan ini setelah Anda sudah memiliki pemblokiran dan ingin membuat scraping secara aktif mahal.
5. Fail2Ban – Alat ban-by-log di sisi origin terbaik
Fail2Ban adalah alat klasik untuk membaca log server, mengenali pola, dan mendorong ban tingkat IP ke firewall. Setiap admin Linux mengenalnya. Untuk scraping AI khususnya, filter Fail2Ban dapat menonton log nginx atau Apache untuk User-Agent regex (GPTBot, ClaudeBot, Bytespider, dll.), atau untuk tanda tangan perilaku (ledakan permintaan per detik dari IP tunggal), dan lepaskan pelanggar ke iptables.
Karena ban terjadi di firewall kernel, origin tidak menghabiskan siklus melayani scraper sama sekali. Gabungkan dengan setup Cloudflare di tepi dan Anubis di tengah, dan Anda memiliki pertahanan secara mendalam.
Di mana itu jatuh pendek: Ban berbasis IP rapuh terhadap rotating residential proxies, yang digunakan scraper serius. Dan filter harus ditulis dan disesuaikan; ini bukan instalasi sekali klik.
Harga:
- Gratis: Open source, di setiap distro Linux mainstream
- Berbayar: Tidak ada
Platform: Linux (asli); dukungan Windows dan macOS terbatas
Garis bawah: Pilihan yang tepat untuk sysadmin yang sudah menulis filter regex dan menginginkan ban di tingkat paket.
6. ModSecurity + OWASP CRS – WAF berbasis aturan terbaik di origin
ModSecurity dengan OWASP Core Rule Set adalah WAF sumber terbuka yang diterapkan admin nginx dan Apache di origin ketika mereka tidak dapat atau tidak ingin layanan edge. CRS dilengkapi dengan aturan untuk serangan umum (SQLi, XSS, RCE), dan set aturan bot AI yang dipertahankan komunitas menambahkan filter User-Agent, ambang perilaku, dan feed IP yang dikenal buruk khusus untuk scraper AI.
Karena berbasis aturan, Anda mempertahankan kontrol penuh. Anda dapat memasukkan dalam daftar putih alat analitik internal, memblokir user-agent tertentu secara global, atau menulis aturan per-jalur. Ini juga dimainkan dengan baik dengan Fail2Ban: ModSecurity menandai permintaan sebagai anomali, Fail2Ban membaca bendera dan melarang sumbernya.
Di mana itu jatuh pendek: Aturan memerlukan pemeliharaan. Positif palsu terjadi pada aplikasi kustom. Dan ini adalah modul asli untuk nginx atau Apache, jadi penyebaran yang dikontainerkan memerlukan citra Docker dengan itu dipanggang.
Harga:
- Gratis: Open source
- Berbayar: Set aturan komersial dan dukungan tersedia dari pihak ketiga
Platform: Linux (nginx/Apache asli), Windows (melalui IIS dengan keterbatasan)
Garis bawah: Default on-origin WAF ketika Anda tidak di belakang Cloudflare dan menginginkan transparansi penuh.
7. DataDome – Manajemen bot tingkat enterprise terbaik
DataDome adalah tempat Anda mendarat ketika blog pribadi berkembang menjadi bisnis nyata. Kira-kira 1.200 perusahaan di seluruh Amerika dan Eropa menjalankan WAF-nya, dan beroperasi di atas 85.000 model pembelajaran mesin khusus pelanggan, artinya setiap situs yang dilindungi menjadi tantangan deteksi sendirinya bagi scraper. Ini mengintegrasikan di tepi (melalui CDN atau DNS), dan deteksinya meluas melampaui bot pelatihan AI ke pengisian ulang kredensial, penipuan iklan, dan pertanian scraping-as-a-service.
Dasbor adalah yang terkuat dalam kategori ini, memberi Anda klasifikasi per-permintaan, perincian geografis, dan perkiraan dampak pendapatan. Waktu respons pada deteksi diukur dalam milidetik. Dukungan tingkat Enterprise disertakan.
Di mana itu jatuh pendek: Harga bukan untuk individu; Anda meminta kutipan. Setup memerlukan kerjasama dengan DNS, CDN, dan origin Anda, jadi itu proyek bukan toggle.
Harga:
- Gratis: uji coba 30 hari
- Berbayar: Kontrak enterprise, kutipan kustom
Platform: Origin apa pun (Windows, macOS, Linux); diterapkan di tepi
Garis bawah: Pilihan yang tepat ketika biaya konten yang dicoreng atau penipuan lebih besar dari tagihan manajemen bot tahunan.
Cara memilih yang benar
- Jika Anda menginginkan opsi paling sederhana dan Anda sudah di Cloudflare: aktifkan AI Crawl Control. Selesai dalam 15 detik.
- Jika Anda ingin melihat kebenaran tentang siapa yang mem-scrape Anda: pasang Dark Visitors (Known Agents) bersama apa pun yang lain. Visibilitas pertama, pemblokiran kedua.
- Jika Anda self-host dan tidak ingin berada di belakang CDN: jalankan Anubis sebagai proxy terbalik Anda. Tambahkan Nepenthes untuk meracuni yang lolos.
- Jika Anda adalah admin Linux yang sudah hidup di log nginx: sambungkan Fail2Ban dan ModSecurity + OWASP CRS. Gratis, transparan, di bawah kontrol Anda.
- Jika Anda adalah bisnis dengan pendapatan nyata yang dipertaruhkan: dapatkan kontrak DataDome. Cloudflare mencakup pasar massal; DataDome mencakup kasus tepi.
- Stack realistis untuk situs kecil hingga menengah pada 2026: Cloudflare AI Crawl Control di tepi, Dark Visitors untuk visibilitas, Anubis untuk apa pun yang Cloudflare tidak tangkap. Kombo itu berjalan untuk $0 di sebagian besar bulan.
FAQ
Apa blocker scraper AI gratis terbaik?
Cloudflare AI Crawl Control jika situs Anda berada di belakang Cloudflare (tingkat gratis menyertakannya). Jika Anda self-host, Anubis adalah opsi sumber terbuka gratis yang paling kuat. Keduanya mengatasi masalah yang sama dari sisi tumpukan yang berbeda.
Bisakah bot AI melewati Cloudflare?
Ya, beberapa bisa. Pengklasifikasi Cloudflare sangat bagus dalam pemblokiran berbasis tanda tangan tetapi scraper canggih menggunakan rotasi proxy perumahan dan browser headless untuk terlihat manusia. Itulah mengapa pertahanan berlapis (tepi + origin + visibilitas) bekerja lebih baik daripada alat apa pun.
Apakah saya perlu memblokir bot AI di blog pribadi?
Itu panggilan Anda. Jika Anda ingin konten Anda digunakan untuk melatih LLM komersial, jangan lakukan apa-apa. Jika Anda lebih suka tidak, aktifkan toggle Cloudflare atau tambahkan Anubis. Kompromi paling umum adalah robots.txt Known Agents ditambah blokir Cloudflare untuk crawler pelatihan terbesar.
Akankah memblokir bot AI melukai peringkat pencarian saya?
Tidak jika Anda mengonfigurasi pemblokir dengan benar. Semua alat dalam daftar ini dapat mengizinkan Googlebot, Bingbot, dan crawler pencarian tradisional lainnya sambil memblokir bot yang hanya melatih seperti GPTBot, ClaudeBot, dan PerplexityBot. Periksa daftar yang diizinkan sebelum penyebaran.
Apa perbedaan antara Anubis dan Cloudflare?
Cloudflare memblokir di tepi jaringan sebelum permintaan mencapai server Anda. Anubis berjalan di server Anda sebagai reverse proxy dan mengeluarkan tantangan proof-of-work. Cloudflare lebih mudah dan mencakup lebih banyak area; Anubis self-hosted, transparan, dan tidak memerlukan pihak ketiga.