Robots.txt
robots.txt adalah file teks yang ditempatkan di direktori root situs web yang menginstruksikan crawler mesin pencari halaman atau file mana yang diizinkan atau dilarang untuk mereka minta. Ini adalah garis pertahanan pertama dalam mengontrol bagaimana bot berinteraksi dengan infrastruktur situs Anda dan membantu mengoptimalkan anggaran crawl.
Mengarahkan Bot ke Konten Terbaik Anda
Google mengalokasikan "crawl budget" terbatas ke situs Anda—jumlah halaman yang akan dirayapi oleh botnya per hari. Jika bot membuang waktu merayapi panel admin, halaman ramah-cetak duplikat, atau URL keranjang/checkout, mereka mungkin melewatkan halaman produk terjemahan Anda yang berharga. robots.txt memberi tahu bot "Jangan buang waktu di /admin/, fokuslah pada /en/, /fr/, /de/ sebagai gantinya." Untuk situs internasional, Anda harus melarang perayapan halaman pengalihan deteksi bahasa otomatis, titik akhir API, dan URL teknis apa pun yang tidak perlu diindeks. Namun, JANGAN PERNAH secara tidak sengaja memblokir direktori bahasa Anda—itu adalah kesalahan bencana yang membunuh semua SEO internasional.
Mengizinkan vs. Melarang Akses Perayapan
Dampak Dunia Nyata
Situs tidak memiliki robots.txt, bot merayapi 10.000 URL keranjang
Anggaran crawl terbuang, halaman produk dirayapi lambat
Produk baru butuh berminggu-minggu untuk muncul di pencarian
Tambahkan robots.txt: Disallow /cart/, /checkout/, /api/
Bot fokus 100% pada halaman produk dan bahasa
Produk baru diindeks dalam 24 jam