Pembuat robots.txt

Susun robots.txt blok demi blok: aturan Allow dan Disallow per crawler, crawl delay, sitemap, dan komentar, dengan pratinjau langsung.

File disusun secara lokal di browser Anda. Tidak ada yang dikirim ke server.

Sitemap

Satu baris Sitemap: per sitemap XML — URL absolut penuh pilihan paling aman.

Pratinjau robots.txt
—

Punya file lama? Tempelkan isinya manual ke blok-blok di atas — pratinjau menggantikan file lama begitu selesai.

Cara kerja

Alat ini menelusuri blok-blok aturan Anda dari atas ke bawah dan menulis satu grup User-agent: per blok: baris agen lebih dulu, lalu setiap baris Allow:, Disallow:, dan Crawl-delay: opsional, disusul entri Sitemap: serta baris komentar yang Anda tambah. Pratinjau berubah saat Anda mengetik, dan salin atau unduh memberi Anda file jadi yang siap diletakkan di root situs sebagai /robots.txt.

Urutan arahan dan pencocokan paling spesifik
Crawler mencari grup yang User-agent:-nya cocok; jika beberapa cocok, Google memakai yang paling spesifik (grup Googlebot-news mengalahkan grup *). Di dalam satu grup, path terpanjang yang cocok yang menang, sehingga Allow: /privat/bagian-umum bisa melubangi Disallow: /privat. Urutan tidak menciptakan prioritas — spesifisitas yang menciptakannya.
Disallow: / lawan Disallow: (kosong)
Disallow: / memblokir seluruh situs untuk agen itu. Nilai kosong, Disallow:, berarti sebaliknya: rambah semuanya. Grup tanpa baris Disallow berlaku seperti yang kosong, karena itu blok bawaan alat ini menyediakan satu baris Disallow kosong.
Wildcard, jangkar akhir, dan mengapa ini bukan keamanan
Google dan Bing memperluas sintaksnya dengan * untuk sembarang karakter dan $ sebagai jangkar akhir, sehingga Disallow: /*.pdf$ melewati semua path PDF. Ingat batasnya: robots.txt adalah protokol kesopanan yang ditaati mesin pencari, bukan ditegakkan siapa pun — dan filenya sendiri publik, jadi baris Disallow justru mengiklankan apa yang Anda sembunyikan. Path sensitif butuh autentikasi, bukan arahan.

Pertanyaan yang sering diajukan

Apakah URL yang diblokir hilang dari Google?

Belum tentu. Disallow menghentikan Google mengambil halaman, tetapi jika situs lain menauti URL itu Google tetap dapat mencantumkannya di hasil cari — biasanya dengan judul, keterangan "URL diblokir oleh robots.txt", dan tanpa deskripsi. Untuk benar-benar menghapus halaman, halaman harus bisa dijangkau dan memasang meta noindex (atau respons 410/401 terautentikasi); robots.txt baru dipasang setelahnya.

Apakah robots.txt lebih baik daripada noindex untuk menyembunyikan halaman?

Umumnya justru sebaliknya. Google menyatakan bahwa pemblokiran lewat robots.txt adalah cara desindexing paling lemah: halaman yang diblokir dari perayapan bisa tetap masuk indeks, dan Google tidak bisa melihat tag noindex pada halaman yang dilarang diambil. Urutan yang andal: izinkan perayapan, sajikan noindex (meta atau header HTTP), lalu tambahkan Disallow setelah halaman keluar dari indeks.

Apakah baris Sitemap: wajib?

Tidak — Search Console dan feed bisa menemukan sitemap dengan cara lain — tetapi ini deskripsi diri termurah yang bisa diberikan sebuah situs: satu baris gratis yang memberi tahu setiap crawler patuh di mana sitemap XML Anda berada. Sertakan minimal URL kanonik sitemap utama Anda.

Bisakah robots.txt melindungi halaman privat atau panel admin?

Tidak, dan mengandalkan itu kesalahan klasik. robots.txt berada di URL publik, sehingga memublikasikan Disallow sama dengan menyebarkan daftar path tersembunyi Anda — Google dan Bing mengindeks file itu sendiri, dan scraper membaca setiap hari. Sesuatu yang rahasia layak berada di balik autentikasi, bukan di balik arahan yang diikuti crawler yang berbaik hati.

Apakah ada yang diunggah ke server?

Tidak. File disusun dari isian formulir Anda dengan JavaScript murni di browser, dan aksi salin maupun unduh bekerja sepenuhnya di sisi klien — Anda bisa membuatnya bahkan tanpa internet. Tidak ada yang keluar dari perangkat Anda kecuali Anda sendiri mengunggah hasilnya ke situs Anda.