sumber : wss-id.org
Read Business Guides Before You Start A Business
Monday, July 20, 2009
mengenal robot.txt
sumber : wss-id.org
Membuat file robots.txt
robots.txt adalah file yang sangat penting jika suatu web ingin mudah di index oleh search engine, ketika search engine crawler datang di web kita, maka dia akan mencari file kusus yaitu file yang bernama robots.txt dan memberitahukan search engine spider bahwa halaman web tersebut harus di indek atau di abaikan
Penempatan file robots.txt
file robots.txt bukanlah file HTML, yang harus di tempatkan di root web misalnya http://www.jagadnet.com/robots.txt
Cara membuat file robots.txt
Isi sebuah file robots.txt hanyalah terdiri dari sebuah catatan, sebuah catatan yang memberikan informasi khusus untuk search engine, setiap catatannya terdiri dari dua bidang yaitu user agent untuk baris pertama dan catatan larangan atau disallow untuk baris ke dua
contoh:
User-agent: googlebot
Disallow: /cgi-bin/
yang di maksut user agen googlebot, hanya bot search engine google ajah yang di perbolehkan untuk mengambil setiap halaman dari web kecuali direktori /cgi-bin/ karena Disallow: /cgi-bin/ maka semua file yang berada di cgi-bin akan di abaikan oleh googlebot.
Disallow atau larangan yang mewakili semua direktori
Agar semua Search engine dapat meng-index halaman web
bila anda menginginkan semua search engine dapat mengindek web anda maka isilah user-agen:*
contoh:
User-agent: *
Disallow: /cgi-bin/
jika file robots.txt anda penulisannya salah maka web anda tidak akan diindex oleh search engine
Untuk mengecek valid dan tidaknya file robots.txt anda, bisa gunakan halaman web http://tool.motoricerca.info/robots-checker.phtml
sumber: jagadnet.com
Robots.txt
Disaat yang lain sibuk membuat tulisan tentang bagaimana meningkatkan traffic, saya malah kebingungan bagaimana untuk menurunkan traffic. Beberapa hari yang lalu di awal bulan maret 2009, blog saya mengalami lonjakan traffic yang saya nilai tidak wajar. Bandwidth yang terpakai sangat tinggi tetapi pengunjung blog relatif tetap, bahkan cenderung menurun. Kemudian saya bandingkan statistik antara awstats dan google analytics. Dan saya menarik kesimpulan bahwa traffic yang tinggi berasal dari robot spider mesin pencari.
Seperti yang kita ketahui, robot/spider/bot atau apalah namanya itu bertugas membaca isi dari blog atau website kita agar blog kita bisa terindex ke mesin pencari darimana robot tersebut berasal. Sebenarnya robot itu sangat membantu kita agar blog kita bisa masuk ke mesin pencari. Tetapi kalo kebanyakan robot sok tahu yang meng-crawl halaman website kita, padahal jatah bandwidth kita terbatas akan menjadi masalah.
Salah satu cara mengatasainya adalah dengan menggunakan robots.txt. Untuk lebih mengenal tentang robot.txt bisa membaca tentang robot.txt disini atau bisa juga baca FAQ-nya di FAQ Robot.TXT. Karena saya tidak paham dengan Robots.Txt maka saya membuat robots.txt menggunakan Robots.Txt Generator, dan hasilnya menjadi seperti ini robot.txt saya. Dan sekarang traffic blog saya kembali normal.sumber: http://www.ardi.web.id
Robot.txt: bagian penting dari manajemen web
robots.txt adalah file yang sangat penting jika suatu web ingin mudah di index oleh search engine, ketika search engine crawler datang di web kita, maka dia akan mencari file khusus yaitu file yang bernama robots.txt dan memberitahukan search engine spider bahwa halaman web tersebut harus di index atau di abaikan
file robots.txt adalah file text yang sederhana (bukan HTML), yang harus di tempatkan di root web misalnyahttp://www.kadung.com/robots.txt
bagaimana membuat file robots.txtseperti di sebutkan di atas bahwa robot.txt adalah file text sederhana, maka isi sebuah file robots.txt hanyalah terdiri dari sebuah catatan, sebuah catatan yang memberikan informasi khusus untuk search engine, setiap catatannya terdiri dari dua bidang yaitu user agent untuk baris pertama dan catatan larangan atau disallow untuk baris ke dua
contoh:User-agent: googlebot
Disallow: /cgi-bin/
Disallow atau larangan yang mewakili semua direktori
contoh:User-agent: googlebot
Disallow: /software
jika Disallow di kosongkan maka search engine dapat mengindek semua halaman yang ada di web anda
User-agent: googlebotDisallow:
bila anda menginginkan semua search engine dapat mengindek web anda maka isilah user-agen:*contoh:
User-agent: *
Disallow: /cgi-bin/
1. jangan menggunakan command di robots.txt misalnya
#awal perintahUser-agent: *
Disallow: /cgi-bin/
#akir perintah
2.jangan mengunakan spasi diawal baris
contoh:User-agent: *
Disallow: /cgi-bin/
contoh:
Disallow: /cgi-bin/
User-agent: *
contoh:
User-agent: *
Disallow: /cgi-bin/ /sofware/ /picture/
contoh:
User-agent: *
Disallow: /cgi-bin/
Disallow: /sofware/
Disallow: /picture/
6.jangan mendaftar semua file dalam satu direktori, jika spider bot ingin mengabaikan file-file di dalam suatu direktori anda tidak perlu mendaftarkan semua file-filenya
contoh:User-agent: *
Disallow: /sofware/handphone.html
Disallow: /sofware/komputer.html
Disallow: /sofware/driver.html
User-agent: *
Disallow: /software/
Tips penggunaan robots.txt yang benar
1. lebih baik memperbolehkan semua search engine dan semua direktori ataupun halaman untuk mengindek web anda
Disallow:
2.jika anda tidak ingin semua search engine mengindek web anda laranganlah root web anda Disallow: /User-agent: *
Disallow: /
http://www.billinghotspot.com/robots.txt
http://www.microsoft.com/robots.txt
http://youtube.com/robots.txt
http://www.ebay.com/robots.txt
http://www.mcanerin.com/en/search-engine/robots-txt.asp
sumber : kadung.com
SEO Tools
P.S. Untuk keterangan lengkap apa itu robots.txt silakan meluncur ke ↓