နည်းပညာ SEO
Robots.txt စည်းမျဉ်း စမ်းသပ်ကိရိယာ
robots.txt ဖိုင်ကို paste လုပ်ပြီး crawler တစ်ခုရွေးပြီး path မည်သည့်အရာမဆို စမ်းကြည့်ပါ။ မည်သည့်စည်းမျဉ်း အနိုင်ရသည်ကို တိတိကျကျ ကြည့်ပြီး search engine တွေကို တိတ်တဆိတ် ပိတ်ဆို့နေခြင်း (သို့) crawl budget ဖြုန်းနေခြင်းတို့ကို ရှာဖွေပါ။
ဤကိရိယာသည် သင့် browser အတွင်း၌သာ လုပ်ဆောင်ပါသည်။ အသုံးပြုမှုအရေအတွက် (anonymized) မှလွဲ၍ paste ထားသောအချက်အလက်များကို မည်သည့်နေရာသို့မျှ မပို့ပါ။
သင့် robots.txt ဖိုင်၏ အတိအကျ အကြောင်းအရာကို paste လုပ်ပါ။
domain မပါဘဲ path နှင့် query string ကိုသာ ထည့်ပါ၊ ဥပမာ /blog/post-1?ref=x
ဤကိရိယာ မည်သို့အလုပ်လုပ်သည်၊ ပုံမှန်အမှားများကို မည်သို့ပြင်ရမည်
အမှန်တကယ် crawler များသည် သူတို့နာမည်နှင့် အကိုက်ညီဆုံး User-agent အုပ်စုတစ်ခုတည်းကိုသာ ရွေးချယ်ပြီး (အတိအကျကိုက်ညီမှု (သို့) prefix အရှည်ဆုံးက "*" ကို အနိုင်ယူသည်)၊ ထို့နောက် ထိုအုပ်စုအတွင်း၌သာ path pattern အရှည်ဆုံး ကိုက်ညီသော Allow (သို့) Disallow စည်းမျဉ်းကို အသုံးချသည်၊ တူညီပါက Allow က အနိုင်ရသည်။ ဤကိရိယာသည် ထို algorithm အတိအကျကို run ပါသည် — ပထမဆုံး တွေ့သော Disallow ကိုသာ ရှာခြင်း မဟုတ်ပါ။
စည်းမျဉ်းအတွင်းရှိ "*" သည် စာလုံးအစဉ် မည်သည့်အရာနှင့်မဆို ကိုက်ညီပြီး၊ နောက်ဆုံးရှိ "$" က path ၏ အဆုံးတွင် စည်းမျဉ်းကို ချိတ်ဆက်ပေးသည်။ Disallow: /*.pdf$ သည် /file.pdf ကို ပိတ်ဆို့သော်လည်း /file.pdf?ref=1 ကို မပိတ်ပါ — PDF များ မထင်မှတ်ဘဲ crawl ဖြစ်နေရသည့် အကြောင်းရင်း တစ်ခု ဖြစ်သည်။
အလွတ် "Disallow:" ကြောင်းသည် ကန့်သတ်ချက် လုံးဝမရှိခြင်းကို ဆိုလိုပြီး မည်သည့်အရာကိုမျှ မပိတ်ဆို့ပါ။ crawler တစ်ခုသည် တိကျသော အုပ်စု (ဥပမာ "Googlebot") နှင့် ကိုက်ညီသည့်အခါ ထို crawler အတွက် "User-agent: *" အောက်ရှိ စည်းမျဉ်းများကို လုံးဝ လျစ်လျူရှုပါသည်၊ နှစ်ခုစလုံးကို ပေါင်းစပ်လေ့မရှိပါ။
ဤကိရိယာက ထောက်ပြသော ပုံမှန်အမှားများ – staging site မှ ကျန်ရစ်ခဲ့သော Disallow: / (အားလုံးကို ပိတ်ဆို့), User-agent ကြောင်းမတိုင်မီ ထားသော စည်းမျဉ်းများ (တိတ်တဆိတ် လျစ်လျူရှုခံရ), Crawl-delay (Google နှင့် Bing က လျစ်လျူရှု), absolute မဟုတ်သော Sitemap URL များ။