SEO 工具 · 不對外抓取

robots.txt 產生器與測試工具

產生 robots.txt 規則,並以最長匹配規則測試特定網址是否被允許。

輸入

結果

User-agent: *
Disallow: /admin
Disallow: /private
Allow: /admin/public

Sitemap: https://example.com/sitemap.xml

測試路徑

允許檢索生效規則: Allow: /admin/public

使用說明

以群組方式設定 User-agent、Disallow 與 Allow 規則,並加入 sitemap 位置,就會產生標準的 robots.txt。同一頁還能直接測試:填入路徑與爬蟲名稱,工具會告訴你允許或封鎖,以及是哪一條規則生效。判定採 Google 與 Bing 的**最長匹配**規則——比對到的路徑最長的那條勝出,長度相同時 Allow 勝過 Disallow——這與「由上而下第一條匹配」的直覺不同,也是最常誤判的地方。

操作步驟

  1. 設定 User-agent 群組與 Disallow、Allow 路徑。
  2. 加入 sitemap 網址。
  3. 在測試區填入路徑,確認實際判定與生效規則。

限制與說明

採用 Google 與 Bing 的最長匹配規則;robots.txt 只影響檢索,不保證不被索引。

隱私

貼上的 HTML、網址與文章只在這個瀏覽器內分析,不會上傳、不會保存,也不會寫進網址或紀錄。

常見問題

Disallow 可以讓頁面不出現在搜尋結果嗎?
不行。robots.txt 阻止的是「檢索」,不是「索引」。被 Disallow 的網址若有外部連結指向它,仍可能以只有網址、沒有描述的形式出現在搜尋結果。要確實不被索引,必須讓爬蟲能讀到頁面並在頁面上放 `noindex`——這代表該頁不能同時被 Disallow。
為什麼是最長匹配而不是第一條匹配?
Google 與 Bing 的實作是比對所有規則後取路徑最長(最具體)的那條,長度相同時 Allow 優先。所以 `Disallow: /admin` 搭配 `Allow: /admin/public` 時,`/admin/public/x` 是被允許的,即使 Disallow 寫在前面。這個工具的測試區就是照這個規則判定。