robots.txtチェッカー

robots.txtを取得して構文を解析し、特定のパスをGooglebot・Bingbotがクロールできるかを判定します。

✨ できること

  • URLを入れるだけで robots.txt を取得し、User-agentグループごとにAllow・Disallowを表で整理
  • 任意のパスについて Googlebot・Bingbot・その他(*) がクロールできるかを判定
  • 最長一致・ワイルドカード(*)・行末一致($)に対応した、実際のクローラーと同じ判定ロジック
  • Sitemap宣言・Crawl-delayの抽出と、404・空ファイル・文法エラー行の指摘

🪄 こんなときに

インデックスされない原因を探す

そのページのパスが robots.txt でブロックされていないかを確かめる。

robots.txt を書き換える前に検証する

新しいDisallowが意図しないページまで巻き込んでいないか確認する。

他サイトの設定を参考にする

公開されている robots.txt を読み、どこを閉じているかを見る。

Sitemapの宣言を確認する

サイトマップのURLが robots.txt から正しく参照されているかを見る。

🔒 プライバシー

入力したURLは、そのサイトの robots.txt を1回だけ取得するためにサーバーへPOSTで送られます。取得した本文の解析はすべてブラウザ内で行い、URLも本文も保存しません。診断対象がURLのクエリに載らないため、このページのリンクを共有しても調べた相手先は伝わりません(共有できるのはツール自体のURLだけです)。取得はhttp/httpsのみ、5秒・64KB・リダイレクト3回までに制限し、localhostやプライベートIPアドレスへは接続しません。

❓ よくある質問

robots.txt でブロックすればページは検索結果から消えますか?

消えるとは限りません。robots.txt はクロール(取得)を止めるだけで、インデックス登録を止めるものではありません。他のサイトからリンクされていると、内容を読まないまま URL だけが検索結果に載ることがあります。検索結果から確実に外したい場合は、robots.txt でブロックせずにクロールを許可したうえで、そのページに noindex(metaタグ または X-Robots-Tag ヘッダ)を置きます。ブロックしているとクローラーが noindex を読めないため、かえって残り続けます。

Allow と Disallow が両方一致したらどちらが勝ちますか?

GoogleやBingが従うRFC 9309では、パスの一致が最も長いルールが勝ちます。例えば Disallow: /private/ と Allow: /private/ok があるとき、/private/ok は Allow(10文字)のほうが長く一致するので許可、/private/x は Disallow(9文字)だけが一致するのでブロックです。長さが完全に同じで衝突した場合は、より許可的な Allow が勝ちます。この順序はファイル内の行の並び順とは関係ありません。

* と $ はどう使いますか?

* は任意の長さの文字列に一致します。Disallow: /*? は「?を含むすべてのURL」、Disallow: /*.pdf は「.pdfを含むURL」を指します。$ は行末に置いたときだけ特別な意味を持ち、URLの終わりに一致します。Disallow: /*.pdf$ なら .pdf で終わるURLだけがブロックされ、/a.pdf?x=1 は対象外です。この2つはオリジナルの仕様には無い拡張ですが、主要な検索エンジンはすべて対応しています。

robots.txt が404のときはどうなりますか?

404(存在しない)が返る場合、クローラーは「制限なし」とみなしてサイト全体をクロールします。robots.txt が無いこと自体は問題ではありません。一方、5xx(サーバーエラー)が続く場合、Googleは安全側に倒して一時的にサイト全体をクロールしない扱いにすることがあります。robots.txt を置かないなら404を返すのが正しく、サーバーエラーやリダイレクトループにならないようにしてください。

🔗 関連ツール

robots.txt を取得する

ページのURLを貼り付けてもかまいません。そのサイトのトップにある /robots.txt を1回だけ取得します。

このパスはクロールできる?

サイト内のパス(/ から始まる部分)を入れると、主要なクローラーごとに判定します。

Googlebot
-
Bingbot
-
* (その他のクローラー)
-

判定は「最長一致のルールが勝ち、同じ長さならAllowが勝つ」というGoogle・Bingの実装(RFC 9309)に合わせています。* は任意の文字列、行末の $ はURLの終わりに一致します。

User-agent グループ

User-agent グループがありません

Sitemap

Sitemap の宣言がありません

気になる行

文法上の問題は見つかりませんでした

robots.txt の中身