crawler_version | クローラバージョン | クロール処理に使用したクローラのバージョン | 調査時の参考用 |
crawl_url | クロールURL | クローラの処理対象URL | |
last_url | 最終URL | リダイレクトやcanonicalを考慮した最終的な到達URL | |
is_crawl_ok | クロール成否 | 当該ページのクロール処理の成否。失敗:false 成功:true | 文字列形式のブール値 |
crawl_skip_reason | クロールスキップ理由 | クロール処理が失敗またはスキップされた理由。成功時は空 | 1.5 クロール失敗理由一覧を参照 |
response_headers | レスポンスヘッダ | クロール時のHTTPレスポンスヘッダ。Python辞書形式で格納(シングルクォート使用) | |
http_status_code | HTTPステータスコード | クロール時のHTTPステータスコード | |
content_type | コンテンツ種別 | 当該ページのContent-Type | |
last_modified | last_modified | クロール時HTTP responseで返されるlast-modified。RFC 2822形式。取得できない場合は空 | |
title | タイトル | HTMLページの場合、<title>タグの内容を出力します。PDFやOffice文書等、HTML以外のコンテンツの場合は空欄。 |
crawler_batch_00101: Failed to fetch page during crawling. | クロール中にページの取得に失敗しました。 | ネットワークエラーやタイムアウト等により、ページの取得に失敗しました。 |
crawler_batch_00201: Last URL is not a target for crawling. | 最終URLがクロール対象外です。 | リダイレクト先のURLがクロール対象外の範囲でした。 |
crawler_batch_00202: Content class is not a target for crawling. content class: {content_class} | コンテンツクラスがクロール対象外です。コンテンツクラス: {content_class} | クローラがHEADアクセス時Content-Type:HTMLであり、GETアクセス時Content-Type:HTML以外の場合に表示されます。 |
crawler_batch_00203: HTTP status code error. Status code: {status} | HTTPステータスコードエラーです。ステータスコード: {status} | クロール時に4xx、5xxなどのエラーステータスコードが返されました。 |
crawler_batch_00204: Exception occurred during crawling process. | クロール処理中に例外が発生しました。 | クロール処理中に予期しないエラーが発生しました。 |
crawler_batch_00205: Exceeded the maximum number of redirects. | 規定回数以上リダイレクトが発生しました。 | リダイレクトの回数が上限を超えたため、クロールを中断しました。 |