クロールポリシー
ペレログはミュージアムの公式サイトを巡回して、開館時間や入館料などの情報を集めています。その巡回のしかたと、止めかたをご案内します。
このページについて
ペレログは、日本のミュージアム(博物館・美術館・科学館・動物園・水族館・植物園)の情報をまとめて紹介しています。掲載にあたっては各館の公式サイトを自動で巡回し、公開されている情報を収集しています。このページは、その巡回を行うプログラム(クローラー)についての説明です。
施設のWebサイトを管理されている方が、ペレログのクローラーによるアクセスを確認された場合、また巡回を制限・停止したい場合は、以下をご覧ください。
クローラーの識別
ペレログのクローラーは、次のUser-Agentを送信します。アクセスログでの識別にお使いください。
PerelogCrawler/0.1 (+https://perelog.com/crawler)巡回を制限・停止する
サイトのrobots.txtに次のように記述してください。ペレログのクローラーは巡回のたびにrobots.txtを取得し、記述に従います。User-Agent名はPerelogCrawlerだけで指定でき、バージョン番号や括弧内のURLは書く必要がありません。
User-agent: PerelogCrawler
Disallow: /User-agent: PerelogCrawler
Disallow: /calendar/
Disallow: /searchUser-agent: PerelogCrawler
Crawl-delay: 10robots.txtでの指定はすべての一般的なクローラーに影響します。ペレログのクローラーだけに指定したい場合は、上記のとおりPerelogCrawlerのグループに記述してください。robots.txtを変更できない場合や、記述しても改善しない場合は、下記のお問い合わせ先までご連絡ください。
巡回のしかた
サイトへの負荷を抑えるため、次のとおり動作します。いずれもプログラムの設定として組み込んでいるものです。
| User-Agent | PerelogCrawler/0.1 (+https://perelog.com/crawler) |
|---|---|
| robots.txt | 巡回前に取得し、記述に従います。取得を許可されていないページからは情報を抽出しません。 |
| Crawl-delay | robots.txtでの指定に従います。ただし間隔を「長くする方向」にのみ反映します。既定より短い値が指定されていても、既定より速くアクセスすることはありません。 |
| アクセス間隔 | 同一ホストへのアクセスは1〜2秒の間隔をあけます。この間隔が1秒を下回る設定はできないようにしています。 |
| 同時接続数 | 1ホストあたり最大2接続です。複数の施設が同一ホスト上にある場合(自治体サイト等)は、そのホストへのアクセスを直列化し1接続とします。 |
| 1施設あたりのページ数 | 1回の巡回で最大12ページです。Crawl-delayが長く指定されているホストでは、間隔を縮めるのではなく取得するページ数のほうを削ります。 |
| 巡回の頻度 | 初回の巡回のあとは月次で、更新されている箇所のみを取得します。 |
| エラー時の挙動 | HTTP 429・503 を受け取った場合は、アクセス間隔を段階的に延ばします。なお Retry-After ヘッダの値は参照していません。 |
取得する情報と使いみち
| 取得する情報 | 開館時間・休館日・入館料・アクセス・所在地・展示や催しの案内といった、来館の判断に必要な事実情報です。 |
|---|---|
| 取得しない情報 | 施設紹介文などの記述をそのまま保存する仕組みを持っていません。データの形式そのものに自由記述の項目がないため、本文を転載することはありません。 |
| 画像 | 画像ファイルは取得せず、URLと出典のみを記録します。画像そのものの掲載は、施設の方に許諾をいただいてから行います。 |
| 利用目的 | ペレログ(perelog.com)に掲載する施設情報の作成にのみ利用します。汎用の生成AIの学習用データとして提供・販売することはありません。 |
| 出典の保持 | 掲載している値には、その根拠となったページのURLを保持しています。掲載内容の出どころをお問い合わせいただければ回答できます。 |
お問い合わせ
巡回によるサーバー負荷についてのご相談、巡回の停止のご依頼、掲載内容の訂正・削除のご依頼は、お問い合わせフォームよりご連絡ください。掲載内容の訂正・削除については、対象の施設名と該当箇所をお知らせいただけますと確認がスムーズです。
なお、施設情報の掲載そのものについてのご相談・ご要望は施設の方へもあわせてご覧ください。
For non-Japanese site operators
Perelog operates a crawler that collects opening hours, admission fees and access information from the official websites of museums in Japan. It obeys robots.txt, keeps a 1–2 second interval per host, opens at most 2 connections per host, and fetches at most 12 pages per museum per visit.
| User-Agent | PerelogCrawler/0.1 (+https://perelog.com/crawler) |
|---|---|
| robots.txt | Use the token PerelogCrawler in a User-agent: group. Disallow and Crawl-delay are both honoured. |
| Contact | https://perelog.com/support |