Для вебмастеров
Бот FotoRevizorBot
Если вы нашли эту страницу по ссылке из журнала запросов — по вашему сайту ходил сканер сервиса «Фоторевизор». Ниже — что он делает, как его опознать и как управлять его доступом.
Кто мы и зачем ходим по сайту
«Фоторевизор» проверяет изображения на сайте: ищет картинки, на которые у владельца может не быть прав, и помогает заменить их. Бот обходит страницы, чтобы собрать список изображений.
Проверку запускает пользователь сервиса. Подтверждения владения сайтом мы не запрашиваем: запуская проверку с главной страницы, пользователь подтверждает, что вправе проверять сайт или действует по поручению владельца. Кроме того, мы сами проверяем сайты, чтобы показать их владельцам найденные на них изображения.
Что именно читаем
- HTML-страницы сайта и подключённые к ним CSS-файлы (в них бывают фоновые картинки);
- изображения со страниц — сначала заголовки и начало файла, чтобы узнать размер, для части — файл целиком;
robots.txt, карту сайта (sitemap.xmlи её варианты), у WordPress —/wp-sitemap.xml, публичный список записей/wp-json/wp/v2/postsи ленту/feed/;- файлы
*.fotorevizor-passport.jsonрядом с картинками — так сервис узнаёт, что замена уже установлена. На сайтах, где замен не было, такие запросы получают 404, и это нормально.
Бот только читает: запросы GET и HEAD, без форм, входа в
аккаунты и отправки данных. Замену изображений
устанавливает не он, а владелец сайта — через доступ по FTP, который даёт сервису сам.
Как опознать
Строка User-Agent целиком:
Mozilla/5.0 (compatible; FotoRevizorBot/1.0; +https://fotorevizor.ru/bot)
Некоторые запросы несут в конце строки пометку назначения (например, preview),
но начало строки у всех одинаковое. Заголовок Accept при обходе страниц:
text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8.
Запросы сейчас идут с адреса 185.185.142.204. Адрес может смениться,
поэтому надёжнее опознавать бота по подстроке FotoRevizor в User-Agent.
Частота запросов
- во время обхода — страницы по одной, с паузой 0,5 с между ними. Вместе с каждой страницей без паузы запрашиваются подключённые к ней CSS-файлы, а на сайтах на Tilda — ещё и оригиналы уменьшенных копий изображений этой страницы, не больше 30 запросов одновременно;
- после обхода, один раз за проверку, — изображения: короткие запросы (заголовки и начало файла) волнами до 30 одновременно, без пауз, пока не будут проверены все найденные;
- дальше, при разборе найденного, часть изображений скачивается целиком — тоже не больше 30 одновременно;
- ожидание ответа на один запрос — до 10 с;
- обычная проверка — до 500 страниц;
- если сайт с первых страниц отвечает отказом (403, 429 или не принимает соединение) и ни одна страница не открылась, бот останавливается после 10 отказов подряд.
Как нас пустить, если сайт закрыт защитой от ботов
Если на сайте стоит защита от ботов (в панели хостинга, у CDN или в отдельном
сервисе защиты), а владелец хочет проверить сайт, добавьте в её настройках правило,
пропускающее запросы, у которых User-Agent содержит FotoRevizor.
Если защита умеет пропускать только по адресу — добавьте адрес выше, но помните,
что он может смениться.
Как нас запретить через robots.txt
Общие правила для всех ботов (User-agent: *) мы не применяем: их пишут
для поисковиков, а наша проверка запускается ради конкретного сайта. Если
наш бот вам не нужен — закройте его по имени FotoRevizorBot, мы это
выполним. Правила действуют на все запросы бота к вашему домену — страницы, карту
сайта, CSS-файлы и изображения — и перечитываются в начале каждой проверки. Сам
robots.txt бот читает всегда.
Запретить весь сайт:
User-agent: FotoRevizorBot
Disallow: /
Запретить раздел, оставив в нём открытую часть (Allow тоже учитывается):
User-agent: FotoRevizorBot
Disallow: /private/
Allow: /private/press/
Если robots.txt недоступен или не читается, бот считает, что правил для
него нет.
Связаться с нами
Если бот мешает работе сайта или есть вопросы — напишите или позвоните нам: контакты внизу этой страницы. Укажите адрес сайта и, если есть, время запросов из журнала.