Бот FotoRevizor — для вебмастеров
Фоторевизор

Для вебмастеров

Бот FotoRevizorBot

Если вы нашли эту страницу по ссылке из журнала запросов — по вашему сайту ходил сканер сервиса «Фоторевизор». Ниже — что он делает, как его опознать и как управлять его доступом.

Кто мы и зачем ходим по сайту

«Фоторевизор» проверяет изображения на сайте: ищет картинки, на которые у владельца может не быть прав, и помогает заменить их. Бот обходит страницы, чтобы собрать список изображений.

Проверку запускает пользователь сервиса. Подтверждения владения сайтом мы не запрашиваем: запуская проверку с главной страницы, пользователь подтверждает, что вправе проверять сайт или действует по поручению владельца. Кроме того, мы сами проверяем сайты, чтобы показать их владельцам найденные на них изображения.

Что именно читаем

  • HTML-страницы сайта и подключённые к ним CSS-файлы (в них бывают фоновые картинки);
  • изображения со страниц — сначала заголовки и начало файла, чтобы узнать размер, для части — файл целиком;
  • robots.txt, карту сайта (sitemap.xml и её варианты), у WordPress — /wp-sitemap.xml, публичный список записей /wp-json/wp/v2/posts и ленту /feed/;
  • файлы *.fotorevizor-passport.json рядом с картинками — так сервис узнаёт, что замена уже установлена. На сайтах, где замен не было, такие запросы получают 404, и это нормально.

Бот только читает: запросы GET и HEAD, без форм, входа в аккаунты и отправки данных. Замену изображений устанавливает не он, а владелец сайта — через доступ по FTP, который даёт сервису сам.

Как опознать

Строка User-Agent целиком:

Mozilla/5.0 (compatible; FotoRevizorBot/1.0; +https://fotorevizor.ru/bot)

Некоторые запросы несут в конце строки пометку назначения (например, preview), но начало строки у всех одинаковое. Заголовок Accept при обходе страниц: text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8.

Запросы сейчас идут с адреса 185.185.142.204. Адрес может смениться, поэтому надёжнее опознавать бота по подстроке FotoRevizor в User-Agent.

Частота запросов

  • во время обхода — страницы по одной, с паузой 0,5 с между ними. Вместе с каждой страницей без паузы запрашиваются подключённые к ней CSS-файлы, а на сайтах на Tilda — ещё и оригиналы уменьшенных копий изображений этой страницы, не больше 30 запросов одновременно;
  • после обхода, один раз за проверку, — изображения: короткие запросы (заголовки и начало файла) волнами до 30 одновременно, без пауз, пока не будут проверены все найденные;
  • дальше, при разборе найденного, часть изображений скачивается целиком — тоже не больше 30 одновременно;
  • ожидание ответа на один запрос — до 10 с;
  • обычная проверка — до 500 страниц;
  • если сайт с первых страниц отвечает отказом (403, 429 или не принимает соединение) и ни одна страница не открылась, бот останавливается после 10 отказов подряд.

Как нас пустить, если сайт закрыт защитой от ботов

Если на сайте стоит защита от ботов (в панели хостинга, у CDN или в отдельном сервисе защиты), а владелец хочет проверить сайт, добавьте в её настройках правило, пропускающее запросы, у которых User-Agent содержит FotoRevizor. Если защита умеет пропускать только по адресу — добавьте адрес выше, но помните, что он может смениться.

Как нас запретить через robots.txt

Общие правила для всех ботов (User-agent: *) мы не применяем: их пишут для поисковиков, а наша проверка запускается ради конкретного сайта. Если наш бот вам не нужен — закройте его по имени FotoRevizorBot, мы это выполним. Правила действуют на все запросы бота к вашему домену — страницы, карту сайта, CSS-файлы и изображения — и перечитываются в начале каждой проверки. Сам robots.txt бот читает всегда.

Запретить весь сайт:

User-agent: FotoRevizorBot
Disallow: /

Запретить раздел, оставив в нём открытую часть (Allow тоже учитывается):

User-agent: FotoRevizorBot
Disallow: /private/
Allow: /private/press/

Если robots.txt недоступен или не читается, бот считает, что правил для него нет.

Связаться с нами

Если бот мешает работе сайта или есть вопросы — напишите или позвоните нам: контакты внизу этой страницы. Укажите адрес сайта и, если есть, время запросов из журнала.