Mister_Black

Рейтинг
188
Регистрация
24.02.2009
Получилось его заблокировать через nginx, добавил строку valid_referers и ответ 403 для не валидных, запросы правда так и идут от него, но ответ для плохого сайта теперь 403
location / {
                location ~ [^/]\.ph(p\d*|tml)$ {
                        try_files /does_not_exists @fallback;
                        limit_req zone=lreqz2 burst=10 nodelay;
                }
                location ~* ^.+\.(jpg|jpeg|gif|png|svg|js|css|mp3|ogg|mpe?g|avi|zip|gz|bz2?|rar|swf|ico)$ {
                        expires 30d;
                        valid_referers none blocked server_names ~(mydomain|yandex|google|yahoo|bing|facebook|subscribe|feedburner|mail|rambler|nigma|ask|qip);
             if ($invalid_referer) {return 403;}
                        try_files $uri $uri/ @fallback;
                }
                location / {
                        try_files /does_not_exists @fallback;
                        limit_req zone=lreqz2 burst=10 nodelay;
                }
                location ~* ^.+\.(jpg|jpeg|gif|png|svg|js|css|mp3|ogg|mpe?g|avi|zip|gz|bz2?|rar|swf|ico)$ {
                        expires 30d;
                        try_files $uri $uri/ @fallback;
                }
        }

webinfo #:

Да, там скрипт, который сразу же открывает другие сайты. Запросы к вашим ресурсам, скорее всего, формируются искусственно - чтобы привлечь внимание.

Да запросов очень много, сейчас лог скачал отсортировал по имени того домена, получилось 139243 запроса только за сегодня
NoMoreContent #:

Во-первых, есть смысл заглянуть на тот bad(.)site

badd.mom там какой то множественный редирект стоит на разные порно сайты, бонга, лайвжасмин и т.д, так что будьте осторожны)

webinfo #:

Скорее всего, до апача запрос не доходит. Если статика отдаётся через nginx, то и запрет надо писать в конфиге  nginx.

Да nginx стоит фронтендом

Не обрабатываются файлы с названиями только цифрами, типа 1.xml, 2.xml, 10.xml и тд, хотя в спецификации это нигде не указано, а например если назвать map1.xml или part1.xml, sitemap1.xml так обрабатывается.
Я сначала создал папку sitemap, чтобы не захламлять большим количеством файлов корневую директорию, а в неё добавлял уже файлы с названиями 1.xml-62.xml ни один из них не обрабатывался, кстати даже bing на такие файлы ругался, мол ошибка и всё тут.

Обманул систему, так как sitemap.xml уже был добавлен и обработан гуглом, я просто добавил в него список карт, сделав его индексным, таким образом гугл его принял, а с названиями sitemapindex, sitemap-index, sitemap_index, indexsitemap и т.д, ни в какую не хотел принимать ))
Сделал индексный файл sitemapindex.xml, Гугл его не принимает "Не удалось обработать файл Sitemap", добавил даже charset=utf8 в заголовок ответа, не помогло, видел что проблема массовая, кому то помогает смена имени файлов сайтмап, кто то делает в txt формате.
sitemap.xml.gz обновляется.
sitemap.xml НЕ обновляется!
Да похоже максимум гугл может обработать 2000 ссылок в сайтмапе, сейчас ради интереса сделал на 3000, обработать не может, хотя тот же Bing спокойно кушает мапы, по 45000 ссылок, в общем какие то непонятки с гуглом, похоже сильно сократили мощности для обработки sitemap, буду думать как сделать такой большой индекс, придётся разбивать максимум по 2000 ссылок в одном файле.
Всего: 728