Сжатие размера скачанного сайта

12
A
На сайте с 21.04.2009
Offline
59
#11
azsx, вопрос - есть ли ссылки в этих конкретных PDF-ах.

опа на... огромное спасибо, действительно, многие документы ссылок не имеют. Это поможет тама один алгоритм оптимизировать, еще раз пасибо.

Как вы будете анализировать ссылки если удалите все теги кроме тегов оформления?

противоречия нет. По моему алгоритму ссылки изначально скидываются в отдельную таблицу, в которой и хранятся. Хранить их в "текстовом составляющем страницы" я позволить не могу, из-за экономии ресурсов (место у меня много, проц слабый).

Если у вас винда включите сжатие каталога сайта, немного поможет.

у меня дебиан с mysql. 1. Я бы хотел решение которое будет переносимым, а не привязанным к конкретному по на сервере; 2. у меня проблема - место много, проц слабый. Любое сжатие потребует ресурсов процессора, я его не имею.

зы

Мне кажется, для качественного анализа исследуемые страницы должны сохраниться в реальном виде. Потому что если тупо повыкидывать то, что кажется неважным, можно в итоге получить неверные результаты.

Допустим я удалил тег <u> - решив, что учитывать его глупо... Впоследствии я пойму, что учитывать этот тег надо! Вы правы - это будет косяк, я над этим подумаю. Возможно и правильнее так: ваще убирать все теги с документа (оставляя только текст) и сохранять этот текст в отдельную таблицу. Сами же страницы с исходным кодом скидывать куда нибудь в архив, так как я пока никакой речи об анализе семантики хтмл кода не веду, с проблемами бы справится...

однако Вы бы видели хтмл код некоторых страниц. Там в два раза минимум сокращается объем.

12

Авторизуйтесь или зарегистрируйтесь, чтобы оставить комментарий