Для получения словаря с привязкой к тематике: 1. Парсинг ЯК или какого-то другого качественного каталога, создание базы вида Слово - Сайт - Число - Яндекс

Алгоритм определения тематики сайтов (решение)

kotofeich · 2009-05-20T15:09:33.0000000Z

Привет всем. Наконец сегодня додумал до логического конца алгоритм определения тематики и начал реализацию. Алгоритм построен на теории нейронных сетей, и нужен мне в корыстных целях направленных на яндекс. Ценность алгоритма в том - что это будет первый алгоритм определения тематики сайта, который сможет реализовать почти любой программист. Надеюсь кому-нибудь пригодится. Этап 1: Определение ключевых слов сайта 1) Получаем страницу 2) Убираем теги, и все кроме букв и пробелов. Знаки препинания заменяем на пробелы. (Цифры удалить!!!) 3) Разбиваем весь текст на слова, то есть делаем одномерный массив слов. 4) удаляем слова меньшие 2 букв 4) Каждое слово прогоняем через стеммер. Я использую алгоритм Портера. Для тех кто не в курсе стеммер - это программа которая отбразывает от слова суффиксы и приставки, оставляя корень. Алгоритм Портера слаб, но пока сойдет. Как найду морфологический словарь - сменю на него. 5) При прогоне через стеммер создаем новый ассоциативный массив, где ключом будет само слово, а значением колличество повторений слова. Например (Yandex =>3, Тиц =>5) и т.д. 6) Упорядочиваем ассоциативный массив по убыванию колличества повторений. 7) Удаляем все слова повторяющиеся менее трех раз (колличество под вопросом). 8) В итоге мы получили ключевики сайта с их тошнотой. Обычно их на этом этапе 50-100 штук. 9) Проверяем каждый ключевик по базе общих слов не несущих тематику. Например слова: меня, когда, сколько и т.д. Я храню эти слова в отдельной таблице бд и написал отдельный скрипт, который позволяет их сформировать. Обойдя сотню сайтов мы набираем базу самых популярных не имеющих тематику слов. Этап 2: Создаем тематическую базу 1) Для начала в бд нужно создать три таблицы: слова, тематики и веса. Поля таблиц: Слова: word_id, word Тематики: theme_id, parent_id, theme Веса: word_id, theme_id, ves 2) Заполняем таблицу тематик. Я для этих целей пользуюсь базой Ашманова (где-то 5000 тематик). Не использую ЯК, потому что сайты в него заносятся вручную, то бишь робот тут не причем. В нашем случае необходимо знать тематику, которую видит робот на обычных сайтов. Я не говорю что тематика по Ашманову совпадет с тем что определил робот яндекса, но нам это и не нужно. Представьте что по Ашманову у нас вышло кпк для донора и акцептора, а по яндексу сотовые телефоны.Не все ли равно? 3) Самый трудный момент. Выбираем нужную тему, например интернет-ресуры. Из найденных в первом этапе ключевиков страницы выбираем относящиеся к этой теме, и проставляем им коэффициенты, насколько сильно они относятся к данной теме (балл от 0 до 1). Позже будем корректировать это значение, сейчас это не суть важно. Это значение и будет синаптической силой. В сумме они дадут активацию нейрона к данной тематике. В реальности это дает потрясающие возможности даже для многозначных слов. Например слово лук можно отнести и к кухне и к охоте. Это не повлияет на верность определения. Этот момент трудный, потому что придется обойти множество сайтов, чтобы собрать хотя бы по 10 слов для каждой тематики. На деле десяти слов вполне достаточно. Итого необходимо 50000 слов, чтобы определить тему сайта по Ашманову. Кто-то скажет это много, но в день при нормальной оболочке можно легко собрать тысячу слов. Итого 50 дней пассивного труда. 4) Мы создали семантическое ядро для каждой тематики, и указали с каким весом относится к каждой теме определенное слово. Этап 3: Узнаем тему неизвестных сайтов и корректируем результаты 1) Поскольку мы первоначально как-то обучили программу. Теперь покажу как ей пользоваться. Для неизвестного сайта выполняем этап 1 и узнаем ключевые слова с тошнотой. В результате полученные примерно 30 ключевиков проверяем по базе к каким темам они относятся и какие коэффициенты имеют. Примитивный пример: Текст Лук и стрелы это лук. Лук тошнота 2. Тема охота вес 0.7. Тема кухня вес 0.6. Стрелы тошнота 1. Тема охота вес 0.8. Находим активацию нейрона: К теме охота: 0.7*2+1*0.8=2.2 К теме кухня: 0.6*1=0.6 Поздравляю - тема текста определена. Здесь также можно определить в % насколько текст относится к другим темам. 2) Возможно в прошлом этапе неверно проставлены коэффициенты и их нужно корректировать. Для этого необходим отдельный интерфейс, где выбрав тематику видишь все ключевые слова по ней с их коэффициентами. Изменяя коэффициенты мы усиливаем значение того или иного слова в определенной теме. При анализе множества сайтов мы приходим к стабильному результату. Результат. Данный алгоритм не нуждается в обсуждении его необходимости. Это каждый решает сам для себя. Мне плевать с колокольни если он вам не нужен:) Для тех кто хоть что-то понял о том что я сказал - интересно услышать ваши мысли о его эффективности, и возможностях улучшения. P.S. Данный пост опубликовал у себя в блоге . Надеюсь тут никто не против ссылки, просто не хочу чтобы яндекс посчитал что на этом сайте находится основной текст, а у меня копия. P.P.S. для определения тематики сайта, а не отдельной страницы легко можно брать ключевики с n страниц

SJ

78

sokol_jack

21 мая 2009, 05:24

#31

kotofeich:
да, ознакомился недельку назад. Принял к сведению, но имхо там мысли от людей далеких от программирования. Они выдвигали теории, которые слабы в реализации.

Точно-точно. :D

Там пару человек которые "не очень далеки от программирования" (причем не только написания на коленке пхп-скриптиков простых) писали о уже готовых системах. 🍻

Любимый хостинг (http://beget.ru?id=2902) How can we grow old when the soundtrack of our lives is rock-n-roll?

A

87

alexalinks

21 мая 2009, 06:51

#32

Бурундук не зря писал, что сортировать надо не по TF, а хотя бы по TF*IDF для отбрасывания лишних слов :)

Б

200

Беобахтер

21 мая 2009, 08:02

#33

alexalinks, а что берём в качестве коллекции при расчёте IDF? Яндекс-то текстовым корпусом пока не поделился. :)

Будь мудрее. Выгляди глупее.

28

kotofeich

21 мая 2009, 09:41

#34

alexalinks:
Бурундук не зря писал, что сортировать надо не по TF, а хотя бы по TF*IDF для отбрасывания лишних слов :)

для TF*IDF нужно большуую базу иметь, чего к сожалнию не имею.

Expert Theme (http://extheme.ru) - определение тематики любых сайтов, текстов и страниц

[Удален]

21 мая 2009, 11:18

#35

Беобахтер:
Яндекс-то текстовым корпусом пока не поделился

есть готовый ресурс :)

удалил по многочисленным просьбам :)

Б

200

Беобахтер

21 мая 2009, 11:24

#36

burunduk, сотри уж. Кому надо - те знают. ;)

Я что-то не видел, кстати, чтобы этот корпус можно было скачать. :) Для оффлайн, так сказать, анализа.

[Удален]

21 мая 2009, 11:27

#37

Беобахтер, ну можно же просто изнасиловать роботами в извращенной форме :)

Б

200

Беобахтер

21 мая 2009, 11:33

#38

burunduk, в промышленных масштабах - гиблое дело. Хилую тему ограбить - куда ни шло. Проще с серпа спарсить.

P.S. оперативно сработал. ;)

108

sun99

21 мая 2009, 12:03

#39

kotofeich:

4) Каждое слово прогоняем через стеммер. Я использую алгоритм Портера. Для тех кто не в курсе стеммер - это программа которая отбразывает от слова суффиксы и приставки, оставляя корень. Алгоритм Портера слаб, но пока сойдет. Как найду морфологический словарь - сменю на него.

Возможно Вам стоит использовать то, чем пользуются (пользовались) в Яндексе.

mystem

космополитизм каждой голове

Z1

164

zweroboy1

21 мая 2009, 12:12

#40

Как вариант более-менее быстрого получения словаря с привязкой к тематике -

1. Парсинг ЯК (либо какого-то другого качественного каталога), создание базы вида УРЛ - тематика.

2. Заход робота на морду каждого из этих сайтов. Парсинг. В базу сохраняем все слова, кроме анкоров внешних ссылок. Словам из титлов, стронгов, мета-дескрипшнов придаём несколько больший вес. После прохождения этого шага имеем базу вида: Слово - Сайт - Число вхождений (Вес) - Тематика.

3. Анализ полученной базы. Делим все слова из базы на три категории:

3.1. Стоп-слова - они часто появляются во всех без исключения тематиках.

3.2. Средние слова - они часто встречаются в одной категории, но иногда попадаются и в других.

3.3. Хорошие слова - часто встречаются в какой-то конкретной рубрике, и практически не встречаются - в других.

4. Заходим на неизвестную страницу, опять же парсим её, анализируем найденные слова. В первую очередь обращаем внимание на хорошие слова из пункта 3.3. Думаю, этого будет достаточно в подавляющем большинстве случаев для правильного определения тематики.

В общем-то, реализуется такое за недельку без особого напряга одним челом.

Плюсы - не надо заморачиваться с морфологией и составлением базы вручную.

Алгоритм ТС будет скорей всего точнее этого, но он имеет большие шансы загнуться на стадии составления словаря с весами :)

Проект «Страна» Лидирующая биржа статей Рунета! Задолбали темы про неэффективные

Что делать, чтобы попасть в ответы Google Bard

Яндекс Вебмастер вынес товарные фиды в отдельный раздел

Алгоритм определения тематики сайтов (решение)