ТЗ по ТОП-20 Яндекса с кластеризацией выдачи по типу страниц: подтемы "есть у вас / добавить", частоты в ‰ вместо вхождений, интент - Словоправ

kotophalk
На сайте с 20.10.2007
Offline
59
165
Два момента, из-за которых я перестал пользоваться анализаторами текста "по топу" и написал свой.

Первый - медиана по всей выдаче. По запросу "фискальный регистратор" в топ-20 шесть каталогов, четыре карточки товара, пара статей и агрегаторы. Средний объём "по топу" не соответствует ни одной странице из этого топа: каталогу он велит резать, статье - дописывать, и оба совета мимо.

Второй - сырые вхождения. Страница на 960 слов, термин встречается 19 раз; у топа со средними 456 словами - девять. Анализатор пишет "перебор, сократить". Делим на объём: 19,8 ‰ против 19,7 ‰ - одно и то же число. Клиенту велели резать текст пополам за то, что его страница длиннее.

Словоправ делает эти две вещи иначе, и дальше - что он показывает на том самом запросе.

Что получается на выходе

Выдача сначала кластеризуется по типу страниц (каталог / карточка / статья / сервис), агрегаторы и маркетплейсы отфильтровываются, и ваша страница сравнивается только со своим кластером. Для "фискального регистратора" это 9 страниц: пять каталогов и четыре карточки. Страница-пример - каталог клиента (с его согласия) на 938 слов при медиане кластера 499, и вердикт по объёму не "сократить вдвое", а "это каталог, объём набирается листингом, проверять разделы".

шапка отчёта - запрос, регион, интент, распределение типов страниц в выдаче, шесть оценок

Подтемы - это разделы, которые есть у большинства страниц кластера. Каждая сверяется с реальными H2/H3 вашей страницы, и у каждой пометка: есть у вас (с указанием, какой именно заголовок), похоже - проверьте, или добавить - и после какого заголовка. На примере: печать и чековая лента, интерфейсы и фискальный накопитель есть; подбор под масштаб бизнеса, автономная работа и готовые решения - нет.

ТЗ - подтемы с пометками ✅ / 🟡 / ➕ и "добавить после…"

Термины - таблицей "нужно / сейчас / у топа в ‰ / употребляют N из M". "Нужно" считается как частота кластера, умноженная на ваш целевой объём, статус ("нет в тексте / меньше / как у топа / больше") - только по ‰. "Больше, чем у топа" - не вердикт: переспам решается отдельно, по z-score на ‰ с защитой нишевых терминов (слово, которое есть у половины конкурентов, переспамом не считается) и с проверкой ИИ на естественность. На примере переспама не нашлось: два кандидата - "выездной" и "автономный" - оба признаны нормальным словарём ниши.

ТЗ - таблица "нужно / сейчас / у топа ‰"

Дальше в том же документе: чего не хватает против конкурентов по смыслу (сущности, а не слова), карта подинтентов ("этот материал / отдельная страница"), черновики Title/H1/Description с пометкой, какие слова в них взяты не со страницы, заголовки конкурентов как есть, E-E-A-T и коммерческие элементы (что есть у N из M конкурентов и чего нет у вас), мета, вхождения по зонам, картинки.

Оценок шесть и они нарочно не сводятся в один балл: покрытие семантики, тематический авторитет, BM25F-релевантность по зонам среди конкурентов, соответствие интенту, естественность, семантическая близость. У каждой - своя шкала и своя полоса "норма", потому что 70 по покрытию и 70 по интенту - разные вещи.

Тот же запрос в обычном анализаторе - для честности

Прогнал "фискальный регистратор" в одном из популярных анализаторов текста по топу (без имени - спор о брендах не нужен, выгрузку в xlsx могу показать). Что он делает хорошо: считает всю страницу с разбивкой "текст / ссылки", даёт плотности, Ципфа, мета-теги и структуру заголовков всех конкурентов. Что получилось по существу: в список "рекомендуется добавить" попали "персональные данные" ×5, "согласие на обработку" ×3, "корзина" ×4 и "купить в 1 клик" ×26 - это формы согласия и кнопки магазинов, которые он принял за словарь ниши; ещё - "атол" ×14 (бренд конкурента) и "этикетка", "сканер" - соседние категории из меню. Один из десяти "конкурентов" ответил 403 и вошёл в средние с 38 словами. Страница клиента у него - 2 181 слово, у нас - 938: разница в том, что мы считаем основной текст без навигации, а он - всю страницу с меню и футером. Это не "он плохой, а мы хорошие" - это две разные единицы измерения, и ТЗ на "добавить „персональные данные“ пять раз" копирайтеру отдавать нельзя.

Как считается, если коротко

Лемматизация pymorphy3 + slovnet с контекстом (омонимы типа "стекла/стекло" решаются по документу), n-граммы только внутри предложений и блоков, TF-IDF с внешним языковым индексом, зональный BM25F (Title, H1, заголовки, первый абзац, тело), медианы с межквартильным размахом вместо средних, эмбеддинги для кластеризации и для сверки подтем с заголовками. ИИ (Gemini) используется там, где считать нечем: интент, формулировки подтем, естественность, E-E-A-T, - и нигде в цифрах вхождений и объёмов.

Отдельно скажу то, что обычно не говорят: ИИ-слой нестабилен, и мы это измеряем, а не делаем вид. Интент берётся средним из пяти ответов (иначе гулял на ±9 баллов), семантическое ядро - из нескольких сэмплов со склейкой по понятиям, пометки подтем между перезапусками совпадают в 90 % случаев - всё это снято бутстрэпом на записанных выдачах, и если кому интересно, как именно, расскажу.

Чего нет и не будет

Позиций, ссылок, ПФ, Google. Это про текст страницы против текста конкурентов - и только. Если разрывы по тексту закрыты, а позиция стоит, Словоправ скажет честно, что дальше не его зона.

Цена

Три отчёта бесплатно после регистрации. Дальше 199 ₽ за отчёт поштучно или 118 ₽ в пакете, без подписки, кредиты не сгорают. Если отчёт упал или часть ИИ-секций не посчиталась - кредит возвращается автоматически. Регион выдачи любой.

Полный пример отчёта без регистрации - slovoprav.ru/se (это синтетический пример на запрос про зимнюю резину, собранный для показа структуры, а не снимок выдачи - говорю сразу, чтобы не было вопросов).
Пустой шаблон того же ТЗ в DOCX - slovoprav.ru/se/tz.
Регистрация - slovoprav.ru/se/app.

Просьба

Дайте запрос и URL страницы, по которым вы сами знаете правильный ответ, - прогоню и выложу сюда отчёт целиком, включая то, где он ошибётся. Мне это полезнее любых отзывов, а вам - честнее любых скриншотов.
Словоправ - ТЗ для копирайтера по реальному ТОП-20 Яндекса → https://slovoprav.ru
Сергей про е-ком
На сайте с 11.05.2008
Offline
390
#1
Откомментирую прозапас, чтобы в истории был. Скину позже.
Крутейшая тема и конструктор на WP - https://shop.greenshiftwp.com/?from=3338
Start Seo
На сайте с 23.07.2019
Offline
66
#2

👍Очень здорово, когда на вайбкодил супер полезную штуку, которой пользуешься сам и которая работает. Но ты это вайбкодил, разбирался, дополнял и в курсе о всех функциях и что  из отчета нужно применять в первую очередь.

На выходе получился большой объем информации со сложным ТЗ копирайтеру, без дополнения блоков и коммерции сайта.  Думаю, что можно внедрить автоматическую корректировку текстов тут, чтобы клиенту было понятно что и где заменить. А пока круто, но сложно, даже человеку сеошнику со стажем. Все понятно, но четкого краткого плана нет. Нужен анализ не только текстов, но и блоков сайта, с конкретными рекомендациями что и где поменять. Какой текст на какой.

Но даже после этого в массы запустить и объяснить будет сложно. Никто сейчас не хочет разбираться долго. Всем нужен готовый результат. Но ИИ уже творит супер вещи! 
SEO Продвижение Ваших сайтов в топ - внутренняя и внешняя оптимизация под ключ https://searchengines.guru/ru/forum/1042599
T
На сайте с 26.04.2018
Offline
114
#3
коммент чтобы не потерять тему. попробую позже как нибудь зарегистрироваться затестить. но тарифы дорогие какие то, 3 бесплатно, а 10 уже 1500 рублей. 
kotophalk
На сайте с 20.10.2007
Offline
59
#4

Тема была скрыта как рекламная - теперь оформлена как рекламный топик, отсюда пауза. За эти дни по мотивам комментариев:

Start Seo #:

👍Очень здорово, когда на вайбкодил супер полезную штуку, которой пользуешься сам и которая работает. Но ты это вайбкодил, разбирался, дополнял и в курсе о всех функциях и что  из отчета нужно применять в первую очередь.

На выходе получился большой объем информации со сложным ТЗ копирайтеру, без дополнения блоков и коммерции сайта.  Думаю, что можно внедрить автоматическую корректировку текстов тут, чтобы клиенту было понятно что и где заменить. А пока круто, но сложно, даже человеку сеошнику со стажем. Все понятно, но четкого краткого плана нет. Нужен анализ не только текстов, но и блоков сайта, с конкретными рекомендациями что и где поменять. Какой текст на какой.

Но даже после этого в массы запустить и объяснить будет сложно. Никто сейчас не хочет разбираться долго. Всем нужен готовый результат. Но ИИ уже творит супер вещи! 

Start Seo, обе ваши вещи доехали до отчёта:

  1. Краткий план - в шапке ТЗ теперь блок "⚡ Сделать в первую очередь": до трёх конкретных действий, собранных из самых сильных разрывов (формат → объём → термины → подтемы → переспам). Полное ТЗ никуда не делось, но ответ «с чего начать» теперь стоит первым.

  2. "Какие блоки менять" — появился раздел "Разделы, слабее всего связанные с темой": разделы вашей страницы, у которых связь с темой выдачи ниже 10-го перцентиля разделов конкурентов. Порог нарочно жёсткий: на сильной странице список пуст, а не высосан из пальца. Дословное «что на что менять» замеряли и не отгрузили: метрика «блок ничего не добавляет к топу» на живых страницах не отделяет воду от нормального текста, и показывать её было бы враньём.

Автоматическую правку текста не обещаю: наша часть - цифры и разрывы, генераторов текста и без нас хватает.

truebusiness #:
коммент чтобы не потерять тему. попробую позже как нибудь зарегистрироваться затестить. но тарифы дорогие какие то, 3 бесплатно, а 10 уже 1500 рублей. 

truebusiness - про "10 уже 1500": поштучно 199 ₽, пакет 10 — 1 490 ₽ (149 ₽/отчёт), пакет 50 — 5 900 ₽ (118 ₽/отчёт). Кредиты не сгорают, подписки нет. Дешевле не сделаю: за каждым отчётом - реальная выдача и ИИ-вызовы, которые стоят денег. Дойдёте до теста - киньте сюда запрос и URL, прогоню и выложу разбор прямо в теме.

И честности ради: первый же тестер из этой темы поймал дефект - из его многосекционной страницы извлекалось 334 слова из ~1 300, и анализировалась эта четверть. Проверили на 390 страницах: так обрезалось ~14 % страниц выдачи. Починено на следующий день, с 20.08 все отчёты считают полный текст. Такой фидбек — лучшее, что может дать тема; приносите запросы.

Авторизуйтесь или зарегистрируйтесь, чтобы оставить комментарий