ЛОГИКА И ОГРАНИЧЕНИЯ
Как пользоваться результатом
Что такое лемматизация текста
Лемматизация приводит слово к его словарной форме: «кроссовки» → «кроссовок», «красных» → «красный», «покупали» → «покупать». Формы одного слова можно объединить и посчитать вместе.
Лемматизатор использует морфологический словарь. Стемминг работает с основой слова, которая может не совпадать с полноценной словарной формой. Этот инструмент выполняет морфологический разбор русского текста.
Как лемматизировать текст или семантическое ядро
Вставьте текст или список поисковых запросов, каждый с новой строки. Выберите настройки и нажмите «Лемматизировать». Результат можно скопировать или скачать в TXT, а таблицу частотности со словоформами — в CSV.
- Для обычного текста оставьте удаление дублей выключенным.
- Для чистки ядра включите удаление дублей по леммам. Первая исходная фраза каждой группы сохраняется.
- Если порядок слов не важен, включите соответствующую настройку. Перед использованием проверьте список удалённых строк.
- Частотность считается по исходному тексту после фильтра стоп-слов, до удаления дублей фраз.
Как использовать леммы в SEO
Таблица частотности помогает увидеть, какие слова повторяются в разных формах. Это удобно при редактуре статьи, сравнении заголовков и подготовке семантического ядра.
Совпадение лемм — повод проверить запросы вместе. Оно не доказывает одинаковое намерение пользователя. При отключённом учёте порядка «рейс Москва Минск» и «рейс Минск Москва» попадут в одну группу, хотя направления разные.
У частоты слова нет универсального безопасного порога для SEO. Оценивайте повторы в контексте текста, его задачи и удобства чтения.
Точность и ограничения
Выбирается наиболее вероятный разбор отдельного слова без анализа контекста предложения. Омонимы вроде «стали» могут иметь несколько лемм. Счётчик неоднозначных разборов показывает, сколько таких вхождений встретилось.
Используются словари OpenCorpora из Az.js 0.2.3, собранные в 2016 году. Для незнакомых слов возможен разбор по аналогии; новые бренды и термины требуют проверки. Латиница, числа и слова длиннее 64 символов остаются без морфологического разбора и приводятся к нижнему регистру.
Пунктуация и рекламные операторы в лемматизированном результате удаляются; границы строк сохраняются для непустых результатов. Стоп-слова исключаются только по выбранному базовому списку. Отрицание «не» в него не входит.
До 100 000 символов за запуск. Словарь загружается с сайта при первом запуске; введённый текст обрабатывается в браузере и не сохраняется сервисом.