Лидеры года — новая категория на Workspace Digital Awards! Номинируйте вашу команду, продукты и проекты.
SEO

Как найти и убрать дубли страниц с помощью Screaming Frog

57 
 

Сайт теряет позиции в поиске, а вложенный в контент и ссылки бюджет не приносит результата? Частая причина — дубли страниц. Поисковые системы видят несколько адресов (URL) с одинаковым или очень похожим содержимым. Это запутывает робота, заставляет его впустую тратить лимит сканирования (crawl budget) и размывает ссылочный вес. В итоге страницы могут выпадать из индекса, а трафик — снижаться.

Screaming Frog SEO Spider — профессиональная программа для технического аудита, которая позволяет быстро находить дубли страниц на сайте. Она анализирует все страницы так же, как поисковый бот.

Что такое дубли страниц и почему они опасны для SEO

Дубль — это ситуация, когда один и тот же контент доступен по разным адресам. Например:

  • site.ru/catalog/ и site.ru/catalog (со слешем и без);

  • site.ru/page и site.ru/page?utm_source=google (с UTM-метками);

  • HTTP- и HTTPS-версии одной страницы (зеркала);

  • страницы пагинации (site.ru/catalog?page=2), которые могут дублировать основную.

Наличие дублей создает проблемы:

  • Конфликт индексации. Робот не знает, какую версию считать оригинальной (канонической), и в выдачу может не попасть ни одна из страниц.

  • Пустой расход краулингового бюджета. Робот тратит время на сканирование копий вместо важных страниц.

  • Потеря ссылочного веса. Внешние и внутренние ссылки делятся между дублями, ослабляя целевую страницу.

Пошаговая инструкция по поиску дублей в Screaming Frog

Для начала скачайте, установите и активируйте Screaming Frog.

  1. Переходим в раздел «Configuration» → «Content» → «Duplicates»;

  2. Убираем галочку напротив «Only check indexable pages for duplicates», чтобы выявить все страницы-дубли и по возможности удалить их — так бюджет сканирования будет расходоваться правильно;

  3. Ставим галочку «Enable Near Duplicates» — она активирует поиск неявных дубликатов;

  4. Near duplicate similarity threshold (%) — от какого процента похожести считать страницы частичными дублями. Рекомендую ставить 70%.


Разместите
тендер бесплатно

Наша система сама подберет вам исполнителей на услуги, связанные с разработкой сайта или приложения, поисковой оптимизацией, контекстной рекламой, маркетингом, SMM и PR.

Заполнить заявку 13772 тендера
проведено за восемь лет работы нашего сайта.


Анализ результатов и экспорт списка

В правом меню во вкладке Crawl Data → Content вы увидите результаты по найденным дублям. Щелкните по любой группе, чтобы детальнее изучить список всех адресов (URL), которые в нее входят, и значение схожести.

  • All — все значения по страницам в одной вкладке;

  • Exact duplicates — дубли, которые совпадают друг с другом на 100%;

  • Near duplicates — страницы с разными URL, которые очень сильно схожи. Их текст не идентичен, но уникального контента мало или сквозных элементов больше, чем уникального текста;

  • Low content pages — страницы, где меньше 200 слов (не путать с символами);

  • Soft 404 pages — страницы, которые отвечают кодом «200», но выглядят как страницы ошибки 404;

  • Spelling errors — страницы с орфографическими ошибками;

  • Grammar errors — страницы с грамматическими ошибками;

  • Readability difficult — трудночитаемый текст с длинными предложениями и сложными словами;

  • Readability very difficult — текст очень сложен для чтения и понимания;

  • Lorem ipsum placeholder — страницы с оставшимся текстом-заглушкой.

Для поиска дублей нас интересуют прежде всего вкладки «Exact duplicates» и «Near duplicates»: в них видно, какие адреса попали в одну группу и насколько они похожи.

Как убрать дубли страниц: практические методы

Найдя дубли, их нужно устранить. Основные способы, которые я использую на практике:

  • Добавление уникального контента. Выделить ресурсы на уникальные тексты для страниц. Подходит для страниц, похожих друг на друга более чем на 75% и попавших в «Near duplicates».

  • Канонический тег (rel=canonical). Добавить на страницы-дубли ссылку на основную версию. Подходит для похожих страниц: карточек товара с разными сортировками, страниц пагинации.

  • 301-редирект. Настроить постоянное перенаправление с дубля на оригинальный адрес. Подходит для зеркал (http/https, с www и без), устаревших адресов после переезда. Требует правок в .htaccess (Apache) или настройки через плагин CMS.

  • Запрет индексации. Использовать метатег robots или директиву в robots.txt. Подходит для служебных страниц и пагинации, если они не нужны в поиске.

  • Устранение причины. Унифицировать адреса (единый формат слеша), настроить корректную обработку UTM-меток на сервере — чтобы дубли не появлялись снова.

  • Массовая переиндексация через Google Indexing API. Когда ошибки исправлены и нужно, чтобы робот заново проверил страницы.

На практике дубли редко бывают единственной проблемой: обычно рядом находятся битые ссылки, цепочки редиректов и ошибки в мета-тегах. Поэтому поиск дублей логично встраивать в полноценный технический аудит сайта, а не проводить в отрыве от остальных проверок.

Расширенные возможности и интеграции

  • Интеграция с Google Analytics и Search Console. Можно загрузить данные о трафике и позициях, чтобы видеть, какие дублирующие страницы забирают поисковый трафик.

  • Анализ мета-тегов. Во вкладках Page Titles и Meta Description легко найти дублирующиеся или слишком короткие заголовки.

  • Парсинг XML Sitemap. Программа может проанализировать sitemap.xml и проверить адреса из него.

Поиск и устранение дублей — важный этап внутренней оптимизации сайта. Screaming Frog позволяет автоматизировать этот кропотливый процесс и получить четкий список проблем для решения. Регулярная проверка помогает улучшать видимость сайта, эффективно распределять краулинговый бюджет и защищать бизнес от потери трафика.

Источник: блог Андрея Павловича, seo-personal.ru

Выскажите мнение
Авторизуйтесь, чтобы добавить свой комментарий.




57

Лучшие статьи

Поделиться: 0 0 0
SEO-специалист в  Alekzo , Минск
 55  1  1

Оцените статью
Спасибо за оценку