- html5css.dev
- SEO
- SEO продвижение
- Техническая оптимизация
- Дубли контента
Дубли контента
Дубли размывают сигналы: вместо одной сильной страницы поисковик видит несколько слабых. Разбираем источники, инструменты склейки и типичные ошибки применения canonical.
Откуда берутся дубли
| Источник | Пример | Решение |
|---|---|---|
| Протокол и www | http://, https://www. | 301 на один вариант |
| Слеш в конце | /page и /page/ | 301 на выбранный формат |
| Регистр | /Page/ и /page/ | 301 на нижний регистр |
| Индексный файл | / и /index.php | 301 на короткий вид |
| Метки кампаний | ?utm_source=… | canonical на чистый URL |
| Сортировки и вид | ?sort=price&view=list | canonical на базовую категорию |
| Фильтры | ?color=red&size=42 | Ценные — свои страницы, остальные — canonical |
| Пагинация | ?page=2 | Свой title, canonical сам на себя |
| Товар в разных категориях | Два пути к одной карточке | Один основной URL, canonical с остальных |
| Версия для печати | /page/print/ | noindex или canonical |
| Тестовый поддомен | dev.site.ru | Закрыть авторизацией |
Три инструмента и когда какой
| Инструмент | Когда применять | Что происходит |
|---|---|---|
| 301 | Дубль не нужен ни людям, ни поиску | Адрес исчезает, сигналы переходят на целевой |
| canonical | Обе страницы нужны людям, в индексе — одна | Рекомендация: в выдаче показывается каноническая |
| noindex | Страница нужна людям, но не поиску | Из выдачи убирается, ссылки с неё работают |
| robots.txt | Только для экономии бюджета обхода | Не убирает из индекса; закрытую страницу робот не увидит и не прочтёт noindex |
robots.txt, робот не загрузит страницу
и не увидит на ней noindex — адрес может остаться в индексе.
Порядок правильный: сначала noindex и доступ открыт, дождаться
выпадения из индекса, и только потом при желании закрывать обход.
Canonical: правила применения
<!-- каноническая страница указывает сама на себя -->
<link rel="canonical" href="https://site.ru/catalog/smesiteli/">
<!-- страница с метками указывает на чистый адрес -->
<link rel="canonical" href="https://site.ru/catalog/smesiteli/">
<!-- фактический URL: /catalog/smesiteli/?utm_source=ads -->
- Абсолютный URL с протоколом и доменом.
- Каноническая страница указывает сама на себя — это снимает неоднозначность.
- Один
canonicalна странице. Два — противоречие, оба игнорируются. - Цель должна отдавать 200 и быть открыта для индексации.
- Содержание должно совпадать. Canonical с карточки на категорию — сигнал, который система проигнорирует.
- Внутренние ссылки ведут на канонический адрес, иначе сигналы противоречат разметке.
Пагинация и фильтры
Для страниц пагинации правильный вариант — canonical сам на себя и свой title с номером. Ставить canonical всех страниц на первую нельзя: товары со второй и последующих выпадут из индекса. Подробности — в уроке о пагинации.
Для фильтров решение зависит от спроса:
- Есть спрос («смесители чёрные») — делаем полноценную страницу со своим title, описанием и canonical на себя.
- Спроса нет — canonical на базовую категорию, а комбинации фильтров закрываем от обхода.
- Комбинаций тысячи — обязательно ограничить обход, иначе бюджет уйдёт на них.
Как найти дубли
- Краулер: одинаковые
title,h1и совпадение содержания. - Search Console → Индексирование: категории «Дубликат: страница не выбрана в качестве канонической» и «Google выбрал другую каноническую страницу».
- Яндекс.Вебмастер → Страницы в поиске: исключённые как дубли.
- Поиск по фрагменту текста в кавычках с оператором
site:— быстрый способ увидеть копии. - Логи: какие адреса с параметрами реально обходит робот.
# сколько уникальных адресов с параметрами обходит робот
grep -i googlebot access.log | awk '{print $7}' | grep '?' \
| sed 's/=[^&]*//g' | sort | uniq -c | sort -rn | head -20
Последняя команда показывает наборы параметров без значений — так видно, какие именно комбинации плодят дубли.
Порядок работ
- Свести все варианты адресации к одному: протокол, www, слеш, регистр.
- Проставить
canonicalна всех шаблонах, включая «сам на себя». - Разобраться с фильтрами: что открываем, что закрываем.
- Проверить внутренние ссылки — они должны вести на канонические адреса.
- Закрыть от обхода бесполезные комбинации параметров.
- Через месяц сверить отчёт индексирования.
Итог
Дубли — техническая, а не редакторская проблема: их не лечат переписыванием
текстов. Сведите варианты адресации к одному, расставьте canonical
и следите, чтобы внутренние ссылки не противоречили разметке. Дальше —
организация пагинации.
Частые вопросы
Есть ли санкции за дубли контента внутри сайта?
Отдельных санкций нет. Проблема механическая: сигналы делятся между копиями, поисковик сам выбирает каноническую версию и может выбрать не ту, а бюджет обхода тратится впустую.
Canonical или 301: что выбрать?
301 — когда дубль не нужен людям и должен исчезнуть. Canonical — когда обе страницы нужны пользователю (например, товар в двух категориях), но в индексе должна быть одна.
Является ли canonical директивой?
Нет, это рекомендация. Поисковик может выбрать другую каноническую версию, если сигналы противоречат: разные внутренние ссылки, разный контент, canonical указывает на нерелевантную страницу.
Как быть с одним товаром в нескольких категориях?
Лучше всего — один URL товара вне категорий, а из категорий на него ссылаться. Если структура вложенная, выберите основной путь и укажите его в canonical на всех остальных.