Top.Mail.Ru Top.Mail.Ru
Sitemap.xml: создание и отправка в поисковые системы

Sitemap.xml: создание и отправка в поисковые системы

Sitemap.xml: создание и отправка в поисковые системы

Sitemap.xml — это карта сайта в формате XML, список URL, которые вы предлагаете поисковику обойти и проиндексировать. Для сайта на 30–50 страниц он не критичен: робот дойдёт по внутренним ссылкам и без него. Но для интернет-магазина с тысячами карточек, нового домена без ссылочной массы или сайта с глубокой вложенностью карта становится рабочим инструментом управления индексацией. Разбираем, как собрать корректный sitemap, отправить его в Яндекс.Вебмастер и Google Search Console и не наделать ошибок, из-за которых робот начнёт файл игнорировать.

Что делает Sitemap.xml и чего он не делает

Карта сайта решает одну задачу — сообщает роботу перечень значимых URL с датой последнего изменения. Это важно, когда страницы плохо связаны перелинковкой или появляются быстрее, чем робот находит их по ссылкам.

Но границы инструмента надо понимать. Наличие URL в sitemap — рекомендация к обходу, а не гарантия индексации. Робот сам решает, что добавить в индекс, опираясь на качество страниц, дубли, robots.txt и rel=canonical: если страница закрыта в robots.txt или указывает каноникал на другой адрес, присутствие в карте её не спасёт. Sitemap не повышает позиции напрямую — он лишь ускоряет то, как робот узнаёт о ваших страницах.

Структура файла и обязательные элементы

Формат описан спецификацией sitemaps.org. Минимально валидный файл выглядит так:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.ru/catalog/pamyatniki/</loc>
    <lastmod>2026-05-28</lastmod>
  </url>
</urlset>

Тег <loc> обязателен и содержит абсолютный URL в той же схеме (https) и хосте, что и сам файл. <lastmod> опционален, но желателен — по нему робот понимает, что страница изменилась (формат даты W3C Datetime, ГГГГ-ММ-ДД).

Теги <changefreq> и <priority> есть в спецификации, но Google официально их игнорирует, а Яндекс относится к ним как к слабой подсказке — не тратьте время на ручную расстановку «приоритетов 0.8 / 0.5». Полезнее держать lastmod честным: робот сверяет дату с реальными изменениями, и вечно «сегодняшняя» дата у всех URL обесценивает сигнал.

Лимиты и разбивка на индексный файл

У формата жёсткие ограничения, задающие архитектуру для крупных проектов.

Параметр Лимит
URL в одном файле sitemap до 50 000
Размер одного файла (в распакованном виде) до 50 МБ
Sitemap в одном индексном файле до 50 000
Сжатие gzip разрешён и рекомендуется

Когда URL больше 50 000 или файл тяжелее 50 МБ, его дробят и создают индексный sitemap — карту карт. Вместо тегов <url> он перечисляет другие файлы sitemap через теги <sitemap> внутри корневого <sitemapindex>.

Даже если сайт укладывается в лимиты, разбивка по типам контента (каталог, блог, услуги) удобна для диагностики: в Вебмастере и Search Console видно индексацию каждого файла отдельно — проще понять, какой раздел проседает.

Какие URL включать, а какие нет

Главный принцип: в sitemap попадают только конечные, индексируемые, отдающие код 200 страницы, которые вы хотите видеть в поиске. Любой URL, противоречащий этому, отравляет файл и снижает доверие робота к нему. Не должны попадать в карту:

  • страницы с редиректами 301/302 (указывайте сразу финальный URL) и отдающие 404/410;
  • неканонические дубли — в карте только URL из rel=canonical (см. канонические URL);
  • адреса, закрытые в robots.txt или метатегом noindex;
  • URL с UTM-метками и параметрами фильтров, плодящие дубли страниц;
  • служебные разделы: корзина, личный кабинет, поиск по сайту.

Конфликт «страница в sitemap, но закрыта в robots.txt» — частая причина предупреждений в панелях: робот видит противоречивые сигналы. Карта и директивы индексации должны говорить одно и то же.

Как создать карту и где её разместить

Способ Когда подходит Нюанс
Плагин CMS (Yoast, RankMath, модули Bitrix/Tilda) Большинство сайтов на популярных CMS Обновляется автоматически при публикации
Краулеры (Screaming Frog, Netpeak Spider) Сайты без удобного плагина, разовая генерация Статичный файл, регенерировать вручную
Программная генерация на бэкенде Крупные магазины, маркетплейсы, частые изменения Гибко, но требует разработки и контроля

Для динамичных проектов предпочтительнее автоматическая генерация на сервере: карта всегда отражает состояние каталога, а lastmod берётся из реальной даты изменения записи. Статичный файл, собранный краулером раз в месяц, для активного магазина быстро устаревает.

Готовый файл размещают в корне домена (https://example.ru/sitemap.xml); в подпапке можно, но тогда карта перечисляет только URL своего уровня вложенности и ниже. Самый надёжный путь — прописать адрес карты в robots.txt отдельной строкой:

Sitemap: https://example.ru/sitemap.xml

Дальше добавьте карту в обе панели:

  • Яндекс.Вебмастер — раздел «Индексирование → Файлы Sitemap». Яндекс проверит файл и покажет число найденных URL и ошибки.
  • Google Search Console — раздел «Файлы Sitemap»: вставляете URL и отправляете. GSC показывает статус обработки и число обнаруженных адресов.

Отправлять достаточно один раз — дальше робот сам перечитывает файл. При индексном sitemap указывают только его, вложенные карты поисковик обойдёт сам. Это не отменяет работы над скоростью индексации другими методами, но даёт роботу удобную отправную точку.

⚠️ Типичные ошибки и риски

Большинство проблем с sitemap — не сложные баги, а небрежность при сборке.

  • Несоответствие хоста и протокола. Файл на https://example.ru, а внутри URL c http:// или www — робот отбросит «чужие» адреса. Все <loc> строго в той же схеме и хосте, что и сам файл.
  • «Грязная» карта. Внутри 404, редиректы, неканонические дубли. Чем больше мусора, тем меньше доверия к файлу. Регулярно прогоняйте sitemap краулером и сверяйте коды ответа.
  • Фейковый lastmod. ⚠️ РИСК: скрипт ставит всем URL текущую дату при каждой регенерации, чтобы «заставить» робота переобходить страницы чаще. Поисковики этот серый приём распознают и игнорируют, а сигнал реального обновления теряется.
  • Карта не обновляется. Статичный файл собрали один раз и забыли; новые страницы туда не попадают. Для активных сайтов — только автоматическая генерация.
  • Превышение лимитов или запрет в robots.txt. Файл на 80 000 URL без разбивки робот обработает частично; сам sitemap.xml не должен быть закрыт в robots.txt, иначе робот его не прочитает.

Мини-кейс: разбивка карты на региональном проекте

На сайте гранитных памятников granit-memory.ru (Новосибирск) изначально была одна общая карта на весь сайт: каталог, услуги, блог и фотогалерея в одном файле. При диагностике в Яндекс.Вебмастере было невозможно понять, какой раздел обходится хуже — панель показывала общую цифру.

Карту разделили на четыре файла (каталог, услуги, блог, портфолио) и собрали индексный sitemap. В Вебмастере стало видно индексацию каждого раздела отдельно, и обнаружилось, что часть карточек портфолио отдавала редиректы и не попадала в индекс — эти URL вычистили из карты и заменили на финальные адреса. Кейс показывает, что разбивка по типам контента нужна не ради «приоритетов», а ради прозрачной диагностики; конкретный прирост позиций здесь не измерялся.

FAQ

Нужен ли sitemap.xml маленькому сайту?
Если у сайта несколько десятков связанных ссылками страниц, робот обойдёт всё и без карты. Sitemap по-настоящему полезен на больших, новых или плохо перелинкованных сайтах, но вреда от корректной карты нет и на небольшом проекте.

Гарантирует ли добавление URL в sitemap его индексацию?
Нет. Карта — рекомендация обойти страницу, а не команда добавить в индекс. Решение робот принимает сам, оценивая качество, дубли, robots.txt и rel=canonical.

Что важнее: priority, changefreq или lastmod?
Только lastmod, и то при честной дате. Google официально игнорирует priority и changefreq, Яндекс относится к ним как к слабой подсказке.

Можно ли использовать один sitemap для Яндекса и Google?
Да, формат единый по спецификации sitemaps.org. Содержимое файла общее, но отправлять его нужно отдельно в Яндекс.Вебмастер и в Google Search Console.

Материал подготовлен экспертами Chrome Media — агентства технического SEO и поискового продвижения для рынка РФ.

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *