Top.Mail.Ru Top.Mail.Ru
Бюджет сканирования (crawl budget): что это и как влияет

Бюджет сканирования (crawl budget): что это и как влияет

Бюджет сканирования (crawl budget): что это и как влияет

Бюджет сканирования (crawl budget) — количество URL, которое поисковый робот готов и способен обойти на сайте за единицу времени. Для небольших проектов тема неактуальна: робот обходит всё и так. Но для интернет-магазинов с тысячами карточек, агрегаторов и классифайдов неоптимальный бюджет означает прямую потерю: важные страницы неделями не попадают в индекс, а робот тратит ресурс на мусор. Разберём, из чего складывается crawl budget, когда о нём думать и как им управлять без чёрных методов.

Из чего складывается crawl budget

Google формализует понятие через две составляющие. Crawl rate limit (предел частоты) — максимальная нагрузка, которую робот может создать, не «уронив» сервер: отвечаете быстро и стабильно отдаёте 200 — лимит растёт; сервер тормозит или отдаёт 5xx — робот снижает интенсивность. Crawl demand (потребность) — насколько поисковику интересно часто обходить ваши URL; зависит от популярности страниц и частоты обновления контента.

Реальный бюджет — пересечение «сколько можно» и «сколько нужно». У Яндекса в Вебмастере для этого есть отчёт «Статистика обхода» и настройка «Скорость обхода». Принцип тот же: робот не безграничен, и каждый его заход на бесполезный URL — это не обойдённая полезная страница.

Кому это действительно важно

Чтобы не оптимизировать несуществующую проблему, оцените масштаб.

Тип сайта Объём URL Приоритет crawl budget
Лендинг, сайт-визитка до 100 Не актуально
Корпоративный сайт, блог 100–1 000 Низкий
Средний интернет-магазин 1 000–10 000 Средний
Крупный магазин, каталог услуг 10 000–100 000 Высокий
Агрегатор, классифайд, маркетплейс 100 000+ Критический

Грубый признак проблемы: если число известных роботу URL в разы превышает число нужных страниц, а новые страницы индексируются медленно — бюджет расходуется не туда. Подробнее о механике обхода — в материале как работают поисковые системы.

Главные пожиратели бюджета

На крупных сайтах робот почти всегда «вязнет» в одних и тех же местах:

  • Параметрические URL и фасетная фильтрация. Один листинг порождает сотни комбинаций ?color=...&size=...&sort=... — для робота это разные URL.
  • Дубли с UTM-метками, сортировкой, пагинацией. Как лечить — в статье дубли страниц: как найти и устранить.
  • Цепочки и петли редиректов. Каждый переход 301 → 301 → 200 робот проходит по шагам.
  • Soft 404 и пустышки. Поиск без результатов, пустые категории, «товар закончился» с кодом 200 — робот считает их полноценными.
  • Бесконечные календари и фильтры, генерирующие URL по дате до бесконечности.
  • Медленный сервер. Высокий TTFB режет crawl rate limit: чем дольше ответ, тем меньше страниц робот успевает обойти.

Как управлять бюджетом: практические рычаги

Логика проста: закрыть от робота бесполезное, ускорить отдачу полезного, не плодить дубли. Все приёмы ниже — белые, базовая техническая гигиена.

1. Закройте мусор в robots.txt. Disallow для параметров фильтрации, корзины, личного кабинета, страниц поиска, служебных каталогов. Важно: robots.txt запрещает сканирование, но не гарантирует исключение из индекса при наличии внешних ссылок. Детали — в robots.txt: правильная настройка для SEO.

2. Используйте canonical и meta robots осознанно. Для дублей, которые должны оставаться доступными пользователю, уместнее rel=canonical или noindex, follow, а не блокировка в robots — иначе робот не увидит сам тег.

3. Держите sitemap.xml актуальным. Туда попадают только канонические, отдающие 200 URL, без редиректов и закрытых страниц. См. sitemap.xml: создание и отправка.

4. Чистите редиректы и битые ссылки. Прямой 301 вместо цепочки, никаких внутренних ссылок на 404.

5. Ускоряйте сервер. Снижение TTFB, кеширование, CDN поднимают crawl rate limit. Здесь же работают на индексацию хорошие Core Web Vitals (LCP < 2,5 с, INP < 200 мс, CLS < 0,1).

6. Управляйте «мёртвыми» URL кодами ответа (404/410 вместо вечного 200 с заглушкой) и стройте плоскую структуру: чем меньше кликов от главной до страницы (3–4), тем выше шанс, что робот до неё дойдёт.

Чек-лист аудита crawl budget

Что проверить Где Сигнал проблемы
Известные URL / нужные страницы Search Console, Вебмастер Превышение в разы
Статистика обхода Яндекс.Вебмастер → Статистика обхода Много обходов 3xx/4xx/5xx
Коды ответа GSC «Индексирование страниц» Рост soft 404, «просканировано, не проиндексировано»
Параметрические дубли Логи, парсер Тысячи URL с ?-параметрами
Цепочки редиректов Парсер (Screaming Frog) Hop > 1
Скорость ответа сервера Логи, PageSpeed Высокий TTFB

Самый честный источник данных — анализ серверных логов: видно, по каким именно URL ходит робот и сколько ресурса уходит. Панели вебмастеров дополняют картину, но логи дают факт.

Мини-пример

Интернет-магазин на ~20 000 карточек. В логах видно, что большая часть обходов робота приходится на URL с параметрами фильтра (?brand=, ?price_from=), дублирующие категории, а новые карточки попадают в индекс с задержкой. Решение: закрыть параметры фильтрации в robots.txt, проставить rel=canonical со страниц фильтров на родительские категории, убрать фильтр-URL из sitemap.xml. Цель — перенаправить обход с дублей на товарные страницы; результат отслеживается по «Статистике обхода» и скорости индексации новых URL. Цифры прироста заранее не гарантируются — зависят от ниши и поведения робота.

⚠️ РИСКи и типичные ошибки

  • Закрыли в robots.txt то, что уже в индексе, и ждёте выпадения. Не сработает: робот перестанет заходить, но из индекса страница сразу не уйдёт. Для исключения нужен noindex (URL должен оставаться доступным для сканирования) или удаление с кодом 404/410.
  • Заблокировали в robots.txt страницы с canonical/noindex. Робот не прочитает тег, который вы для него закрыли, — это взаимоисключающие инструкции.
  • Искусственно «раздули» скорость обхода вручную на слабом сервере — рискуете получить рост 5xx и, как следствие, снижение реального бюджета.
  • Генерация десятков почти одинаковых страниц под близкие запросы ради охвата пожирает бюджет и попадает под алгоритмы качества: у Google — Helpful Content, у Яндекса — снижение по факторам качества. ⚠️ РИСК санкций.

FAQ

Влияет ли crawl budget напрямую на позиции?
Нет, это не фактор ранжирования. Но косвенно: если важная страница не обойдена и не проиндексирована, ранжироваться ей нечем. Бюджет — про попадание в индекс, а не про место в нём.

У меня сайт на 300 страниц, нужно ли этим заниматься?
Скорее всего нет. На таких объёмах робот обходит всё без проблем. Достаточно базовой гигиены: корректные robots.txt и sitemap.xml, отсутствие массовых дублей и редиректных цепочек.

Как ускорить сканирование конкретной важной страницы?
Добавьте её в sitemap.xml, поставьте внутренние ссылки с авторитетных страниц и отправьте URL на переобход — в Search Console через «Проверку URL», в Яндекс.Вебмастере через «Переобход страниц».

Чем «просканировано, но не проиндексировано» отличается от проблемы бюджета?
Статус в GSC означает, что страница обойдена, но не сочтена достойной индекса (часто — низкая ценность или дубль). Проблема бюджета — когда страница вообще не доходит до обхода.

Материал подготовлен экспертами Chrome Media. Управление бюджетом сканирования — часть технического SEO-аудита: находим утечки обхода по логам и панелям вебмастеров и выстраиваем индексацию крупных сайтов.

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *