Google обновила руководство по Crawl Budget
Google обновила руководство по оптимизации crawl budget для крупных и часто обновляемых сайтов. Документ на developers.google.com описывает, как Google распределяет ресурсы на обход страниц, и кому нужны продвинутые настройки. Для небольших проектов, где страницы обходятся в день публикации, достаточно актуальной карты сайта и отчета об индексировании в Search Console.
Crawl budget складывается из crawl capacity limit и crawl demand. Первый параметр ограничивает нагрузку на сервер по числу параллельных соединений и времени их удержания. Второй отражает спрос на обход URL с учетом размера сайта, частоты обновлений, качества страниц и их популярности. Даже при свободной емкости Google может обходить сайт реже, если спрос на его URL низкий.
Руководство рекомендует управлять инвентарем URL, объединять дубликаты, блокировать лишние разделы через robots.txt и возвращать 404 или 410 для удаленных страниц. Google предупреждает, что noindex не экономит crawl budget, потому что робот все равно запрашивает страницу. Также стоит избегать soft 404, поддерживать sitemap с lastmod, ускорять загрузку и использовать код 304 Not Modified.
Обновление дополняет раздел документации по crawling infrastructure, где уже есть материалы о robots.txt и краулерах. Ранее Google обновил документацию по тегу robots, и новое руководство по crawl budget развивает эту линию рекомендаций для владельцев сайтов с миллионами URL и частыми изменениями контента.
Материал полезен командам продвижения сайтов и специалистам по созданию сайтов, которые работают с большими каталогами, фильтрами и частыми обновлениями контента. Чтобы повысить эффективность обхода, Google советует сокращать лишние URL, улучшать скорость ответа сервера и при необходимости наращивать ресурсы хостинга, если Search Console показывает превышение hostload.