Як усунути помилки сканування

Нижче перераховані основні кроки для усунення несправностей зі скануванням вашого сайту.

  1. Дізнайтеся, чи є у робота Googlebot проблеми з доступом до вашого сайту.
  2. Дізнайтеся, чи є у вас сторінки, які не скануються, хоча повинні.
  3. Перевірте, чи потрібно прискорити сканування певних розділів сайту.
  4. Підвищіть ефективність сканування сайту.
  5. Зведіть до мінімуму надмірне сканування сайту.

Якщо ви поліпшите доступ до сторінок сайту, це не обов’язково призведе до збільшення ліміту на його сканування. Google визначає оптимальну частоту сканування з урахуванням потреби в ньому, як описано вище. Тим не менш, якщо є проблеми з доступом, робот Googlebot не зможе сканувати сайт так інтенсивно, як дозволяє ліміт.

Діагностика

Відкрийте звіт «Статистика сканування», щоб переглянути історію сканування вашого сайту роботом Googlebot. Так ви дізнаєтеся, коли виникали проблеми. Якщо у звіті є помилки або попередження, пов’язані з доступністю вашого сайту, знайдіть, де на графіках Доступність хоста запити робота Googlebot виходять за червону лінію. Натисніть на графік, щоб дізнатися, які URL-адреси були недоступні, і спробуйте з’ясувати, в чому причина.

Щоб перевірити невелику кількість URL, ви можете скористатися інструментом перевірки URL. Якщо інструмент повертає попередження Перевищено навантаження на хост, значить, робот Googlebot не може просканувати всі виявлені URL-адреси на вашому сайті.

Усунення несправностей

  • Ви можете дізнатися про те, як виявити та усунути деякі проблеми з доступністю сайту, зі статті про звіт «Статистика сканування».
  • Заблокуйте сканування сторінок, які ви не хочете показувати в результатах пошуку. Детальніше…
  • Скоротіть час завантаження та відображення сторінок. Детальніше…
  • Збільште серверні потужності. Якщо Google регулярно сканує ваш сайт з максимально можливим навантаженням, але деякі важливі URL-адреси залишаються не охопленими або оновлюються рідше, ніж потрібно, збільште потужність сервера, щоб пошуковий робот міг паралельно запитувати більше сторінок сайту. Перегляньте історію доступності хоста у звіті «Статистика сканування» і з’ясуйте, чи часто робот Googlebot перевищує максимальну частоту сканування. При необхідності збільште серверні потужності на місяць і перевірте, чи зросте за цей час кількість запитів на сканування.

Google виділяє на сканування вашого сайту стільки часу, скільки потрібно для індексації всього корисного і доступного користувачам контенту. Якщо робот Googlebot пропускає важливі сторінки, значить, їх сканування заборонено або Google не може їх виявити, або є проблеми з доступністю вашого сайту, або Google намагається не перевантажувати ваші сервери.

Діагностика

У Search Console немає даних про сканування сайту, які можна відфільтрувати за URL або шляхом, але ви можете дізнатися, які URL сканував Googlebot, з журналів сайту. Нагадуємо, що додавання відсканованих URL-адрес до індексу тут не розглядається.

У більшості випадків Google виявляє нові сторінки на сайті не в день їх додавання, а принаймні через кілька днів. Виняток становлять деякі категорії ресурсів, контент яких оновлюється дуже часто, наприклад, новинні сайти.

Усунення несправностей

Якщо додані на сайт сторінки досить довго не скануються, значить: Google не може їх виявити; ви заборонили їх сканувати; досягнуто ліміт навантаження на ваші сервери; або вичерпано ліміт на сканування.

  1. Повідомте Google про свої нові сторінки: додайте їх URL до файлів Sitemap.
  2. Перевірте, чи не заблоковано випадково сканування цих сторінок у правилах файлу robots.txt.
  3. Визначтеся зі своїми пріоритетами сканування (тобто раціонально витрачайте ліміт на сканування).Оптимізуйте кількість сторінок, які підлягають скануванню, і підвищіть ефективність сканування сайту.
  4. Переконайтеся, що у вас достатньо серверних потужностей. Робот Googlebot зменшить навантаження на ваші сервери, якщо їм не вистачатиме ресурсів під час сканування.

Зверніть увагу, що навіть відскановані сторінки можуть не відображатися в результатах пошуку, якщо вони не представляють цінності для користувачів або їх контент нікому не цікавий.

Якщо робот Googlebot пропустив нові або оновлені сторінки на вашому сайті, ймовірно, він їх не знайшов або не виявив змін у них. Нижче описано, як ви можете повідомити нам про новий контент.

Ми прагнемо виявляти зміни на сторінках та індексувати їх якомога швидше. Новий контент більшості сайтів сканується та індексується через три доби або пізніше. Не розраховуйте на те, що ваші сторінки будуть додані до індексу Google вже в день публікації, якщо, звичайно, ви не розміщуєте інформацію, що швидко змінюється, яка представляє значну цінність для користувачів (наприклад, новини).

Діагностика

Дізнатися, коли Googlebot сканував ту чи іншу URL-адресу, можна з журналів сайту.

Щоб дізнатися дату індексації, скористайтеся інструментом перевірки URL або знайдіть оновлені URL-адреси.

Усунення несправностей

Що рекомендується робити

  • Якщо на вашому сайті публікується новинний контент, використовуйте файл Sitemap для Google News.
  • Щоб повідомити нас про зміну вмісту, розміщеного під вже доданим до індексу URL, використовуйте тег <lastmod>.
  • Щоб роботи Google могли сканувати ваш сайт, він повинен мати зручну для перегляду структуру URL.
  • Щоб спростити виявлення своїх сторінок, вкажіть стандартні посилання, які можна сканувати, у тегах <a>.
  • Якщо на сайті різні версії сторінок для мобільних пристроїв і для ПК, то список посилань в різних версіях сайту повинен бути однаковим. Якщо список посилань у мобільній версії відрізняється, додайте їх до файлу Sitemap. Google індексує лише мобільну версію сайту, і обмеження посилань у цій версії може призвести до затримки виявлення нових сторінок.

Що не рекомендується робити

  • Не надсилайте один і той же файл Sitemap кілька разів на день.
  • Не розраховуйте, що робот Googlebot просканує всі сторінки, зазначені у файлі Sitemap, або почне сканування відразу. Файли Sitemap — це корисні підказки для Google, а не обов’язкові для виконання вимог.
  • Не додавайте до файлів Sitemap URL, які не потрібно показувати в результатах пошуку. В іншому випадку ваш ліміт на сканування буде витрачено даремно на їх обробку.

Здатність Google сканувати ресурси залежить від пропускної здатності, часу, а також доступності роботів Googlebot. Якщо сервер сайту відповідатиме на запити швидше, ми зможемо просканувати більше сторінок на ньому. При цьому слід враховувати, що Google прагне сканувати тільки корисний контент. Якщо ваші сторінки швидко завантажуються, але при цьому мають низьку якість, Googlebot не буде обробляти ваш сайт частіше. І навпаки, якщо ми з’ясуємо, що роботи Google пропускають якісний контент з вашого сайту, то ми можемо збільшити ваш ліміт на сканування, щоб охопити цей контент.

Ось як можна оптимізувати сторінки та ресурси з точки зору сканування:

  • Внесіть об’ємні і при цьому не є цінними для користувачів ресурси у файл robots.txt, щоб робот Googlebot не завантажував їх. Це можуть бути, наприклад, елементи графічного оформлення сторінки, які не важливі для розуміння її змісту.
  • Забезпечте швидке завантаження сторінок.
  • Не використовуйте довгі ланцюги переадресації, оскільки вони викликають проблеми при скануванні.
  • Значення має не тільки час відповіді серверів на запити, але й час, необхідний для відображення сторінок, в тому числі для завантаження зображень і виконання скриптів. Враховуйте це, якщо у вас є великі або повільно завантажувані ресурси, які потрібно проіндексувати.

У пошуковій системі Google заголовки HTTP-запиту If-Modified-Since та If-None-Match використовуються не в усіх сценаріях сканування. Під час надсилання заголовків пошукові роботи Google враховують контекст запиту: так, заголовки HTTP-запиту If-Modified-Since та If-None-Match з більшою ймовірністю надсилатиме робот AdsBot. У значенні заголовка If-Modified-Since, надісланого нашими пошуковими роботами, вказуються дата й час останнього сканування. На основі цього значення сервер може повернути код статусу HTTP 304 (Not Modified) без тіла відповіді. У цьому випадку Google повторно використовуватиме версію контенту, отриману під час останнього сканування. Якщо контент було оновлено після дати попереднього сканування, вказаної пошуковим роботом у заголовку If-Modified-Since, сервер може повернути код статусу HTTP 200 (OK) із тілом відповіді.

Якщо в контент не вносилися зміни з моменту останнього сканування цього URL роботом Googlebot, то у відповідь на будь-який запит від цього робота ви можете надсилати код статусу HTTP 304 (Not Modified) без тіла відповіді незалежно від заголовків запиту. Так ви заощадите час обробки та ресурси сервера, що може опосередковано підвищити ефективність сканування.

Виділення серверних потужностей для сканування непотрібних сторінок може уповільнити аналіз важливих для вас сторінок, а новий або оновлений контент, цікавий для користувачів, може бути виявлений зі значною затримкою.

Якщо на вашому сайті багато відкритих URL-адрес, обробка яких пошуковим роботом небажана, це може погано вплинути на сканування та індексацію сайту. Зазвичай ці URL-адреси поділяються на кілька категорій:

Що рекомендується робити

  • Використовуйте файл robots.txt, щоб повністю заборонити сканування сторінки або ресурсу.
  • Якщо на декількох сторінках використовується спільний ресурс (наприклад, зображення або файл JavaScript), вказуйте його скрізь з одним і тим самим URL. Тоді Google зможе кешувати ресурс для багаторазового використання і не запитувати його кілька разів.

Що не рекомендується робити

  • Не потрібно постійно додавати в файл robots.txt і видаляти з нього сторінки або каталоги, щоб перерозподілити ліміт на сканування вашого сайту. Використовуйте файл robots.txt лише для сторінок і ресурсів, які ви хочете виключити з результатів пошуку Google на тривалий час.
  • Не потрібно часто змінювати файли Sitemap або намагатися перерозподілити ліміт на сканування сайту за допомогою інших прийомів, які дозволяють тимчасово приховати вміст.

Помилкою soft 404 називається ситуація, коли відвідувач вебсторінки бачить повідомлення про те, що її не існує, і при цьому браузер отримує відповідь із кодом статусу 200 (success). Цей код означає “Успішно”. У деяких випадках відкривається сторінка, на якій немає основного або взагалі будь-якого контенту.

Такі сторінки створюються веб-сервером, де розміщений сайт, системою управління контентом або браузером користувача. Причини можуть бути різними, наприклад:

  • Відсутність файлу SSI
  • Помилка при зверненні до бази даних
  • Порожня внутрішня сторінка результатів пошуку
  • Незавантажений або відсутній з іншої причини файл JavaScript

Ми не рекомендуємо повертати код статусу 200 (success), а потім виводити повідомлення про помилку чи вказувати на наявність помилки на сторінці. Користувачі можуть подумати, що потрапили на діючу сторінку, але після цього побачать повідомлення про помилку. Подібні сторінки вилучаються з Google Пошуку.

Якщо алгоритми Google за вмістом сторінки визначать, що вона містить повідомлення про помилку, то в звіті про індексацію сторінок цього сайту в Search Console буде вказано помилку soft 404.

Є різні способи усунення помилок soft 404 залежно від стану сайту та від бажаного результату:

Подумайте, яке рішення буде оптимальним для ваших користувачів.

Якщо сторінку видалено і для неї немає заміни на вашому сайті з аналогічним контентом, потрібно надсилати відповідь із кодом статусу 404 (not found) або 410 (gone). Ці коди статусу повідомляють пошуковим системам, що сторінки не існує і ви не хочете, щоб пошукові системи індексували її.

Якщо у вас є доступ до файлів конфігурації вашого сервера, сторінки з повідомленнями про помилки можна зробити корисними для користувачів. Наприклад, на такій сторінці 404 ви можете розмістити функції, покликані допомагати відвідувачам у пошуку потрібної інформації, або корисний контент, який утримає їх на вашому ресурсі. Ось кілька порад щодо створення корисної сторінки 404:

  • Користувачам має бути зрозуміло, що запитувана сторінка недоступна. Повідомте їм про це в ввічливій формі.
  • Страница 404 должна быть выполнена в том же стиле (включая элементы навигации), что и основной сайт.
  • Розмістіть на сторінці посилання на найпопулярніші статті або записи блогу, а також на головну сторінку.
  • Дайте користувачам можливість повідомляти про непрацюючі посилання.

Корисні сторінки 404 створюються виключно для зручності користувачів. Пошукові системи ігнорують такі сторінки, тому рекомендуємо повертати для цих сторінок код статусу HTTP 404, щоб вони не індексувалися.

Якщо сторінку перенесено або вона має заміну, надсилайте відповідь із кодом 301 (permanent redirect), щоб перенаправляти користувачів. Відвідувачам сайту це не завадить, а пошукові системи дізнаються про нове розташування сторінки. Щоб дізнатися, чи правильний код відповіді надсилається під час відкриття сторінки, використовуйте інструмент перевірки URL.

Якщо нормально працююча сторінка викликала помилку soft 404, ймовірно, вона не була коректно завантажена роботом Googlebot, під час рендерингу були недоступні важливі ресурси або показувалося помітне повідомлення про помилку. Проаналізуйте відрендерений контент і код відповіді HTTP за допомогою інструмента перевірки URL. Якщо на відрендереній сторінці немає або дуже мало контенту чи він викликає помилку, помилка soft 404 може бути зумовлена тим, що сторінка містить ресурси (наприклад, зображення, скрипти та інші нетекстові елементи), які не вдається завантажити. Можливі причини проблем із завантаженням – блокування доступу у файлі robots.txt, занадто велика кількість ресурсів або занадто великий їх розмір, а також будь-які помилки сервера.

Google використовує алгоритми, які обмежують кількість запитів на сканування, щоб запобігти перевантаженню сайту. Якщо перевантаження все-таки станеться, ви можете вжити заходів, описаних нижче.

Діагностика

Перевіряйте, чи не надсилає робот Googlebot занадто багато запитів на сервер вашого сайту.

Усунення несправностей

Ось що рекомендується робити в екстрених випадках:

    1. Якщо ваш сервер перевантажений, тимчасово надсилайте у відповідь на запити робота Googlebot код статусу HTTP-відповіді 503 або 429. Робот намагатиметься просканувати ті самі сторінки ще приблизно два дні. Зверніть увагу: якщо надсилати коди, що вказують на недоступність сайту, довше ніж кілька днів, Google повністю припинить сканування ваших сторінок або надовго уповільнить його. Тому виконайте також наведені нижче дії.
    2. Коли частота сканування знизиться, припиніть надсилати код статусу HTTP 503 або 429 у відповідь на запити пошукового робота. Якщо надсилати код 503 або 429 понад дві доби, Google вилучить недоступні URL-адреси з індексу.
  1. Відстежуйте, як змінюються статистика сканування та завантаження сервера.
  2. Якщо проблеми зі скануванням виникають через пошукового робота AdsBot, то причина, ймовірно, в обраних вами на сайті сторінках для таргетингу динамічних пошукових оголошень. Google сканує такі сторінки раз на три тижні. Якщо ресурси вашого сервера не дозволяють підтримувати цю функцію, вам слід або обмежити кількість цільових сторінок для таргетингу оголошень, або збільшити пропускну здатність сервера.