Робот Googlebot

Googlebot — загальна назва пошукового робота, який використовується в Пошуку Google.

  • Googlebot Smartphone — пошуковий робот, який імітує користувача мобільного пристрою.
  • Googlebot Desktop — пошуковий робот, який імітує користувача комп’ютера.

Визначити, який робот обробляє вашу сторінку, можна за заголовком user-agent в HTTP-запиті. Але враховуйте, що давати різні команди різним роботам у файлі robots.txt неможливо, оскільки обидва типи роботів відповідають одному й тому ж токену агента користувача.

Під час обробки більшості сайтів Google насамперед індексує мобільну версію контенту. Тому більшість запитів на сканування надходитиме від робота Googlebot, який імітує користувача мобільного пристрою, і лише невелика їх частина — від робота Googlebot Desktop.

Робот Googlebot не може звертатися до сайту частіше, ніж раз на кілька секунд (у середньому). Це стосується більшості сторінок. У разі затримок частота відвідування сайту нашим роботом може трохи збільшитися. Якщо запити від Google усе-таки уповільнюють роботу сервера, спробуйте знизити частоту сканування.

Googlebot сканує лише перші 15 МБ вмісту HTML-файла або текстового файла підтримуваного формату. Витяг коду CSS і JavaScript та інших ресурсів з HTML-файла виконується окремо й відповідно до чинного обмеження на розмір файла. Отримавши 15 МБ, Googlebot припиняє сканування файла й відправляє на індексацію лише перші 15 МБ його вмісту. Обмеження на розмір файла застосовується до нестиснених даних. Для інших пошукових роботів Google, таких як Googlebot Video і Googlebot Image, можуть діяти інші обмеження.

Коли робот Googlebot сканує з IP-адрес із США, він працює в тихоокеанському часовому поясі.

Інші технічні властивості робота Googlebot описані в огляді пошукових роботів Google.

Робот Googlebot виявляє нові URL-адреси за посиланнями, вбудованими в раніше відскановані сторінки. Навіть якщо ви самі не розміщуєте посилання на свій сайт, зберегти його в таємниці не вдасться. Як тільки хтось натисне на посилання на вашому «таємному» сайті й перейде на інший, URL, переданий у тегу джерела посилання, може бути збережений і опублікований на цільовому сайті в журналі джерел посилань.

Якщо ви хочете запобігти скануванню вашого сайту роботом Googlebot, ознайомтеся з нашими інструкціями. Не забувайте, що сканування та індексування — різні процеси. Якщо заборонити роботу Googlebot сканувати ту чи іншу сторінку, її URL усе одно може з’являтися в результатах пошуку.

Блокування робота Googlebot впливає на Пошук Google (включно з «Рекомендаціями» й усіма функціями Пошуку Google), а також інші продукти (наприклад, Google Зображення, Google Відео, Google Новини й «Рекомендації»).

Пам’ятайте, що заголовок user-agent в HTTP-запиті, який використовується роботом Googlebot, часто імітують інші пошукові роботи. Перш ніж блокувати доступ нашому роботу, переконайтеся в тому, що небажаний запит надійшов саме від Google. Найнадійніший спосіб – виконати зворотний DNS-запит за IP-адресою джерела або порівняти IP-адресу джерела з діапазоном IP-адрес робота Googlebot.