Як працює Google Пошук

Пошукова система Google повністю автоматизована і використовує так звані пошукові роботи, які постійно сканують інтернет і додають нові сторінки в індекс Google. Майже всі сайти в результатах пошуку Google знайдені саме так, а не додані вручну. У цьому документі розповідається про те, як Google Search працює з контентом на вашому сайті. Вивчивши цю інформацію, ви зможете усунути проблеми зі скануванням, забезпечити індексацію своїх сторінок, а також дізнатися, як поліпшити представлення свого сайту в Пошуку Google.

Компанія Google не гарантує, що ваш сайт буде просканований, проіндексований і показаний в результатах пошуку, навіть якщо він відповідає рекомендаціям з керівництва Головне про Пошук Google.

Алгоритм Пошуку Google включає три етапи, які перераховані нижче, однак при обробці певних сторінок деякі з них можуть не виконуватися.

  1. Сканування. Google завантажує текст, зображення та відео з веб-сайтів в Інтернеті за допомогою автоматизованих програм, які називаються роботами.
  2. Індексація. Google аналізує фрагменти тексту, зображення та відео, розміщені на сторінці, а потім зберігає інформацію про них в індексі Google, який являє собою велику базу даних.
  3. Показ результатів пошуку. Після того, як ви введете пошуковий запит в Google, система запропонує вам найбільш підходящі результати.

Перший етап полягає в пошуку сторінок, опублікованих в інтернеті. Оскільки їх централізованого реєстру не існує, роботу Google доводиться постійно шукати нові сторінки і додавати їх до списку вже відомих компанії. Цей процес називається виявленням URL. Деякі сторінки вже відомі, тому що робот Google відвідував їх раніше. Інші виявляються, коли він витягує посилання з вже відомих сторінок (наприклад, посилання на новий запис у блозі на головній сторінці). Іноді власники сайтів самі надсилають списки URL, які потрібно просканувати — так звані файли Sitemap.

Виявивши URL сторінки, робот Google відвідує її (або сканує), щоб дізнатися, що на ній опубліковано. Компанія постійно сканує мільярди сторінок в Інтернеті, використовуючи для цього величезну кількість комп’ютерів. Програма, яка витягує дані про сторінки, називається роботом Googlebot (а також пошуковим роботом або «павуком»). Робот Googlebot автоматично визначає, які сайти слід сканувати, як часто це потрібно робити, а також скільки сторінок слід обробити на кожному з них. Крім того, пошукові роботи Google запрограмовані так, щоб сканувати сайт не надто швидко і тим самим запобігати його перевантаженню. Це досягається за рахунок механізму, який враховує відповіді сайту (наприклад, помилки HTTP 500 означають, що робота сайту сповільнена).

У той же час робот Googlebot сканує не всі виявлені сторінки. Деякі сторінки заборонено сканувати, а до інших не можна отримати доступ без введення пароля.

Під час сканування Google малює сторінку і запускає виявлений код JavaScript в останній версії Chrome, подібно до того, як браузер малює сторінки, які ви відвідуєте. Це дуже важливо, тому що для відображення вмісту сторінки часто використовується JavaScript, і без відображення Google може не витягти з неї контент.

Можливість сканування залежить від того, чи мають пошукові роботи Google доступ до сайту. Його може не бути з наступних причин:

Після сканування сторінки Google намагається з’ясувати, які контент на ній розміщений. Цей етап називається індексуванням і складається з обробки та аналізу представленого на ній тексту та основних тегів та атрибутів (наприклад, вмісту в тегах <title> і атрибутах alt), зображень, відео і т. д.

Під час індексації Google намагається визначити, чи не є оброблювана сторінка дублікатом або канонічною версією будь-якої іншої сторінки. У результатах пошуку зазвичай відображається канонічна версія. Вона визначається наступним чином: спочатку ми об’єднуємо в групу (або кластер) знайдені в інтернеті сторінки з подібним контентом, а потім вибираємо серед них головну. Решта сторінок у цій групі вважаються альтернативними версіями, які можуть відображатися в інших ситуаціях, наприклад, якщо користувач виконує пошук за допомогою мобільного пристрою або шукає певну сторінку з вхідних в кластер.

Крім того, Google збирає сигнали, що стосуються канонічних сторінок та їх вмісту, і може використовувати цю інформацію на наступному етапі — при показі в результатах пошуку. До таких сигналів належать мова сторінки, її зручність, країна, для якої призначений контент тощо.

Інформація про канонічну сторінку та її кластер може зберігатися в індексі Google — великій базі даних, розміщеній на тисячах комп’ютерів. Ми не гарантуємо, що всі сторінки, оброблені алгоритмами Google, будуть проіндексовані.

Можливість індексації також залежить від вмісту сторінки та її метаданих. Проблеми з індексацією можуть виникнути з наступних причин:

Коли користувач вводить запит, система знаходить в індексі і показує в результатах пошуку найякісніші сторінки, які найбільше відповідають цьому запиту. При цьому враховуються сотні різних факторів, таких як місцезнаходження, мова, тип пристрою користувача (комп’ютер або телефон) і багато іншого. Наприклад, результати за запитом «ремонт велосипедів» будуть відрізнятися в залежності від того, чи перебуваєте ви в Парижі чи в Гонконзі.

Функції, які можуть бути задіяні на сторінці результатів пошуку, також залежать від характеру та змісту запиту. Наприклад, в більшості випадків за запитом «ремонт велосипедів» будуть показані місцеві результати і не буде результатів пошуку картинок, а за запитом «сучасний велосипед» — навпаки. З ключовими елементами інтерфейсу користувача Google Пошуку можна ознайомитися в галереї візуальних елементів.

Іноді проіндексовані сторінки не відображаються в результатах пошуку. Це може статися з наступних причин: