Системи автоматичного ранжування результатів Google при кожному запиті сортують сотні мільярдів веб-сторінок і різного контенту в індексі Пошуку Google. Вони враховують багато факторів і сигналів і за частки секунди знаходять найбільш релевантні і корисні результати. У цій статті ми розповідаємо про найважливіші алгоритми сортування. Деякі з них є частиною основних систем ранжування, які підбирають результати пошуку у відповідь на запити. Тут же ви знайдете описи алгоритмів, які використовуються для ранжування за особливими правилами.
Наші системи ранжування працюють на рівні сторінки. Вони оцінюють, наскільки корисна для користувачів кожна сторінка окремо, і застосовують при цьому найрізноманітніші фактори ранжування та системи. Сигнали та класифікатори, що стосуються всіх сторінок сайту, також допомагають нам аналізувати сторінки. Наявність хороших сигналів такого типу не гарантує, що весь контент з сайту буде відображатися на високих позиціях, а наявність поганих не означає, що контент буде з’являтися на низьких позиціях.
Ми постійно вдосконалюємо алгоритми сортування, ретельно тестуючи та оцінюючи оновлення перед впровадженням, а також повідомляємо користувачів про зміни, які можуть бути їм корисні.
Системи ранжування доповнюють інші інструменти Google Search і допомагають систематизувати всю наявну в світі інформацію, роблячи її доступною і зручною для використання. Детальніше про це розказано на сайті Принципи роботи Google Пошуку.
БЕРТ
BERT — система Google на основі штучного інтелекту, яка допомагає співвідносити комбінації слів з різними контекстами та намірами.
Системи інформування в кризових ситуаціях
Компанія Google розробила системи для оперативного надання корисної інформації в кризові періоди, до яких відносяться особистісні кризи, стихійні лиха та інші масштабні кризові ситуації.
- Особистісні кризи. Наші системи здатні визначати, коли користувачі шукають інформацію, пов’язану з кризовою ситуацією в особистому житті: суїцидальними думками, зґвалтуванням, ковтанням отруйних речовин, насильством за ознакою статі або виникненням наркотичної залежності. У результатах пошуку при цьому з’являться телефони довіри та матеріали перевірених організацій. Детальніше про результати Пошуку Google за запитами, пов’язаними з особистісними кризами…
- Екстрені сповіщення. Під час стихійних лих або широкомасштабних криз система екстрених оповіщень відображатиме інформацію, опубліковану місцевими, національними та міжнародними органами державної влади. Приклади такої інформації: номери телефонів та адреси сайтів для екстреного зв’язку, карти, переклади важливих фраз, способи відправки пожертв тощо. Докладніше про алгоритм екстрених сповіщень та його роль у роботі системи Google, яка використовується під час стихійних лих…
Системи дедуплікації
Пошук за індексом Google може повернути тисячі або навіть мільйони відповідних веб-сторінок. Деякі з них можуть бути дуже схожі між собою. У таких випадках системи Google показують лише найбільш релевантні результати без непотрібних дублікатів. Детальніше про дедуплікацію та способи перегляду виключених результатів…
Дедуплікація застосовується і до виділених описів. Якщо на будь-якій веб-сторінці є інформація, яка буде винесена у виділений опис, вона не буде повторюватися на першій сторінці результатів. Це допомагає впорядкувати результати та спрощує користувачам пошук релевантної інформації.
Система контролю точної відповідності доменів
Для систем ранжування Google слова в доменних іменах — це один з багатьох критеріїв релевантності контенту. Наша система контролю точної відповідності доменів допоможе відфільтрувати контент, розміщений у доменах, які були спеціально адаптовані під відповідність певним запитам. Наприклад, доменне ім’я «кафе-з-кращими-бізнес-ланчами» явно вказує на прагнення власника підняти сторінку в список найкращих результатів. Система контролю Google блокує такі спроби знайти лазівки.
Системи ранжування за актуальністю
Щоб виправдати очікування користувачів у всіх випадках, коли запит передбачає отримання останніх новин, компанія Google використовує кілька систем для відстеження актуальності результатів. Наприклад, при пошуку інформації про нещодавно випущений фільм більшість зазвичай очікує побачити не старі статті про початок зйомок, а свіжі рецензії. Запит «землетрус» може повернути сторінки з правилами поведінки під час землетрусу. Але якщо десь у світі нещодавно стався землетрус, в результатах можуть з’явитися новини про це.
Системи аналізу посилань і PageRank
У нас є кілька систем для відстеження посилань, які пов’язують сторінки між собою. Ці системи допомагають визначити смисловий зміст сторінок і підібрати результати, які найбільше відповідають введеному запиту. До таких систем відноситься і PageRank, один з основних алгоритмів ранжування і ровесник пошукової системи Google. Детальніше про нього розповідається в оригінальній науковій статті та на сторінці з описом патенту. З тих пір алгоритм PageRank сильно змінився, але він все ще залишається однією з основних систем ранжування Google.
Системи пошуку місцевих новин
У Google також є системи, які допомагають знаходити місцеві джерела новин, наприклад, для каруселей «Головні новини» або «Місцеві новини».
МУМ
MUM (Multitask Unified Model) — система на основі штучного інтелекту, яка вміє розпізнавати складні запити та пропонувати відповіді на них. У Пошуку Google вона використовується не для ранжування результатів за загальними запитами, а для більш вузьких цілей, наприклад, для покращення пошукової видачі про вакцину проти вірусу COVID-19 або виділених описів.
Алгоритм нейронних відповідностей
Алгоритм нейронних відповідностей розпізнає в запитах концепції і підбирає для них відповідні сторінки. Він заснований на принципах штучного інтелекту.
Системи визначення унікального контенту
Компанія Google використовує системи, завдяки яким в результатах пошуку перші місця займає унікальний контент, в тому числі оригінальні репортажі, а не матеріали з цитатами з них. Наприклад, ми впровадили підтримку канонічної розмітки, щоб авторам було легше знайти основну сторінку серед її дублікатів на різних ресурсах.
Системи зниження рейтингу через видалення контенту
Якщо контент певного типу порушує правила Google, його можна видалити. Якщо щодо будь-якого сайту надходить значна кількість запитів на видалення контенту, це говорить нам про те, що потрібно поліпшити пошукові алгоритми. Крім усього іншого, це стосується запитів наступних категорій:
- Видалення на юридичних підставах: Якщо ми отримуємо значну кількість запитів на видалення контенту у зв’язку з порушенням авторських прав щодо певного сайту, ми на підставі цього можемо знизити позиції інших його матеріалів у результатах пошуку Google. Це робиться для того, щоб контент, який порушує авторські права, зустрічався користувачами рідше, ніж унікальний контент. Ми знижуємо позиції і при наявності скарг іншого роду, наприклад на наклеп або підроблені товари, а також при отриманні запиту на видалення контенту за рішенням суду. Виявивши контент, що представляє неповнолітніх у сексуальному контексті, ми завжди видаляємо його, а також знижуємо позиції сайтів, на яких досить багато такого контенту.
- Видалення персональних даних: Якщо щодо будь-якого сайту, який вимагає плату за видалення даних, надходить значна кількість запитів на видалення персональних даних, ми знижуємо позиції інших його матеріалів у результатах пошуку Google. Ми також шукаємо ознаки подібної поведінки на інших сайтах. Виявивши ці ознаки, ми знижуємо позиції таких сайтів. Крім того, ми можемо знижувати позиції сайтів, щодо яких надходить значна кількість запитів на видалення контенту, розміщеного з метою доксингу, особистого сексуального контенту, який був створений або розповсюджений без дозволу, або фіктивного контенту сексуального характеру, який був опублікований без дозволу.
Система ранжування фрагментів
Система ранжування фрагментів — це інтелектуальний алгоритм, який призначений для аналізу окремих розділів (або «фрагментів») веб-сторінки, щоб оцінити її релевантність щодо пошукового запиту.
Система RankBrain
RankBrain — це система на основі штучного інтелекту, яка відповідає за зіставлення слів з поняттями. Це означає, що навіть якщо на сайті з релевантним контентом не буде слів з пошукового запиту в точній формі, він все одно займе високу позицію, оскільки буде розпізнано зв’язок з іншими словами і поняттями.
Системи ранжування за достовірністю інформації
Пошукова система Google об’єднує безліч алгоритмів, завдяки яким в результати потрапляють найбільш надійні матеріали. Цього вдається досягти, зокрема, за рахунок вибору надійних сторінок, зниження позицій низькоякісного контенту та визначення пріоритетів високоякісної журналістики. Коли достовірна інформація відсутня, до результатів автоматично додаються попередження про вміст. Це може статися, якщо користувача цікавлять теми, які викликають активне обговорення, або якщо ми не впевнені в якості результатів пошуку. Ці попередження містять поради, як покращити запит, щоб отримати більш корисні результати. Дізнайтеся більше про те, як отримати надійні результати в Пошуку Google…
Система відгуків
Система ранжування відгуків необхідна для того, щоб перевагу в результатах пошуку Google отримували більш якісні відгуки, які підготовлені експертами або компетентними користувачами і містять детальний аналіз або оригінальне дослідження.
Система забезпечення різноманітності сайтів
Наша система забезпечення різноманітності сайтів, як правило, не дозволяє показувати в списку популярних результатів більше двох веб-сторінок з одного і того ж сайту, щоб всі лідируючі позиції не були зайняті одним ресурсом. Винятки можливі, якщо наші алгоритми оцінюють такі сторінки як особливо релевантні для певного пошукового запиту. Піддомени в більшості випадків вважаються частиною кореневого домену. Наприклад, описи з рівня субдомену (subdomain.example.com) і кореневого домену (example.com) вважатимуться такими, що відносяться до одного і того ж сайту. Але з точки зору різноманітності відповідні для запиту піддомени можуть в деяких випадках розглядатися як окремі сайти.
Системи виявлення веб-спаму
Ніхто не хоче бачити спам у папці вхідних електронних листів, тому спам-фільтри ніколи не бувають зайвими. У сервісі «Google Пошук» існує схожа проблема — інтернет переповнений спамом, який, якщо з ним не боротися, може витіснити дійсно корисні та релевантні результати. Для блокування контенту та дій, які порушують наші правила щодо веб-спаму, ми використовуємо різні системи виявлення, включаючи SpamBrain. Вони постійно оновлюються, щоб користувачі Google завжди були захищені від загрози спаму, що розвивається.
Системи, підтримка яких була припинена
Описи наступних систем наведені для того, щоб зберегти інформацію про них в архівах Google. В даний час вони стали частиною алгоритмів, які прийшли на їх зміну, або основних систем ранжування Google.
Система ранжування за якістю контенту
Ця система була представлена в 2022 році і в той час називалася новим алгоритмом визначення корисного контенту. Її призначення полягало в тому, щоб допомогти користувачам отримувати в результатах пошуку оригінальний і корисний контент, який був створений людьми і для людей, а не матеріали, спрямовані в першу чергу на залучення трафіку з пошукової системи. А в березні 2024 року ми включили її до складу наших основних алгоритмів ранжування, які спираються на широкий спектр сигналів і інструментів, щоб підібрати найбільш підходящі результати для користувачів.
Колбрі
Це було велике оновлення для систем ранжування, випущене в серпні 2013 року. Це стало важливим етапом у їхньому розвитку, але згодом його змінили більш досконалі алгоритми.
Система Panda
Ця система була створена для того, щоб у результатах пошуку з’являвся високоякісний та унікальний контент. Ми випустили її в 2011 році під назвою Panda, а в 2015 році інтегрували в основні системи ранжування Google.
Система Penguin
Ця система призначалася для боротьби зі спамом посилань. Вона була анонсована і випущена в 2012 році під назвою «оновлення Penguin», а через чотири роки інтегрована в основні системи ранжування Google.