Публікуючи документи та зображення в Інтернеті, ви можете випадково залишити в них інформацію, не призначену для широкої аудиторії. Наприклад, в документах деяких форматів зберігаються дані, які не видно при відкритті файлу, але зчитуються пошуковими системами.
Пошукові системи індексують загальнодоступні матеріали, розміщені в Інтернеті, включаючи зображення, тому контент, який не був повністю видалений, може бути присутнім у результатах пошуку. Технології доступності (наприклад, програми для читання з екрана) та системи оптичного розпізнавання символів або інших об’єктів дозволяють знаходити вміст, який ви вважали прихованим.
Текст може бути невидимим для звичайних користувачів, якщо закрити його зображенням, вибрати дуже дрібний шрифт, зробити шрифт однаковим з фоном кольору тощо. Однак за допомогою таких прийомів неможливо приховати контент від пошукових систем, які все одно його проіндексують і відобразять у результатах пошуку.
Крім того, документи деяких форматів містять інформацію, наявність якої неочевидна. Наприклад, історія змін дозволяє побачити видалений або змінений текст. Іноді в документах доступні вихідні версії зображень, які були обрізані або відредаговані з метою видалення певної інформації. Деякі файли також містять метадані, які не видно під час перегляду документа, але можуть містити імена користувачів, які відкривали або змінювали його.
Така інформація часто зберігається навіть при експорті або конвертації документа в інші формати. Якщо ви хочете видалити дані з файлу, це потрібно зробити до того, як файл буде опубліковано в Інтернеті.
Нижче наведено рекомендації щодо видалення з документів інформації, яку не потрібно індексувати та показувати в Пошуку Google.
Додавайте зображення до документа вже після їх редагування та експорту
Пошук Google індексує зображення, виявлені не тільки на веб-сторінках, але й у документах різних форматів. При цьому користувачі часто редагують вбудовані зображення безпосередньо в документі. Видалення інформації з зображень у цьому випадку може виявитися марним, якщо зображення буде проіндексовано окремо від документа. Тому краще спочатку видалити інформацію з графічних файлів, а вже потім кудись їх вбудовувати. Ось кілька рекомендацій:
- Виріжте фрагменти зображення з небажаною інформацією перед тим, як вбудовувати його в документ. Деякі програми для роботи з текстом або слайдами зберігають в документах вихідні версії зображень, крім відредагованих, і ці версії залишаються доступними після публікації контенту. Перевірте наявність такої особливості за довідковими матеріалами, які відносяться до потрібного додатка.
- Повністю видаліть або приховуйте частини зображення, які не призначені для широкої аудиторії, оскільки текст, що міститься в них, може бути прочитаний системами оптичного розпізнавання символів і проіндексований.
- Видаліть зайві метадані.
Після виконання рекомендацій з цього документа експортуйте або збережіть зображення в растровому форматі, наприклад PNG або WEBP, щоб видалені та приховані фрагменти не потрапили в опублікований документ.
Перенесіть вже відредагований текст у файл, призначений для публікації
Перш ніж створити загальнодоступну версію документа, видаліть з тексту всі непотрібні фрагменти. Перенесіть відредагований текст у файл, формат якого не передбачає збереження історії змін з попереднього файлу. Більш детальні рекомендації:
- Використовуйте відповідні засоби для видалення інформації. Наприклад, не намагайтеся закрити текст чорними прямокутниками, оскільки в результаті він може залишатися доступним у опублікованому документі.
- Уважно перевірте метадані в опублікованому файлі.
- Дотримуйтесь порад щодо видалення тексту з документів вибраного формату (наприклад, PDF).
- Зверніть увагу на інформацію в URL або назві файлу. Навіть якщо ви за допомогою файлу robots.txt заборонили пошуковим роботам сканувати деякі сторінки сайту, їх URL все одно можуть бути додані до пошукового індексу (без контенту). Хешуйте параметри URL, щоб приховати адреси електронної пошти та імена, що містяться в них.
- Для обмеження доступу до видалених матеріалів можна використовувати автентифікацію. Щоб заблокувати індексацію сторінки входу, яка буде відображатися замість таких матеріалів, додайте на неї метатег robots з директивою
noindex. - Перед публікацією переконайтеся, що ви підтвердили право власності на сайт у Google Search Console. Таке підтвердження дозволяє при необхідності швидко видалити небажану інформацію.
Що можна зробити, якщо небажана інформація потрапила в індекс Пошуку Google
- Видаліть опублікований документ з сайту або ресурсу, на якому ви його розмістили.
- Якщо ви підтвердили право власності на сайт, скористайтеся інструментом видалення URL, щоб виключити документ з Пошуку Google. Щоб видалити кілька документів, вкажіть загальну початкову частину їх URL (префікс). URL-адреси сайтів, на які підтверджено право власності, зазвичай видаляються менш ніж за добу. Після цього ті самі документи більше не відображаються в результатах пошуку за запитами, що містять видалені фрагменти тексту.
- Розмістіть остаточну версію документа за іншою URL-адресою. Тоді наступного разу буде проіндексована нова версія документа, а не стара (оскільки повторне сканування URL і їх оновлення в пошуковому індексі зазвичай займає деякий час). Змініть всі посилання на документ відповідно до нової URL-адреси.
- Попросіть представників інших сайтів видалити розміщені у них попередні версії ваших документів. Запропонуйте їм скористатися інструментом видалення URL в обліковому записі Search Console. Ви також можете подати в Google запит на оновлення результатів пошуку за допомогою інструменту видалення застарілого контенту.
- Зачекайте, поки запити на видалення URL перестануть бути дійсними (це відбувається після оновлення URL в індексі Google або через шість місяців).