Robots.txt — текстовий файл у кореневій директорії сайту, який містить директиви для пошукових роботів щодо того, які розділи сайту вони можуть сканувати, а які — ні. Файл розміщується за адресою domain.com/robots.txt і керує саме доступом краулерів до сканування, а не видаленням сторінок з індексу пошукової системи.
Як це працює?
Robots.txt — це рекомендаційний, а не примусовий механізм: сумлінні боти (Googlebot, Bingbot) читають файл перед скануванням сайту і дотримуються вказаних правил, але зловмисні краулери можуть його ігнорувати.
Основні директиви
Файл складається з блоків директив для конкретних User-agent:
- User-agent — вказує, до якого бота застосовується блок правил (
*— до всіх) - Disallow — забороняє сканування вказаного шляху
- Allow — дозволяє сканування конкретного шляху всередині забороненої директорії
- Sitemap — вказує повну адресу XML-карти сайту
Пріоритет правил
Правила читаються зверху вниз, і при конфлікті між Disallow та Allow пошукові системи використовують більш специфічний (довший) шлях.
Навіщо це потрібно?
Robots.txt дозволяє економити краулінговий бюджет, спрямовуючи роботів на пріоритетний контент замість службових розділів (адмінка, кошик, фільтри з параметрами, дублі сторінок пагінації).
Файл також запобігає перевантаженню сервера зайвими запитами від ботів і дає можливість одразу вказати пошуковим системам розташування Sitemap, прискорюючи виявлення нових URL.
Приклад використання
User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /*?filter=
Allow: /wp-admin/admin-ajax.php
User-agent: Googlebot-Image
Disallow: /private-images/
Sitemap: https://example.com/sitemap.xmlПоширені помилки
Disallow: / у кореневому блоці
Випадково блокує сканування всього сайту — найкритичніша помилка, яку варто перевіряти після кожного релізу.
Плутанина з meta robots noindex
Robots.txt забороняє сканування, але не гарантує видалення сторінки з індексу: якщо на неї є зовнішні посилання, вона може залишитися в індексі без опису.
Блокування CSS/JS-файлів
Заважає Googlebot коректно відрендерити сторінку та оцінити її мобільну зручність.
Директива Crawl-delay для Google
Googlebot цю директиву не підтримує, керувати швидкістю сканування слід через налаштування Search Console.
Некоректна адреса Sitemap
Відносний шлях замість повного URL або невідповідність протоколу (http замість https).
Як перевірити?
У Google Search Console у розділі Settings є звіт по robots.txt, який показує останню зчитану версію файлу та можливі помилки синтаксису. Також файл можна відкрити напряму за адресою domain.com/robots.txt і перевірити конкретний URL через інструмент перевірки URL (URL Inspection) у тій самій Search Console.
FAQ
Чи обов'язковий robots.txt для кожного сайту?
Ні, файл не є обов'язковим. За його відсутності пошукові роботи сканують сайт без обмежень, покладаючись на інші сигнали (canonical, noindex, структуру посилань).
Чи можна вказати кілька Sitemap в одному robots.txt?
Так, директиву Sitemap можна повторювати кілька разів у файлі — це стандартний спосіб вказати кілька карт сайту або файл-індекс sitemap.
Де саме має знаходитися файл robots.txt?
Виключно в кореневій директорії домену (example.com/robots.txt). Файл у підпапці (example.com/blog/robots.txt) пошукові системи ігнорують.
Чи можна закрити через robots.txt сторінку, що вже проіндексована?
Закриття сканування не видаляє сторінку з індексу автоматично — для гарантованого видалення потрібен noindex або видалення сторінки з поверненням коду 404/410.
Пов'язані терміни
- Meta robots (noindex)Керує індексацією конкретної сторінки, на відміну від robots.txt, який керує лише скануванням.
- Sitemap.xmlКарта сайту, адресу якої часто вказують саме в robots.txt.
- Crawl budget (краулінговий бюджет)Ліміт сканування, яким керує robots.txt, спрямовуючи ботів на пріоритетні сторінки.
- Duplicate content (дублі контенту)Одна з причин, чому службові й параметричні URL закривають через robots.txt.
- Indexation (індексація)Процес, на який robots.txt впливає опосередковано, лише через заборону сканування.
- Canonical URLІнший інструмент боротьби з дублями, що працює на рівні індексації, а не сканування.
Матеріал підготовлено командою LuchanLabs