Технічне SEO

Robots.txt: що це і як налаштувати правильно

Оновлено: 25 вересня 2026 р.2 хв читання
Поділитися

Robots.txt — текстовий файл у кореневій директорії сайту, який містить директиви для пошукових роботів щодо того, які розділи сайту вони можуть сканувати, а які — ні. Файл розміщується за адресою domain.com/robots.txt і керує саме доступом краулерів до сканування, а не видаленням сторінок з індексу пошукової системи.

Як це працює?

Robots.txt — це рекомендаційний, а не примусовий механізм: сумлінні боти (Googlebot, Bingbot) читають файл перед скануванням сайту і дотримуються вказаних правил, але зловмисні краулери можуть його ігнорувати.

Основні директиви

Файл складається з блоків директив для конкретних User-agent:

  • User-agent — вказує, до якого бота застосовується блок правил (* — до всіх)
  • Disallow — забороняє сканування вказаного шляху
  • Allow — дозволяє сканування конкретного шляху всередині забороненої директорії
  • Sitemap — вказує повну адресу XML-карти сайту

Пріоритет правил

Правила читаються зверху вниз, і при конфлікті між Disallow та Allow пошукові системи використовують більш специфічний (довший) шлях.

Robots.txt дозволяє економити краулінговий бюджет, спрямовуючи роботів на пріоритетний контент замість службових розділів (адмінка, кошик, фільтри з параметрами, дублі сторінок пагінації).

Файл також запобігає перевантаженню сервера зайвими запитами від ботів і дає можливість одразу вказати пошуковим системам розташування Sitemap, прискорюючи виявлення нових URL.

Приклад використання

User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /*?filter=
Allow: /wp-admin/admin-ajax.php

User-agent: Googlebot-Image
Disallow: /private-images/

Sitemap: https://example.com/sitemap.xml

Поширені помилки

Disallow: / у кореневому блоці

Випадково блокує сканування всього сайту — найкритичніша помилка, яку варто перевіряти після кожного релізу.

Плутанина з meta robots noindex

Robots.txt забороняє сканування, але не гарантує видалення сторінки з індексу: якщо на неї є зовнішні посилання, вона може залишитися в індексі без опису.

Блокування CSS/JS-файлів

Заважає Googlebot коректно відрендерити сторінку та оцінити її мобільну зручність.

Директива Crawl-delay для Google

Googlebot цю директиву не підтримує, керувати швидкістю сканування слід через налаштування Search Console.

Некоректна адреса Sitemap

Відносний шлях замість повного URL або невідповідність протоколу (http замість https).

Як перевірити?

У Google Search Console у розділі Settings є звіт по robots.txt, який показує останню зчитану версію файлу та можливі помилки синтаксису. Також файл можна відкрити напряму за адресою domain.com/robots.txt і перевірити конкретний URL через інструмент перевірки URL (URL Inspection) у тій самій Search Console.

FAQ

Чи обов'язковий robots.txt для кожного сайту?

Ні, файл не є обов'язковим. За його відсутності пошукові роботи сканують сайт без обмежень, покладаючись на інші сигнали (canonical, noindex, структуру посилань).

Чи можна вказати кілька Sitemap в одному robots.txt?

Так, директиву Sitemap можна повторювати кілька разів у файлі — це стандартний спосіб вказати кілька карт сайту або файл-індекс sitemap.

Де саме має знаходитися файл robots.txt?

Виключно в кореневій директорії домену (example.com/robots.txt). Файл у підпапці (example.com/blog/robots.txt) пошукові системи ігнорують.

Чи можна закрити через robots.txt сторінку, що вже проіндексована?

Закриття сканування не видаляє сторінку з індексу автоматично — для гарантованого видалення потрібен noindex або видалення сторінки з поверненням коду 404/410.

Пов'язані терміни

  • Meta robots (noindex)Керує індексацією конкретної сторінки, на відміну від robots.txt, який керує лише скануванням.
  • Sitemap.xmlКарта сайту, адресу якої часто вказують саме в robots.txt.
  • Crawl budget (краулінговий бюджет)Ліміт сканування, яким керує robots.txt, спрямовуючи ботів на пріоритетні сторінки.
  • Duplicate content (дублі контенту)Одна з причин, чому службові й параметричні URL закривають через robots.txt.
  • Indexation (індексація)Процес, на який robots.txt впливає опосередковано, лише через заборону сканування.
  • Canonical URLІнший інструмент боротьби з дублями, що працює на рівні індексації, а не сканування.

Матеріал підготовлено командою LuchanLabs

Чи була ця стаття корисною?