Robots.txt для Joomla 5 и 6: правильная настройка и пример

Robots.txt для Joomla 5 и 6

Файл robots.txt помогает управлять сканированием сайта поисковыми роботами: с его помощью можно закрыть от обхода служебные разделы и указать расположение XML-карт сайта. При этом robots.txt не является средством защиты сайта и не гарантирует удаление URL из поисковой выдачи.

В Joomla 5 и 6 базовая конфигурация robots.txt уже учитывает структуру CMS. В большинстве случаев ее не нужно усложнять десятками дополнительных правил — важнее не закрыть от поисковых систем полезные страницы и ресурсы, необходимые для корректного отображения сайта.

Что делает robots.txt и чего он не делает

Robots.txt — это обычный текстовый файл в корне сайта. Он сообщает поисковым роботам, какие URL или разделы разрешено или запрещено сканировать.

Важно различать сканирование и индексирование. Директива Disallow запрещает роботу запрашивать указанный путь, но сама по себе не является надежным способом удалить страницу из результатов поиска. Если URL уже известен поисковой системе из внешних или внутренних ссылок, он в некоторых случаях может остаться в индексе без полноценного описания.

Если страницу нужно именно исключить из поиска, обычно применяется noindex. При этом робот должен иметь возможность открыть страницу и увидеть эту директиву, поэтому одновременно закрывать такой URL через robots.txt не следует.

Где находится robots.txt в Joomla

Рабочий файл должен быть доступен по адресу:

https://example.com/robots.txt

То есть он размещается в корневой директории домена и должен называться именно robots.txt.

В дистрибутиве Joomla также присутствует файл robots.txt.dist. Это базовый шаблон, с которым удобно сравнивать рабочий robots.txt после обновлений CMS.

Стандартный robots.txt для Joomla 5 и 6

В современных версиях Joomla базовый robots.txt.dist содержит компактный набор правил для служебных каталогов:

User-agent: *
Disallow: /administrator/
Disallow: /api/
Disallow: /bin/
Disallow: /cache/
Disallow: /cli/
Disallow: /components/
Disallow: /includes/
Disallow: /installation/
Disallow: /language/
Disallow: /layouts/
Disallow: /libraries/
Disallow: /logs/
Disallow: /modules/
Disallow: /plugins/
Disallow: /tmp/

Эти правила закрывают от сканирования служебные каталоги Joomla. Обратите внимание, что здесь нет запрета на /media/ и /templates/. Не стоит автоматически переносить в Joomla 5 или 6 старые наборы правил из инструкций для Joomla 2.5 или 3, особенно если они блокируют CSS, JavaScript, изображения и другие ресурсы, необходимые для отображения страниц.

Основные директивы robots.txt

User-agent

Определяет, к каким поисковым роботам относятся следующие правила.

User-agent: *

Звездочка означает, что группа правил применяется ко всем роботам, которые поддерживают стандарт robots.txt.

Disallow

Запрещает сканирование указанного пути:

Disallow: /administrator/

Это не делает каталог недоступным для посетителей и не является способом защиты административной панели. Директива предназначена именно для поисковых роботов.

Allow

Разрешает сканирование пути внутри более широкого запрещенного раздела. В простом robots.txt Joomla эта директива обычно не нужна. Например, строка Allow: / избыточна, если остальные правила и так не запрещают сканирование публичной части сайта.

Sitemap

Указывает полный URL XML-карты сайта. В robots.txt можно прописать несколько строк Sitemap, что удобно для мультиязычных сайтов.

Нужен ли Crawl-delay

В старых конфигурациях robots.txt часто встречается такая строка:

Crawl-delay: 3

Для Google она не нужна: Googlebot не использует эту директиву. Поэтому добавлять ее только ради Google нет смысла.

Если поисковый робот создает слишком большую нагрузку, проблему лучше диагностировать по статистике сканирования и состоянию сервера, а не копировать универсальные значения Crawl-delay из старых инструкций.

Рабочий пример robots.txt для Joomla

На StimylRosta используется Joomla 5.4.7 и мультиязычная структура сайта. После проверки стандартного robots.txt.dist рабочий файл был приведен к базовой конфигурации Joomla и дополнен двумя XML-картами OSMap — для русской и украинской версий.

User-agent: *

Disallow: /administrator/
Disallow: /api/
Disallow: /bin/
Disallow: /cache/
Disallow: /cli/
Disallow: /components/
Disallow: /includes/
Disallow: /installation/
Disallow: /language/
Disallow: /layouts/
Disallow: /libraries/
Disallow: /logs/
Disallow: /modules/
Disallow: /plugins/
Disallow: /tmp/

Sitemap: https://stimylrosta.com.ua/component/osmap/?view=xml&id=1&format=xml
Sitemap: https://stimylrosta.com.ua/uk/component/osmap/?view=xml&id=1&format=xml

Здесь нет отдельного Allow: /, нет Crawl-delay и нет большого набора исключений для CSS, JavaScript и изображений. За основу взята стандартная структура Joomla, а специфическая часть сведена к реальным адресам Sitemap.

Как добавить Sitemap в robots.txt

Joomla сама по себе не обязана создавать карту по адресу /sitemap.xml. Если карта генерируется расширением, в robots.txt нужно указывать ее реальный рабочий URL, а не предполагаемый адрес.

На StimylRosta XML-карты формирует компонент OSMap Free. В административной панели он доступен через меню Компоненты → OSMap Free.

Переход к OSMap Free в панели управления Joomla

В списке карт OSMap для мультиязычного сайта доступны отдельные XML-представления русской и украинской версий. Именно эти реальные URL следует использовать в robots.txt и отправлять в Google Search Console.

XML-карты Russian и Українська в OSMap для Joomla

Обратите внимание на похожие пути /components/ и /component/. Стандартное правило Joomla:

Disallow: /components/

закрывает служебный каталог /components/, но не запрещает SEF-маршрут OSMap /component/osmap/, поэтому XML-карта остается доступной.

Как проверить robots.txt и Sitemap

После изменения robots.txt сначала откройте его непосредственно в браузере по адресу https://ваш-домен/robots.txt. Проверьте, что файл отдается без ошибки и содержит ожидаемые правила.

XML-карты следует добавить в раздел Файлы Sitemap Google Search Console. Если сайт мультиязычный и используются отдельные карты для языков, их удобно отправить по отдельности.

Проверка двух XML-карт сайта в Google Search Console

На момент обновления этой инструкции обе XML-карты StimylRosta успешно обрабатываются Google Search Console: отдельно для русской и украинской версий сайта.

Типичные ошибки при настройке robots.txt в Joomla

  • Блокировать страницы, которые нужно исключить из индекса. Для этого robots.txt подходит не всегда; чаще требуется noindex.
  • Закрывать CSS и JavaScript без необходимости. Это может мешать поисковому роботу корректно отрисовывать и анализировать страницу.
  • Копировать robots.txt от старой версии Joomla. Структура CMS меняется, поэтому лучше сверяться с актуальным robots.txt.dist.
  • Указывать несуществующий Sitemap. Перед добавлением URL в robots.txt обязательно откройте XML-карту в браузере.
  • Использовать Crawl-delay как универсальное средство. Для Google эта директива не нужна.
  • Считать robots.txt средством безопасности. Он не запрещает пользователю открыть URL и не заменяет серверную защиту.
  • Закрыть нужный URL через Disallow и одновременно установить на нем noindex. Если робот не может открыть страницу, он не увидит noindex.

Итоги

Для Joomla 5 и 6 лучше начинать не с огромного списка SEO-директив, а со стандартного robots.txt Joomla. Базовый файл уже закрывает основные служебные каталоги, а индивидуальные изменения следует добавлять только тогда, когда для них есть конкретная причина.

Для обычного Joomla-сайта достаточно проверить актуальность правил, не блокировать важные ресурсы и добавить реальные URL XML-карт сайта. После изменения конфигурации robots.txt и Sitemap следует проверить через браузер и Google Search Console.

Добавить комментарий

Нашли ошибку или неточность?

Выделите фрагмент текста и нажмите Ctrl + Enter. Также можно воспользоваться кнопкой ниже.

Нашли ошибку или неточность?

Выделенный фрагмент будет добавлен в сообщение автоматически. При необходимости добавьте пояснение.

Форма защищена от автоматических отправок

Данные используются только для проверки и исправления материала.