← Назад в блог

SharePoint Search Service: regex-правила обхода для типов файлов

Опубликовано
1 мин чтения
--- просмотров

Задача: настроить SharePoint Search Service так, чтобы показывались только страницы следующих типов: документы (.doc/.docx/.pdf), таблицы (.xls, .xlsx) и aspx-страницы (.aspx).

Инструкция:

  1. Сначала нужно составить regex для решения задачи. В моём случае regex будет таким:
  http://<host>/.*(.aspx|.doc(x)?|.xls(x)?|.pdf)
regex-101

Рекомендую использовать очень полезный сайт https://regex101.com/ для составления и тестирования регулярных выражений.

  1. Скопируйте свой regex и перейдите в SharePoint Admin CenterServices, найдите службу поиска и зайдите в ManageCrawl Rules. Добавьте новое правило обхода с типом include (ВНИМАНИЕ: уберите обратные слэши из regex, полученного на шаге 1). Включите флажок Follow complex URLs also!
new-crawl-rule
new-crawl-rule-edit
  1. Нажмите save. На странице, где вы добавили новое правило, можно также протестировать несколько ссылок и посмотреть, попадёт ли страница под это правило. Например:
check-crawl-rule
  1. Также нужно добавить глобальное правило exclude для всех источников контента с более низким приоритетом, чем у правил include (ВНИМАНИЕ: добавьте правила include и exclude для всех источников контента). В моём случае regex правила exclude будет таким:
https://host/.*
  1. Сохраните все правила и запустите полное сканирование индекса. Проверьте обойдённые страницы в логе обхода.
  2. PROFIT!

Открыт для работы по контракту

Я доступен для работы по контракту. Если у вас есть интересная идея проекта — запишитесь на звонок через Calendly.

Записаться на 30-минутный звонок