API Нажмите для просмотра документации по параметрам POST-запросов для запуска индексирования.

Расширенное индексирование

Запустить индексирование:  Здесь можете указать начальные ссылки и запустить индексирование. "Индексирование" означает, что YaCy загрузит данные сайта, извлечёт все ссылки и загрузит содержимое по извлечённым ссылкам. Длительность индексирования зависит от заданной "глубины индексирования". A crawl can also be started using wget and the post arguments for this web page.

Сканирование

Индексирование состоит из одной или более начальных точек, ограничений и правил индексирования документов.

Начальная точка
Одна или несколько ссылок:
(должна начинаться с http:// https:// ftp:// smb:// file://)
информацияУкажите одну или несколько начальных ссылок здесь. Несколько ссылок указывайте отдельными строками. Каждая из этих ссылок загружается в начале индексирования, существующие ссылки всегда перезагружаются. Уже посещённые ссылки сортируются как повторные, если не разрешена их переиндексация.  
пустой
Из списка ссылок URL

Из карты сайта
Из файла (укажите путь
в пределах вашей локальной системы)
Атрибуты индекса
информация Результат индексирования может быть помечен с именами в кандидаты для запроса в хранилище. These tags can be selected with the GSA interface using the 'site' operator. To use this option, the 'collection_sxt'-field must be switched on in the Solr Schema
Не используйте подчеркивание «_» в названии коллекции, вместо этого используйте «-». Если это необходимо, добавьте к имени коллекции код языка, например. «топ-100».
информация Часовой пояс требуется, когда анализатор обнаруживает дату на просматриваемой веб-странице. Контент можно искать с помощью модификатора on: -, который при выполнении запроса также требуется часовой пояс. Чтобы нормализовать все заданные даты, дата сохраняется в часовом поясе UTC. Чтобы получить правильное смещение от дат без часовых поясов до UTC, здесь необходимо указать это смещение. Смещение указывается в минутах; Смещение часового пояса для местоположений к востоку от UTC должно быть отрицательным; смещения для зон к западу от UTC должны быть положительными.
Гусеничный фильтр

Ограничения работы индексатора. Фильтры применяются до загрузки страницы.

Индексирование:
информация Разрешает индексирование вэб-страниц, пока индексатор производит загрузку. По-умолчанию включено. Кэш документов без индексирования. :     :
информация Если отмечено, то индексатор будет связываться с другими узлами и использовать их для удалённого индексирования. Отключите, если желаете получать результаты индексирования локально. Только старшие и главные узлы могут инициировать или принимать удалённую индексацию. Сообщение YaCyNews будет создано для информирования всех узлов о глобальном сканировании, поэтому они могут пропустить запуск индексирования с одной и той же начальной точки.
:

Это сообщение будет отображаться в таблице других узлов в поле 'Другой узел начал индексирование'.
Глубина сканирования
информация Определяет, как часто индексатор будет идти по ссылкам (из ссылок ...) вэб-сайтов. Ноль означает, что только начальная страница будет добавлена для индексации. 2-4 это нормальное индексирование. Значения более 8 использовать не целесообразно, поскольку такая глубина индексирования предполагает примерно 25.600.000.000 страниц в индексе, возможно это весь WWW.     также все связанные не-проанализированные документы
Неограниченная глубина индексирования для ссылок совпадающих с
Максимальное число страниц домена
информация Вы можете ограничить максимальное число извлечённых и проиндексированных страниц одного домена с помощью этой опции. Вы можете совместить это ограничение с фильтром 'Авто-домен' так как это ограничение применяется ко всем доменам без указания уровня. Домены за пределами указанного уровня сортируются в любом случае. :    :
информация Вопросительный знак обычно означает динамическую страницу. Ссылки, указывающие на динамический контент. обычно не индексируются. Однако, иногда встречаются вэб-страницы со статическим содержимым, которое доступно по ссылкам, содержащим вопросительный знак. Если вы не уверены, то не включайте эту опцию, чтобы избежать замкнутого индексирования. Следующие кадры НЕ выполняются Gxxg1e, но мы делаем это по умолчанию, чтобы иметь более богатый контент. «nofollow» в метаданных роботов можно переопределить; это не влияет на выполнение файла robots.txt, который никогда не игнорируется. Принимать ссылки с ('?') в части запроса:
Учитывать html-robots-noindex:
Соблюдайте html-robots-nofollow:
Определение типа носителя
Информация для проверки типа носителя Если не загружать URL-адреса с неподдерживаемым расширением файла, это быстрее, но менее точно. Действительно, для некоторых веб-ресурсов фактический тип носителя не соответствует расширению файла URL. Вот несколько примеров:
Load Фильтр ссылок
информация The filter is a regular expression. Например, для разрешения только ссылок, содержащих слово 'science' , нужно установить фильтр '.*science.*'. Вы можете также использовать автоматическое ограничение домена при полном индексировании простого домена. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
обязательное совпадение
Запретить запуск домена
Запретить часть пути
Использовать фильтр (не должен быть пустым)
не должен совпадать
Загрузить фильтр по источнику ссылок URL
информация The filter is a regular expression. Example: to allow loading only links from pages on example.org domain, set the обязательное совпадение filter to '.*example.org.*'. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
обязательное совпадение (не должен быть пустым)
не должен совпадать
Загрузить фильтр по IP-адресам
обязательное совпадение (не должен быть пустым)
не должен совпадать
информация Индексаторы могут быть запрещены для определённых стран. При этом используется код страны, который может быть вычислен по IP-адресу сервера, на котором размещена страница. Фильтр не использует регулярные выражения. Список кодов стран перечисляется через запятую. Oграничение по странам отсутствует
Использовать фильтр  
Фильтр документов

Ограничения на получение индекса. Фильтры применяются после загрузки вэб-страницы.

Фильтр ссылок
информация The filter is a regular expression которое не должно совпадать с ссылками, если контент по этой ссылке проиндексирован. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
обязательное совпадение (не должен быть пустым)
не должен совпадать
No Индексирование: when Canonical present and Canonical != URL
Фильтр содержимого документа
(весь видимый текст, включая слитно написанные ссылки и заголовок)
обязательное совпадение (не должен быть пустым)
не должен совпадать
Фильтрация по типу носителя документа (также известному как MIME-тип)
Информация о фильтре типа носителя The filter is a regular expression что должен соответствовать типу носителя документа (также известному как тип MIME), чтобы можно было индексировать URL. Standard Media Types are described at the IANA registry. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
обязательное совпадение
не должен совпадать
Solr query filter on any active indexed field(s)
Solr информация фильтра запроса Каждый анализируемый документ проверяется по заданному запросу Solr перед добавлением в индекс. The query must be written in respect to the standard Solr query syntax.
обязательное совпадение
не должен совпадать
Контент-фильтр

Это ограничения на части документа. Фильтр будет применен после загрузки веб-страницы. Вы можете выбрать:

Оценить по умолчанию
Использовать all words in document by default until a CSS class as listed below appears; then ignore all
Игнорировать по умолчанию
По умолчанию игнорируйте все слова в документе, пока не появится класс CSS, указанный ниже, затем оцените все слова.
Фильтровать имена классов div или nav
разделенный запятыми список элементов <div> или <nav> имена классов элементов, которые следует отфильтровать /in в соответствии с переключателем выше.
Очистка перед началом индексирования
Очистить информацию из кэша событий поиска Установите этот флажок, чтобы получать свежие результаты поиска, включая недавно просканированные документы. Помните, что это также прервет любое обновление/resorting результатов поиска, запрошенное в данный момент со стороны браузера.
Без удаления
информация Если индексирование было выполнено раньше, то документ может потерять актуальность и даже быть удалён из индексируемого сайта. Переиндексации недостаточно после удаления старых файлов из поискового индекса, но может быть необходимо, так как старые файлы уже не существуют. Использование этой функции вместе с переиндексацией может занять много времени. Не удалять любые документы перед началом индексирования.
Удалить часть ссылки
Для каждого хоста в начальном списке ссылок, удалять все документы (даже в подпапках) из хоста.
Удалить только устаревшие
Считать загруженные документы назад как устаревшие и удалите их до начала сканирования.
Правила повторной проверки
Нет повторов
информация Вэб-индексатор дважды сверяет все ссылки в интернете с внутренней базой данных. Если некоторые ссылки были найдены опять, то ссылка считается повторной. В зависимости от возраста, ссылка может быть загружена повторно. Для этого включите опцию "Повторная загрузка". Никогда не загружать любую страницу, если она уже известна. Только начальная ссылка может быть загружена опять.
Перезагрузить
Считать загруженные документы назад как устаревшие и загрузите их снова. Если они моложе, их игнорируют.
Кэш документов
информация Эта опция используется по-умолчанию для прокси, но не используется для явного индексирования.
информация Политика состояний кэширования, когда кэш используется во время индексации: без кэша: never use the cache, all content from fresh internet source; если свежий кэш: use the cache if the cache exists and is fresh using the proxy-fresh rules; если кэш существует: use the cache if the cache exist. Do no check freshness. Otherwise use online source; только кэш: never go online, use all content from cache. If no cache exist, treat content as unavailable без кэша    если свежий кэш    если кэш существует    только кэш
Поведение робота
информация Потому что YaCy можно использовать в качестве замены коммерческих поисковых устройств. (например, GSA). Пользователь должен иметь возможность индексировать все вэб-страницы, представленные коммерческими платформами. Отсутствие этой опции может сильно припятствовать профессиональному использованию этой программы. Поэтому вы можете выбрать альтернативные User-Agent'ты здесь. Они будут иметь различные задержки индексирования и также идентифицировать себя с другим User-Agent'ом и соблюдать соответствующие правила роботов.