Skip to content

Тестирование стоп слов. #154

Description

@audetv

Добавил стоп слова, работает с версией концептуального словаря. На данный момент список стоп слов из стандартного набора ru, en. Необходимо потестировать, определиться оставляем ли стоп слова? Добавляем ли стоп слова на обычный поиск? Будем ли пополнять список стоп слов?

Со стоп словами заметил одну особенность, которая ломает поиск по синонимам словоформам (wordforms), если встречается словосочетание в левой части, то сочетание не работает и не ищется вместе с указанным значением. И пока мне не удалось в wordforms это победить, если стоп слова включены. Есть идея потестировать с исключениями, но исключения:

Header Header Header
Case sensitive Can use special characters that are not in charset_table Underperform on huge dictionaries

Чувствительный к регистру и к ним не применяется steming - словоформы, окончания, падежи. В exceptions при необходимости надо описывать все необходимые сочетания слов и где-то видел в доках, что медленнее, чем словоформы, но это ладно, я думаю там речь шла о миллионах строк.

Правую часть надо бы тоже проверить, я просто уже не ставил справа сочетания слов по причине указанной в этом сообщении https://github.com/audetv/fct-search/issues/128#issuecomment-1523274596

Сейчас считаю, что так делать не надо, что вообще никакие фразы не надо ставить справа. Справа лучше всего на мой взгляд - сокращение, аббревиатура или одно слово. Я это понял позже, когда добавил еще с десяток слов, когда гонял разные сочетания, обучая свой естественный интеллект. Пока я еще новые данные по словарю не выгружал.

Но поставлю и посмотрю, что будет например с «мастер и маргарита».

Metadata

Metadata

Assignees

No one assigned

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions