21314

USING CONTEXT DATA IN INFORMATION RETRIEVAL

Научная статья

Информатика, кибернетика и программирование

Proposed approach can be easily included in current search engines. This approach is not a complete alternative to classic methods applied in popular search engines, but it can be treated as an additional improvement that provides more efficient way in positioning on relevant document.

Английский

2015-01-19

21 KB

10 чел.

Ivan Zagidulin

USING CONTEXT DATA IN INFORMATION RETRIEVAL

Department of Informatics and Processes Management, Ural State University, Ekaterinburg, Russia

 1. Introduction

The major issue of current web search engines is to provide the most relevant documents to the users. Statistics show that the vast majority of search requests consists of one or two words. Clearly there cannot be a reliable answer has given to the question that has lack of information about what user need. Words of the shot request can be included in documents of different domains. And the user has to look through a lot of irrelevant documents or send new request with additional words.

So, current interface of web search engines assumes that the user repeatedly will adjust his request. It is supposed that usage of surrounding context of the request can solves this problem. This paper proposes a new interface web search engines different from command line. Base on this interface search engine will be able to receive current browsing context and use it in search results ranking algorithm. Developed context-based techniques allow to define the domain of the request and retrieve documents in which search phrase has certain meaning.

Proposed approach can be easily included in current search engines. This approach is not a complete alternative to classic methods applied in popular search engines, but it can be treated as an additional improvement that provides more efficient way in positioning on relevant document.

 2. Context-based search

An idea of out technique is to provide for the IR-system both search request and context, in which the user encountered the information of interest. IR-system finds the documents containing the request, and the ranking function assigns the highest priority for the text closest to the context. This approach does not depend on the way of context's gathering and measure used for  documents proximity calculation.

In out paper we assume that context is structure, containing user's current working environment data, that obtained without user participation and provided for IR-system along with request. Words «current working environment» in this definition means text, surrounding searched terms. Context may also contain web-browsing history, information about most visited pages, system platform and browser. Notice that this information can be gathered by search client automatically so that the user shouldn't «specify the context» himself (like choosing from given categories or using special query syntax).

Thus, the idea of applying query context in information search may have many implementations and can be embedded as plug-in in existing search engines.

Different disambiguation techniques may be used in our approach but algorithms without supervisor are more appropriate in this case. First, modern IR-systems have huge collections of documents and a lot of routing work is needed to mark them. Second, the structure of inverted search index are suitable for unsupervised methods. In search index each term has a corresponding list of documents, containing it. We only must group this documents in clusters using appropriate metric for implementation of our technique. Variable parameters of such approach are proximity measure, text representation and clustering algorithm. Extending documents corpus new texts may be added to existing clusters or set a new group, depending on value of measure.

System based on clustering of text collection may have following architecture:

  1.  Firstly, the construction of inverted search index from plain text corpus take place. For each new term we find all documents, containing it, and run clustering algorithm. As result each term will have corresponding set of clusters (set of tokens). Thus we construct modified search index (homonym thesaurus) in which a set of tokens corresponds for each term and a set of documents corresponds for each token.
  2.  We can easily find relevant documents using constructed homonym thesaurus. Request to search system in our approach consists of two parts: the query and its context. We will have to find the cluster, nearest to the query context.

 3. Experiments and conclusion

To test our ideas, we implemented experimental prototype of system, building inverse search index from text collection. Each document was represented as a vector of term weights. The nearer term to the requested word, the greater value it obtained. We used hierarchical algorithms for clustering documents. Distance between clusters was equal to the maximum distance between any two vectors from different clusters.

After learning phase clusters was represented by their centroids. This representation requires less of memory and provides fast distance calculation. Distance between context vector and cluster was found as distance to centroid of this cluster.

Experiments show that using our technique documents with close contexts are retrieved on requests, especially in case of collocations, idioms and phrasal verbs. The idea of using context for request disambiguation can be naturally added to existing search engines to bring more effectiveness.


 

А также другие работы, которые могут Вас заинтересовать

72201. Россия в 18 веке 102 KB
  18 век – это время расцвета, а затем и кризиса феодальной системы. В Европе наступает период заката абсолютизма. В России в это время феодализм переживает период апогея, но с конца века усиливается кризис феодальной системы, однако в отличие от Запада кризис феодализма сопровождался не сужением...
72202. Россия в 19 веке 57.5 KB
  В основе социальной структуры лежал сословный принцип. Дворянство еще более увеличило свои привилегии, однако к середине 19 века наблюдался явный кризис помещичье-крепостнического хозяйства. В центре общественной мысли стояли два важнейших вопроса: судьба крестьян и самодержавия.
72203. Русь в 16-17 веках 69 KB
  16 век – это сложный противоречивый период. В его центре такие события, как правление Ивана IV, постоянные войны с Польшей, Швецией, Ливонией. Происходит расширение территории страны. Были присоединены Казань, Астрахань, Сибирское ханство. На рубеже 16-17 веков Россию потрясла Смута.
72204. История управления качеством 61.5 KB
  Характерные особенности: Жесткий контроль качества изготовления продукции с использованием методов математической статистики; Внимание к процессу планирования по объемным и качественным показателям административный контроль за выполнением планов; совершенствование управления фирмой в целом.
72205. ПРЕДМЕТ АКУШЕРСТВА И ГИНЕКОЛОГИИ. ОСНОВНЫЕ ИСТОРИЧЕСКИЕ ЭТАПЫ РАЗВИТИЯ АКУШЕРСКОЙ НАУКИ. ОРГАНИЗАЦИЯ АКУШЕРСКО-ГИНЕКОЛОГИЧЕСКОЙ ПОМОЩИ 203.5 KB
  В современном представлении акушерство и гинекологию следует рассматривать как науку о женщине. Наш предмет изучает физиологию и патологию женской половой системы, состояние и деятельность женских половых органов в нормальных и патологических условиях...
72206. История рекламы в России 39 KB
  Российская реклама в современном её понимании началась примерно в 1988-89г. И до 1991-92г. Это был хаотично образующийся рынок. Рынок рекламы как экономическое понятие возник в России в 1992г. Примерно к 1993г. Стали появляться подразделения, специализирующиеся в разных областях.
72207. Виды соединений. Резьбовые соединения. Геометрические параметры резьбы. Материалы резьбовых деталей, допускаемые напряжения 2.32 MB
  Детали, составляющие машину, связаны между собой. Связи могут быть подвижными (шарниры, подшипники, зацепления и др.) и неподвижными. Неподвижные связи называют соединениями. Соединения подразделяются на разъемные и неразъемные. Разъемные соединения позволяют разъединять детали без их повреждения.
72208. Порядок рассмотрения дел о налоговых и административных правонарушениях 156.5 KB
  Дела о налоговых правонарушениях выявленных в ходе иных мероприятий налогового контроля рассматриваются в порядке предусмотренном ст. При выявлении нарушений в ходе проведения налоговой проверки акт и материалы а также представленные проверяемым лицом письменные возражения по акту...
72209. Обжалование решения налогового органа, вынесенного по результатам налоговой проверки 103.5 KB
  Каждое лицо имеет право обжаловать акты налоговых органов ненормативного характера, действия или бездействие их должностных лиц, если, по мнению этого лица, такие акты, действия или бездействие нарушают его права. Нормативные правовые акты налоговых органов могут быть обжалованы в порядке...