
On One Approach to Building An Information System for Processing Text Information Based on Semantic Groups
Author(s) -
S V Mochenov,
R. R. Akhmetgaleev
Publication year - 2019
Publication title -
intellektualʹnye sistemy v proizvodstve
Language(s) - Russian
Resource type - Journals
eISSN - 2410-9304
pISSN - 1813-7911
DOI - 10.22213/2410-9304-2019-2-58-64
Subject(s) - computer science , information processing , information retrieval , information system , natural language processing , psychology , engineering , neuroscience , electrical engineering
В статье рассматривается подход к анализу текста, основанный на построении и использовании баз данных частей речи и других членов предложения. Соответствующие базы данных для русскоязычных текстов формируются на основе экспертных оценок, получаемых в процессе анализа текстовых массивов с предложениями различной сложности. Актуальность работы связана с проблемой автоматизации поиска и выделения полезной для пользователя информации, необходимой для решения конкретных задач. В процессе анализа формируются различные массивы индексов. Осуществляется: выделение различных сочетаний слов предложения, сравнение их с допустимыми комбинациями из базы данных (формирование смысловых групп), структуризация предложений и формирование иерархической системы смысловых групп. На примерах показаны развернутые результаты работы программного комплекса. При анализе основных частей предложения (темы и ремы) используется одинаковый набор функциональных модулей. Представленные результаты показали принципиальную возможность создания подобной информационной системы анализа текстовой информации на основе изложенного подхода. Разработанный программный комплекс при выделении СГ анализирует комбинации слов, а не отдельные предлоги, союзы и другие вспомогательные элементы предложений. За счет разделения на СГ с использованием экспертных баз данных обеспечивается более полное сохранение смысловой составляющей текста. В дальнейшем предполагается расширение сферы применения программного комплекса для выделения полезной для пользователя информации, сокращения ее объема, уменьшения времени, затрачиваемого на поиск.