1.6.4. ИНФОРМАЦИОННО-ПОИСКОВЫЕ ЯЗЫКИ, СЛОВАРНЫЕ СРЕДСТВА
ИНФОРМАЦИОННО-ПОИСКОВЫЙ ЯЗЫК (ИПЯ )
[information retrieval language, indexing language] -
Искусственный язык, предназначенный для формализованного описания смыслового содержания документов, данных, отдельных понятий или терминов и обеспечения последующего их поиска в информационно-поисковых массивах.
Формализация лексики и создание различных ИПЯ вызвано необходимостью устранения "избыточности" и "недостаточности" естественного языка для целей информационного поиска, а также ликвидации присутствующий в нем синонимии и омонимии (см. ниже) для реализации "однозначности" информационного поиска.
Различают языки описания (декларативные языки ), которые в свою очередь подразделяются на языки предкоординатные (классификационные) и посткоординатные (координатные), а также - процедурные языки (языки запросов и манипулирования данными ). Подробнее см.:[36 - 38].
Каждый тип языковых средств включает в себя: алфавит и микро синтаксис (графические средства представления данных), лексику с парадигматикой (отражаемых словарями) и синтаксис, который для языков описания может быть представлен в виде наборов форматов.
По области или по сфере применения информационно-поисковых языков можно выделить:
1. Коммуникативные (общесистемные) ИПЯ - предназначенные для обеспечения взаимодействия между различными (информационными, библиотечными и др.) системами (в т.ч. распределенными по государственной, ведомственной или территориальной принадлежности);
2. Локальные (внутренние) ИПЯ - предназначенные для использования в рамках отдельной системы;
3. Внешние ИПЯ - используемые в других системах и предназначенные для взаимодействия только с ними.
ПРЕДКООРДИНАТНЫЕ ИПЯ (ИПЯ КЛАССИФИКАЦИОННОГО ТИПА )
[pre-coordination language] -
ИПЯ , построенные на принципах предкоординации (см. ниже). Эти языки представлены известными классификационными системами вида: УДК, МКИ, ГРНТИ, ББК, ТБК и др.
Предкоординация [pre-coordinatin] - Построение словарного состава ИПЯ (до его использования при индексировании), которое характеризуется применением словосочетаний и фраз, выражающих сложные понятия.
ПОСТКООРДИНАТНЫЕ ИПЯ (ИПЯ ДЕСКРИПТОРНОГО ТИПА )
[post-coordination language] -
ИПЯ, построенные на принципах посткоординации (см. ниже). Эти языки представлены различного вида “тезаурусами ”, а также “ключевыми словами ".
Посткоординация [post-coordination] - Построение словарного состава путем разделения сложных понятий на составные элементы и последующего объединения полученных лексических единиц ИПЯ при индексировании документов вводимых в информационно-поисковые массивы и запросов путем использования логических операторов и других средств, представляющих его синтаксис .
Термины, связанные с посткоординатными ИПЯ:
- Координатный (посткоординатный, дескрипторный) ИПЯ [post-coordination language, descriptor language] - ИПЯ, построенный на принципах посткоординации, лексическими единицами которого являются дескрипторы . Основными словарными средствами, реализующими эти языки являются тезаурусы , представляющие так называемую нормированную лексику, и ключевые слова - ненормированную лексику .
- Объектно-признаковый ИПЯ - Вид координатного ИПЯ , предназначенный для представления объектографических (фактографических) данных.
- Дескриптор [descriptor] - Лексическая единица дескрипторного ИПЯ, которая при индексировании выбирается не из обрабатываемого текстового или другого материала, а из специального словаря. Дескрипторы отличаются от ключевых слов тем, что им придана смысловая однозначность.
- Ключевое слово, недискриптор [keyword, non-descriptor] - Лексическая единица, выбираемая из обрабатываемого (индексируемого) текста (вводимых в систему документов и запросов на поиск) а не словаря. Однако “ключевые слова” (точнее было бы их назвать - “ключевыми терминами”) составляются на основании специальных правил и построенных на их основе технологических инструкций, обеспечивающих однозначность их понимания и применения.
СЛОВАРЬ [dictionary] -
1. Упорядоченный перечень слов, словосочетаний, терминов, символических имен или наименований, знаков с указанием их значений или толкований или без них. Важным требованием к словарям, используемым в автоматизированнных системах является устранение “синонимии” и “омонимии ” для обеспечения “точности” и “полноты ” поиска;
2. В автоматизированных информационных системах “словарь” это структура данных, обеспечивающая доступ к БД и отдельным записям по их текстовому имени.
Виды словарей:
- Машинный словарь - Словарь, находящийся в памяти ЭВМ. Используется для автоматического и/или контролируемого индексирования .
- Рубрикатор [rubricator] - Разновидность словаря, содержанием которого является перечень предметных рубрик и их классификационных индексов. Одним из наиболее распространенным видов рубрикаторов, являются иерархические тематические рубрикато-ры (УДК, ГРНТИ, ББК, МКИ и др .).
- Тезаурус (информационно-поисковый) [thesaurus normative, thesaurus] -
1. Словарь, который содержит разрешенные для использования при индексировании лексические единицы ИПЯ, а также парадигматические отношения между этими лексическими единицами. Тезаурусы различают по принципу их организации (например, - алфавитный, иерархический, фасетный), способу использования (например, - машинный тезаурус , т.е. находящийся в памяти ЭВМ), тематике и полноте охвата его лексикой определенной предметной области (например, - базовый тезаурус, рабочий тезаурус, многоотраслевой тезаурус, узко тематический тезаурус и т.п). В некоторых автоматизированных информационных системах словари, выполняющие функции тезауруса, носят иные названия, например, - “Базовый терминологический словарь (БТС)” ВИМИ.
2. Словарь синонимов (см. ниже - “Синонимия ”), в прогаммном обеспечении: файл с синонимами, записанными на диске совместно с программой, использующей этот файл [35].
Понятия и термины, связанные со словарями:
- Предметная рубрика [subject heading] - Краткое наименование классификационного признака однородных объектов (узко-) библиографической или (широко) информационной деятельности.
- Классификационный индекс [classification number] - Условное обозначение цифровыми или буквенно-цифровыми символами деления какой-либо системы классификации.
- Синонимия [synonymy] - Совпадение или близость значений различных слов (синонимов [synonyms]). Разновидностью синонимии является т.н. логическая синонимия [logical synonymy], относящаяся к различным словосочетаниям, отражающим одни и те же понятия. Например, словосочетания "мой любимый город", "место, где я вырос" и т.п. могут означать понятие, выражаемое названием конкретного города, скажем, - Севастополя .
- Омонимия [homonymy] - Внешнее совпадение слов одинаковых по написанию и звучанию (омонимов [homonyms]) , но выражающих различные понятия. Наличие в естественном языке омонимов также как логических синонимов (см. выше) характеризует его недостаточность для выполнения эффективного поиска необходимых документов и данных.
- Лексическая единица (ЛЕ) - Обозначение отдельного понятия в естественном или специально созданном искусственном языке, например ИПЯ. лексическая единица может иметь вид слова, устойчивого словосочетания, аббревиатуры, символьного кода и т.п.
ГРАММАТИКА [gramma] -
Система правил построения и описания естественного или искусственного языка, в том числе правил словообразования и построения словосочетаний (см. синтаксис) ИПЯ.
С грамматикой связаны следующие термины:
- Позиционная грамматика [position grammar] - способ фиксации характера смысловых отношений между лексическими единицами индексируемого материала путем размещения этих единиц в соответствующей последовательности):
- Мешочная грамматика (расстановка дескрипторов или ключевых слов независимо от их значения или положения соответствующих им понятий в индексируемом тексте).
- Синтаксис [syntax] - Раздел грамматики , изучающий способы организации слов в словосочетаниях и предложениях, а также типы предложений, их значения и условия использования. С синтаксисом связаны правила грамматики использования ИПЯ при подготовке поисковых образов документов и поисковых предписаний, а также ст. "логические операторы ").
- Семантика [semantics] - Часть определенного языка, касающаяся указания смысла и действия текста, составленного в соответствии с синтаксическими правилами этого языка.
ОТНОШЕНИЯ [relations] -
Форма связи между объектами, выражающая то что их объединяет. Различают отношения: парадигматические, синтагматические, ассоциативные, семантические и др. (см. ниже).
Виды отношений и связанные с ними термины:
- Ассоциативные отношения [associative relations] -
1. Разновидность парадигматических отношений (см. ниже), отражающих представление пользователя о взаимосвязи понятий, которые они отображают. Часто под ассоциативными отношениями понимаются все виды парадигматических отношений кроме отношений типа: "вид-род" и "часть-целое". Так же как и парадигматические отношения они являются внетекстовыми и служат для реализации конкретных задач пользователей;
2. Отношения между данными в структурах данных .
- Парадигматические отношения, аналитические отношения, ассоциативные отношения [paradigmatic relations, analytical relations, context-free relations] - Вид логических отношений между лексическими единицами ИПЯ (дескрипторами, ключевыми словами и т.п.), которые не зависят от конкретного контекста, в котором соответствующие им понятия употребляются. Парадигматические отношения позволяют осуществлять т.н. избыточное индексирование текстов путем включения в поисковый образ документа и поисковое предписание близких по смыслу лексических единиц ИПЯ для повышения полноты поиска.
- Семантические отношения [semantic relations] - Отношения между понятиями в т.н. "семантических сетях". Различают лингвистические (соответствующие и взаимоотношению слов в предложении), теоретико-множественные и логические отношения.
- Синтагматические отношения, текстуальные отношения, синтаксические отношения [syntagmatic relations, synthetic relations, contextual relations] - Отношения между лексическим единицами ИПЯ (дескрипторами, ключевыми словами и т.п.), которые выражают логические связи между соответствующими понятиями в тексте документа. Синтагматические отношения являются разновидностью семантических отношений.
- Синтагма [syntagma] - Группа лексических единиц, связанных синтагматическим отношениями и представляющих собой законченное предложение на информационно-поисковом языке .
Некоторые дополнительные термины, связанные с видами ИПЯ:
- Естественный язык [natural language] - Неформализованный язык пользователя информационно-поисковой системы, являющийся средством человеческого общения;
- Естественно-деловой язык, ограниченно нормализованный естественный язык, язык деловой прозы - Разновидность естественного языка, расширенная специальными терминами;
- Профессионально-ориентированный язык - Естественно-деловой язык, ориентированный на определенную область науки или производственной деятельности человека;
- Язык запросов [query language] - Язык общения пользователей с информационной системой, являющийся средством описания запросов на поиск и вывод данных;
- Язык предметных заголовков - ИПЯ, основанный на использовании иерархических предметных рубрик с фиксированным числом уровней, в котором для обозначения рубрик или связанных с ними понятий не используются специальные классификационные индексы или коды;
- Синтагматический язык [syntagmatic organization language] - Семейство ИПЯ, использующих связанные в предложения лексические единицы - синтагмы ;
- Тематический информационно-поисковый язык, тематический ИПЯ - Язык ключевых слов без грамматики, основными лексическими единицами которого являются слова и словосочетания естественного языка;
- Язык с синтаксисом - ИПЯ, в котором лексические единицы, включая коды , могут соединяться в более сложные (составные) лексические единицы и фразы;
- Язык фасетной структуры - ИПЯ с синтаксисом, основанным на использовании фасет ;
- Фасета [facet] - Группа однородных терминов, связанных общностью какого-либо признака (характеристики, основания деления). Служит средством построения информационно-поисковых языков фасетной структуры ;
- Фреймовый язык, язык представления фреймов [frame language] - Язык представления знаний, основанный на использовании фреймов.
1.6.5. ИНДЕКСИРОВАНИЕ И КОДИРОВАНИЕ ДАННЫХ
ИНДЕКС [index, code, notation, mark, symbol] -
1. Условный знак (в т.ч. слово, словосочетание, цифра, буквенный или буквенно-цифровой код и т.п.), обозначающий определенное понятие и используемый для записи результатов классифицирования а также идентификации объектов поиска в информационно-поисковых массивах;
2. Указатель адреса ;
3. Таблица в электронном каталоге , определяющая местоположение набора данных;
4. Совокупность указателей, при помощи которых можно найти запись в файле данных;
5. Уровень в иерархической структуре системы многоуровневого индекса (см. ниже).
Виды индексов, связанных с их структурой:
- Многоуровневый индекс [multilevel index] - Индекс, относящийся к структуре индексов, которая построена в виде иерархического дерева, имеющего два и более уровней иерархии. Корень этого дерева называется индексом высшего уровня или главным индексом [master index].
- Одноуровневый индекс - Индекс, относящийся к структуре, которая не отвечает признакам многоуровневости (см. выше).
В зависимости от характера используемой системы знаков различают:
- Буквенный индекс [alphabetic code, alphabetic notation] - Индекс, использующий отдельные буквы или сочетание букв алфавита;
- Цифровой индекс [numerical code, numerical notation] - Индекс, использующий отдельные цифры, числа, сочетания цифр или их комбинации;
- Десятичный индекс [decimal code, decimal classification code] - Цифровой индекс, составленный на основе десятичной системы счисления;
- Алфавитно-цифровой индекс [alphanumeric code] - Смешанный индекс, состоящий из букв и цифр.
- Смешанный индекс [mixed code, mixed notation] - Индекс, состоящий из разнородных знаков, например, из букв различных алфавитов, букв и цифр и т.п.;
В зависимости от структуры и организации записи различают:
- Простой индекс [unitary code] - Индекс, имеющий вид одной законченной записи и отображающий одно понятие, один признак, одно множество и т.п.;
- Сложный индекс [compound code
, compound classification number] - Индекс, представляющий собой сложное понятие и составленный путем объединения нескольких других (простых и/или сложных) индексов (см. выше);
- Составной индекс [combined index (code)
, combined classification number] -
1. Индекс, образованный в результате объединения нескольких, каждый из которых сохраняет свое основное значение:
2. Индекс, в качестве которого используется комбинация атрибутов (см. "Реляционная модель ");
- Многоуровневый (ступенчатый, иерархический) индекс [multilevel inde м , hierarchically structured classification numbe м ] - Простой или сложный индекс, в котором отдельные его составные части расположены в форме "дерева" в последовательности от более общего (корневого) значения к более частному, например, индексы УДК, ГРНТИ и др. Корневым в этой структуре ("дереве") является индекс высшего уровня.
В вычислительных системах элементы нижнего уровня многоуровневого индекса, также как элементы т.н. одноуровневых индексов (т.е. не являющихся многоуровневыми) непосредственно указывают на отдельную запись или группу записей. Элементы верхних уровней многоуровневого индекса указывают на группу элементов более низкого уровня. Использование многоуровневых индексов производится в тех случаях, когда время поиска по одноуровневым индексам оказывается недопустимо большим;
- Интервальный индекс [interval index] - Индекс, значения которого определяются некоторой областью, например, диапазоном от 3 до 12:
В зависимости от уровня приоритетности различают:
- Гипериндекс [hyperindex] - Высший уровень индекса индексной организации баз данных -, принятый в некоторых СУБД (наряду с главным и нормальным индексами - см. ниже);
- Главный (основной, первичный, старший) индекс [master index, primary index, main subject code, main classification number] –
- 1. Индекс высшего уровня в иерархической системе организации данных (см. " Иерархическая модель ");
- 2. Индекс, отражающий главную тему содержания индексируемого текста, документа и т.п. и относящийся к основной принятой системе классификации;
- Нормальный индекс [normal index] - Подмножество ключей базы данных, соответствующих конкретному значению поля, объявленного дескриптором (признаком поиска). Используется в четырехуровневой системе индексов СУБД, например, - ADABAS;
- Вспомогательный (дополнительный) индекс [additional index, auxiliary code, auxiliary classification number] - Индекс, являющийся дополнением к главному (основному) и отражающий дополнительные признаки индексируемого текста, документа и т.п. или относящийся к вспомогательной системе классификации.
В зависимости от характера индексируемых объектов и/или назначения индекса различают:
- Авторский знак [author mark, author notation, author number] - Индекс, обозначающий автора произведения, используемый при расстановке и поиске книг в библиотеках;
- Кеттерский знак [cutter number] - Авторский знак ,
определяемый по "Авторской таблице" Ч. Кеттера ;
- Расстановочный индекс [location mark, location number] -
Индекс, используемый для расстановки и поиска книг, документов и т.п. в библиотеке или фонде;
- Каталожный индекс [catalog classification mark, catalog classification number] - Индекс, используемый для расстановки и поиска карточек в каталоге;
- Индекс каталога [catalog index] - Старший индекс
в библиотечной организации данных;
- Индекс массива [array index] -
Индекс, присваиваемый массиву документов или данных для его идентификации;
- Индекс файла [index number]
- В некоторых операционных системах (например, UNIX) номер индексного дескриптора файла и др.
ИНДЕКСАЦИЯ [subscripting, notation system, indexing] -
1. Метод, обеспечивающий возможность обращения к элементу массива с помощью указания массива и выражений, определяющих местоположение этого элемента в массиве:
2. Система (совокупность) индексов, используемая для индексирования (см. ниже) и соответствующая определенной системе классификации.
Примечание: В указанных выше определениях понятия "индексация" оно ни коим образом не обозначает процесс и его нельзя смешивать с понятием "индексирование"! 1. Автоматическое определение истинного адреса путем сопоставления содержимого индексного регистра с адресной частью команды.
Различаются следующие виды индексации:
- Кумулятивная индексация [cumulative indexing] - Индексация, предусматривающая присвоение одному адресу несколько индексов;
- Однорядная индексация [pure notation system] - Индексация, в которой использованы т.н. "однорядные" знаки: буквы одного алфавита, цифры одной системы счисления и т.п.:
- Одноуровневая индексация - Индексация с использованием одноуровневых индексов (см. также - "многоуровневый индекс");
- Многоуровневая индексация -
Индексация с использованием многоуровневых индексов;
- Смешанная индексация [mixed notation system] -
Индексация, в которой использованы различные знаки: буквы, цифры и т.п.
ИНДЕКСИРОВАНИЕ [indexing] -
Процесс выбора и присвоения документам, их частям, данным и/или отдельным понятиям (терминам) индексов - лексических единиц ИПЯ (в том числе - цифровых или символьных кодов, если они предусмотрены).
В зависимости от характера используемого ИПЯ различают предкоординатное индексирование и координатное (посткоординатное) индексирование, в т.ч. свободное индексирование (разновидность координатного индексирования производимого ключевыми словами, т.е. без использования какого-либо словаря). В зависимости от полноты учета разнородных признаков индексируемого материала (объекта индексирования) различают "одноаспектное" и "многоаспектное" индексирование (см. ниже).
Процесс индексирования включает:
1. Анализ содержания индексируемого материала и выбор из него т.н. номинативных лексических единиц, существенных для его понимания;
2. Формирование перечня ключевых слов, используемых при свободном индексировании ;
3. Нормализацию ключевых слов по форме и содержанию при помощи словаря используемого ИПЯ пред- или посткоординатного типа;
4. Избыточное индексирование (см. ниже);
5. Заполнение рабочего листа с введением в него грамматических средств.
В зависимости от объекта и содержания процесса индексирования его результатами являются: поисковый образ документа (ПОД), поисковый образ лексической единицы (ПОЛЕ), поисковый образ запроса (ПОЗ) или поисковое предписание (ПП).