НОУ ИНТУИТ | Основы информационных технологий. Лекция 3: Инструменты традиционного и сетевого информационного поиска

Учитесь и получайте официальные документы БЕСПЛАТНО. Вы можете поддержать наш проект.

Регистрация Вход

Твой путь к знаниям!

Национальный исследовательский университет "Высшая Школа Экономики"

Опубликован: 19.11.2012 | Доступ: свободный | Студентов: 12821 / 7958 | Длительность: 29:54:00

Темы: Программное обеспечение, Образование

Специальности: Менеджер, Преподаватель

|

Вам нравится? Нравится 129 студентам

| Поделиться |

Поддержать курс

| Скачать электронную книгу

Координатное индексирование

Новая технология пришла в информационный поиск в виде метода координатного индексирования, разработанного в США в 50-е гг. прошлого века математическим логиком М. Таубе и работником службы химической информации К. Муэрсом. Этот метод основан на предположении, что основное смысловое содержание любого документа и информационного запроса можно выразить при помощи набора терминов, по большей части содержащихся в самом индексируемом документе. Эти термины получили название ключевых слов. Если, к примеру, нужно индексировать документ, в котором говорится о защите от коррозии лопаток газовых турбин, то совокупность терминов "турбина", "газ", "лопатки", "коррозия", "защита" и будет служить поисковым образом документа. Эти ключевые слова образуют для данного документа как бы координатную сетку, по которой в дальнейшем ведется информационный поиск по соответствующему запросу.

Преимущества данного метода очевидны. Прежде всего, информационные работники и потребители информации освобождаются от жестких рамок классификационных схем и перечней предметных рубрик. Индексирование новых документов ведется без оглядки на отраженные в них потенциальные и часто уже устаревшие запросы специалистов. С другой стороны, индексирование освобождается от субъективизма - ключевые слова выбираются формально. Эту работу, в принципе, можно поручить автомату. Во многих современных информационно-поисковых системах оператор вводит в машину библиографические данные документа, его реферат (аннотацию, резюме), а иногда и наиболее информативные части текста (например, первый и последний абзацы статьи, которые содержат наибольшее число терминов, относящихся к ее содержанию). Эти элементы текста можно просто отсканировать. При помощи "запретительного" списка служебных и общезначимых слов, введенных в компьютер, осуществляется автоматический отбор ключевых слов, которые программно приводятся к нормальному виду (единственное число именительного падежа существительных и прилагательных, инфинитив глаголов). Это существенный шаг к автоматизации ввода информации в информационно-поисковую систему.

При поиске необходимой информации специалист может формулировать свой запрос в виде цепочки терминов, на пересечении которых и окажется большинство документов, содержащих необходимую информацию. При этом потребитель может произвольно менять стратегию поиска в зависимости от оценки его промежуточных результатов. Если документов по запросу мало или нет в системе, можно снять из запроса какие-либо ключевые слова (в приведенном выше примере "газ" и "защита"). Тогда система выдаст документы более широкого содержания о коррозии лопаток турбин, в которых все же может содержаться нужная информация. В случае если документов по запросу слишком много, можно добавить ключевые слова, ограничивающие поиск, например, определенным классом турбин или же конкретными методами защиты их лопаток от коррозии. В этом уже заключен важный элемент возможности диалога с системой при помощи слов естественного языка.

Основные достоинства этого принципиально нового подхода к раскрытию содержания документов и поиску информации заключаются в том, что он позволяет находить информацию по любому, заранее не предвиденному сочетанию признаков. Кроме того, при появлении совершенно новых направлений исследований можно вести поиск во всем массиве документов, ранее индексированных по этому методу. Традиционные методы таких возможностей не предоставляли.

Было бы несправедливо умолчать о том, что достоинства нового метода приходится оплачивать преодолением дополнительных трудностей. Прежде всего, поиск с использованием естественного языка ограничивает его рамками знакомых пользователю языков. Чтобы расширить этот круг, приходится прибегать к словарям. Затем, каждый естественный язык отличается богатством своего словарного состава - слова, одинаковые по написанию, могут иметь разный смысл (многозначность, омонимия), а одно и то же понятие может выражаться разными терминами (синонимия). Запросив информацию о косах, вы получите сведения не только о сельскохозяйственных орудиях, но и о географических объектах, а может быть, и о прическах. Желая получить документы о транзисторах, следует помнить, что они могут также называться полупроводниками.

Термины находятся в сложных взаимоотношениях между собой, выражают более узкие или более широкие понятия, могут быть связанными по сходству, по контрасту или по другим ассоциациям. Чтобы иметь возможность учитывать это при поиске, приходится составлять на каждом языке специальные понятийные справочники (тезаурусы). В них для каждого понятия (класса условной эквивалентности) выбирается один термин - дескриптор, а для остальных слов указывается их связь с дескриптором. Тезаурусы иногда называют дескрипторными словарями, а сам поиск с их использованием - дескрипторным. Кроме словарей, для поиска по ключевым словам и дескрипторам часто создают специальную грамматику. Необходимость в ней вызывается возникновением ложной координации терминов, ошибочным их сочетанием. В ответ на запрос

$"трубы" \cap "медь" \cap "свинец" \cap "покрытие"$

можно получить не только необходимую информацию о покрытии медных труб свинцом, но и о покрытии свинцовых труб медью.

Курьеза ради следует упомянуть, что метод координатного индексирования для поиска информации, явившийся принципиальным шагом к новой информационной технологии, на самом деле новшеством не был. В 1915 г. он был реализован на перфокартах американским орнитологом Т. Тейлором при составлении определителя птиц, а у Б. Виккери возникло предположение, что шумерские врачи еще в III тысячелетии до н. э. пользовались диагностическими устройствами, работавшими по этому принципу. На глиняных клинописных плитках записывались симптомы болезней, а под каждым из них - названия болезней, при которых эти симптомы встречаются. Совокупность симптомов составляла координатную сетку, а совпадающие для всех симптомов названия болезней - наиболее вероятные недуги больного.

Из этого понятно, что информационно-поисковые системы, основанные на принципе координатного индексирования, могут быть реализованы простейшими средствами ручного обращения. Система "унитермкарт" самого М. Таубе представляла собой особым образом организованную картотеку, позволявшую легко сличать номера документов, чтобы выявить совпадающие номера для заданных терминов ("унитермов"). Первые информационно-поисковые системы такого типа часто создавались на просветных перфокартах. Однако подлинный размах создание координатных, по большей части дескрипторных систем получило, когда они стали использовать компьютеры второго поколения. В 60-е -70-е годы на базе крупнейших в мире реферативных служб были созданы мощные автоматизированные информационные системы, которые предназначались для ускорения выпуска информационных изданий и расширения спектра информационных услуг, а затем стали основными генераторами документальных баз данных на магнитных лентах.

Цитирование, библиографическое сочетание, социтирование

Принцип цитирования был использован Институтом научной информации США, основанным в 1958 г. Ю. Гарфилдом, для создания принципиально нового вида информационного обслуживания. Английское слово citation означает упоминание, ссылку и не соответствует русскому слову цитирование, означающему дословное повторение "чужого" текста. Однако в данном случае в качестве термина привилась прямая калька с английского языка, поскольку речь идет о библиографических ссылках (для цитирования в русском значении употребляется английское слово quotation).

При поиске информации Ю. Гарфилд взял в качестве индексов библиографические ссылки в документах. В выпускаемых им указателях цитированной литературы, называемых также "индексами цитирования", эти ссылки располагаются по алфавиту фамилий авторов цитированных работ с указанием сведений о документах, в которых они упоминаются. Произведения, использованные при написании статьи, составляют как бы координатную сетку для ее поиска. Если статья написана по совсем новой проблеме, не нашедшей рубрики в классификации наук, с еще не устоявшейся и малоизвестной терминологией, найти ее в потоке мировой литературы другими методами очень трудно. Указатель цитированной литературы можно представить себе как многоуровневую систему библиографических описаний документов, находящихся в обратной связи друг с другом.

Указатели цитированной литературы позволяют искать информацию по совершенно новым межотраслевым или комплексным проблемам под фамилиями пионеров и наиболее известных специалистов каждой из таких проблем. Например, для поиска литературы по цитированию достаточно знать фамилию Ю. Гарфилда, так как почти в каждой работе по этой проблеме есть упоминание о нем и его статьях. Фамилии авторов найденных работ могут, в свою очередь, служить входами в указатель, и за 1-5 таких итераций (последовательных поисков) все сведения об отраженной в указателе литературе по проблеме оказываются найденными.

Индексы цитирования предоставляют уникальную возможность проследить за всеми случаями применения какой-либо идеи или метода, за их критикой и обсуждением, оценить информационный вклад того или иного ученого или научной школы, степень и динамику популярности их работ. Известны случаи, когда по этим указателям предсказывали нобелевских лауреатов. Институт научной информации США выпускает указатели цитированной литературы по точным, естественным и прикладным наукам (с 1964 г.), по общественным наукам (с 1969 г.), по искусству и гуманитарным наукам (с 1976 г.), для чего просматривается около 10 тыс. научных журналов и ежегодно несколько тысяч названий книг. Указатели распространяется не только в обычном (бумажном), но и в машиночитаемом виде (на магнитной ленте, дискетах, оптических дисках). Нужно ли говорить о том, что осуществление принципа, положенного в основу этих изданий, стало возможным лишь благодаря компьютерам. Ведь речь идет о ежегодном библиографировании более 10 млн ссылок.

В двух статьях и , например (см. рис. 3.2) имеются библиографические ссылки, которые устанавливают прямую библиографическую связь между ними (цитирующими документами) и статьями A, B, C и , которые в них упоминаются (цитируемыми документами). В указателе цитированной литературы эти ссылки, по алфавиту которых упорядочивается его массив, обозначают цитируемые документы, а под ними располагаются описания цитирующих документов.

Понимание потенциальных возможностей комплексирования документов по признаку общих ссылок и стремление максимально использовать накопленный массив в машиночитаемой форме повели к поискам новых путей применения метода цитирования. Можно считать связанными по смыслу документы, авторы которых ссылаются на одни и те же работы, а числом совпадающих ссылок - измерять степень такой связанности. Этот метод, который называется библиографическим сочетанием документов, долгое время не имел широкого практического применения, но затем был использован для создания ретроспективной поисковой системы на компакт-дисках.

Рис. 3.2. Схема цитирования, социтирования и библиографического сочетания документов

Можно также считать связанными по смыслу и тематике работы, на которые совместно ссылаются авторы нескольких документов. Этот метод, чаще всего называемый социтированием, имеет другую коммуникационную основу. В каждой исследовательской области имеется некоторый набор важных работ, отражающих познавательную основу этой области. Данные работы цитируются многими исследователями и поэтому принадлежат к числу высоко цитируемых. Больше того, они часто цитируются вместе, образуя таким образом социтирование. Другими словами, социтированием принято называть одновременное упоминание любых двух или большего числа публикаций в какой-либо последующей публикации.

Для лучшего представления разницы в этих методах приведена схема (рис. 3.2), на которой и являются цитирующими документами текущего года, а A, B, C и - цитируемыми документами более ранних годов. Сплошными стрелками показаны связи по цитированию, т. е. цитирует A, B и , а цитирует B, C и . Тогда между цитирующими работами и образуется библиографическое сочетание, а между цитируемыми работами и - социтирование (обозначено пунктиром). Для простоты и наглядности степень связанности на схеме минимальная, хотя на практике она значительно больше (т. е. для признания библиографического сочетания между двумя работами или кластера социтирования в каждом отдельном случае устанавливается определенный минимальный порог, который тем выше, чем интенсивнее цитирование).

Между характером этих методов установления связи и областью их применения имеется существенная разница. Библиографическое сочетание - это однократно произошедший факт, поскольку и были однажды опубликованы со своими ссылками, и с ними в дальнейшем ничего уже произойти не может. Именно поэтому данный метод применяется для ретроспективного поиска документов, связанных между собой единством тематики, которая исследовалась их авторами.

Совсем по-другому обстоит дело с социтированием, так как связь между цитируемыми B и C может сохраняться (увеличиваться или уменьшаться) в последующие годы в зависимости от того, насколько часто они будут попарно цитироваться в новых работах. Частое социтирование указывает на их концептуальную близость, поскольку они используются как единый комплекс. Между этими работами как бы возникают невидимые связи, которые после наглядного их выражения образуют смысловые сгустки (кластеры). Совокупность таких кластеров ключевых работ, отражающих исследовательские области, представляет собой как бы карту определенной научной области, а совокупность карт - атлас науки на данный момент.

Рубрикаторы информационных изданий

На большинстве европейских языков рубрикатором называли переписчика рукописей, который в скрипториях средневековья и Возрождения размечал красной краской первые буквы смысловых фрагментов текста, получивших название рубрик. Это название сохранилось и до наших дней, хотя в нынешних произведениях печати рубрики отмечаются абзацными отступами или отделяются друг от друга пробелами. В журналистике рубриками принято также называть постоянные разделы в журналах и газетах, а в библиотековедении - структурные подразделения систематического и предметного каталогов.

В 50-е годы в информатике рубрикаторами стали называть перечни рубрик реферативных журналов и других информационных изданий. В данном случае рубрика выступает как содержательный фрагмент такого издания и состоит из индекса и заголовка раздела, а также библиографических записей (с аннотациями или рефератами) произведений печати, которые по своему содержанию относятся к данной рубрике. По мере роста числа и увеличения объемов реферативных журналов их рубрикация стала усложняться. Появилась необходимость в создании такого перечня рубрик, который отвечал бы определенным требованиям и мог бы служить средством систематизации библиографических записей вместе с рефератами. Поскольку библиотечно-библиографические классификации оказались непригодными для этого, реферативные службы стали создавать собственные рубрикаторы.

Рубрикатор - это особым образом организованный перечень рубрик иерархической классификации, предназначенный для отражения сведений о текущих публикациях в информационных изданиях или системах информационного обслуживания. К его характерным особенностям относятся сравнительно небольшая глубина индексации, ориентированность на межотраслевые, междисциплинарные, комплексные проблемы, простота и линейность структуры, достаточная гибкость, частая и безболезненная изменяемость формулировки рубрик. Любой рубрикатор создается под влиянием двух противоречивых факторов, отражает два взаимосвязанных, но разных информационных потока: документального и запросов потребителей. Первый оказывает преимущественное влияние на структуру рубрикатора, второй - на формулировку заголовков рубрик, причем изменение структуры документального потока несколько отстает от быстро меняющегося характера информационных запросов.

Возникает вопрос, почему же все-таки для создания рубрикаторов не использовались существующие классификации? Можно указать на несколько обстоятельств, которые ведут к серьезным различиям в схемах иерархических классификаций, используемых для библиотечных каталогов и для построения рубрикаторов. Первые, рассчитанные, в первую очередь, на систематические каталоги и картотеки библиотек, отражают структуру универсального потока документов: книг, брошюр, периодических и продолжающихся изданий. Рубрикаторы реферативных журналов ориентированы преимущественно на журнальные статьи и другие публикации из научной периодики, которые имеют другую содержательную структуру, более дробную и гибкую. В реферативных журналах подчас приходится открывать рубрики для таких вопросов, которые в библиотечном каталоге могут стать необходимыми лишь через десять лет.

Систематические каталоги библиотек ориентированы на дисциплинарную структуру, т. е. на выделение основных классов в соответствии с научной классификацией. В рубрикаторе наряду с дисциплинарными характеристиками необходимо учитывать комплексные междисциплинарные проблемы и отрасли народного хозяйства. Это нарушает строгую логику иерархической классификации, но придает рубрикатору особую гибкость. Библиотечная классификация предназначена для ретроспективного поиска, для накопления записей за много лет, это требует сложной структуры, ее стабильности, устойчивости, медлительности в изменениях. Для рубрикатора частые изменения являются правилом, формулировка заголовков рубрик, публикуемых в каждом номере издания, играет сравнительно большую роль, а форма индексов, выполняющих служебную роль, менее значима. Рубрикатор легко обозрим, имеет небольшую глубину и простой служебный аппарат (систему ссылок и вспомогательных делений, способы сочетания рубрик).

По рубрикаторам классифицируются самые мощные потоки научных публикаций - во всем мире ежегодно миллионы несовпадающих документов. Это на порядок больше, чем приходится на долю классификаций, применяемых ежегодно для описания входных потоков всеми библиотеками мира. Поэтому рубрикаторы приобрели большое значение в научно-информационной деятельности. Во многих информационных центрах избирательное распространение информации, сигнальная информация и даже справочно-библиографическое обслуживание осуществляются при помощи рубрикаторов. Чтобы они могли справиться с такими несвойственными им функциями, приходится оснащать их различными вспомогательными средствами, которые приближают их к библиотечным классификациям, но затрудняют их использование по прямому назначению. Как и во всех подобных случаях, здесь приходится прибегать к разным компромиссам, но это неизбежно там, где мы не пользуемся новой информационной технологией.

Дальше >>

Авторизоваться

Основы информационных технологий

Инструменты традиционного и сетевого информационного поиска

Координатное индексирование

Цитирование, библиографическое сочетание, социтирование

Рубрикаторы информационных изданий

Вопросы и ответы