|
||||
|
Приложение 1Системы полнотекстного поискаСегодня рынок предлагает значительный перечень всевозможных поисковых утилит, программ и систем разного уровня. Программное обеспечение этого класса бывает двух типов*. {Градский П. Поисковые системы. // Санкт-Петербургские ведомости //, 26 июня 2002 года; Дериев И. Особенности национального поиска. // Компьютерное Обозрение // №15,17 — 23 апреля 2002. Уваров С. Ищущие да обрящут. Программные продукты использующие технологию прямого поиска, просто перебирают файлы и выполняют поиск в каждом из них. Недостатком этой технологии являются значительные временные затраты. Аналогичные утилиты традиционно присутствуют во всех операционных системах, файловых менеджерах и инструментальных пакетах. 1. Поисковик AVSearch. Если у вас совсем нет денег, то вам может помочь бесплатная программа Анатолия Вознюка — AVSearch ( 2. Поисковик SSScanner с достаточно высокой скоростью работает с документами Word, WordPerfect, PDF, HLP, а также с несколькими десятками языков и кодировок. Имеется возможность нечеткого поиска (по контексту) с оценкой релевантности и формальный. Результаты отображаются в отдельном окне с выдержками из оригинальных документов. SSScanner стоит около $30, условно-бесплатная версия имеет ряд ограничений. В настоящее время программы прямого поиска уходят на второй план, их активно вытесняют программные продукты, использующие технологию поиска с индексированием. Программное обеспечение этого типа просматривает и анализирует указанные текстовые файлы, создавая собственную базу данных («индекс»), по которой затем и осуществляется поиск. Индексирование -процесс достаточно длительный, но зато поиск занимает считанные секунды. До недавнего времени основными недостатками данного ПО считались продолжительность операции первичного создания индекса и дополнительный расход дискового пространства. Однако для мощных современных компьютеров это не существенно. Некоторое неудобство по-прежнему связано с необходимостью регулярного обновления индексов, однако и это не проблема. Начнем свое рассмотрение этого сегмента рынка полнотекстовых поисковиков с западных образцов. 1. Поисковик AdvancedDocumentServer И если многие, кто работает с документами Word, используют само приложение (хотя у Microsoft есть и специальная программа просмотра), то для PDF этот принцип уже не подходит. Помимо этого, применение средств автоматизации OLE в данном случае крайне негативно сказывается на производительности. 2. Программное обеспечение Greenstone 3. Поисковик dtSearchDesktop ( По виду поиска используются: морфологический, фонетический, поиск синонимов, а также поиск в словах с орфографическими ошибками. Помимо этого, dtSearch Desktop предлагает пользователю словарь (построенный в процессе создания индекса) и при вводе запроса выполняет в нем автоматический поиск. В качестве недостатка можно отметить только английский интерфейс программы. Стоит dtSearch Desktop около $200. Российское программное обеспечение. По своим поисковым возможностям отечественные разработки имеют определенное преимущество перед западными, поскольку их разработчики априори лучше иностранцев разбираются во всевозможных лингвистических нюансах нашего государственного языка. 1. Поисковик "Ищейка" «Ищейка» — это полнотекстовая персональная поисковая система, работа с которой напоминает работу в поисковых системах Интернета, таких как AltaVista, Yahoo, Rambler. При первом запуске она создает базу данных по имеющимся документам и индексирует ее. Каждая база данных представляет собой зону поиска — пространство на жестком диске, состоящее из каталогов, в пределах которого программа мгновенно находит документы и файлы. Тест-версия программы поддерживает возможность создания лишь двух зон поиска с индексированием в каждой максимально 500 файлов. Перед проведением поиска документов «Ищейке» необходимо указать зону поиска или создать новую, после чего ввести в окошке диалогового окна ключевые слова, которые должен содержать документ, и нажать кнопку Ищи! Бесплатная версия «Ищейки» работает только с текстовыми и DOC-файлами, профессиональная ($15) еще с RTF и HTML. Помимо этого для профессиональной версии имеется набор дополнительных подключаемых фильтров — для текста во всех кодировках, документов других приложений Microsoft Office и PDF. Поддержка PDF появилась в программе недавно, и пока этот модуль «не понимает» русского языка, хотя представители компании обещают устранить этот недостаток в самое ближайшее время. Зато модуль великолепно работает с защищенными документами — не только индексирует их содержимое, но и способен корректно определить название и даже извлечь текст. 2. Интеллектуальная поисковая система «Следопыт» ( По своей функциональности «Следопыт» напоминает dtSearch. В распоряжении пользователей несколько вариантов поиска: нечеткий, т.е. «на естественном языке», система сама отбросит «шумовые» слова, а остальные приведет к морфологической основе; строгий, при котором ищутся в точности те слова, что указаны в запросе; формальный — с логическими и другими операторами и возможностью комбинирования двух предыдущих. Поддерживаются текстовые файлы в самых разных кодировках, документы основных приложений Microsoft Office, PDF-файлы, в том числе и упакованные в zip-архивы, а также папки (как сами сообщения, так и вложения) Microsoft Outlook. Следует отметить, что используемые фильтры достаточно «честные», они работают с DOC-файлами именно как с документами Word, не индексируют PDF-файлы, защищенные от копирования информации, и т. д. — естественно, это может быть расценено двояко. Тем не менее PDF-фильтр из «Следопыта» показался одним из лучших при работе с русским языком. Интерфейс программы достаточно удобен, за исключением нескольких нюансов. Например, окно просмотра найденных документов необходимо вызывать специально, при этом оно все время остается самым «верхним» и в некоторых случаях мешает работать с программой. Зато очень корректно извлекается текст из документов всех поддерживаемых форматов и подсвечиваются слова запроса. Стоит только иметь в виду, что «Следопыт» работает лишь при запущенном приложении Microsoft SQL Server, это приложение устанавливается одновременно с установкой самого «Следопыта». Программа распространяется в трех вариантах — персональном, профессиональном и корпоративном. Персональный при цене в $10 лишен фактически всех наиболее интересных функций — не поддерживает морфологию и формальные запросы, не индексирует PDF и папки Outlook. Профессиональный «Следопыт» обойдется в $48 и может явиться золотой серединой, так как корпоративная версия распространяется с довольно дорогими пакетами лицензий, хотя дополнительным сервисом является только работа с ресурсами локальной сети. 3. Документальная система поиска информации «Cros» ( «CROS» при загрузке в него автоматически распознает все основные форматы и кодировки текстовых файлов, поддерживает архивы электронных документов и с высокой скоростью осуществляет поиск информации в них по любым сочетаниям слов и свойств документов. Программа обладает развитыми средствами навигации (простой, но мощный язык запросов), сортировки и просмотра найденных фрагментов документов, а также автоматизированной компоновки отчетов. Имеется также отдельно распространяемый Web-интерфейс (в виде Web-сайта для IIS, Apache или другого сервера с поддержкой CGI), обеспечивающий подключение к «Cros» удаленных пользователей и выполнение с банком данных всех основных операций. Данное программное обеспечение устойчиво работает в ОС Windows, нетребовательно к ресурсам, удобно и просто в эксплуатации. Существуют как локальная, так и сетевая версии этого программного продукта. Если сравнивать с имеющимися аналогами, то «CROS» практически не имеет ограничений по объему накапливаемой информации, при этом значительно экономит пространство на жестком диске. Имеется бесплатная демонстрационная версия с усеченными возможностями, она работает с одним банком данных объемом до 5000 документов. Цена однопользовательской версии «CROS» — $140, при установке на несколько компьютеров в одной и той же организации предлагаются существенные скидки. 4. "Евфрат 99" «Евфрат @SOHO» — это практически полноценная рабочая среда со своим рабочим столом, корзиной, средствами работы с файлами и т. д. Помимо всех этих «прибамбасов» программа «понимает» документы Microsoft Office, индексирует их и выполняет контекстный поиск и даже автоматически следит за обновлением указанных документов и папок. Основной ее недостаток — отсутствие поддержки прочих форматов, в частности PDF, но имеются и кое-какие приятные дополнительные возможности вроде встроенной OCR для ввода документов со сканера. Стоимость программы $20. «Евфрат Office» поддерживает форматы документов MS Office 95/97/2000 (DOC, XLS, PPT), текстовые (RTF, HTML, TXT (ASCII, ANSI, KOI-8), графические документы — черно-белые и цветные — TIF, PCX, JPG, BMP, GIF и другие. Работает «черновой» режим просмотра (с учетом оригинального оформления и форматирования документа). Имеется функция экспорта во внешние приложения, поддерживающие необходимый формат. «Евфрат Office» осуществляет полнотекстовый и реквизитный поиск документов по запросу любой сложности с использованием логических операций "И", «ИЛИ», «НЕ», контекстный поиск (запрос по выделенным словам документа в режиме просмотра его текста). Скорость поиска достаточно высока и не зависит от количества зарегистрированных документов и сложности запроса. Имеется дополнительно устанавливаемый модуль Евфрат Document Server, который обеспечивает одновременную работу нескольких пользователей с единой базой данных. Краткое резюме. В конце нашего обзора хотелось бы отметить, что выбор программного обеспечения у вас есть — это весьма эффективные dtSearch Desktop, «Ищейка», «Следопыт», «Cros» и «Ефрат», за обладание которыми придется расстаться с некой толикой зеленых общечеловеческих ценностей. Ну в если ваше прижимистое руководство денег на программное обеспечение не дает, а результаты требует, то не стоит забывать про AVSearch. Правда, временные и трудовые затраты в данном случае значительно возрастают. Постановка задачи Хранить большое количество текстовых файлов различных форматов. Проводить поиск по тексту и другим реквизитам документов. Готовить обзоры, справки, отчеты, рефераты на основе найденных документов. Список программ для тестирования CROS 2.08, НПК «Кронос-Информ». Следопыт 2.0, MediaLingva. Clio 1.2, Software House. Ищейка 2.18, iSleuthHound Technologies. Евфрат 99 DELUXE (Build 0430), Cognitive Technologies. Конечно, это программы разных групп, но их применение в рамках поставленной задачи вполне правомерно. По крайней мере, найдется немало пользователей, которые пытаются использовать эти программы для решения подобной задачи. Параметры массива документов для тестирования Общее количество файлов *) 1652 В том числе: Текстовые (кодировка DOS, Windows) 1366 Документы формата MSWord 7.0 226 Документы формата Html 60 Общее количество вложенных папок 15 Общий размер файлов (байт) **' 336 735 760 В том числе: Текстовые (кодировка DOS, Windows) 264 950 779 Документы формата MSWord 7.0 69 587 789 Документы формата Html 2 197 192 Максимальный размер файла (байт) 13 927 759 Минимальный размер файла (байт) 1657 *) Выбиралось с учетом того, что демо-версия «Ищейки» не работает более чем с 2000 файлами. **)Выбирался из расчета (ОБЪЕМ RАМ * 5). Тесты проводились на компьютере следующей конфигурации: Intel Celeron 400, 64Mb RAM, HDD Quantum CR 13Gb (файловая система: NTFS), Windows NT4Sp6 Workstation. Перед каждым тестом диск дефрагментировался. Результаты тестирования режима добавления документов CROSСледопытClioИщейкаЕвфрат Исходные данные (байт) 336 735 760 336 735 760 336 735 760 336 735 760 336 735 760 Время внесения в банк 4мин. 36 сек. -- — - Время индексирования 22мин. 32сек. 30 мин. 27сек. 41мин. 52сек. 6 час. 10 мин.»15 час. *) Общее время обработки 27мин. 08сек. 30 мин. 27сек. 41мин. 52сек. 6 час. 10 мин. » 15 час. *) Размер данных после обработки (байт) 141 575 480 336 735 760 336 735 760 336 735 760 336 735 760 Размер индексов (байт) 18 038 127 64 825 824 140 604 649 46 652 300»35 663 872*) Общий объем (байт) **) 159 613 607 401 561 584 477 340 409 383 388 060»372 399 632*) Общий объем по отношению к исходному (в %) 47 119 142 114»111*) *) За 15часов обработано 33% (584 документа), тест прерван. **) Объем данных, требующийся для осуществления поиска и просмотра результатов. |
|
||
Главная | В избранное | Наш E-MAIL | Добавить материал | Нашёл ошибку | Вверх |
||||
|