Гипертекстовые интеллектуальные информационные системы
Министерство образования и науки Российской Федерации
ФГБОУ ВПО «Нижегородский государственный педагогический университет имени Козьмы Минина»
Факультет дизайна и информационных технологий
Кафедра «Математика и информатика»
КУРСОВАЯ РАБОТА
по дисциплине
«Интеллектуальные информационные системы»
на тему:
Гипертекстовые
Выполнил: студент группы
ИСТ-09
Бобин С.
Проверил: к.п.н., профессор
Бахтиярова Л.Н.
Нижний Новгород
2012
Аннотация
В данной курсовой работе рассматриваются гипертекстовые интеллектуальные информационные системы. В первой главе рассматривается общая информация о гипертекстовых системах. Во второй главе дается общее представление о языке HTML. В третьей главе описана возможность представления знаний на базе языка HTML.
Содержание
Введение 4
Глава 1. Общая информация о гипертекстовых системах 5
- Гипертекстовые системы 5
- Что такое гипертекст 6
- Что дает использование гипертекста 7
Глава 2. Язык HTML 10
- Общее представление 10
- Браузеры 11
- Версии 12
- Структура HTML-документа 14
Глава 3. Возможности представления знаний на базе языка HTML 16
- HTML-документ в виде семантической сети 16
- TextAnalyst 24
- Принцип работы HTML-конвертора 28
Заключение 33
Источники информации 34
Введение
Гипертекст - новая технология работы с текстами на компьютерной фазе информационного обмена. Важно использование гипертекстовых технологий в социальной сфере, описываемой множеством формализуемых параметров. Другой причиной популярности является предоставляемая возможность реализации индивидуальных информационных потребностей.
Гипертекст - обучающее средство
активно используется в учебном
процессе, совершенствование
HTML - язык для написания
гипертекстовых документов. Особенность
- наличие гипертекстовых связей
между документами
Цель курсовой работы – изучить гипертекстовые интеллектуальные информационные системы, а так же способы представления знаний.
Глава 1. ОБЩАЯ ИНФОРМАЦИЯ О ГИПЕРТЕКСТОВЫХ СИСТЕМАХ
- Гипертекстовые системы
В течение последних нескольких лет "гипертекст" превратился в популярную тему многих конференций по информатике, научно-технической информации, искусственному интеллекту, лингвистике, психологии и теории обучения. Интерес вызывает принципиально нелинейная организация информационных единиц, которые могут быть представлены текстом, аудио и видео информацией, дружелюбная и гибкая форма нелинейного управления этими единицами в гипертекстовой системе. Максималисты утверждают, что развитие гипертекстовых технологий вызовет последствия сравнимые с изобретением книгопечатания и приведет к повышению КИ (Коэффициента Интеллекта) человеко-машинного взаимодействия.
- Что такое гипертекст
Термин гипертекст был введен в обращение Тедом Нельсоном (Ted Nelson) в 1965 г. для описания документов (например, представляемых компьютером), которые выражают нелинейную структуру идей, в противоположность линейной структуре традиционных книг, фильмов и речи. Более поздний термин "гипермедиа" близок к нему по смыслу, но он подчеркивает наличие в гипертексте нетекстовых компонентов, таких как анимация, записанный звук и видео".
"Под "гипертекстом" - писал Нельсон - я понимаю непоследовательную запись. Обычно процесс письма осуществляется последовательно по следующим двум причинам. Во-первых, потому, что он является производным от речи..., которая не может не быть последовательной (так как у нас для этого только один канал), и, во-вторых, потому, что книги неудобно читать иначе как последовательно. Однако мысли образуют структуры, которые не являются последовательными - они связаны многими возможными переходами"
В популярной литературе встречаются различные толкования термина гипертекст.
Приведем два:
- "Гипертекст позволяет связывать текст, аудио, фотографии, чертежи, карты, движущиеся картинки и другие формы информации в осмысленное целое, к которому может осуществляться доступ при помощи системы индексации, ориентированной на конкретные идеи, а не на конкретные слова в тексте".
- "Гипертекст можно определить как нелинейную документацию, документацию, которая ветвится и взаимосвязывается, позволяя читателю исследовать содержащуюся в ней информацию, в последовательности, которую он сам выбирает."
- Что дает использование гипертекста
Гипертекстовая информационная модель, основанная на гипотезе о том, что переработка и генерация идей человеческим мозгом происходит ассоциативно, получает все большее признание в качестве структуры для эффективного представления и передачи знаний. Технически реализующая эту модель "гипертекстовая система" использует электронные и программные средства для преодоления ограничений линейной природы текста напечатанного на бумаге. Бумага (плоская среда) хорошо приспособлена для представления только 2-мерного потока информации: линейного и иерархического. Мы читаем последовательно слева направо, сверху вниз, переворачиваем страницы. В отличие от этого гипертекстовая система, содержащая сеть узлов (фрагментов, модулей, фреймов) и заданные на них ассоциативные связи порождает 3хмерное информационное пространство, что создает информационную среду адекватную глубинной структуре переработки идей человеческим мозгом.
Когнитивная психология, изучающая процесс передачи знаний, полагает, что линейно писать и читать человек учится, тогда как в глубине его мышления лежат трансформации значительно более сложных представлений. В весьма упрощенной модели писатель (ученый, специалист, литератор и др.) идет от сети идей к линейному тексту, а читатель осуществляет обратную трансформацию линейного текста в сеть идей.
Гипертекстовая система позволяет писателю любого (научного, технического, экономического, художественного и др.) текста записать в явной форме сеть идей (мыслей, тезисов, фрагментов) и открывает читателю прямой доступ к этой сети идей автора. Производительность труда писателя и адекватность восприятия материала читателем при этом возрастают, так как исключаются промежуточные трансформации. Оперируя вербальными и невербальными представлениями, гипертекстовые (гипермедиа) системы позволяют выдавать пользователю ("читателю") информацию в наиболее эффективной форме с учетом не только сущности информации, но и индивидуальных психофизиологических особенностей пользователя.
Тем самым гипертекстовые системы впервые предлагают инструмент, способный поддерживать процессы ассоциативного мышления, доминирующие в правом полушарии нашего мозга.
Для того, чтобы информационная система могла быть названа гипертекстовой информационной системой, она должна обладать следующим рядом характеристик в совокупности:
- Структурный аспект.
Система должна иметь базу данных, состоящую из объектов двух видов: а) информационных единиц (ИЕ) или “узлов”, содержащих информацию, потенциально интересную для пользователей и б) дуг, представляющих структурные и семантические отношения связывающие информационное содержание узлов. (Информация, представляемая дугами разных типов, и возможность исследовать и интерпретировать возможные траектории перемещения от одних ИЕ к другим может иметь для пользователя значение не меньшее, чем информация содержащаяся в узлах). В литературе базу данных гипертекстовой системы называют по-разному: гипертекстом, гипертекстовой базой данных, гипербазой данных, гиперпространством.
- Функциональный аспект.
Создание гипертекста (ИЕ и "следов", в смысле Буша) и навигация в гиперпространстве (см. дальше) является нелинейной (не последовательной) деятельностью. Соответственно этому гипертекстовая система должна иметь специальные инструментальные средства двух видов: 1) средства для поддержки авторской деятельности (ни в русском, ни в немецком языке нет подходящего термина эквивалентного английскому ? "authoring") и 2) средства для броузинга (см. дальше) ИЕ в процессе ассоциативной навигации.
- Визуальный аспект.
Управление функционированием гипертекстовой системы осуществляется на основе принципа прямого манипулирования представленными на экране монитора символами внеязыковых объектов. Принцип прямого манипулирования [Shneidermann 1987] означает возможность инициировать быстрые, реверсивные операции над объектами с немедленно видимыми результатами. Пользователь получает возможность легко и практически мгновенно перемещать единицы информации и фрагменты гипертекста из одного контекста в другой вместе со всей совокупностью заданных в первом контексте связей: ИЕ или ее элемент активизируются (выбираются) путем нажатия мышью на так называемую, “электронную кнопку”, играющую роль исходной точки связи, ведущей к той или иной информации, которая может представлять интерес для пользователя. Система осуществляет переход в конечную точку указанной связи и выдает на экран соответствующую ей ИЕ. Это может быть либо новая ИЕ, замещающая на экране исходную, либо вставка некоторого нового элемента в представленную на экране единицу информации, или старая и новая единицы информации могут быть представлены на экране одновременно.
В отличие от других типов информационных систем, например, использующих традиционные СУБД, использование дисплея в качестве основного устройства управления процессами авторизации и навигации является необходимым, хотя и недостаточным, признаком гипертекстовой системы.
Глава 2. ЯЗЫК HTML
- Общее представление
Язык HTML был разработан британским учён
Изначально язык HTML был задуман и создан как средство структурирования и форматирования документов без их привязки к средствам воспроизведения (отображения). В идеале, текст с разметкой HTML должен был без стилистических и структурных искажений воспроизводиться на оборудовании с различной технической оснащённостью (цветной экран современного компьютера, монохромный экран органайзера, ограниченный по размерам экран мобильного телефона или устройства и программы голосового воспроизведения текстов). Однако современное применение HTML очень далеко от его изначальной задачи. Например, тег <TABLE>, несколько раз использованный для форматирования страницы, которую вы на данный момент читаете, предназначен для создания в документах самых обычных таблиц, но, как можно убедиться, здесь нет ни одной таблицы. С течением времени основная идея платформонезависимости языка HTML была принесена в жертву современным потребностям в мультимедийном и графическом оформлении.
- Браузеры
Текстовые документы, содержащие разметку на языке HTML (такие документы традиционно имеют расширение .html или .htm), обрабатываются специальными приложениями, которые отображают документ в его форматированном виде. Такие приложения, называемые «браузерами» или «интернет-обозревателями», обычно предоставляют пользователю удобный интерфейс для запроса веб-страниц, их просмотра (и вывода на иные внешние устройства) и, при необходимости, отправки введённых пользователем данных на сервер. Наиболее популярными на сегодняшний день браузерами являются Google Chrome, Mozilla Firefox, Opera, Internet Explorer и Safari.
- Версии
- RFC 1866 — HTML 2.0, одобренный как стандарт 22 сентября 1995 года;
- HTML 3.2 — 14 января 1997 года;
- HTML 4.0 — 18 декабря 1997 года;
- HTML 4.01 (изменения, причём более значительные, чем кажется на первый взгляд) — 24 декабря 1999 года;
- ISO/IEC 15445:2000 (так называемый ISO HTML, основан на HTML 4.01 Strict) — 15 мая 2000 года.
- HTML 5 — в разработке. Конец разработки запланирован на 2014 год.
Официальной спецификации HTML
1.0 не существует. До 1995 года существовало
множество неофициальных
Версия 3 была предложена Консорциумом всемирной паутины (W3C) в марте 1995 года и обеспечивала много новых возможностей, таких как создание таблиц, «обтекание» изображений текстом и отображение сложных математических формул. Даже при том, что этот стандарт был совместим со второй версией, реализация его была сложна для браузеров того времени. Версия 3.1 официально никогда не предлагалась, и следующей версией стандарта HTML стала 3.2, в которой были опущены многие нововведения версии 3.0, но добавлены нестандартные элементы, поддерживаемые браузерами Netscape Navigator и Mosaic.
В версии HTML 4.0 произошла некоторая «очистка» стандарта. Многие элементы были отмечены как устаревшие и нерекомендованные (англ. deprecated). В частности, элемент font, используемый для изменения свойств шрифта, был помечен как устаревший (вместо него рекомендуется использовать таблицы стилей CSS).
В 1998 году консорциум Всемирной паутины начал работу над новым языком разметки, основанном на HTML 4, но соответствующим синтаксису XML. Впоследствии новый язык получил название XHTML. Первая версия XHTML 1.0 одобрена в качестве Рекомендации консорциума Всемирной паутины 26 января 2000 года.
Планируемая версия XHTML 2.0 должна была разорвать совместимость со старыми версиями HTML и XHTML, но 2 июля 2009 года консорциум Всемирной паутины объявил, что полномочия рабочей группы XHTML2 истекают в конце 2009 года. Таким образом, была приостановлена вся дальнейшая разработка стандарта XHTML 2.0.
- Структура HTML-документа
HTML — теговый язык разметки документов. Любой документ на языке HTML представляет собой набор элементов, причём начало и конец каждого элемента обозначается специальными пометками — тегами. Элементы могут быть пустыми, то есть не содержащими никакого текста и других данных (например, тег перевода строки <br>). В этом случае обычно не указывается закрывающий тег. Кроме того, элементы могут иметь атрибуты, определяющие какие-либо их свойства (например, размер шрифта для элемента font). Атрибуты указываются в открывающем теге. Вот примеры фрагментов HTML-документа:
- <strong>Текст между двумя тегами — открывающим и закрывающим.</strong>
- <a href="http://www.example.com">
Здесь элемент содержит атрибут href.</a> - А вот пример пустого элемента: <br>
Регистр, в котором набрано имя элемента и имена атрибутов, в HTML значения не имеет (в отличие от XHTML). Элементы могут быть вложенными. Например, следующий код:
<b>
Этот текст будет полужирным,
<i>а этот - ещё и курсивным</i>
</b>
даст такой результат:
Этот текст будет полужирным, а этот — ещё и курсивным
Кроме элементов, в HTML-документах
есть и сущности (англ. entities) —
Например, © — знак авторского права (©). Как правило, сущности используются для представления символов, отсутствующих в кодировке документа, или же для представления «специальных» символов: & — амперсанда (&), < — символа «меньше» (<) и > — символа «больше» (>), которые некорректно записывать «обычным» образом, из-за их особого значения в HTML.
Каждый HTML-документ, отвечающий спецификации HTML какой-либо версии, должен начинаться со строки объявления версии HTML <!DOCTYPE…>, которая обычно выглядит примерно так:
<!DOCTYPE HTML PUBLIC "-//W3C//DTD HTML 4.01//EN"
"http://www.w3.org/TR/html4/
Если эта строка не указана, то добиться корректного отображения документа в браузере становится труднее.
Далее обозначается начало
и конец документа тегами <
Глава 3. ВОЗМОЖНОСТИ ПРЕДСТАВЛЕНИЯ ЗНАНИЙ НА БАЗЕ ЯЗЫКА HTML
3.1 HTML-документ в виде семантической сети
Рассмотрим, каким образом HTML-документ может быть представлен в виде семантической сети. Нам необходимо выделить те конструкции языка, которые могут быть полезными для решения этой задачи.
Прежде всего, к числу таких конструкций относятся теги типа <TITLE>, <META…> и <A…>. Первый тег важен для фиксации семантики всего HTML – документа, так как текст, заключенный между тегами <TITLE> и </TITLE> чаще всего отражает его назначение или содержание.
Теги типа <META…> вводят имена атрибутов и их значения с помощью параметров name=”…” и content=”…”, а ссылки и якоря фиксируют отношения между частями одного документа или между отдельными документами.
Теги типа <META…> явно вводят семантику значений атрибутов, одинаково интерпретируемых броузерами за счет ключевых слов, которые могут быть значениями параметра name.
Теги типа <A…> фиксируют лишь факт наличия отношения между ссылкой и ее якорем. В некоторых случаях этому отношению можно «приписать» имя SeeAlso (смотри также), в других случаях – ConsistOf, PartOf или иное подходящее имя, но семантика данной конструкции имплицитна, а встроенная интерпретация ее связана лишь с переходом по ссылке и визуализацией начала соответствующего фрагмента документа или загрузкой нового документа для просмотра.
Другими полезными конструкциями являются заголовки разделов и подразделов (тексты между тегами <Hi> и </Hi>), списки, таблицы и другие элементы языка.
Но в целом, выделение
значимых для семантической
Рассмотрим в качестве примера страницу официального сайта компании Microsystems LTD, расположенную в сети по адресу http://www.analyst.ru. На этой странице располагается по информация по программе TextAnalyst 2.0. Экранная форма этой страницы показана на рисунке.
Фрагмент соответствующего HTML – текста представлен ниже:
<html>
<head>
------------------------------
<meta name="KEYWORDS" content="Microsystems, TextAnalyst, text mining, knowledge discovery, textmining, e-commerce, classification, semantic analysis, neuro networks, natural linguistc, text processing, Микросистемы, анализ текстов, база знаний, документооборот, классификация, семантический анализ, нейронные сети, натуральные языки, текст процессор">
<meta name="GENERATOR" content="Microsoft FrontPage 4.0">
<meta name="ProgId" content="FrontPage.Editor.
<title>Microsystems, Ltd</title>
<link rel="stylesheet" type="text/css" href="style.css">
</head>
------------------------------
<body topmargin="0" leftmargin="0">
<table border="0" cellspacing="0" cellpadding="0">
<tr>
<td valign="top" width="239"><a
href="/index.php?lang=eng"><
border="0" src="/images/top_logo.gif"></
<td valign="top" align="left">
<table border="0" cellspacing="0" cellpadding="0">
<tr><td width="100%"><img border="0" src="/images/top_up.gif">
</td></tr>
<tr> <td width="100%">
<table border="0" cellspacing="0" cellpadding="0" width="100%"
bgcolor="#001395" height="23">
<tr><td width="100%">
------------------------------
</table>
</td></tr>
</table>
<!-- end menu -->
------------------------------
<!-- start menu here -->
<table border="0" cellspacing="0" cellpadding="0" width="100%">
<tr> <td width="241" valign="top" align="left">
<table border="0" width="100%" cellspacing="0" cellpadding="0">
<tr><td width="100%">
<p> </p>
<p align="center">
<img border="0" src="/images/10thyear_s.gif" width="210" height="52">
</p>
</td></tr>
<tr><td width="100%" valign="top" align="left">
<!-- left menu-->
<table border="0" width="218">
<tr><td width="210" bgcolor="#DDDDDD" valign="top" align="left">
<p align="right"><b>Products</b><
</tr>
<tr onmouseout="this.style.
onmouseover="this.style.
<td width="210" align="right">
<a href="/index.php?lang=eng&dir=
content/products/menu.txt
<span style="color: #000000; text-decoration: none">
TextAnalyst SDK</span></a>
</td></tr>
<tr><td width="210" align="right">
<p align="right"><img border="0" src="/images/bd14580_.gif" width="12"
height="12">
TextAnalyst</p>
</td></tr>
<tr onmouseout="this.style.
onmouseover="this.style.
<td width="210" align="right">
<a href="/index.php?lang=eng&dir=
tref&left=content/products/
" target="_self">
<span style="color: #000000; text-decoration: none">
Text Referent</span></a>
</td></tr>
<!-- end left menu-->
------------------------------
</table>
<!-- end here -->
</td>
<!-- free space -->
<td valign="top" align="left">
</td>
<!-- end free space -->
<td valign="top" align="left" width=100% >
<!-- content started here -->
<table border="0" cellspacing="6" cellpadding="0">
<tr> <td width="100%" valign="top" align="left">
<head>
<meta name="DESCRIPTION" content="TextAnalyst - personal text mining system">
<meta name="KEYWORDS" content="TextAnalyst, personal, text mining">
<title>TextAnalyst</title>
</head>
<div align="left">
<table border="0" align="left" cellspacing="4" cellpadding="3">
<tr> <td valign="top" align="center" width="250">
<p align="center"> </p>
<p
align="center"><a href="cgi-bin/stat/loadfile.
<img
border="0" src="images/downloads.gif"></
<p align="center">Получите бесплатную версию
TextAnalyst</p>
<table border="0">
<tr><td width="100%" bgcolor="#008000">
<p align="center" class="menu">
<font color="#FFFFFF">Системные требования</font></td> </tr>
<tr><td width="100%">Intel-based PC</td> </tr>
<tr> <td width="100%">Windows 9X, NT, 2000, Me</td> </tr>
<tr> <td width="100%" bgcolor="#C0C0C0">
<p align="center" class="menu">
<font color="#FFFFFF">Технические характеристики</font></td>/tr>
<tr><td width="100%" valign="top" align="left">
<ul>
<li> Средняя скорость анализа текста около 1Мбайт/мин (при использовании Pentium-II).</li>
<li>Максимальный объем анализируемой подборки не ограничен и зависит от объема ресурсов компьютера и настройки TextAnalyst.</li>
<li>Собственный объем TextAnalyst не превышает 5Мб.</li>
<li>Форматы обрабатываемых файлов:</li>
<li>*.txt (ANSI, DOS), *.rtf</li>
<li>Экспорт информации в форматы: *.txt,
*.csw (электронные таблицы).</li>
</ul> </td></tr>
</table>
------------------------------
<h1 align="center">
<img border="0"
src="../../images/octopus_
<p align="center"><b>персональная система автоматического анализа текста </b></p>
<p>TextAnalyst
разработан в качестве
<ul>
<li>анализа содержания текста
с автоматическим
<li>анализа содержания текста
с автоматическим
<li>смыслового поиска с
<li>автоматического
<li>кластеризации информации - анализа
распределения материала
<li>автоматической индексации текста с преобразованием в гипертекст; </li>
<li>ранжирования всех видов информации о семантике текста по «степени значимости» с возможностью варьирования детальности ее исследования; </li>
<li>автоматического/
</ul>
<p
align="center"><b>Не
<p
align="center"><i>Работа с
</i></p></td> </tr>
</table></div></td> </tr>
</table>
------------------------------
</body>
</html>
Сравнив приведенные экранную форму и HTML-текст, видим, что семантически значимыми элементами данного документа являются:

- Гипертекстовые системы
- Гипертекстовые технологии
- Гипертекстовые технологии
- Гипертекстовые технологии
- Гипертоническая болезнь
- Гипертоническая болезнь
- Гипертоническая болезнь
- Гиперподвижный ребенок
- Гипертекст
- Гипертекстовая технология
- Гипертекстовая технология
- Гипертекстовая технология
- Гипертекстовая технология
- Гипертекстовая технология