История обработки естественного языка

 

 

Содержание.   

1. Предыстория.

2. История  компьютерной лингвистики на  Западе.

    2.1. АОТ с 40-х годов XX века по 1965 г.

    2.2. АОТ с 1966 по 1980 годы.

    2.3. АОТ в 80-е и 90-е годы.

    2.4. Современные результаты компьютерной  лингвистики.

3. История  компьютерной лингвистики в СССР  и России.

    3.1. До теории «Смысл↔Текст».

    3.2. Теория «Смысл↔Текст».

    3.3. 70-80-е годы.

    3.4. Современное коммерческие системы.

4. Послесловие.

5. Использованная  литература и другие источники.    
 

1. Предыстория 

Для античности был характерен синкретизм мышления. Человек понимался как часть  природы и общества. Человек отождествлялся мышлению, а мышление миру. Мир можно  познавать через слова, поэтому  речь также отождествлялась с  мышлением. Мышление понималось только в словесно-логической форме. Языковое и мыслительное содержание не различались. Центральным понятием античного  учения о языке был Логос –  то, при помощи чего боги вступают в  разговор с людьми. Логос – это  и слово, правильно выражающее мысль, и мысль, правильно выраженная в  слове. В этом периоде поднимается  вопрос о том, что первично для  языка – человеческое сознание или  внешняя объективная данность. Аристотелем  впервые вводится логика для исследования речи и языка, а позднее Квинтилиан вводит разделение искусств на грамматику, логику и риторику.

 

 В  более позднее время влияние  римской империи привело к  тому, что в Европе больше чем  на тысячу появился общий язык  – латынь, а центральной проблемой  в учении о языке стал спор  реалистов и номиналистов. Реалисты  утверждали, что универсальные понятия  (человек, лошадь и т.д.) существуют  в действительности, независимо  и первично по отношению к  физической реальности. Номиналисты  заявляли, что различные объекты  имеют независимое существование.  Посредством универсальных понятий  в языке помечаются понятия,  существующие лишь в сознании, абстрактные понятия.

 

 В  1453 году пал Константинополь.  Латинская лингвистика ограничилась  рамками Италии. Но возродился  интерес к работам греческих  и римских классиков. Европа  была политически разделена. Чтобы  иметь возможность управлять,  правительства отдельных государств  использовали местные языки в  качестве общенациональных. Потребность  в латыни снизилась.

 

Средневековье вводит понятие грамматики (грамматика Порт-Ройаль), которая подразделяется на морфологию, синтаксис и прагматику. Локк вводит разделение понятий 

Концепт (понятие как таковое) и его  Выражение. Кондиак выделяет минимальные  смысловые единицы речи. Язык описывается  как единство структуры и смысла. Для целей книгопечатания вводятся стандарты языка, разработанные  Кэкстоном. Изобретение книгопечатания Гуттенбергом решающим образом повлияло на характер изучения языка.

  

 Центральной  проблемой учения о языке Нового  времени стал поиск Истинного  Языка. Европейские ученые обратили  свое внимание на санскрит, древний  язык с сильно развитым словоизменением  и более сложный, чем греческий.  Гумбольдт выдвигает гипотезу  о существовании в древности  протоиндоевропейского языка. Дарвинизм  дал толчок изучению языков  первобытных племен и представлениям  о эволюции языка.

    

Основоположником  современной лингвистики принято  считать Соссюра.Согласно Фердинанду де Соссюру, идеи подобны Вселенной, из которой ничто не может быть выделено в независимое состояние. Ничто не может быть идентифицировано (однозначно определено) до возникновения  языка. Знаки ( в частности звуки  и слова), приписываемые человеком  вещам и явлениям изначально произвольны. Для Соссюра то, что может быть извлечено путей изучения прошлого языка, имеет мало практического  значения. Более важным для его  учения является прояснение структуры  языка. Соссюр доказывает, что вопросы, касающиеся отношений языка и  мира не являются основой учения о  языке.

Языком (la langue) он называл общий для всех говорящих набор средств, используемых при построении фраз; речью (la parole) – конкретные высказывания индивидуальных носителей языка. Лингвистика по Соссюру изучает структуру языка (la langue).

Большинство современных разработок в области  АОТ являются продолжением теории Соссюра  и основываются на изучении языка, добавляя к нему исследование речи.

 

До Соссюра  язык рассматривался как именование природных объектов (Теория Имен). Соссюр предположил, что природа в хаотическом  состоянии может быть разделена  только когда язык вводит ссылки на ее объекты, так чтобы каждый объект мог быть распознан. Это был поворот  на 180 градусов по отношению к общепринятому  воззрению. Другими словами, предполагалась автономия языка. Изучение языка  превращалось в науку о предмете, независимом от мира природы.

 

 Тезис  об автономности языка Соссюр  развил в понятиях «означающего»  и «означаемого». Языковой знак  состоит из акустического образа («означающего») и понятия («означаемого»)  и имеет два основных свойства. Во-первых, между означаемым и  означающим нет внутренней, естественной  связи – связь произвольна.  Во-вторых, означающее обладает протяженностью  только в одном измерении (во  времени). Означаемое и означающее  не устанавливаются извне –  они внутренне присущи языку. 

     

    В то время как Соссюр предлагал  противопоставление означаемого  и означающего вкупе с произвольностью  природы языка, Чарльз Сандерс  Пирс изучал человеческие познавательные  процессы. 

Пирс  вводит понятие «интерпретации», чтобы  иметь возможность обращаться с  языком в конкретном контексте. Были предложены три структуры (абстракция возрастает слева направо):  

икона индекс символ
абдукция индукция дедукция
термин предположение аргументация
Соссюр  исключил понятия этой колонки из своего учения ради идеи независимости  языка «означающее»  у Соссюра «означаемое»  у Соссюра
 

 

    Дедукция (лат. deductio — выведение) — метод мышления, при котором новое положение выводится чисто логическим путем из предшествующих, вывод осуществляется по правилам логики, подразумевает цепь умозаключений (рассуждение), звенья которой (высказывания) связаны отношением логического следования. Началом (посылками) дедукции являются аксиомы, постулаты или просто гипотезы, имеющие характер общих утверждений («общее»), а концом — следствия из посылок, теоремы («частное»). Если посылки дедукции истинны, то истинны и ее следствия. Дедукция — основное средство доказательства. Противоположно индукции.

    

    Индукция (лат. inductio — наведение) — процесс логического вывода на основе перехода от частного положения к общему. Индуктивное умозаключение связывает частные предпосылки с заключением не столько через законы логики, а скорее через некоторые фактические, психологические или математические представления.

    

    Абдукция - рассуждение, имеющее  дело с  гипотезами. Гипотезы, относящиеся к реальному миру, получаются согласованием правил  и достигнутых результатов. Абдукция в логике — силлогизм (рассуждение, состоящее из трёх простых атрибутивных высказываний: двух посылок и одного заключения), вид редуктивного вывода, с той особенностью, что из посылки, которая является условным высказыванием, и заключения вытекает вторая посылка. Пример: Первая посылка - Все люди смертны. Заключение - Сократ - смертен. Мы можем предположить, с помощью абдукции, что вторая посылка - Сократ - человек.

     Язык рассматривается и как  способ умозаключения, и как  некто, основанное на определенных  аксиомах, и как зеркало реального  мира.      
 
 
 

2. История компьютерной  лингвистики на  Западе.    

      Автоматической обработке текстов  на естественном языке (АОТ)  достаточно много лет. Использование  компьютера для расчетов артиллерийских  таблиц и расшифровки шифров  уже не казались чем-то очень  уж важным через несколько  лет после окончания второй  мировой войны. Мирное время  дало исследователям возможность  пофантазировать и на другие  темы. Впрочем, до 1960-го года в  области АОТ было сделано достаточно  небольшое количество работ, так  что вполне нетрудно было бы  написать их исчерпывающий обзор.  Настоящая революция произошла  в 60-е годы.  

2.1. АОТ с 40-х годов  XX века по 1965 г.  

       Образцы механических переводчиков  языков существовали еще до  изобретения компьютера. Первой  работой, которую можно было  бы отнести к нашей области,  была система поиска по словарю,  разработанная в колледже Беркбек  в Лондоне в 1948 году.

Первые  интерес в США к этой теме обычно датируют выходом в 1949 году меморандума  Уоррена Уивера. Во время второй мировой войны Уивер был вовлечен в работы по расшифровке шифров. Его идея была проста: все люди одинаковы (несмотря на то, что говорят на разных языках), поэтому текст любого языка можно рассматривать как некую  шифровку или код. Если этот код разгадан, становится возможным вывести любой документ на другом языке. С его точки зрения немецкий язык – это зашифрованный английский.

      

     Исследователи быстро ухватили  эту идею. Ее пытались  развить  в исследовательских группах  США, Великобритании, Франции и  Советского Союза. Ранние американские  системы концентрировали свое  внимание на переводе с немецкого  на английский, так как после  войны осталось много потенциально  полезной немецкой технической  документации. Со временем интерес  переместился на перевод с  русского на французский и  английский и с французского  и английского на русский. Таким  образом Холодная война оказала  влияние и на машинный перевод.

  

    Ранние системы машинного перевода  были явно неудачными. Хуже того, они в конечном итоге привели  к враждебности  власть имущих  и тех, от кого зависело финансирование  исследований, к разработчикам этих  систем. Меморандум Уоррена Уивера 1949 года вдохновил разработчиков  многих проектов, многим из которых  пришлось теперь спуститься с  небес на землю: в АОТ не  было получено никакой теоретической  базы и никаких знаний о  методиках, которые можно было  бы в дальнейшем применять  и развивать. Первые исследователи  были зачастую математиками, а  их усилия во многом сводились  к борьбе с примитивностью  современных им ЭВМ. Немногие  разработчики были двуязычными.  В основном это были немцы,  иммигрировавшие в США. Ожидалось,  что их знания по крайней  мере помогут получать удовлетворительный  перевод технических текстов.  Однако скоро стало очевидным,  что задачу они поставили перед  собой чрезвычайно трудную. Язык  оказался гораздо более сложным  явлением, чем они себе представляли.

Кроме того знания двух языков было недостаточно: нужно было умение кодировать свои знания в виде компьютерной программы.

      

    Вопрос, который стоял перед компьютерной  лингвистикой накануне когнитивной  революции, был: может ли наука  о языке быть основана на  дедуктивной системе, подобной  физике. Индуктивный анализ обеспечивается  только посредством данных. Возможности  компьютеров на тот момент  были очень ограниченными. Кроме  того возможности развития индуктивного  подхода были ограничены недостатком  алгоритмических моделей.

      

     Как разработать систему для  обработки естественного языка,  которая пройдет тест Тьюринга? Представим большую таблицу, содержащую  соответствия между предложениями  и их смыслом или предложениями  на одном языке и предложениями  на другом языке. Это похоже  на обман и не передает сути  процесса понимания или перевода  с одного языка на другой. Таблица  должна быть бесконечно большой,  так как количество возможных сочетаний слов неограниченно. Значит, такой подход не решает проблему и нужно достигать цели за счет алгоритмических решений.  

      Типичными крайностями были развитие  теорий, в которых не уделялось  должного внимания данным (подход  «сверху-вниз»), и запоминание данных  без включения логического подхода  (подход «снизу-вверх»). История исследований  машинного перевода  в дальнейшем  – это, во многом, борьба между  этими двумя подходами.  

       Сначала очевидным казалось обратиться  за помощью к лингвистике. Литература 50-х годов свидетельствует о  растущей осведомленности лингвистов  в проблематике машинного перевода. Для молодых исследователей в  области языкознания тема машинного  перевода становится достаточно  популярной. Хотя можно было бы  поприветствовать стремление смежных  дисциплин внести вклад в решение  проблемы, но до некоторых пор  оставалось непонятным в чем  этот вклад состоит, так как  подходящей для цели машинного  перевода теории в языкознании  не существовало.

       

 Используемый  в это время вариант подхода  «снизу-вверх» был частью общенаучного  течения, называемого структурализмом.  Структурализм в случае АОТ  – это попытка преобразования  спекулятивной лингвистики в  науку о языке.  Невозможно  покрыть все аспекты живой  речи. Но лингвисты восприняли  эту невозможную задачу как  вызов для себя.   

   Они фокусируются на специфических  феноменах и производят выводы, основанные на любых языковых  феноменах, о которых они когда-либо  слышали. Создаются массивные  базы данных образцов предложений,  которые лингвисты хранят и  организовывают для своих нужд.   

   Неудачи подводят исследователей  этого периода к  выводу: субъективные  спекуляции полученные из наблюдений  над данными не могут прояснить  природу языка.  

   Ситуация изменилась в 1957 году  с публикации работы молодого  американского лингвиста Ноама  Хомского «Синтаксические структуры». Положения, развитые в этой  статье до сих пор являются  в АОТ доминирующими. Хомский  сделал революции в лингвистике  и, вероятно, сделал это без  посторонней помощи. Он представил  идею порождающих (генеративных) грамматик. основанные на правилах  описания синтаксических структур. Хотя многие не приняли идею  Хомского о продуцировании альтернативных  лингвистических формализмов и  его метода извлечения лингвистических  данных, почти все работы в  области АОТ с 1957 года были  отмечены его влиянием.

 

Хомский считал способность к языковому  общению заложенной в человека генетически, врожденной, поэтому поддержал идею возможного открытия природы языка  через исследование способности  человека к языковому общению. Очевидно, область исследований ограничивается бессознательным представлениями  о грамматике(синтаксисе), а семантика  исключалась из рассмотрения.

 

   Работы Хомского послужили началом  рационалистического направления  в компьютерной лингвистике. Исходная  точка рационализма - компьютерные  модели, независимые от языка.  Модели лучше всего принимаются,  когда они настолько просты, насколько  это возможно. Здесь можно провести  параллель с идеей Соссюра  отделить язык от реального  мира.  

      С самого начала этот подход  не дал хороших результатов,  но поскольку работы в этом  направлении упорно продолжались, результаты стали несколько лучше,  чем у систем, исповедовавших  подход «снизу-вверх». Теория универсальной  грамматики Хомского давало схему,  независимую от индивидуальных  особенностей конкретного языка.  Синтаксис лучше всего соответствовал  моделям независимых языков, в  которых только языки принимались  в расчет.  

     Ранние исследователи машинного  перевода поняли, что машина не  может перевести введенный текст  без дополнительной помощи. Учитывая  нехватку лингвистических теорий, особенно до 1957 года, кое-кто предлагал  предварительно редактировать тексты  таким образом, чтобы отмечать  в них трудности, например, чтобы  разрешить омонимию. А поскольку  системы машинного перевода не  могли производить правильный  результат, текст на целевом  языке должен был быть отредактирован, чтобы стать понятным.  

     Идея предварительного и последующего  редактирования текста породила  идею, что компьютер может быть  использован для оказания помощи  человеку в областях, с которыми  компьютер не в состоянии пока  справляться своими силами. В  области машинного перевода компьютер  может действовать как память-хранилище,  освобождая человека от необходимости  знать огромное количество слов. Бар-Гиллель рассмотрел область  исследований и пришел к выводу, что Полностью Автоматический  Высококачественный Перевод (FAHQT – Full-Automatic High-Quality Translation) не возможен без знаний. Он также пришел к выводу, что многочисленные проекты, в которых перевод сводился главным образом к попарной замене слов одного языка на слова другого, были изначально обречены на провал даже с учетом многочисленных заплаток и расширений. Причина проста: переводчик-человек добавляет свое понимание документа, который нужно перевести, к своим знаниям о структурах языка, с которым он работает. Там остаются некоторые конструкции, которые требуют понимания документа или пути, по которому представления о мире и предметной области могут быть представлены. Во многих языках трудно понять, что имеет в виду говорящий предложение типа:  

«Она  надела красные туфли  и чулки».   

      Были ли чулки тоже красными? Во многих случаях это не  имеет значения, но если система,  например, анализирует свидетельские  показания, значение таких деталей  может существенно возрастать.

     

Комментарии Бар-Гиллеля оказали долговременное влияние на восприятие практичности АОТ и машинного перевода, в  частности. Другим обличающим фактором были размеры продаж систем. Исследовательские  проекты должны были иметь постоянное и долгосрочное финансирование, чтобы  удерживать членов групп разработчиков  вместе. В ситуации, когда есть много  групп, работающих в одной и той  же базовой области, крайне важно  уметь показывать, что был достигнут  значительный прогресс. Спонсоры хотели видеть четкую практическую демонстрацию результатов от их финансирования. Продажи систем машинного перевода были убыточными до середины 1960-х годов. Этому не способствовало даже наивное  стремление некоторых представителей прессы подать с блеском некоторые  разработки. Одним из примеров этого  была организация презентации Джорджтаунской системы 7 января 1955 года. Сейчас, спустя полвека после этого, система  представляется невероятно сырой, для  которой  не было никакой надежды  когда-либо воплотиться в какое-то проявление практического машинного  перевода.

   

В США  финансирование машинного перевода в середине 1960-х годов достигало 20 миллионов долларов. Консультативный  Комитет по автоматической обработке  языка (ALPAC – Automatic Language Processing Advisory Commitee) выпустил отчет о результатах финансирования в котором сделал вывод, что «машинный перевод общенаучного текста не получен и нет перспектив его получения в близком будущем».

Финансирование  машинного перевода в США было остановлено, что в конечном итоге  привело и к остановке разработок в АОТ, не связанных с машинным переводом. Это также послужило  толчком к остановке финансирования разработок в других странах и  развитие АОТ вступило в неактивную фазу.      
 
 
 
 

2.2. АОТ с 1966 по 1980 год  

Некоторые историки свидетельствуют о том, что АОТ практически исчезла  со сцены после доклада ALPAC. Это не в полной мере соответствует действительности. Безусловно верно и то, что разработок стало значительно меньше, а работы по машинному переводу были практически свернуты больше чем на 10 лет. Тем не менее, в течении 15 лет после доклада ALPAC произошел ряд значительных событий, некоторые из которых повлияли и на сегодняшнее положение дел в этой области науки.

 

Ключевыми идеями, появившимися в этот период, были Расширенная Сеть Переходов, Грамматика Падежей и процедурная семантика.   

Расширенная Сеть Переходов (ATN – Augmented Transition Network).   

    Расширенная Сеть Переходов представляет собой образец программного обеспечения, продемонстрировавшего возможность использования достаточно мощных грамматических средств для обработки синтаксиса. Неправильно думать о ней только как о средстве обработки синтаксиса, потому что это нечто большее, чем просто реализация поискового алгоритма. Она представила формализм для выражения знаний о предметной области (знания записывались в виде расширенной сети переходов). Был также представлен способ использования этих сетей для поиска путей решения проблем. Применительно к АОТ речь шла о знаниях синтаксиса английских предложений, а проблемой, которую система должна была решать, был синтаксический разбор этих предложений.  

Грамматика  Падежей (Case Grammar).  

   Грамматика падежей привлекательна  с точки зрения семантики. Многие  языки, например английский (русский  в меньшей степени), выражают отношения  между глаголами и существительными  главным образом посредством  связующих предлогов. Рассмотрим следующее предложение:  

   John bought a ticket for Mary in the Symphony Hall Booking Office.

   (Джон купил билет для Марии в кассе заказов симфонического зала)  

Мы знаем  из позиции слов John и ticket, что Джон является агентом, производящим действие, а билет является объектом (или пациентом) этого действия. Мы знаем также, что Мэри является бенефициаром (тем, кто извлекает пользу) действия, так как перед ее именем употреблен предлог for. Местом действия является касса заказов симфонического зала, на что указывает предлог in.   

Чарльз  Филмор (Fillmore) заметил, что некоторые языки не имеют предлогов, но и в них существительные отвечают тем же ролевым классам. В разных языках используются различные способы выражения той же самой информации. Например, это может быть достигнуто посредством использования окончаний или жесткого порядка слов в предложении. ( В русском языке для выражения семантической роли в разной степени служат и предлоги и окончания и положение слова в предложении). Филмор предположил, что существует очень небольшое число глубинных падежей (deep cases), которые выражают возможные отношения между глаголом и существительным в предложении. Разные языки выражают эти глубинные роли разными способами, такими как порядок слов, местоимения, словоизменение (например, изменение окончаний слов).

  

Значение  этого предположения для АОТ  в том, что оно позволяло достаточно легко создать теорию о том, как  собирать семантическую информацию. Разработка грамматики падежей также  привело к развитию одной из сложных  проблем машинного перевода: перевода предлогов.  

Концептуальная  зависимость и  процедурная семантика 

В этот период было несколько значительных разработок в обработке семантики. Шэнк (Shank) и его коллеги предложили понятие Концептуальной Зависимости и связанный с ним метод выражения языка посредством семантических примитивов (процедурная семантика). Система была создана так, что в ней в принципе отсутствовала синтаксическая обработка. Килиан (Quillian) разрабатывал идею семантической сети, которая была в различных формах  использована в дальнейшем во многих системах. Уильям Вудс (Woods) использовал идею процедурной семантики для описания промежуточного представления, используемого во взаимодействии системы обработки текста с базой данных.   

Ключевыми разработками в этом периоде были SHRDLU, LUNAR и LIFER/LADDER.  

История обработки естественного языка