Принципы составления двуязычных словарей электронного формата
Министерство образования и науки Российской Федерации
Федеральное агентство по образованию
Федеральное
государственное
высшего профессионального образования
«Южный федеральный университет»
Факультет филологии и журналистики
Кафедра английской филологии
ПРИНЦИПЫ СОСТАВЛЕНИЯ ДВУЯЗЫЧНЫХ СЛОВАРЕЙ ЭЛЕКТРОННОГО ФОРМАТА
Курсовая работа студентки 3 курса очной
формы обучения А.И. Рудской
Научный руководитель:
Профессор, д.ф.н. Николаев С.Г.
Ростов-на-Дону
2010
СОДЕРЖАНИЕ
ВВЕДЕНИЕ 3
1. СУЩНОСТЬ ЭЛЕКТРОННОГО СЛОВАРЯ И ЕГО ВИДЫ 6
1.1 Электронный словарь и его использование 6
1.2 Системы поиска 11
1.3 Основа электронного словаря 13
1.4 Классификация электронных словарей 16
2. АНАЛИЗ ПРАКТИКИ СОСТАВЛЕНИЯ
2.1 Электронные словари "МультиЛекс" 19
2.2 Электронные словари "Lingvo" 21
2.3 Проблема словарной статьи в электронном словаре 22
2.4 Термин как основа современного двуязычного электронного словаря 28
Заключение 37
БИБЛИОГРАФИЯ 39
ВВЕДЕНИЕ
Общеизвестно, что создание словарей является чрезвычайно трудоемким делом. С.В. Гринёв отмечает, что для составления толкового или переводного словаря объемом 1000 лексических единиц одному человеку потребуется несколько лет [8].
Актуальность настоящего исследования обусловлена интересом современной лингвистики к изучению специфики электронных словарей и возможностей их дальнейшего совершенствования.
Объектом курсового исследования являются принципы формирования двуязычных словарей электронного типа, а предметом – различные виды электронных словарей.
Проникновение компьютера в лексикографию первоначально заключалось в создании машинных банков данных, в разработке методов формирования этих банков, представления информации и ее использования. Со временем стали актуальными задачи облегчения и ускорения работы пользователя словарем за счет переведения печатных словарей в электронный формат, создания «корпусов» данных и новых видов словарей, использующих преимущества глобальной сети связей и возможности различных поисковых систем. Вопросы создания многофункциональных текстовых баз данных, или корпусов, находятся в центре внимания лексикографов и рассматриваются в русле как теоретической, так и практической лексикографии. Создатели словарей пересматривают свои лексикографические работы на корпусной основе.
Теоретическим фундаментом курсовой работы послужили труды следующих авторов: Берков В.П., Белоногов Г.Г., Зельцер Д., Кутыев И., Плавская Т.В., Рублева О.С., Русакова А.В., Савина A., Типикина Т., Селегей В.
Быстрое развитие в наши дни науки и техники вызывает необходимость в подготовке все большего числа терминологических словарей разных типов. Поэтому наряду с традиционными методами подготовки терминологических словарей все большее применение в последнее время находят автоматизированные методы работы.
Известно, что переводчик, работающий традиционным способом, без текстоориентированных списков терминов, тратит много времени на безрезультатный поиск многих из них в традиционных словарях и справочниках, на консультации со специалистами, то есть на подготовительную работу. Не случайно на современном этапе так много говорят о необходимости поиска путей повышения производительности труда переводчика, об интенсификации работ в плане создания автоматических словарей, что существенным образом повлияло бы на процесс автоматизации рабочего места (АРМ) переводчика.
Целью данной курсовой работы является поиск ответа на следующие вопросы: Что такое электронный словарь? Просто современная удобная оболочка “бумажного” словаря или же начало нового этапа в развитии лексикографии?
Для достижения данной цели были поставлены следующие задачи:
- Изучить особенности электронного словаря;
- Рассмотреть различные виды классификаций электронных словарей;
- Исследовать проблему словарной статьи электронного словаря;
- Определить роль термина как основы современного электронного словаря;
- Выявить преимущества электронного словаря по сравнению с бумажным.
В ходе исследования использовались следующие методы: сопоставительного анализа, обобщения, интерпретации и комплексного описания.
Курсовая работа включает введение, теоретическую часть, практическую часть, заключение и список использованной литературы.
Теоретическая часть включает четыре параграфа и отражает сущность электронного словаря, принципы построения, особенности его использования, классификацию электронных словарей.
Практическая часть представляет собой анализ практики формирования словарей электронного типа и существующих проблем в данной сфере.
Курсовая работа выявляет тенденцию формирования современного электронного словаря на основе терминов, что определяет её практическую значимость.
СУЩНОСТЬ ЭЛЕКТРОННОГО СЛОВАРЯ И ЕГО ВИДЫ
Электронный словарь и его использование
Словари играют большую роль в современной культуре, в них отражаются знания, накопленные обществом на протяжении веков. Они служат целям описания и нормализации языка, содействуют повышению правильности и выразительности речи его носителей. [12]
Состояние современной двуязычной
лексикографии демонстрирует
Главная особенность электронного словаря — это возможность обойти роковое противоречие “бумажной” лексикографии, состоящее в следующем: чем больше информации предлагает словарь, чем более развит его научный аппарат, тем сложнее им пользоваться.
Теория и практика в лексикографии неразрывно связаны, ведь, как верно заметил Б.Ю. Городецкий, «словарь является одновременно и объектом лексикографической деятельности, и предметом изучения в лексикографической теории». Формирование электронного словаря включает построение искусственных языков, разработку информационных банков, построение алгоритмов обработки текстов. [6] При создании словаря могут привлекаться методы лексикологии, семантики, лингводидактики, теории перевода и других, смежных с лексикографией, дисциплин в зависимости от направленности словаря.
Задача электронных словарей —
удовлетворить нужды самой
Как отмечает Румянцева Е.А в своей работе «Аспекты разработки двуязычных учебных электронных словарей» [15]: «Компьютерные технологии облегчили как работу лексикографа по созданию словаря, так и работу конечного пользователя со словарем. На наш взгляд, принципиально важны две характеристики компьютерных словарей упоминаемые, в частности, Б. Свенсеном [23] – это возможность полнотекстового поиска и потенциально неограниченный объем».
Нельзя не согласиться с Тараскиным А.А. [21], что электронных словарей сейчас выпущено довольно много, поэтому нужно остановиться только на двуязычных англо-русских и русско-английских словарях. Для примера автор выбрала два самых известных: Lingvo компании Abbyy и МультиЛекс, разработанный фирмой МедиаЛингва. По мнению Добролюбовой Н.А. эти словари любопытно сравнить, ведь создающие их команды, исповедуют разные взгляды на принципы электронной лексикографии.
Первое, что бросается в глаза, когда мы говорим об электронных словарях - это резкое сокращение объема. На десятиграммовом компакт-диске помещается целая полка толстых словарей общим весом в двадцать пять килограмм. Но, естественно, не это главное. Важно, что электронный словарь принципиально может обойти ключевое противоречие книжной лексикографии: чем больше информации предлагает словарь, чем развитее его научный аппарат, тем сложнее им пользоваться.
Таким образом, классические словари разделяются на две категории. Первая - популярные, относительно удобные, но довольно простые. Вторая - обстоятельные академические издания, не позволяющие быстро получить искомую информацию.
Современные электронные словари не только значительно превосходят по объему книжные, но и находят искомое слово или словосочетание за несколько секунд. Причем искать можно в любой форме. Некоторые, например Lingvo, встраиваются во все основные офисные приложения и выделенное слово можно переводить наведение курсора.
При традиционном подходе минимальной единицей доступа является лексема (имя словарной статьи): нужно прочесть всю статью, чтобы определить, содержится ли в ней ответ на наш запрос. Для таких словарей, как оксфордский, это представляет серьезную проблему. Например, глагол 'set' имеет там 40 только основных значений (и у многих из них имеются подзначения).
Пользователь хотел бы, чтобы словарь максимально локализовал релевантную информацию. При этом речь не идет об автоматическом выборе переводного эквивалента (если мы говорим о переводном словаре). Специфика словарного ответа в том, что он дает весьма разнообразную информацию о слове или словосочетании, а не просто переводное соответствие, предполагает активный выбор пользователя из нескольких возможных хорошо обоснованных альтернатив.
Однако попытка решить проблему адекватной реакции словаря на запрос неизбежно наталкивается на сопротивление самого словарного материала, перенесенного из бумажного словаря.
Электронные словари не только содержат транскрипцию, но и могут произносить слова. Здесь тоже существует два подхода. В МультиЛекс встроен синтезатор звука и произносятся все слова. Однако полностью доверять такому подходу, не контролируя его по транскрипции, опасно. Синтезатор может неправильно поставить ударение или вообще исказить произношение слова.
В
Abbyy Lingvo основную лексику озвучивает
диктор с оксфордским
Но, конечно, самое главное преимущество хороших электронных словарей - одновременный поиск не только по названию словарной статьи, но и по всему огромному объему словарей, что просто нереально в бумажном варианте. Такой поиск создает многомерный портрет слова, при этом извлекаются из глубин словарной статьи не только конкретные примеры его использования и устойчивые выражения, в которых слово встречается, но и обнажаются, становятся явными языковые законы, которым подчиняются правила словообразования. Даже мобильный электронный словарь не может отразить все сиюминутные движения языка, но он может дать ключ для расшифровки и понимания этих изменений, делая пользователя соавтором лексикографа. Что очень важно, когда требуется точный смысловой перевод, ведь это не задача подбора подходящего выражения, а в широком смысле отображение одной культуры с помощью языка другой. Поэтому в Lingvo можно строить и свой собственный словарь под общей оболочкой.
Чтобы пользователь смог почувствовать оттенки слова, необходимо привести в словаре максимально возможное количество синонимов — слов, близких по смыслу. Например, английский глагол break означает, в частности: 1) ломать, разрушать, разбивать и 2) рвать, разрывать, отрывать. Для первого случая синонимами будут слова crush (давить, дробить) и smash (разбиваться вдребезги). Второму значению близки слова separate (отделять, разделять — более деликатный смысл) и tear off (отрывать, срывать). Через общую "карту" синонимов становится яснее, как перевести на иностранный язык слово с тем или иным смысловым оттенком. Очень полезны иллюстрирующие примеры, особенно на использование слов с предлогами или в устойчивых словосочетаниях.
Например: "уехать отсюда", "уехать куда-то", "уехать за чем-то", "уехать" в значении "отсутствовать".
Информацию о синонимах, словосочетаниях и случаях употребления правильнее всего предоставить на родном языке пишущего: если Писатель русский - то в русско-английском словаре, если он англичанин — то в англо- русском. Ни для кого не секрет, насколько лучше помогают толковые английские словари при решении мучительной проблемы, какое слово употребить. А вот жесткая ориентация словаря на перевод, а не на описание языка делает его использование Писателем непростым и неочевидным. Таким образом, в современных электронных словарях отражено пионерское достижение российской лексикографии - двуязычный словарь во многом становится толковым. Кроме того, такой электронный словарь, как Lingvo, строит нажатием нужной клавиши парадигму, то есть совокупность всех форм слова.
Системы поиска
Вообще, в условиях глобализации, у пользователей электронных словарей возникает потребность уже даже не в двуязычных, а многоязычных словарях.
Так, Н.Н. Абрамова и Е.И. Глобус [2] обращают внимание на то, что расширение ЕС - это не только политическая и экономическая проблемы, но и лингвистическая проблема. Сегодня в ЕС говорят на 20 официальных языках, относящимся к разным языковым семьям: германским, романским, славянским, угро-финским. В рамках ЕС ведется разработка многоязычных словарей, которые будут помогать в общении. Однако роль многоязычных словарей не исчерпывается функцией перевода. Они применяются для обучения языкам, унификации терминологии в различных областях науки и технологий, поиска информации в иноязычных базах данных по запросам на родном языке (так называемый кросс-языковой поиск). В последние годы в связи с бурным развитием интернет-технологий актуальность многоязычной лексикографии резко возрастает.
Эти факты красноречиво свидетельствуют об актуальности создания поисковых систем с кросс-языковыми возможностями.
Такие системы пока не получили в Интернете распространения. Компания ПРОМТ выпустила первую систему машинного перевода для Интернета под названием WebTranSite, снабженную средством перевода запросов на поиск с английского, немецкого и французского языков на русский и обратно. Однако качество перевода не удовлетворяет взыскательных пользователей. То же самое можно сказать и о системе перевода SYSTRAN (Systran, USA) на сервере Altavista, которая, правда, обладает большими возможностями в смысле количества задействованных языков.
Для поиска в базах данных в мире популярна разработка компании Convera Technologies - программный продукт RetrievalWare (RW), в котором реализована функция кросс-языкового поиска. Пользователь может формировать запросы на одном из 14 языков (русском, английском, немецком, французском, испанском, арабском, китайском, японском и т.д.), а получать в ответ документы на других языках. Однако сами разработчики утверждают, что использовать эту дорогостоящую систему только для работы с Internet-ресурсами нецелесообразно. Поэтому основные клиенты Convera - крупные банки, государственные организации, СМИ, исследовательские центры и т.д.
Из наших отечественных разработок следует отметить систему поиска информации в русскоязычных реферативных базах данных по запросам на английском языке, которая уже несколько лет функционирует в ВИНИТИ РАН. Для перевода запросов с английского языка на русский используется система ERTRANS, затем русскоязычные переводы формализуются с помощью логических операторов и исключается малоинформативная лексика для использования их в ИПС «Сокол».
Также в работе Саломатиной Н.В. и Гусева В.Д. «Автоматизация формирования индикаторных словарей и возможности их использования» [18] описывается оригинальный подход к решению проблемы поиска, связанный с индикаторными словарями и индикаторным методом извлечения информации.
Однако проблема поиска не входит в круг вопросов курсового исследования и требует отдельного рассмотрения.
Основа электронного словаря
Существующая в настоящее время практика разработки многоязычных машинных словарей опирается на традиционные книжные словари и тезаурусы, которые сначала с помощью технологий сканирования и распознавания текстов переводятся в электронную форму, а затем автоматически записываются в требуемом формате. По такому методу созданы все известные словари, например Lingvo, MultiLex, Eckado и т.д. Некоторые многоязычные словари (например, во ВНИИКИ Госстандарта) создавались вручную на основе справочников, пособий, толковых словарей, энциклопедий и т.д., а затем записывались в электронной форме.
Однако если использовать только лексику, содержащуюся в традиционных книжных словарях, то получить хорошее покрытие текстов невозможно, так как словари всегда отстают от реальных текстов.
Оригинальный способ решения этой проблемы предлагался компанией Мultitran в проекте multitran.ru - ведение словарей с помощью Интернет в режиме on-line.
Н.Н. Абрамова и Е.И. Глобус [2] видят путь решения в том, чтобы при разработке машинных многоязычных словарей наряду с обработкой существующих традиционных словарей составлять словари по реальным текстам, естественно, используя автоматизированные методы.
Идея составления двуязычных словарей на основе билингв (или параллельных текстов) впервые была высказана профессором Белоноговым Г.Г. [4] и реализована его учениками. В настоящее время в компьютерной лингвистике активно развивается направление по исследованию многоязычных корпусов текстов.
В 90-х годах прошлого века в ВИНИТИ был составлен русско-английский словарь на основе массива текстов заголовков научно-технических документов на английском языке и их переводов на русский язык. Словарь составлялся с использованием средств автоматизации во всех основных операциях, таких как выделение пар русских и английских заголовков и их нумерация, морфологический анализ русских словосочетаний, построение поисковых образов словосочетаний (ПОС) и сортировка словосочетаний по ПОС-ам, удаление дублирующихся пар заголовков. Переводные соответствия между русскими и английскими словосочетаниями устанавливались с помощью дистрибутивно-статистического метода. В основе этого метода лежит гипотеза о том, что «если два предложения (на русском и английских языках) являются переводами друг друга, то для каждого слова и/или словосочетания одного из предложений с высокой вероятностью найдется эквивалентное ему по смыслу словосочетание или слово из другого предложения, и при этом переводы слов, входящих в состав русского словосочетания, будут располагаться в английских предложениях компактно».
Сначала
по всему массиву русских
Попыток
автоматического составления
Наиболее остро стоит вопрос о многозначности слов и словосочетаний. Известно, что в двуязычных словарях в силу объективных языковых факторов (существование синонимии слов и словосочетаний, грамматических конструкций, синонимичных аббревиатур для выражения одного и того же понятия) не всегда достигается взаимно-однозначное соответствие русских и иноязычных словосочетаний. В многоязычных словарях роль этих факторов усиливается за счет включения новых языков, в каждом из которых имеются эти явления. Поэтому при составлении словарей нужно либо изначально выявлять синонимию в исходных параллельных текстах с помощью многоязычного тезауруса, приводя все синонимы к заглавному дескриптору, либо выявлять многозначность слов и словосочетаний в процессе анализа текстов.
Классификация электронных словарей
За последние
десятилетия значительно
НАПРАВЛЕНИЯ ЛЕКСИКОГРАФИЧЕСКОЙ РАБОТЫ
Общая лексикография Частная лексикография
учебная научно- компьютерная ассоциативная авторская диалекто- …
(двуязыч-
техническая
ная) (термино-
логическая)
Рис. 1
Приведенный на рис. 1 перечень остается открытым, поскольку с течением времени и появлением новых средств лексикографирования могут оформиться и другие направления работы в этой области, в том числе и прогнозируемая нами разработка единой системы электронных ресурсов, раскрывающая специфику слов-коррелятов в разных лингвокультурах за счет добавления к словарям результатов экспериментальных исследований различных видов.
Универсальной классификации словарей не существует в силу того, что один и тот же словарь может быть отнесен к разным типам в зависимости от выбранного критерия классификации (см. таблицу).
Таблица. Основные критерии классификации и типы словарей
Критерии классификации |
Типы словарей | |
1 |
Количество словарных статей |
Большие, краткие, малые |
2 |
Количество языков |
Одноязычные (учебные, энциклопедические, лингвострановедческие, толковые, этимологические, ономастические, иностранных слов), переводные |
3 |
Охват лексики |
Специальные, толковые, энциклопедические, орфографические, орфоэпические, тезаурусы |
4 |
Оформление информации |
Бумажные, компьютерные |
5 |
Функциональная направленность |
Функциолнально-отраслевые (тезаурусы, терминологические, тематические), функционально-языковые (словари сочетаемости), функционально-образные (фразеологические, словари крылатых слов) |
6 |
Порядок подачи лексического материала |
Алфавитные, обратные, гнездовые |
7 |
Культурологическая направленно |
Ономастические, страноведческие, словари литературной нормы |
8 |
Количество лингвистической |
Лингвистические и энциклопедические словари |
9 |
Назначение |
Учебные, информационно-поисковые, справочники |
10 |
Отношение к синхронии и диахронии |
Исторические, неисторические, этимологические |
11 |
Отношение к языковой норме |
Нормативные, ненормативные |
12 |
Тип языкового общения |
Общие, областные и т.п. |
13 |
Источник информации о слове |
Полученные через анализ устной речи, письменной речи, обращение к носителям языка и культуры |
14 |
Виды деятельности пользователя словарем |
Словари, ориентированные на научно-исследовательскую деятельность лингвиста (любой вид словаря и любое количество словарей); словари, ориентированные на практическую деятельность пользователя словарем (выбор словаря/словарей в зависимости от цели, ситуации и т.д.) |
В зависимости от используемых источников информации о слове можно выделить следующие типы словарей (рис.2):
АНАЛИЗ ПРАКТИКИ СОСТАВЛЕНИЯ
ДВУЯЗЫЧНЫХ ЭЛЕКТРОННЫХ СЛОВАРЕЙ
Электронные словари "МультиЛекс"
Компьютерная лексикография является особым направлением в практической лексикографии со своими собственными подходами не только к отображению, но и к содержанию словаря. В. Селегей [19] полагает, что электронный словарь - это особый лексикографический объект, в котором могут быть реализованы и введены в обращение многие продуктивные идеи, не востребованные по разным причинам в бумажных словарях.
Самыми
популярными и постоянно
Компания МедиаЛингва придерживается при создании словарей МультиЛекс довольно простой стратегии. Она создает цифровую копию известных книжных изданий. На сайте фирмы можно найти формулировку этого принципа: "В основу электронных словарей заложены словарные базы книжных изданий, уже завоевавших популярность и признание среди переводчиков, преподавателей иностранных языков, студентов и школьников". Некоторые эксперты считают, что такая политика покоится на эксклюзивном договоре МедиаЛингва с "естественным монополистом" рынка российских словарей, издательством "Русский язык". С точки зрения МедиаЛингва, задача электронной лексикографии - как можно точнее перевести традиционный словарь в электронную форму.
За основу словаря «МультиЛекс» взят "Новый большой англо-русский словарь" под редакцией А.Д. Апресяна. Есть и расширенная версия, где к основному словарю добавлены экономико-финансовый, юридический, строительный, политехнический словари и словарь по полиграфии и издательскому делу.
Конечно,
словарь Апресяна - выдающееся достижение
лексикографии, но подход МедиаЛингва
имеет и недостатки. Первое, традиционные
словари довольно серьезно отстают
от языковой реальности. Обычно это
не менее десяти лет. А электронные
словари можно пополнять чуть ли не ежедневно.
Второе, словари, содержащие сотни тысяч
словарных статей, какими бы квалифицированными
лексикографами они не составлялись, всегда
содержат ошибки и неточности, не говоря
уже о возникновении дополнительных значений
слов. Жесткая привязка к бумажному прототипу
не дает возможности исправлять и дополнять
электронный, тем более изменять структуру
построения словарной статьи.
Электронные словари "Lingvo"
По другому
и, вероятно, более перспективному пути
пошла компания Abbyy.
Конечно, и в их большом электронном словаре
LingvoX3 есть переведенные в цифровой вид
лицензированные бумажные словари - это
политехнический, юридический, экономический,
финансовый, медицинский и - что очень
своевременно - динамично пополняемый
компьютерный словарь. Но основу
Lingvo, по словам руководителя лингвистического
отдела фирмы Владимира
Селегея [19], составляет электронный словарь
собственной разработки. Каждая новая
версия Lingvo дополняется актуальной лексикой,
и в ней исправляются найденные ошибки
и неточности. Таким образом, благодаря
лексикографическим исследованиям англо-русский
словарь фирмы Abbyy близок к языковой практике.
Удачной
находкой Abbyy выглядит приглашение
всем желающим размещать на их Интернет-узле
словари собственного изготовления http://www.lingvoda.ru/index.
2.3 Проблема словарной статьи в электронном словаре
Рублева О.С. в своей работе «Слово в электронном словаре (с позиций пользователя электронными ресурсами)» [14] рассмотрела 42 электронных словаря русского языка и 37 электронных словарей английского языка и существующие типологии словарей такого рода, что позволило ему предложить собственную типологию словарей на электронной основе (см. схему на рис. 3).
Рис. 3
Особое значение имеет выбор слова для анализа словарных статей в словарях различных типов. Для этого в своем исследовании Рублева О.С. [14] составила анкету и предложила ее пятидесяти испытуемым – сотрудниками двух коммерческих компаний. В результате было получено 50 анкет, на основе которых выбрано именование нравственного качества «порядочность» как получившего самую высокую суммарную оценку по шкале от 0 до 100.
Ход дальнейшего исследования включал семь последовательно выполняемых этапов, схематично представленных на рис. 4.
Рис. 4