23599

Автоматизация анализа письменного текста: основные подходы к решению проблемы

Доклад

Иностранные языки, филология и лингвистика

ТБД автоматизированная система инвентаризации и машинного представления терминологической лексики и ее семантизации в системах машинного и человекомашинного речевого общения. Научные задачи: моделирование терминологической системы РЯ как системы подсистем построение общенаучных и общетеоретических тезаурусов исследование русской терминологии Типы традиционного использования ТБД: справочноинформационное обслуживание специалистов различных областей знания обеспечение традиционного перевода научнотехнической литературы обеспечение АСОТ...

Русский

2013-08-05

16 KB

1 чел.

Билет 14

1. Автоматизация анализа письменного текста: основные подходы к решению проблемы.

Существует 2 основные стратегии решения проблемы:

1. модульный подход - последовательный анализ по уровням (морфологический, синтаксический, семантический, прагматический)

2. интегральный подход (более современный и более адекватный, Р. Шенк)

1.   Системы модульного типа (Леонтьева):

модуль морфологического анализа

-> полное морф. представление

модуль синтаксического анализа

-> полное синт.представление

модуль семантического анализа

-> частичное (фрагментарное) представл.

прагматический анализ

(пока не реализован)

Для широких ПО может быть использован в нескольких системах:

СМП (SYSTRAN)

системах извлечения знаний

ИПС

2.   Системы интегрального типа

Концептуальный анализ

->

фрагментарные концептуальные представления:

морф.анализ

синт.анализ

сем. анализ

сценарии, фреймы. планы.

Ищет в тексте диагностические слова

заполняет пустые слоты в сценарии

делает ряд концептуальных выводов (inferences) о смысле текста (в результате чего способна отвечать на поставленные вопросы по содержанию)

на определенных этапах подключает процедуры

нельзя получить уровневое представление

тексты узко ограниченной тематики

Пример: интегральная система анализа Шенка:

1. MARGE (Memory Response Generation in English) - обработка концептуальной информации.  В основе лежит теория концептуальных зависимостей - комплексная теория человеческого мышления.

Работает в двух режимах:

перефразирование (перевод входной фразы на ЯКЗ)

концептуальный вывод

2. Модель SAM (Script Applying Mechanism) является компьютерной программой, которая позволяет понимать связность текста за счет применения сценариев:

 POLITICS (ведет диалог, моделирует политическую идеологию)

 PAM  -> TALE-SPIN - порождение сказок

 FRUMP - машинное реферирование сообщений на нескольких языках, чтение , опирающееся на понятие интереса (Integral Partial Parser)

2. Терминологические банки данных: структуры, функции, методы построения.

ТБД - автоматизированная система инвентаризации и машинного представления терминологической лексики и ее семантизации в системах машинного и человеко-машинного речевого общения. Это единая служба с удобным доступом, описывающая все сведения о термине и ликвидирующая неравномерность описания терминологии.

Научные задачи:

моделирование терминологической системы РЯ как системы подсистем

построение общенаучных и общетеоретических тезаурусов

исследование русской терминологии

Типы традиционного использования ТБД:

справочно-информационное обслуживание специалистов различных областей знания

обеспечение традиционного перевода научно-технической литературы

обеспечение АСОТ, включая системы машинного перевода

лингвистическое обеспечение авт. систем информации

обеспечение работ по упорядочению терминологии

подготовка и издание терминологических словарей

унификация определенных терминов

подготовка научных отчетов о составе РЯ

Организационная структура ТБД:

терминологические центры

службы переводов (переводческая функция)

службы стандартизации (нормативная функция)

университеты (исследовательская функция)

всероссийские органы НТИ (по АСУ и ИПС)

Функциональная структура ТБД:

1. Головной ТБД - справочно-поисковый аппарат  по видовым банкам данных:

ведение коммуникативного формата данных

организация и руководство работами по передаче данных в ТБД

обработка и ввод данных

обслуживание предприятий

2. Специализированные ТБД (сбор, хранение , обработка информации), могут включать существующие ТБД, словарно-терминологические службы НТИ:

отбор представительного массива источников

ввод и обновление терминологической информации в БД

передача информации другим СТБД и ГТБД

эксплуатация СТБД в соответствии с конкретными задачами организации.

ТБД состоит из ряда массивов, которые называются подфондами.

Подфонды - массивы терминов, которые создаются и хранятся в центральном органе МФРЯ (Машинный фонд РЯ) на базе массивов первичного типа.

Подфонды:

специальных и межотраслевых терминов, фигурирующих в отдельных отраслях знаний и деятельности

общенаучных и общетехнических терминов

терминоэлементов (используются в нескольких терминосистемах).

3. Примеры оформления сложных документов (сноски, газетная верстка, колонтитулы и т. д) в MS Word 5.0.

Сноски:

1. курсор на месте символа ссылки на сноску

2. Format, Footnote

3. в поле reference mark ввести ссылку на сноску (не более 28 символов)

4. enter

5. ввести текст сноски (до нескольких абзацев)

перемещение между сноской и текстом: Jump Footnote

использование окна сносок: Esc W S F

переход из окна в окно: F1

местоположение сносок:

по умолчанию - на той же стр., где ссылка

 Format Division Layout: same page, end

Газетная верстка:

колонки:

1. Options: Show Layout Yes или Alt-F4

2. Esc Format Division Layout

колонтитулы:

1. курсор в начало документа

2. ввести текст + enter

3. курсор внутрь текста или выделить текст

4. Esc Format Running Head: Position:

Top Bottom None Odd Even First      Alignment: left margin Edge-of-paper

5. enter

Быстрое создание колонтитулов:

1-3 - то же самое

4. верхний  колонтитул: Ctrl+F2

нижний колонтитул: Alt+F2

На каждой странице может быть не более двух колонтитулов: верхний и нижний

Выравнивание колонтитулов: Format Paragraph или Alt C, Alt R.

Вывод номера страницы/даты:

1. курсор в то место колонтитула, где будет страница.

2. набрать page/date

3. F3 


 

А также другие работы, которые могут Вас заинтересовать

19406. Превращение непрерывного сигнала в цифровой 10.9 KB
  Превращение непрерывного сигнала в цифровой. Для сигнала будет справедлива теорема Котельникова которая гласит что произвольный сигнал спектр которого не содержит частот выше чем Fверх может быть полностью восстановлена если известны отчетные значения этого сигнала
19407. Классификация электрических цепей 11.25 KB
  Классификация электрических цепей Электрической цепью называют совокупность устройств и объектов предназначенных для распределения взаимного преобразования и передачи электрической и других видов энергии и информации. Свое назначение цепь выполняет при наличии в
19408. Цепь с емкостью 67.87 KB
  Цепь с емкостью Ток в цепи конденсатора пропорционален скорости изменения напряжение и измеряется синусоидально опережая по фазе напряжения на угол 900 При нарастании напряжения цепь работает в режиме потребления при уменьшении в режиме генератора. Средняя мощнос
19409. Четырехполюсники 11.15 KB
  Четырехполюсники. При анализе электрических цепей очень часто бывает удобным выделить фрагмент цепи имеющий две пары зажимов. Поскольку электрические электронные цепи очень часто связаны с передачей энергии или обработкой и преобразованием информации одну пару заж...
19410. Свободные колебания в идеальном контуре 12.38 KB
  Свободные колебания в идеальном контуре. Свободные колебания в идеальном контуре характеризуются следующими свойствами. Эквивалентная схема. Свободные колебания в реальном и идеальном контурах имеющих одинаковые L и С весьма незначительно отличаются по частоте и с...
19411. Генезис науки. Основные этапы развития науки 32 KB
  Генезис науки. Основные этапы развития науки. Относительно возникновения науки существуют пять точек зрения: 1Наука была всегда начиная с момента зарождения человеческого общества так как научная любознательность органично присуща человеку; 2Наука возникла в Дре...
19412. Техника. Этапы развития 28 KB
  Техника общее название различных преспособлениймеханизмов и устройствне существуемых в природе и созданных человеком. Техника это судьба человечества сопровождающая его с момента пробуждения сознания. Первоначально в эпоху каменного века техника была орудием уб...
19413. Технические достижения древних земледельческих цивилизаций 31 KB
  Технические достижения древних земледельческих цивилизаций Техника – это совокупность действий знающего человека направленных на господство над природой. Цель их – придать жизни человека такой облик который позволил бы ему снять с себя бремя нужды и обрести нужну
19414. Наука и техника в античном мире 29 KB
  Наука и техника в античном мире. До VII века до н. э. Греция была периферией ближневосточной цивилизации. Греки учились у Востока: они позаимствовали у финикийцев алфавит и конструкцию кораблей у египтян – искусство скульптуры и начала математических знаний. Греция была