Измерение информации
Введение
Важным вопросом является измерение количества информации. Как понять, сколько информации мы получили в том или ином сообщении?
Разные
люди, получившие одно и то же сообщение,
по-разному оценивают его
Мощность
информационного сигнала, также
как и вес носителя информации
не могут служить оценкой
Измерение информации
1.1 Измерение информации в технике
В технике информацией считается любая хранящаяся, обрабатываемая или передаваемая последовательность знаков, символов. В технике под количеством информации понимают количество кодируемых, передаваемых или хранимых символов.
Определить
понятие «количество
Пример: собака – 6 символов, dog – 3 символа.
Человеку привычно работать с символами, а компьютеру - с кодами. Каждый символ кодируется двоичным кодом, длиной в 8 знаков (восьмибитный код).
Прежде чем измерить информацию в битах, вы определяете количество символов в этом сообщении. Каждый символ не случайно кодируется 8-битным кодом. Для удобства введена более "крупная" единица информации в технике – байт, с помощью которой легче подсчитать количество информации в техническом сообщении - оно совпадает с количеством символов в нем.
В вычислительной технике: бит (binary digit) - двоичный знак двоичного алфавита {0, 1}, минимальная единица измерения информации.
Байт (byte) - единица количества информации в системе СИ. Байт - восьмиразрядный двоичный код, с помощью которого можно представить один символ.
Единицы
измерения информации в вычислительной
технике:
| Бит | Элементарная единица информации |
| Байт (б) | 8 бит |
| Килобайт (Кбайт) | 210 байт = 1024 байт |
| Мегабайт (Мбайт) | 210 Кбайт = 220 байт |
| Гигабайт (Гбайт) | 210 Мбайт = 230 байт |
| Терабайт (Тбайт) | 1024 Гбайт = 240 байт |
| Петабайт (Пбайт) | 1024 Тбайт = 250 байт |
| Эксабайт (Эбайт) | 1024 Пбайт = 260 байт |
Информационный объем сообщения (информационная емкость сообщения) - количество информации в сообщении, измеренное в битах, байтах, производных единицах (Кб, Мб и т.д.) [2].
Длина сообщения зависит от числа различных символов, употребляемых для записи сообщения. Например, слово "мир" в русском алфавите записывается тремя знаками, в английском - пятью (peace), а в КОИ-8 - двадцатью четырьмя битами (111011011110100111110010).
1.2 Измерение информации в быту
Вы получили какое-то сообщение. В этом сообщении содержится какое-то количество информации. Как оценить, сколько информации вы получили? Другими словами, как измерить информацию? Можно ли сказать, что чем больше статья, тем больше информации она содержит?
Разные
люди, получившие одно и тоже сообщение,
по-разному оценивают
1.3
Измерение информации
в теории
В
теории информации количеством информации
называют числовую характеристику сигнала,
не зависящую от его формы и
содержания и характеризующую
Теория информации как самостоятельная научная дисциплина была основана Клодом Шенноном в конце 40-х годов 20 века. Предложенная им теория основывалась на фундаментальном понятии количественной меры неопределенности – энтропии и связанного с нею понятия количества информации. При энтропийном подходе под информацией понимается количественная величина исчезнувшей в ходе какого-либо процесса (испытания, измерения и т.д.) неопределенности. При этом в качестве меры неопределенности вводится энтропия. Энтропия – мера внутренней неупорядоченности информационной системы.
Энтропия
увеличивается при хаотическом
распределении информационных ресурсов
и уменьшается при их упорядочении.
Одним из самых замечательных
результатов теории информации является
доказательство, что при любых
помехах и шумах можно
Если в системе, состоящей из одного атома, произошло его энергетическое возбуждение, нам это может стать известно по значению температуры. При этом возможно только одно распределение возбуждения в системе равному единице. Энтропия связана с распределением следующим образом: . В нашем случае , а значит, система обладает нулевой энтропией.
В системе из ста атомов, распределение возбуждения может быть осуществлено ста способами, т.е. , . Энтропия системы выросла и стала хаотичной, поскольку мы не знаем, где находится в каждый момент возбужденный атом. Принято считать, что любая система стремится к состоянию равновесия, т.е. растет энтропия системы. Однако второе начало термодинамики (закон сохранения энтропии и информации) требует компенсировать рост энтропии. Информация и является средством компенсации.
Р. Хартли предложил в качестве меры неопределенности логарифм от числа возможностей, т.е. процесс получения информации рассматривает как выбор одного сообщения из конечного наперёд заданного множества из N равновероятных сообщений, а количество информации I, содержащееся в выбранном сообщении, определяет как двоичный логарифм N: - формула Хартли. Обычно количество информации представляется в виде: , где m - число возможных выборов. Тогда стандартной единицей количества информации будет выбор из двух возможностей. Такая единица получила наименование бит и представляется одним символом двоичного алфавита: 0 или 1.
В некоторых случаях, когда однозначно нельзя ответить на вопросы распределения вероятности, для определения количества информации уже нельзя использовать формулу Хартли.
Пример: являются ли равновероятными сообщения "первой выйдет из дверей здания женщина" и "первым выйдет из дверей здания мужчина". Однозначно ответить на этот вопрос нельзя. Все зависит от того, о каком именно здании идет речь.
Для задач
такого рода американский учёный Клод
Шеннон предложил в 1948 г. другую формулу
определения количества информации,
учитывающую возможную
Формула Шеннона:
,
где рi - вероятность того, что именно i-е сообщение выделено в наборе из N сообщений.
Если вероятности равны, то каждая из них равна 1/N, и формула Шеннона превращается в формулу Хартли.
2. Подходы измерения
В информатике, как правило, измерению подвергается информация, представленная дискретным сигналом. При этом различают следующие подходы:
Структурный. Измеряет количество информации простым подсчетом информационных элементов, составляющих сообщение. Применяется для оценки возможностей запоминающих устройств, объемов передаваемых сообщений, инструментов кодирования без учета статистических характеристик их эксплуатации.
Статистический. Учитывает вероятность появления сообщений: более информативным считается то сообщение, которое менее вероятно, т.е. менее всего ожидалось. Применяется при оценке значимости получаемой информации.
Семантический. Учитывает целесообразность и полезность информации. Применяется при оценке эффективности получаемой информации и ее соответствия реальности.
2.1Структурный подход к измерению информации
В рамках структурного подхода выделяют три меры информации:
геометрическая. Определяет максимально возможное количество информации в заданных объемах. Мера может быть использована для определения информационной емкости памяти компьютера;
комбинаторная.
Оценивает возможность
аддитивная, или мера Хартли.
Геометрическая мера
Определяет
максимально возможное
8 бит = 1 байт (сокращенно б или Б),
1024 Б = 1 килобайт (сокращенно Кб или К),
1024 К = 1 мегабайт (сокращенно Мб или М),
1024 М = 1 гигабайт (сокращенно Гб или Г).
Тогда, например, объем винчестера – 3 гигабайта; объем основной памяти компьютера – 32 мегабайта и т.д.
Очевидно, геометрическая мера не учитывает, какими символами заполнено сообщение. Так, одинаковыми по количеству информации, измеренной геометрической мерой, являются, например, сообщения «компьютер» и «программа»; а также 346 и 10В
Комбинаторная мера
Оценивает
возможность представления
Комбинаторная мера может использоваться для оценки информационных возможностей некоторого автомата, который способен генерировать дискретные сигналы (сообщения) в соответствии с определенным правилом комбинаторики. Пусть, например, есть автомат, формирующий двузначные десятичные целые положительные числа (исходное множество информационных элементов {0, 1, 2, 3, 4, 5, 6, 7, 8, 9}). В соответствии с положениями комбинаторики, данный автомат генерирует размещения (различаются числа, например, 34 и 43) из 10 элементов (используются 10 цифр) по 2 (по условию задачи, формируются двузначные числа) с повторениями (очевидно, возможны числа, состоящие из одинаковых цифр, например, 33). Тогда можно оценить, сколько различных сообщений (двузначных чисел) может сформировать автомат, иначе говоря, можно оценить информационную емкость данного устройства: Рп(102) = 102 = 100.
Комбинаторная мера используется для определения возможностей кодирующих систем, которые широко используются в информационной технике.
Пример 1. Определить емкость ASCII-кода, представленного в двоичной или шестнадцатеричной системе счисления.
ASCII-код
– это сообщение, которое
для двоичного представления – из информационных элементов {0, 1}, сообщение длиной (объемом) 8 символов;
для шестнадцатеричного представления – из информационных элементов {0, 1, 2, …., А, В, С, …. F}, сообщение длиной (объемом) 2 символа.
Тогда в соответствии с положениями комбинаторики:
= () = = 256;
= () = 256,
где , – количества информации, соответственно, для двоичного и шестнадцатеричного представления ASCII-кода.
Таким образом, емкость ASCII-кода для двоичного и шестнадцатеричного представления одинакова и равна 256.
Следует
отметить, что все коды постоянной
длины формируются по правилам комбинаторики
или их комбинациям. В случае, когда сообщения
формируются как размещения с повторениями
из элементов алфавита мощности h и известно
количество сообщений М, можно определить
требуемый объем сообщения (т.е. его длину
l) для того, чтобы в этом объеме представить
все сообщения: l=
М .
Например, есть 4 сообщения – a, b, c, d. Выполняется двоичное кодирование этих сообщений кодом постоянной длины. Для этого требуются 2 двоичных разряда. В самом деле: l = 4 = 2.
Очевидно,
комбинаторная мера является развитием
геометрической меры, так как помимо
длины сообщения учитывает
Аддитивная мера
Эта мера
предложена в 1928 году американским ученым
Хартли, поэтому имеет второе название
– мера Хартли. Хартли впервые ввел
специальное обозначение для
количества информации – I и предложил
следующую логарифмическую
I = l log h,
где I – количество информации, содержащейся в сообщении;
l – длина сообщения;
h – мощность исходного алфавита.
При исходном алфавите {0,1}; l = 1; h = 2 и основании логарифма, равном 2, имеем
I = 1* = 1.
Единицей измерения информации в аддитивной мере является бит.
Пример 1. Рассчитать количество информации, которое содержится в шестнадцатеричном и двоичном представлении ASCII-кода для числа 1.
В соответствии с таблицей ASCII-кодов имеем: шестнадцатеричное представление числа 1 – 31, двоичное представление числа 1 – 00110001.
Тогда по формуле Хартли получаем:
для шестнадцатеричного
представления
I = 216 = 8 бит;
для двоичного представления I = 8 2 = 8 бит.
Таким образом, разные представления ASCII-кода для одного символа содержат одинаковое количество информации, измеренной аддитивной мерой.
2.2 Статистический подход к измерению информации
В 30-х годах ХХ века американский ученый Клод Шеннон предложил связать количество информации, которое несет в себе некоторое сообщение, с вероятностью получения этого сообщения.
Вероятность p – количественная априорная (т.е. известная до проведения опыта) характеристика одного из исходов (событий) некоторого опыта. Измеряется в пределах от 0 до 1. Если заранее известны все исходы опыта, сумма их вероятностей равна 1, а сами исходы составляют полную группу событий. Если все исходы могут свершиться с одинаковой долей вероятности, они называются равновероятными.
Например, пусть опыт состоит в сдаче студентом экзамена по информатике. Очевидно, у этого опыта всего 4 исхода (по количеству возможных оценок, которые студент может получить на экзамене). Тогда эти исходы составляют полную группу событий, т.е. сумма их вероятностей равна 1. Если студент учился хорошо в течение семестра, значения вероятностей всех исходов могут быть такими:
p(5) = 0.5; p(4) = 0.3; p(3) = 0.1; p(2) = 0.1, где запись p(j) означает вероятность исхода, когда получена оценка j (j = {2, 3, 4, 5}).
Если студент учился плохо, можно заранее оценить возможные исходы сдачи экзамена, т.е. задать вероятности исходов, например, следующим образом:
p(5) = 0.1; p(4) = 0.2; p(3) = 0.4; p(2) = 0.3.
В обоих случаях выполняется
где n – число исходов опыта,
i – номер одного из исходов.
Пусть можно получить n сообщений по результатам некоторого опыта (т.е. у опыта есть n исходов), причем известны вероятности получения каждого сообщения (исхода) - . Тогда в соответствии с идеей Шеннона, количество информации I в сообщении i определяется по формуле:
I
= -,
где – вероятность i-го сообщения (исхода).
Таким образом, количество получаемой с сообщением информации тем больше, чем неожиданнее данное сообщение. Этот тезис использован при эффективном кодировании кодами переменной длины (т.е. имеющими разную геометрическую меру): исходные символы, имеющие большую частоту (или вероятность), имеют код меньшей длины, т.е. несут меньше информации в геометрической мере, и наоборот.
Формула Шеннона позволяет определять также размер двоичного эффективного кода, требуемого для представления того или иного сообщения, имеющего определенную вероятность появления.
Единица измерения информации при статистическом подходе – бит.
На практике часто вместо вероятностей используются частоты исходов. Это возможно, если опыты проводились ранее и существует определенная статистика их исходов. Так, строго говоря, в построении эффективных кодов участвуют не частоты символов, а их вероятности.
2.3 Семантический подход к измерению информации
Учитывает целесообразность и полезность информации. Применяется при оценке эффективности получаемой информации и ее соответствия реальности. В рамках этого подхода рассмотрим такие меры, как целесообразность, полезность (учитывают прагматику информации) и истинность информации (учитывает семантику информации).
Целесообразность информации
Количество I получаемой вместе с сообщением
информации с позиций ее целесообразности
определяется по формуле:
где , – вероятности достижения цели после и до получения сообщения, соответственно.
Пример 1. Пусть вероятность сдачи экзамена по информатике до получения сообщения (подсказки от соседа) оценивается студентом со значением 0,2. После того, как ему удалось получить подсказку, вероятность сдачи увеличилась: = 0,8. Определить количество информации, содержащейся в подсказке, с точки зрения ее целесообразности.В соответствии с приведенной формулой имеем: I = (0,8/0,2) = 4 = 2.
Полезность информации.
Количество усваиваемой потребителем информации Iусв тесно связано с теми знаниями, которые имеет потребитель к моменту получения информации – с тезаурусом (ТЗ) потребителя. Этим определяется полезность информации. В самом деле, для усвоения тех знаний, которые получаются в ВУЗе, требуется среднее образование - иначе студент ничего не поймет. С другой стороны, любая учебная дисциплина ориентируется на знания, которые учащийся должен приобрести в предыдущих курсах. Этим объясняется последовательность учебных дисциплин по годам обучения.
Зависимость усваиваемой потребителем
информации от его тезауруса выражается
графически следующей кривой:
Как видно из графика, при тезаурусе, равном нулю и максимальному значению в точке max, информация не усваивается: в первом случае, потребителю непонятна принимаемая информация, во втором – она ему уже известна. Максимально усваивается информация (т.е. она наиболее полезна) в точке opt, когда потребитель обладает достаточным (но не максимально возможным) тезаурусом для понимания получаемой информации. При значении тезауруса i-го потребителя ТЗi количество усваиваемой им информации определяется как Iусв = f(ТЗi). Сам тезаурус ТЗi может быть практически определен как результат интеллектуального тестирования, которое проводится, например, в некоторых западных странах. При таком тестировании человеку выставляется некоторый балл, который и может расцениваться как его ТЗi.
Истинность информации.
Эта мера оценивает информацию с позиций ее соответствия отображаемому источнику информации, т.е. реальному миру.
Оценить истинность сложного сообщения можно, разбив его на простые. Например, сообщение mess: «данное пособие посвящено информатике и имеет объем 5 страниц»
можно представить как два простых сообщения mess1 и mess2:
mess1 - «данное пособие посвящено информатике» ,
mess2 - «данное пособие имеет объем 5 страниц».
Тогда можно предложить рассчитывать истинность сложного сообщения как среднее арифметическое значение истинностей сообщений, его составляющих (что называют - «истинно лишь наполовину»). В таком случае имеем:
r(mess) = Ѕ
(r(mess1) + r(mess2)) = Ѕ (1 + 0) = 0,5.
Заключение
Мощность
информационного сигнала, также
как и вес носителя информации
не могут служить оценкой

- Измерение информации и источники информации
- Измерение и регулирование влажности воздуха подручными средствами
- Измерение качества в сфере услуг
- Измерение качества. Квалиметрия. Методы измерения качества
- Измерение. Классификация измерений
- Измерение крутящего момента на полуоси автомобиля
- Измерение крутящего момента на полуоси автомобиля
- Измерение давления
- Измерение давления жидкости манометром
- Измерение денежной массы
- Измерение диаграммы направленности микрофона Shure SV-100
- Измерение длин линий мерными лентами и рулетками
- Измерение длин линий мерными лентами и рулетками (1)
- Измерение информации