Энтропия информации
Энтропия информации — это среднее количество информации, которое содержит один символ источника сообщений. Она показывает неопределённость выбора символа: чем менее предсказуем источник, тем больше его энтропия.
Формула
Если источник может выдавать символы \(a_1, a_2, \ldots, a_n\) с вероятностями \(p_1, p_2, \ldots, p_n\), его энтропия вычисляется как среднее значение количества информации о появлении символа. Это связано с формулой количества информации.
Здесь \(H\) — энтропия в битах на символ, а \(p_i\) — вероятность \(i\)-го символа. Если все \(N\) символов равновероятны, формула упрощается: \(H = \log_2 N\). Максимальная энтропия при данном числе символов достигается именно при равных вероятностях.
Источник выбирает один из четырёх символов с одинаковой вероятностью. Энтропия равна \(H = \log_2 4 = 2\) бита на символ. Если один символ встречается намного чаще остальных, неопределённость уменьшается, и энтропия становится меньше 2 битов.
Энтропия — это среднее количество информации на один символ источника, а не количество информации в конкретном сообщении. Например, редкий символ может содержать больше информации, чем часто встречающийся, но энтропия учитывает все варианты и их вероятности. Также энтропию не следует смешивать с количеством информации в двоичном сообщении.
Как изменится энтропия источника, если один из его символов станет встречаться почти всегда?
Энтропия задаёт теоретическую нижнюю границу среднего числа битов, необходимых для представления символов без потери информации. Поэтому она важна при оценке эффективности кодирования: избыточность сообщения можно уменьшать, но опуститься ниже энтропии в среднем нельзя.
Главное
- Энтропия — среднее количество информации на один символ источника.
- Формула: \(H = -\sum p_i\log_2 p_i\); при равновероятных символах \(H=\log_2 N\).
- Чем менее предсказуем источник, тем больше его энтропия.