Текстовая информация
Текстовая информация — это сведения, представленные последовательностью символов: букв, цифр, знаков препинания и пробелов. В компьютере каждый символ заменяется двоичным кодом, поэтому текст можно хранить, передавать и обрабатывать как набор чисел.
Как кодируется текст
Сначала выбирают набор допустимых символов — алфавит. Затем каждому символу ставят в соответствие числовой код. Числа хранятся в двоичной системе, то есть в виде последовательностей нулей и единиц. Например, если на один символ отводится 8 бит, возможны \(2^8=256\) различных кодов.
Количество памяти зависит от числа символов и способа кодирования. При фиксированной длине кода размер текста вычисляют с учётом числа символов, количества бит на символ и перевода единиц информации; подробнее это рассматривается на странице размер текста и в теме перевод единиц информации. Современные тексты часто используют Юникод, позволяющий кодировать символы разных языков.
Здесь \(N\) — информационный объём текста в битах, \(K\) — количество символов, а \(i\) — число бит, отведённых на один символ. Формула применима, когда все символы имеют одинаковую длину кода.
В сообщении 20 символов, каждый кодируется 8 битами. Тогда \(N=20\cdot8=160\) бит, или \(160:8=20\) байт (если не учитывать дополнительные сведения файла).
Алфавит — это набор используемых символов, а кодировка — правило сопоставления символов и числовых кодов. Один и тот же текст при разных кодировках может занимать разный объём и отображаться неправильно.
Сколько различных символов можно закодировать кодами длиной 7 бит?
Главное
- Текст состоит из символов выбранного алфавита.
- В компьютере каждому символу соответствует двоичный код.
- При одинаковой длине кодов объём текста вычисляют по формуле \(N=K\cdot i\).