Кодировка символов

Набо́р си́мволов (англ. character set) — таблица, задающая кодировку конечного множества символов алфавита (обычно элементов текста: букв, цифр, знаков препинания). Такая таблица сопоставляет каждому символу последовательность длиной в один или несколько символов другого алфавита (точек и тире в коде Морзе, сигнальных флагов на флоте, нулей и единиц (битов) в компьютере).

Набор символов в компьютере

Символы в компьютере обычно кодируются одним или нескольким байтами (группами из восьми битов).

Хотя термин «набор символов» (англ. character set, charset), узаконенный интернет-стандартом RFC 2278, сейчас является, пожалуй, наиболее авторитетным, предшествовавший ему термин «кодировка» (англ. encoding) по-прежнему используется в качестве синонима, в частности, в языках программирования Java, Perl и XSLT, а также в HTML.

Нередко также вместо термина «набор символов» неправильно употребляют термин «кодовая страница», означающий на самом деле частный случай набора символов с однобайтным кодированием.

В настоящее время в основном используются кодировки трёх типов: совместимые с ASCII, совместимые с EBCDIC и основанные на Юникоде 16-битные, с подавляющим преобладанием первых. Представление UTF-8 Юникода совместимо с ASCII. Кодировки на базе EBCDIC (например, ДКОИ) используются только на некоторых мэйнфреймах. Первоначально в каждой операционной системе использовался один набор символов. Теперь используемые наборы символов стандартизованы, зависят от типа операционной системы лишь по традиции и устанавливаются согласно локали.

В Википедии и других проектах Фонда Викимедиа используется Юникод UTF-8.

Современные 8-битные вычислительные платформы характеризуются небольшими объёмами ОЗУ и ПЗУ; многобайтные кодировки в таких изделиях значительного распространения не получили. Причиной тому не только больший объём, занимаемый текстовыми данными, представленными в многобайтной кодировке, но и отсутствие «лишней» памяти для хранения графического представления дополнительных символов, а также трудность обработки таких строк. В настоящее время часто используются следующие стандартные однобайтные кодировки:

В программах на английском языке — CP437;
В программах на русском языке используются такие варианты:
- CP866 — чаще используется более опытными инженерами, начинавшими работать в DOS; позволяет рисовать псевдографические «рамки», но требует хранения исходного текста ПО именно в этой кодовой странице, что бывает затруднительно для начинающих;
- CP1251 — используется, если необходимо иметь русские символы непрерывным массивом для лёгкости их обработки, и в случае наличия ОС Windows, перекодировать такой текст можно без использования стороннего ПО. Но, не позволяет рисовать «рамки».

Автоматическое распознавание кодировок

Во многих современных текстовых редакторах и браузерах присутствует функция автоматического распознавания кодировок, но она не всегда выдает верный результат. Иногда бывает, что текст, набранный например в командной строке или некоторых программах, неверно декодируется, и вместо нормальных слов получается набор непонятных символов. Справиться с прочтением такого текста может помочь большое количество декодеров текста, которые работают онлайн.

Для однобайтных кодировок нужно учитывать тот факт, что частотность использования разных букв сильно различается (например, в русском часто используется «о», но редко «ъ»). Поэтому, зная язык текста, можно легко выбрать кодировку, в которой частотность байтов лучше соответствует частотности букв данного языка.

Альтернативная точка зрения считает подобные эвристические алгоритмы определения кодировки текста вредными, поскольку современные информационные технологии располагают средствами недвусмысленно сопоставить тексту положенную ему кодовую страницу (см., например, MIME). Широкое же распространение эвристических анализаторов поощряет использование некачественных программ создания текстовых данных, нарушающих стандарты.

Распространённые кодировки

BCDIC
EBCDIC
- ДКОИ
ISO/IEC 646
- ASCII
- КОИ-7
ISO/IEC 8859
- ISO/IEC 8859-1
- ISO/IEC 8859-2
- ISO/IEC 8859-3
- ISO/IEC 8859-4
- ISO/IEC 8859-5
- ISO/IEC 8859-6
- ISO/IEC 8859-7
- ISO/IEC 8859-8
- ISO/IEC 8859-9
- ISO/IEC 8859-10
- ISO/IEC 8859-11
- ISO/IEC 8859-13
- ISO/IEC 8859-14
- ISO/IEC 8859-15
Кодировки DOS
- CP437
- ^[англ.]
- CP850
- CP852
- CP855
- CP858
- ^[англ.]
- ^[англ.]
- ^[англ.]
- CP866
- ^[англ.]
Кодировки Microsoft Windows
- Windows-1250 для языков Центральной Европы, которые используют латинское написание букв (польский, чешский, словацкий, венгерский, словенский, хорватский, румынский и албанский)
- Windows-1251 для кириллических алфавитов
- Windows-1252 для западных языков
- Windows-1253 для греческого языка
- Windows-1254 для турецкого языка
- ^[англ.] для иврита
- ^[англ.] для арабского языка
- ^[англ.] для балтийских языков
- ^[англ.] для вьетнамского языка
Кодировки Macintosh
- MacRoman
- MacCyrillic
КОИ-8
- KOI8-R
- KOI8-U
^[англ.]
^[англ.]
VISCII^?!
^[англ.] (наиболее известный вариант — Microsoft ^[англ.])
- HKSCS
^[англ.]
- GB2312
- ^[англ.] (Microsoft ^[англ.])
- ^[англ.]
Shift JIS и ^[англ.] для японского языка (Microsoft ^[англ.])
^[англ.] для корейского языка (Microsoft ^[англ.])
^[англ.] и ^[англ.] для китайской письменности
Представления Юникода
- UTF-7
- UTF-8
- UTF-16
- UTF-32

См. также

Генетический код
Псевдографика

Ссылки

Юникод-коды символов на unicode.org

Примечания

Перечень основных «кодировок» в руководстве по Java SE 6 (неопр.). Дата обращения: 27 сентября 2008. Архивировано 16 декабря 2008 года.
Обсуждение темы «кодировок» в документации по языку Perl (неопр.). Дата обращения: 27 сентября 2008. Архивировано 6 октября 2008 года.
Обсуждение темы «кодировок» в документации по технологии XSLT (неопр.). Дата обращения: 5 октября 2008. Архивировано 13 августа 2017 года.
Обсуждение соотношения терминов «кодировка» и «набор символов» в документации по языку HTML (неопр.). Дата обращения: 11 октября 2008. Архивировано 26 октября 2008 года.
Спецификации наборов символов на сайте IANA (неопр.). Дата обращения: 27 сентября 2008. Архивировано 16 июля 2004 года.
Универсальный декодер — конвертер кириллицы (неопр.). Дата обращения: 4 декабря 2014. Архивировано 28 декабря 2014 года.

[1] Перечень основных «кодировок» в руководстве по Java SE 6 (неопр.). Дата обращения: 27 сентября 2008. Архивировано 16 декабря 2008 года.

[2] Обсуждение темы «кодировок» в документации по языку Perl (неопр.). Дата обращения: 27 сентября 2008. Архивировано 6 октября 2008 года.

[3] Обсуждение темы «кодировок» в документации по технологии XSLT (неопр.). Дата обращения: 5 октября 2008. Архивировано 13 августа 2017 года.

[4] Обсуждение соотношения терминов «кодировка» и «набор символов» в документации по языку HTML (неопр.). Дата обращения: 11 октября 2008. Архивировано 26 октября 2008 года.

[5] Спецификации наборов символов на сайте IANA (неопр.). Дата обращения: 27 сентября 2008. Архивировано 16 июля 2004 года.

[6] Универсальный декодер — конвертер кириллицы (неопр.). Дата обращения: 4 декабря 2014. Архивировано 28 декабря 2014 года.

Кодировка символов

Набор символов в компьютере

Автоматическое распознавание кодировок

Распространённые кодировки

См. также

Ссылки

Примечания

NiNa.Az

Император Конин

Император Кобун

Император Коан

Император Когэн

Император Итоку