Алло, робот! - читать бесплатно онлайн полную версию книги автора Александр Михайлович Кондратов (ЗАПАС ПРОЧНОСТИ» ЯЗЫКА) #28

ЗАПАС ПРОЧНОСТИ» ЯЗЫКА

Почему же бессмысленный набор букв несет в пять раз больше информации, чем осмысленный текст? Как же это так получается?

Дело в том, что мы измеряем количество информации, а не ее смысл. С помощью формулы Шеннона мы вычисляем в битах «степень незнания», которую уничтожают получаемые нами кодовые знаки — буквы. Разумеется, наше незнание гораздо больше, когда мы принимаем беспорядочный набор букв вроде ъапроатшезщбльоцнстьнронрб, а не осмысленную речь. Мы не знаем, какая буква будет следующей в этом наборе. А в осмысленной речи легко догадаться, что после слов «он учится только на пять, он круглый…» последует слово «отличник», что после букв «учительн…» последует окончание «ица», или «ицы», или «ицей», но никак не «ая» или «ой».

Вот и получается, что по количеству «уничтожаемого незнания» бессмыслица стоит выше, чем осмысленный текст.

Конечно, в будущем ученые смогут измерять не только общее количество информации, но и величину смысла. Правда, сделать это невероятно трудно: слишком сложен наш человеческий язык, чтобы выразить в числах не только кодовые знаки, но и смысл сообщения.

И еще более трудно определить ценность информации.

В книге из 10 тысяч букв содержится 10 тысяч бит информации. Вполне может случиться, что вы эту книгу читали и даже знаете наизусть. Ваш приятель читал ее давно и поэтому плохо помнит. А другой приятель вообще первый раз в жизни слышит о ней. Сколько же информации получит каждый из вас?

Если мерять количество информации, то, разумеется, оно будет одинаково — 10 тысяч бит. Но вы не получите ровно ничего нового. Первый приятель лишь подновит забытые сведения. А второй и в самом деле получит уйму новых сведений. Разумеется, ценность информации для всех трех различна. Однако попробуйте выразить ее в числах!

Но даже ограниченное измерение информации, без учета ее смысла и ценности, позволяет делать интересные выводы и наблюдения.

Мы уже говорили, что примерно лишь 0,0002 процента всех возможных сочетаний русских букв образуют слова. Почему же такая неэкономия? Нельзя ли сделать так, чтобы каждая буква, каждое сочетание букв было самостоятельным словом? Например, чтобы русскими словами были не только буквы «а», или «я», или «и», но и «з», «п», «м», «ю» или сочетания букв вроде «птп», «мн», «ашяс» и т. д.

В принципе, конечно, можно. Hq тогда нельзя было бы заметить или исправить ошибку в языке.

Когда мы пишем «электростанця» вместо «электростанция», пропустив букву «и» в конце слова, то любой легко поймет смысл слова, а порой даже и не заметит ошибки.

В языке, где каждое сочетание букв имеет смысл, «электростанця» было бы не искаженной «электростанцией», а каким-то новым, самостоятельным словом. Еще хуже было бы с разговором — ведь малейшие колебания воздуха, изменение тембра голоса, смена настроения меняли бы звуковой состав речи и тем самым давали бы новые слова!

Таким образом, русский язык имеет своеобразный «запас прочности». Причем, как показали исследования, и в английском, и в русском, и в шведском, и в румынском, и в испанском, и во французском языках «запас прочности» примерно одинаков.

Иногда этот «запас прочности», называемый в теории информации «избыточностью языка», приходится искусственно повышать.

Например, деловая речь изобилует стандартными оборотами, разъяснениями, повторами. В результате одна буква деловой речи несет информацию не в 1 бит, а всего лишь в 0,6 бита.

Еще больше «запас прочности», еще больше избыточность в переговорах между дежурным по аэродрому и пилотом, находящимся в воздухе. Ошибка здесь может стоить жизни. Естественно, что «запас прочности» повышен до предела: одна буква несет информацию в 0,2 бита.