ランダムイベントスペース
1946 年にアメリカの統計学者ジョン・テューキーが BIT という名前を提案しました。
ランダムなイベントの空間を想像してくださいこれは、1枚の偽コインを投げることから成り、その両側にはワシがあります。ワシはいつ落ちますか。それはいつも明らかです。私たちのスペースはとても整理されているので、私たちは前もってこれを知っています。ワシの落下は信頼できる出来事です。つまり、その確率は1です。いいえこのようなメッセージの情報量は、0と見なされます。
では、公正なコインを投げてみましょう。当然のことながら、一方の側は表であり、もう一方の側は尾です。表と裏の着地は、ランダム イベントの空間を構成する 2 つの異なるイベントになります。 1回のトスの結果を報告すれば、それは確かに新しい情報になります。表がドロップされた場合は 0 がレポートされ、裏がドロップされた場合は 1 がレポートされます。この情報をレポートするために必要なのは 1 ビットだけです。
何が変わったのでしょうか?私たちのイベントスペースに不確実性が現れました。自分でコインを投げず、トスの結果を見ていない人に、このことについて伝えたいことがあります。しかし、私たちのメッセージを正しく理解するには、私たちが何をしているのか、0 と 1 が何を意味するのかを正確に理解しなければなりません。私たちのイベントスペースは一致しなければならず、デコードプロセスはthrowの結果を復元するためにユニークにあります。送信機と受信機のイベント空間が一致しない場合、またはメッセージを明確にデコードする可能性がない場合、情報は通信チャネルにノイズだけが残ります。
2つを独立して同時に投げる場合コインの場合、同じ確率で表と表、表と裏、裏と表、裏と裏の 4 つの異なる結果が得られます。情報を送信するには 2 ビットが必要で、メッセージは次のようになります: 00、01、10、11。情報量は 2 倍になります。不確実性が高まったため、このようなことが起こりました。このようなペアのトスの結果を推測しようとすると、間違う可能性が 2 倍になります。
イベント空間の不確実性が大きければ大きいほど、その状態に関するメッセージに含まれる情報も多くなります。
イベントスペースを少し複雑にしてみましょう。これまでに起こったすべての出来事は同じ確率で起こっています。しかし、現実空間では、すべてのイベントの確率が等しいわけではありません。私たちが見るカラスが黒い確率は 1 に近いとします。道で最初に会う通行人が男性である確率は約 0.5 です。しかし、モスクワの路上でワニに出会うことはほぼ不可能だ。直観的には、ワニとの遭遇に関する報告の方が黒いカラスに関する報告よりもはるかに大きな情報価値があることがわかります。イベントの確率が低いほど、そのようなイベントに関するメッセージ内の情報が多くなります。
イベントスペースをそれほどエキゾチックにしないでください。 私たちはただ窓に立って通り過ぎる車を見ます。 4色の車が通り過ぎているので、報告する必要があります。これを行うには、色をエンコードします。黒 - 00、白 - 01、赤 - 10、青 - 11。正確にどの車が運転したかを報告するには、2ビットの情報を転送する必要があります。
でも長い間車を見て車の色は不均等に分布していることに注意してください。黒 - 50%(毎秒)、白 - 25%(毎秒)、赤と青 - 12.5%(八分の一)。それからあなたは伝達された情報を最適化することができます。
ほとんどの車が黒なので、黒 - 0 - 最短のコードを示し、残りすべてのコードは 1 から始まります。残りの半分のうち、白 - 10、残りの色は 11 から始まります。最後に、赤 - 110、青 - を示します。 111.
これで、車の色に関する情報を渡して、それをより厳密にエンコードできます。

シャノンエントロピー
イベントスペースを n 個で構成するとしますさまざまなイベント。表が 2 つのコインを投げる場合には、そのようなイベントがちょうど 1 つあり、公正なコインを 1 枚投げる場合にはちょうど 2 つ、コインを 2 枚投げる場合や車を観察する場合にはちょうど 4 つあります。各イベントには発生確率があります。表が 2 つのコインを投げる場合、イベントは 1 つあり (表が落ちる)、その確率は p1 = 1 です。公平なコインを投げる場合、イベントは 2 つあり、それらは同じ確率であり、それぞれの確率は 0.5 です: p1 = 1 0.5、p2 = 0.5。 2 つの公正なコインを投げる場合、4 つのイベントがあり、それらはすべて確率が等しく、それぞれの確率は 0.25 です: p1 = 0.25、p2 = 0.25、p3 = 0.25、p4 = 0.25。自動車を観察する場合、4 つのイベントがあり、それぞれの確率が異なります: 黒 - 0.5、白 - 0.25、赤 - 0.125、青 - 0.125: p1 = 0.5、p2 = 0.25、p3 = 0.125、p4 = 0.125。

これは偶然ではありません。Shannonはエントロピー(イベントスペースの不確実性の尺度)を選択したので、3つの条件が満たされました。
- 1 確率が 1 である信頼できるイベントのエントロピーは 0 に等しい。
- 2つの独立した事象のエントロピーは、これらの事象のエントロピーの合計に等しい。
- エントロピーは、すべてのイベントが同じ確率である場合に最大になります。
これらすべての要件は、当社の要件と完全に一致しています。イベントスペースの不確実性についてのアイデア。イベントが 1 つだけある場合 (最初の例)、不確実性はありません。イベントが独立している場合、つまり合計の不確実性が不確実性の合計に等しい場合、イベントは単純に合計されます (2 枚のコインを投げる例)。そして最後に、すべてのイベントの確率が等しい場合、システムの不確実性の程度は最大になります。 2 枚のコインを投げる場合と同様に、4 つのイベントはすべて同じ確率で発生し、エントロピーは 2 です。これは、車の場合よりも大きくなります。車の場合には、同じく 4 つのイベントがありますが、それぞれの確率は異なります。この場合、エントロピーは次のようになります。 1.75。
量 H は、情報、選択、不確実性の尺度として情報理論において中心的な役割を果たします。

クロード・シャノン
クロード・エルウッド・シャノン- アメリカのエンジニア、暗号解読者、数学者。 「情報時代の父」とみなされる。現代のハイテク通信システムへの応用を発見した情報理論の創始者。現在現代の通信技術の基礎を形成している基本的な概念、アイデア、およびそれらの数学的定式化を提供します。
1948年、「ビット」という言葉を使うことを提案情報の最小単位を示します。彼はまた彼によって入力されたエントロピーが送信されたメッセージの情報の不確実性と同等であることを示しました。 Shannonの記事「通信の数学的理論」と「秘密システムにおける通信の理論」は、情報理論と暗号化の基礎となると考えられています。
第二次世界大戦中、シャノンはベル研究所で暗号システムの開発に取り組み、後に誤り訂正符号化法の発見に役立ちました。
Shannonは、確率論的スキーム、ゲーム理論、オートマトン理論、および制御システム理論 - サイバネティックスの概念の一部である科学の分野 - に重要な貢献をしました。
コーディング
そしてコインを投げ、通過車はそうではありませんスペースで発生するイベントを報告するには、これらのイベントを説明する方法を考える必要があります。この記述はコーディングと呼ばれます。
Кодировать сообщения можно бесконечным числом разных способов. Но Шеннон показал, что самый короткий код не может быть меньше в битах, чем энтропия.
Именно поэтому энтропия сообщения и есть мера информации в сообщении. Поскольку во всех рассмотренных случаях количество бит при кодировании равно энтропии, — значит кодирование прошло оптимально. Короче закодировать сообщения о событиях в наших пространствах уже нельзя.
最適なコーディングにより、損失や損失は発生しません。メッセージ内の単一の送信ビットを歪ませる。 1ビットでも失われると、情報は歪んでしまいます。しかし、実際のすべての通信チャネルでは、メッセージのすべてのビットが歪みなく受信者に届くという 100% の信頼が得られるわけではありません。
この問題を解決するには、次のことを行う必要がありますコードは最適ではなく、冗長です。たとえば、メッセージと一緒にチェックサムを送信します。これは、メッセージ コードを変換するときに特別に計算された値であり、メッセージの受信時に再計算することで確認できます。送信されたチェックサムが計算されたチェックサムと一致する場合、送信にエラーがなかった可能性は非常に高くなります。チェックサムが一致しない場合は、再送信を要求する必要があります。これは、たとえばインターネット上で情報のパケットを送信する場合など、今日のほとんどの通信チャネルがおおよそどのように機能するかです。
自然言語メッセージ
以下のイベントスペースを考えてください。自然言語での投稿から。これは特別なケースですが、最も重要なケースの1つです。ここでのイベントは送信された文字(固定アルファベットの文字)になります。これらの文字は、さまざまな確率で言語に含まれています。
最も頻度の高いシンボル(つまり、ほとんどの場合、ロシア語で書かれたすべてのテキストで見つけることができます)スペース:1000文字の、平均スペースは175回見つけられます。 2番目の周波数はシンボル "o" - 90、それに続く他の母音です。最初の子音 "t" - 53.そして最も珍しい "f" - この記号は1000文字の2倍しか見られません。
ロシア語の31文字のアルファベットを使用します言語(それは "e"と "e"、および "ъ"と "ь"と違いはありません)。すべての文字が同じ確率で言語内で検出された場合、シンボルあたりのエントロピーはH = 5ビットになりますが、シンボルの実際の頻度を考慮すると、エントロピーは少なくなります。H= 4.35ビットです。 (これは、文字が1バイトとして伝送される場合、従来のコーディングよりもほぼ2倍少なくなります - 8ビット)。
しかし、言語における文字のエントロピーはさらに低くなります。 次の文字の出現確率は、すべてのテキストにおける文字の平均頻度によって完全には決まっていません。どの文字が続くかは、すでに転送された文字によって異なります。たとえば、現代のロシア語では、記号 "ъ"の後に子音の記号音をたどることはできません。 2つの連続した母音「e」の後、「長い首」という言葉がない限り、3番目の母音「e」が続くことはめったにありません。つまり、次の文字はある程度決まっています。次のシンボルのそのような所定性を考慮に入れると、次のシンボルの不確実性(すなわち情報)はさらに4.35未満になる。ある見積もりによると、ロシア語の次の記号は50%以上言語の構造によってあらかじめ決められています。つまり、最適なコーディングでは、メッセージから文字の半分を削除することによってすべての情報を送信できます。
また、すべての文字を安全に削除できるわけではありません。例えば、高周波の "o"(そして一般的には母音)は消すのが簡単ですが、まれな "f"や "e"はかなり問題があります。
私たちが互いにコミュニケーションする際に使用される自然言語は非常に冗長であるため、信頼性が高く、たとえ聞き間違えたとしても、情報は送信されます。
しかし、Shannonが情報の尺度を導入するまで、言語が冗長であること、そしてメッセージをどの程度圧縮できるか(そしてテキストファイルがアーカイバによって非常によく圧縮されている理由)を理解できませんでした。
自然言語の冗長性
記事「私たちはどうやってvorpsimanie tektktについて」Ivan TurgenevのNoble Nestの小説の断片が撮影され、何らかの変換が行われました。ランダムなものではなく、34%の文字が断片から削除されました。単語の最初と最後の文字は残り、母音のみが削除され、すべてが削除されるわけではありません。目標は、変換されたテキストのすべての情報を復元する機会を得ることだけでなく、このテキストを読む人が文字が欠落していることによる特別な問題を経験しないようにすることです。

なぜこの破損したものを読むのは比較的簡単なのでしょうか文章?実際には、単語全体を再構成するために必要な情報が含まれています。ロシア語を母語とする人は、認識する際に使用する特定の一連のイベント (単語と文全体) を持っています。さらに、話者は情報を回復するのに役立つ標準的な言語構造を自由に使用できます。例えば、“彼女はブリーブリーです”- 高い確率で次のように読むことができます「彼女はもっと敏感だった」。しかし、別々に取られる「彼女はもっと気が悪い」むしろ、次のように復元されます。“彼女は白人でした”。日常のコミュニケーションの中で扱っているので、ノイズや干渉のあるチャネルでは、情報を復元するのが得意ですが、事前にわかっている情報のみを復元します。たとえば、次のようなフレーズです。「彼女の特徴は、最も気持ちの良いものではない、htya nmngo rspkhliおよびスプラッシュ」最後の単語を除いてよく読めます"スプラッシュ" - "ラリー"。この言葉は現代の辞書にはありません。単語を速く読むとき「しぶき」遅いときは「くっついている」ように読みますが、単に困惑するだけです。
信号デジタル化
音、または音響振動は正弦波です。 これは、たとえばサウンドエディタの画面で確認できます。正確に音を伝えるには、無限の数の値、つまり正弦波全体が必要です。これはアナログ接続で可能です。彼は歌います - あなたは耳を傾けます、歌が続く間、接触は中断されません。
チャネルを介したデジタル通信では、有限数の値しか送信できません。これは音を正確に再現できないということでしょうか?そうではないことがわかりました。
異なるサウンドは、異なるように変調された正弦波です。離散値(周波数と振幅)のみを送信します。正弦波自体を送信する必要はありません。受信デバイスが生成できます。正弦波を生成し、それに重ね合わせます通信チャネルを介して送信される値から作成される変調。通信チャネルへの入力におけるサウンドが出力におけるサウンドと一致するように離散値を送信する必要があるという正確な原則があり、これらの値は標準的な正弦波に重ねられます(これがコテルニコフの定理です)について)。
コテルニコフの定理(英語文学 - ナイキスト - シャノン定理、読みの定理)- デジタル分野における基本的な声明信号処理では、連続信号と離散信号を結び付け、「0 から f1 までの周波数で構成される任意の関数 F(t) は、1/(2*f1) 秒間連続する数値を使用して任意の精度で連続的に送信できる」と述べています。
干渉防止コーディングハミングコード
信頼できないチャンネルに送信する場合多少の誤りはありますが、Ivan Turgenevのコード化されたテキストはかなり意味のあるテキストになります。しかし、すべてを少しでも転送する必要がある場合、タスクは解決されません。エラーがランダムであるため、どのビットが間違っているのかわかりません。チェックサムでさえも必ずしも保存するわけではありません。
それが今日データを送信するときの理由ですネットワークは、最大量の情報をチャネルにプッシュすることができる最適なコーディングではなく、むしろエラーを回復することができる(明らかに冗長) - Ivan Turgenevの断片の単語を読んだときのように。
障害発生後に情報を回復できるようにする特別なエラー訂正コードがあります。その1つがハミングコードです。私たちの言語全体が 3 つの単語で構成されているとします。111000、001110、100011。メッセージの送信元と受信者の両方がこれらの単語を知っています。また、通信チャネルではエラーが発生することはわかっていますが、1 つの単語を送信する際に歪む情報は 1 ビットにすぎません。
最初に111000という単語を渡したとします。その結果、1つのエラー(エラーを識別したこと)を超えないようにすることができます。
1) 111000、011,000、101000、110000、111100、111010、111001。
単語001110を送信すると、次のいずれかの単語を取得できます。
2) 001110、101110、011110、000110、001010、001100、001111。
最後に、100011のために我々はレセプションに着くことができる:
3) 100011、000011、110011、101011、100111、100001、100010。
3つのリストすべてがペアではないことに注意してください。交差します。つまり、通信チャネルの反対側にリスト1のいずれかの単語が表示された場合、受信者はその単語111000が自分に送信されたことを確実に認識します。彼らは私達のコードが一つのエラーを修正したと言っています。
この修正は 2 つの要因により発生しました。まず、受信者は「辞書」全体を知っていますすなわち、メッセージ受信者のイベントスペースは、メッセージを送信した人のスペースと一致する。コードが1つのエラーだけで送信されたとき、単語は辞書にはありませんでしたが出てきました。
次に、辞書内の単語は特別な方法で選択されました。エラーが発生しても受信者は受信できませんある単語と別の単語を混同する。たとえば、辞書が「娘」、「点」、「バンプ」という単語で構成されており、送信時の結果が「ヴォチカ」だった場合、受信者はそのような単語が存在しないことを知っているため、次のことを行うことができません。エラーを修正します - 3 つの単語のいずれかが正しいことが判明する可能性があります。辞書に「点」、「daw」、「branch」が含まれており、間違いが 1 つだけ許されていることがわかっている場合、「vochka」は間違いなく「点」であり、「daw」ではありません。誤り訂正符号では、誤りがあった後でも単語を「認識できる」ように、単語が正確に選択されます。唯一の違いは、コード「アルファベット」には 0 と 1 の 2 つの文字しかないことです。
そのようなコーディングの冗長性は非常に大きく、したがって我々が伝えることができる単語の数は比較的少ない。辞書から単語を除外する必要がありますが、エラーがある場合、送信された単語に対応するリスト全体と一致する可能性があります (たとえば、「娘」と「ドット」という単語は辞書にありません)。しかし、正確なメッセージ送信は非常に重要であるため、エラー耐性のあるコードの研究に多大な労力が費やされています。
センセーション
エントロピーの概念(または不確実性とメッセージの予測不可能性および冗長性(または事前決定および予測可能性)は、情報の尺度についての私たちの直感的な考えに非常に自然に対応します。メッセージが予測不可能であるほど(可能性が少ないため、そのエントロピーが大きくなるほど)、メッセージはより多くの情報を伝送します。センセーション(たとえば、Tverskayaのワニとの出会い)はまれなイベントであり、その予測可能性は非常に低いため、情報の価値は高くなります。多くの場合、情報はニュースと呼ばれます - 発生したばかりのイベントの報告です。しかし、同じ単語について2回目と3回目を話した場合、メッセージの冗長性は大きくなり、その予測不可能性はゼロになります。そして、私は単純に聞きません。したがって、メディアは最初になるように一生懸命に努力しています。この予想外のニュースを生み出す直感的な新奇感への対応は、一般の読者を対象としたものではないShannonの記事がセンセーションとなり、それがマスコミが自然の知識の普遍的な鍵として取り上げたという事実において大きな役割を果たした。 - 言語学者や文学評論家から生物学者まで。
しかしシャノン情報概念 - 厳密な数学理論そして通信理論の外でのその応用は非常に信頼できません。しかし、コミュニケーション自体の理論では、それは中心的な役割を果たしています。
意味情報
シャノン、尺度としてエントロピーの概念を導入情報を扱う機会を得ました。まず第一に、情報を測定し、チャネル容量や最適なコーディングなどの特性を評価します。しかし、シャノンが情報をうまく扱うことを可能にした主な仮定は、情報の生成は確率論の観点からうまく説明できるランダムなプロセスであるという仮定でした。プロセスが非ランダムである、すなわち、それが法則に従う(さらに、自然言語で起こるように常に明確であるとは限らない)場合、Shannonの議論はそれに適用できません。シャノンの言うことは、その情報が意味のあるものであることとは何の関係もありません。
文字(またはアルファベットの文字)について話している間に、私たちはランダムな出来事に関してはよく論じることができますが、その言葉の言葉にたどり着くとすぐに状況は劇的に変わります。スピーチは特別に編成されたプロセスであり、そしてここでメッセージの構造はそれが送信されるキャラクタより劣らず重要ではありません。
つい最近まで、私たちは何もできなかったように思えました。これは、少なくとも何らかの形でテキストの意味の測定に近づくために行われましたが、近年、状況が変わり始めています。そしてこれは主に、機械翻訳、テキストの自動要約、テキストからの情報の抽出、自然言語でのレポートの生成といったタスクへの人工ニューラル ネットワークの使用に関連しています。これらのタスクにはすべて、自然言語に含まれる意味のある情報の変換、エンコード、およびデコードが含まれます。そして、そのような変換中に情報が失われること、つまり意味のある情報の範囲についての考えが徐々に形成されます。しかし今日、シャノンの情報理論のような明確さと正確さは、これらの困難な問題においてはまだ利用できません。