引用した出典に基づき、AIが執筆・翻訳した記事です。編集方法と確認内容。
AI生成の概念図であり、歴史資料の写真や定量的な図ではありません。リレー風の装置と光のパルスで雑音中の通信を表現していますが、1948年の特定装置を記録したものではありません。
1. 異なる装置に共通する問題
電報、話し言葉、写真は異なりますが、工学的には「選ばれたメッセージを別の場所で再現する」という問題を共有します。ケーブル、電波、記憶装置はその物理的な手段です。受信側は、媒体の不完全さがあっても候補を区別しなければなりません。
シャノンの論文は、Bell System Technical Journalの1948年7月号と10月号に二部に分けて掲載されました。ナイキストやハートレーらの先行研究を踏まえ、情報源の統計的性質と雑音を扱っています。ここで引用するMITの版は、明記された「訂正を含む再版」であり、原誌二号の写真複製ではありません。S1, S2
この理論でいう情報は、どのメッセージが選ばれたかについての不確実性に関わります。意味、真偽、有用性、知能の点数ではありません。予想どおりの警告でも極めて重要な場合がありますが、新しい統計的情報は少ないかもしれません。この限定によって工学的問題を計算可能にするのであって、意味の重要性を否定するわけではありません。
2. 不確実性からビットへ
有限個の記号からなるアルファベット上の確率変数をXとし、各記号の確率p_iの和を1とします。結果iの意外さと、その平均であるエントロピーは次のように表せます。
Ii=−log2pi.
H(X)=−i∑pilog2pi.
対数の底は2なので、単位は情報源の1記号あたりのビットです。0 log₂0 = 0と約束します。等確率の二択ならエントロピーは1ビット、確実な結果なら0です。ビットは情報の単位であり、特定の電圧や印字された1文字そのものではありません。
例として、記憶のない5記号の情報源を考え、頻度の高い記号に短い符号語を割り当てます。
| 記号 | 確率 | 符号 | 長さ(ビット) |
|---|---|---|---|
| A | 1/2 | 0 | 1 |
| B | 1/4 | 10 | 2 |
| C | 1/8 | 110 | 3 |
| D | 1/16 | 1110 | 4 |
| E | 1/16 | 1111 | 4 |
H(X)=Lˉ=21(1)+41(2)+81(3)+2161(4)=1.875.
どの符号語も別の符号語の接頭辞になっていないので、区切り記号なしで復号できます。独立な1,000記号の期待符号長は1,875ビットです。各記号を固定長3ビットで表す3,000ビットに比べ、37.5%減ります。ただし、指定した分布での期待値であり、ヘッダーや伝送上の付加情報を除きます。すべてのメッセージで同じ削減率になるわけではなく、まれな記号には4ビット必要です。S3
3. 圧縮には明確な限界がある
既知の有限情報源が独立同分布に従う場合、n記号のブロックに対する最適な二進接頭符号の期待ブロック長L_nは、次を満たします。
nH(X)≤Ln<nH(X)+1.
H(X)≤nLn<H(X)+n1.
nで割ると、長いブロックではH(X)を超える付加量を小さくできると分かります。下限は一意復号可能な符号にも当てはまります。これは元のメッセージを正確に復元する無損失符号化です。記号間に相関がある場合は、適切な情報源の仮定の下でエントロピー率を考える必要があり、単独の記号のエントロピーをそのまま使えるとは限りません。S3
圧縮は予測可能な構造を利用します。あらゆる二進ファイルを短くすることはできません。短い列の数は長い列の数より少ないため、一部の入力は同じ長さにとどまるか長くなる必要があります。確率モデルのずれ、小さいファイル、符号表を送る費用によって、実用上の利得が失われることもあります。
4. 雑音に対抗するために冗長性を加える
情報源符号化は不要な冗長性を取り除きます。一方、通信路符号化は、乱された後でもメッセージを区別できるよう、構造を持つ冗長性を意図的に加えます。目的が異なるので矛盾はありません。図では説明のために両者を分離し、物理的な変調や同期は省略しています。
シャノンの通信系の抽象化を参考に、本記事用に作成した科学的模式図。圧縮の後に保護用符号化を行い、復号は逆順に進みます。矢印はメッセージの流れであり、実測信号や時間軸ではありません。各送信ビットが独立に確率p = 0.1で反転すると仮定します。論理値0を000、1を111として送り、多数決で復号します。誤るには少なくとも2回の反転が必要です。
Pe=3p2(1−p)+p3=0.028.
復号後のビット誤り確率は10%から2.8%に下がりますが、通信路を3回使って情報を1ビット送る速度になります。この反復符号は交換条件を示す例で、シャノン限界に近い符号ではありません。独立な3ビットブロックをさらに送っても、その残留誤りは消えません。誤りに相関やバースト性があれば、この計算は適用できません。
5. 通信路容量は速度の限界であり、完全性の約束ではない
ここでは、有限の入出力アルファベットを持つ、定常で記憶のない離散通信路を扱います。各出力Yの条件付き分布は、対応する入力Xだけで決まります。遷移則が固定され、入力分布に追加制約がないとき、容量は次のとおりです。
I(X;Y)=H(X)−H(X∣Y),
C=PXmaxI(X;Y).
R=nlog2M.
これらの式でMは等確率メッセージの数、nは1符号語で通信路を使用する回数です。一方、圧縮の不等式ではnは情報源記号の数、L_nはビット単位の期待符号長です。nの二つの用法は別の例を表します。
相互情報量I(X;Y)は、Yを観測することでXについての不確実性がどれだけ減るかを測ります。容量の単位は通信路1使用あたりのビットです。等確率のメッセージを長さnのブロックに符号化するとき、Cより厳密に小さい任意の固定速度Rに対し、nの増大とともにブロック誤り確率が0に近づく符号列が存在します。Cを超える速度では、このモデルで誤りを0に近づけることはできません。漸近的な存在定理であり、有限長での完全無誤りや効率的な実装を保証しません。S4, S5, S6
独立な反転確率pを持つ二元対称通信路では:
h2(p)=−plog2p−(1−p)log2(1−p).
C=1−h2(p).
C(0.1)≈0.5310.
等確率の入力ビットでこの容量を達成できます。p = 0.1なら、限界は1使用あたり約0.5310情報ビットであり、0.9ではありません。誤りの位置が分からないため、メッセージの識別可能性が減ります。毎秒1,000回使用する場合、531.0 bit/sは漸近容量であって、アプリケーションの実測転送速度ではありません。
6. 帯域幅と電力を計算に入れる
帯域制限された理想通信路で、信号と独立な加法性白色ガウス雑音があり、信号の平均電力を制限する場合:
C=Wlog2(1+NP).
3000log2(1001)≈29901.7bit/s.
Wは帯域幅で単位はHzです。PとNは信号電力とその帯域内の総雑音電力で、同じ単位、例えばWで表します。P/Nは無次元の線形電力比であり、デシベル値ではありません。帯域幅W = 3,000 Hz、信号対雑音比30 dBなら、P/N = 10^(30/10) = 1,000です。容量は約29,901.7 bit/s、すなわち29.90 kbit/sとなります。これは例示用のモデル入力であり、歴史的な電話回線の実測値ではありません。S1、定理17
フェージング、インパルス性干渉、振幅制限、指定された有限信号点配置に対する万能の式ではありません。帯域幅Wを増やすとNも増えることがあるので、根拠なく雑音電力を固定せず再計算する必要があります。実機と理想限界の差は、ハードウェア、符号長、遅延、プロトコルの付加量によって決まります。
7. 何が変わり、何までは言えないのか
シャノンは、情報源がどれだけ情報を生み出すかと、通信路がどれだけ確実に運べるかを別々の定量的問題にしました。設計を以前の装置だけでなく、理論的限界と比較できます。ただし、情報源と通信路のモデルは、測定による裏付けを必要とします。
1948年の研究が、すべての実用的な圧縮法や誤り訂正符号を与えたわけではありません。ガラガーによる符号化誤り確率の解析など、その後の研究が速度、ブロック長、信頼性の関係を発展させました。また、ランダムなデータが意味を持つ、圧縮できれば理解している、計算力を増やせば仮定を変えずに容量を超えられる、という主張でもありません。S6
長く残る成果は、制約下の不確実性を考えるための言葉です。限界に直面した工学は、モデルを明らかにし、差を測り、符号・通信路・目的のどれを改善するか判断できます。
本記事の出典と確認
引用資料に基づき、AIシステムが英語で執筆し翻訳しました。同じシステムが科学的模式図も作成しました。数値例はコードで再計算し、各言語版はAIが確認しました。人や独立した専門家による審査は主張していません。表紙はChatGPT Imageで生成しました。
基準版SHANNON-EN-1、2026年9月9日。引用した1948年の該当箇所と後年の数学的解説をオンラインで読みました。式、仮定、計算、一意復号、各言語のラベルを確認しました。例は理論計算であり実験ではありません。説明用の模式図と生成された表紙は区別しています。この注記は本記事の実際の準備内容を示すもので、自律公開を認証するものではありません。
出典
- S1 — C. E. Shannon — A Mathematical Theory of Communication (1948), corrected reprint
- S2 — Nokia Bell Labs — A Mathematical Theory of Communication
- S3 — M. Médard, MIT 6.441 (2010) — Lecture 5: codes, Kraft inequality, optimal codes
- S4 — M. Médard, MIT 6.441 (2010) — Lecture 8: channel capacity
- S5 — M. Médard, MIT 6.441 (2010) — Lecture 10: channel coding theorem
- S6 — R. G. Gallager — A Simple Derivation of the Coding Theorem and Some Applications (1965)
