Artículo redactado y traducido por IA a partir de las fuentes citadas. Método editorial y comprobaciones.
Ilustración conceptual generada por IA, no fotografía de archivo ni diagrama cuantitativo. Los dispositivos semejantes a relés y los pulsos de luz evocan comunicación con ruido; no documentan un aparato concreto de 1948.
1. Un problema común a máquinas diferentes
Un telegrama, una frase hablada y una fotografía son distintos, pero comparten un problema de ingeniería: reproducir en otro lugar un mensaje seleccionado. El cable, la onda de radio o el dispositivo de almacenamiento son medios físicos. El receptor debe distinguir las alternativas pese a sus imperfecciones.
El artículo de Shannon apareció en dos partes del Bell System Technical Journal, en julio y octubre de 1948. Desarrolló trabajos anteriores, entre ellos los de Nyquist y Hartley, considerando las estadísticas de la fuente y el ruido. La copia del MIT citada aquí es expresamente una reimpresión corregida, no un facsímil de los dos números originales. S1, S2
La información se refiere a la incertidumbre sobre el mensaje elegido. No puntúa significado, verdad, utilidad ni inteligencia. Una advertencia previsible puede ser vital y aportar poca información estadística nueva. Esta restricción permite calcular el problema; no elimina la importancia del significado.
2. De la incertidumbre a los bits
Sea X un símbolo de un alfabeto finito, con probabilidades p_i cuya suma es uno. La sorpresa del resultado i y su media, la entropía, son:
Ii=−log2pi.
H(X)=−i∑pilog2pi.
Los logaritmos tienen base 2: la unidad es el bit por símbolo de fuente, con 0 log₂0 = 0. Dos resultados equiprobables tienen entropía de 1 bit; un resultado seguro, entropía cero. El bit es una unidad de información, no un voltaje específico ni necesariamente un carácter impreso.
Para una fuente ilustrativa sin memoria de cinco símbolos, asignemos palabras cortas a los símbolos frecuentes:
| Símbolo | Probabilidad | Código | Longitud (bits) |
|---|---|---|---|
| A | 1/2 | 0 | 1 |
| B | 1/4 | 10 | 2 |
| C | 1/8 | 110 | 3 |
| D | 1/16 | 1110 | 4 |
| E | 1/16 | 1111 | 4 |
H(X)=Lˉ=21(1)+41(2)+81(3)+2161(4)=1.875.
Ninguna palabra de código es prefijo de otra, por lo que se decodifica sin separadores. Para 1 000 símbolos independientes, la longitud esperada es 1 875 bits frente a 3 000 con etiquetas fijas de tres bits: un ahorro del 37,5 %. Son valores esperados para esa distribución, sin cabeceras ni sobrecarga de transmisión, no garantías para cada mensaje. Un símbolo raro necesita cuatro bits. S3
3. La compresión tiene un límite preciso
Para una fuente finita conocida, independiente e idénticamente distribuida, el mejor código prefijo binario de bloques de n símbolos tiene una longitud media de bloque L_n que cumple:
nH(X)≤Ln<nH(X)+1.
H(X)≤nLn<H(X)+n1.
Al dividir por n, la sobrecarga por encima de H(X) puede hacerse pequeña con bloques largos. La cota inferior también vale para códigos únicamente decodificables. Se trata de compresión sin pérdidas: se reconstruye exactamente el mensaje. Con correlaciones se necesita una tasa de entropía bajo hipótesis adecuadas, no automáticamente la entropía de un símbolo aislado. S3
La compresión aprovecha estructura previsible; no puede acortar todos los archivos binarios posibles. Hay menos cadenas cortas que largas. Algunas entradas deben mantener su tamaño o crecer. Un modelo probabilístico equivocado, un archivo pequeño o el coste de enviar el diccionario pueden anular el ahorro.
4. Añadir redundancia para resistir el ruido
La codificación de fuente elimina redundancia evitable. La de canal añade redundancia estructurada para distinguir mensajes tras una perturbación. No se contradicen: resuelven problemas diferentes. El esquema las separa para explicarlas y omite la modulación física y la sincronización.
Esquema científico creado para este artículo a partir de la abstracción de Shannon: la compresión precede al código protector y la decodificación invierte el orden. Las flechas indican el recorrido del mensaje, no una señal medida ni una escala temporal.Supongamos inversiones independientes de cada bit con probabilidad p = 0,1. Enviamos 0 como 000 y 1 como 111, y decidimos por mayoría. El error exige al menos dos inversiones:
Pe=3p2(1−p)+p3=0.028.
La probabilidad de error del bit decodificado baja del 10 % al 2,8 %, a costa de enviar un bit de información por tres usos del canal. Este código de repetición ilustra el compromiso sin acercarse al límite de Shannon. Su error residual no desaparece enviando más bloques independientes de tres bits. Errores correlacionados o en ráfagas invalidarían este cálculo concreto.
5. Capacidad: una tasa, no una promesa de perfección
En el canal discreto estacionario sin memoria y con alfabetos finitos considerado aquí, la distribución condicional de cada salida Y depende solo de su entrada X correspondiente. Para una ley de transición fijada y una distribución de entrada sin restricciones adicionales:
I(X;Y)=H(X)−H(X∣Y),
C=PXmaxI(X;Y).
R=nlog2M.
En estas fórmulas, M es el número de mensajes equiprobables y n los usos del canal por palabra de código. En la cota de compresión, n cuenta símbolos de fuente y L_n es una longitud esperada en bits. Son dos ejemplos distintos.
La información mutua I(X;Y) mide cuánto reduce la observación de Y la incertidumbre sobre X. La capacidad se expresa en bits por uso del canal. Con mensajes equiprobables codificados en bloques de longitud n, cualquier tasa fija R estrictamente menor que C admite secuencias de códigos cuya probabilidad de error de bloque tiende a cero al aumentar n. Por encima de C, eso es imposible en este modelo. Es un resultado asintótico de existencia, no una garantía de cero errores a longitud finita ni de implementación eficiente. S4, S5, S6
Para un canal binario simétrico con inversiones independientes de probabilidad p:
h2(p)=−plog2p−(1−p)log2(1−p).
C=1−h2(p).
C(0.1)≈0.5310.
Las entradas equiprobables alcanzan la capacidad. Con p = 0,1, el límite es aproximadamente 0,5310 bits de información por uso, no 0,9. Desconocer dónde están los errores reduce la distinción entre mensajes. A 1 000 usos por segundo, 531,0 bit/s es la capacidad asintótica, no un caudal de aplicación medido.
6. Cuando intervienen el ancho de banda y la potencia
Para un canal ideal limitado en banda con ruido blanco gaussiano aditivo, independiente de la señal, y una restricción de potencia media:
C=Wlog2(1+NP).
3000log2(1001)≈29901.7bit/s.
W es el ancho de banda en hercios; P y N son las potencias de señal y ruido total dentro de esa banda, en la misma unidad, por ejemplo vatios. P/N es una razón lineal adimensional, no un valor en decibelios. Con W = 3 000 Hz y 30 dB de relación señal/ruido, P/N = 10^(30/10) = 1 000: unos 29 901,7 bit/s, o 29,90 kbit/s. Son parámetros ilustrativos, no una medición histórica de una línea telefónica. S1, teorema 17
La fórmula no es universal para desvanecimientos, interferencias impulsivas, límites de amplitud o una constelación finita impuesta. Aumentar W puede aumentar N: hay que recalcular el ruido, no mantenerlo constante sin justificación. Hardware, longitud del código, retardo y protocolos determinan la distancia práctica al límite.
7. Qué cambió y qué no afirma la teoría
Shannon permitió separar dos preguntas cuantitativas: cuánta información genera una fuente y cuánta puede transportar fiablemente un canal. Así, un diseño se compara con un límite, no solo con una máquina anterior. Los modelos todavía deben contrastarse con mediciones.
El trabajo de 1948 no proporcionó todos los algoritmos prácticos de compresión o corrección de errores. Trabajos posteriores, como el análisis de Gallager sobre probabilidades de error de codificación, desarrollaron los vínculos entre tasa, longitud de bloque y fiabilidad. Tampoco se deduce que los datos aleatorios tengan significado, que comprimir pruebe comprensión o que más cálculo supere la capacidad sin cambiar las hipótesis. S6
Su aportación duradera es un lenguaje para razonar sobre incertidumbre bajo restricciones. Ante un límite, el ingeniero puede identificar el modelo, medir la distancia y decidir si mejora el código, el canal o el objetivo.
Fuentes y comprobaciones de este artículo
Artículo redactado en inglés y traducido por un sistema de IA a partir de las fuentes citadas. El mismo sistema produjo el esquema científico. Los ejemplos se recalcularon mediante código y las versiones fueron comprobadas por IA; no se afirma revisión humana ni experta independiente. La portada se generó con ChatGPT Image.
Referencia SHANNON-EN-1, 9 de septiembre de 2026. Se leyeron en línea los pasajes citados de 1948 y los tratamientos matemáticos posteriores. Se comprobaron ecuaciones, hipótesis, aritmética, decodificación única y etiquetas localizadas. Los ejemplos son cálculos teóricos, no experimentos. El esquema explicativo se distingue de la portada generada. Esta nota describe la preparación real del artículo; no certifica publicación autónoma.
Fuentes
- S1 — C. E. Shannon — A Mathematical Theory of Communication (1948), corrected reprint
- S2 — Nokia Bell Labs — A Mathematical Theory of Communication
- S3 — M. Médard, MIT 6.441 (2010) — Lecture 5: codes, Kraft inequality, optimal codes
- S4 — M. Médard, MIT 6.441 (2010) — Lecture 8: channel capacity
- S5 — M. Médard, MIT 6.441 (2010) — Lecture 10: channel coding theorem
- S6 — R. G. Gallager — A Simple Derivation of the Coding Theorem and Some Applications (1965)
