Calculadora d'Entropia - Calcula l'Entropia de Shannon en Línia Gratuïtament
Calculadora d'entropia gratuïta per a càlcul instantani de l'entropia de Shannon. Mesura la aleatorietat de les dades, la incertesa i el contingut d'informació amb resultats pas a pas. Perfecta per a ciència de dades.
Calculadora d'Entropia
Introduïu valors numèrics separats per espais o comes depenent del format seleccionat.
Distribució de Freqüència
Introduïu dades per veure la visualització
Documentació
Què és una calculadora d’entropia?
Una calculadora d’entropia troba l’entropia de Shannon d’un conjunt de nombres. L’entropia de Shannon és una manera de mesurar fins a quin punt un conjunt de dades és imprevisible. Un conjunt de dades en què tots els valors són iguals té entropia zero, perquè no hi ha res d’incert. Un conjunt de dades en què tots els valors tenen la mateixa probabilitat d’aparèixer té la màxima entropia possible per a la seva mida.
La idea prové de la teoria de la informació, un camp iniciat pel matemàtic nord-americà Claude Shannon el 1948. Shannon volia mesurar quanta informació transmet un missatge. Va definir l’entropia com la quantitat mitjana de «sorpresa» d’una seqüència de símbols. La mateixa fórmula ara apareix en la ciència de dades, la criptografia, la biologia i l’aprenentatge automàtic, en qualsevol àmbit en què calgui mesurar l’aleatorietat d’un conjunt de resultats.
Fórmula de l’entropia de Shannon
Per a un conjunt de dades amb valors únics x₁ a xₙ, cadascun amb probabilitat p(xᵢ), l’entropia de Shannon H és:
En paraules: per a cada valor únic, multiplica’n la probabilitat pel logaritme en base 2 d’aquesta probabilitat, suma tots aquests productes i després canvia’n el signe. El resultat sempre és zero o positiu.
Aquesta calculadora sempre utilitza logaritmes en base 2, de manera que el resultat es mesura en bits. Hi ha altres bases per a altres finalitats: el logaritme natural dona unitats anomenades nats, i la base 10 dona unitats anomenades hartleys. Els bits són la unitat estàndard en informàtica i teoria de la informació, per això aquesta calculadora utilitza la base 2.
Per què el resultat no pot ser negatiu
Cada probabilitat p(xᵢ) es troba entre 0 i 1, de manera que el seu logaritme és zero o negatiu. Multiplicar una probabilitat per un logaritme negatiu o zero dona un nombre negatiu o zero. La suma d’aquests nombres, amb el signe canviat, sempre produeix un resultat igual o superior a zero.
Entropia màxima possible
Per a un conjunt de dades amb n valors únics, l’entropia és màxima quan tots els valors apareixen amb la mateixa freqüència. Aquest màxim és igual a log₂(n) bits. Un conjunt de dades amb 4 valors únics igualment freqüents pot assolir com a màxim 2 bits d’entropia, perquè log₂(4) = 2. Qualsevol distribució desigual dels mateixos 4 valors dona una entropia inferior.
Com calcular l’entropia: pas a pas
- Enumera els valors únics del conjunt de dades i compta quantes vegades apareix cadascun.
- Divideix cada recompte pel nombre total de valors per obtenir la probabilitat de cada valor únic.
- Calcula el logaritme en base 2 de cada probabilitat i multiplica’l per aquesta mateixa probabilitat.
- Suma tots aquests productes i multiplica el total per −1.
Aquesta calculadora fa automàticament els mateixos quatre passos. Escriu els nombres al quadre d’entrada, separats per espais o comes, tria el format corresponent i l’entropia, la taula de probabilitats i un gràfic de barres apareixeran immediatament. Una taula sota el resultat mostra el valor, el recompte, la probabilitat i p(x) × log₂(p(x)) de cada nombre únic, de manera que el càlcul es pot veure i no només el resultat final.
Regles d’entrada
- Només s’accepten valors numèrics: funcionen tant els nombres enters com els decimals i els nombres negatius.
- Els valors se separen per espais (exemple:
1 2 3 4) o per comes (exemple:1,2,3,4), segons el format seleccionat. - Un conjunt de dades pot contenir fins a 100.000 valors. Si se n’introdueixen més, apareix un missatge d’error que demana un conjunt de dades més petit.
- S’accepta la notació científica, de manera que
1e3es llegeix com a 1000. - El text, els símbols o les entrades buides entre separadors es rebutgen amb un error, en lloc d’ignorar-se silenciosament.
- També es rebutja un nombre massa gran per ser emmagatzemat en un ordinador, com ara
1e400. El valor màxim que pot emmagatzemar la calculadora és aproximadament 1,8 x 10^308.
Exemple resolt
Considerem el conjunt de dades 1 2 3 1 2 1, que té sis nombres.
Primer, comptem cada valor únic:
| Valor | Recompte | Probabilitat |
|---|---|---|
| 1 | 3 | 3/6 = 0,5 |
| 2 | 2 | 2/6 ≈ 0,3333 |
| 3 | 1 | 1/6 ≈ 0,1667 |
A continuació, apliquem la fórmula a cada fila i sumem els resultats:
El conjunt de dades té 3 valors únics, de manera que la màxima entropia possible és log₂(3) ≈ 1,585 bits. El resultat real, 1,4591 bits, és inferior a aquest màxim perquè el valor 1 apareix més sovint que els altres, fet que fa que el conjunt de dades sigui lleugerament menys aleatori que una distribució perfectament uniforme.
Un conjunt de dades sense incertesa
El conjunt de dades 5 5 5 5 5 només té un valor únic, de manera que la seva probabilitat és 1. Com que log₂(1) = 0, cada terme de la suma és zero i l’entropia és exactament de 0 bits. No hi ha cap incertesa en un conjunt de dades en què tots els valors són idèntics.
Interpretació del resultat
- Una entropia propera a 0 significa que les dades són repetitives i predictibles. Un o uns quants valors hi predominen.
- Una entropia propera a log₂(n), on n és el nombre de valors únics, significa que les dades estan distribuïdes gairebé uniformement entre tots els seus valors únics.
- Una entropia exactament de 0 significa que tots els valors del conjunt de dades són iguals.
L’entropia, per si sola, no indica si un conjunt de dades és «bo» o «dolent». Un generador de contrasenyes vol una entropia alta perquè això fa que la contrasenya sigui difícil d’endevinar. Un sensor que hauria de mesurar una temperatura constant vol una entropia baixa, perquè això significa que la lectura és estable.
On s’utilitza l’entropia de Shannon
- Aprenentatge automàtic: els algorismes d’arbres de decisió utilitzen l’entropia per decidir quina característica divideix millor un conjunt de dades en grups predictibles.
- Compressió de dades: l’entropia estableix el límit teòric de fins a quin punt es pot comprimir un fitxer sense perdre informació.
- Criptografia: l’entropia mesura fins a quin punt una contrasenya o una clau criptogràfica és imprevisible.
- Genètica: l’entropia pot posar de manifest regions inusuals o molt variables d’una seqüència d’ADN.
- Anàlisi de textos: considerar les lletres o les paraules com els «valors» permet que l’entropia mesuri fins a quin punt és predictible un text.
Preguntes freqüents
Què és l’entropia en la teoria de la informació? És un nombre que mesura fins a quin punt un conjunt de dades és incert o imprevisible. Es calcula a partir de les probabilitats de cada valor únic de les dades, no a partir dels valors en si.
Com es calcula manualment l’entropia de Shannon? Compta amb quina freqüència apareix cada valor únic, divideix cada recompte pel total per obtenir les probabilitats, multiplica cada probabilitat pel seu logaritme en base 2, suma els resultats i multiplica-ho per −1.
L’entropia pot ser negativa? No. El valor mínim possible és de 0 bits, i es produeix quan tots els valors del conjunt de dades són idèntics.
Quina és l’entropia màxima d’un conjunt de dades? El màxim és log₂(n) bits, on n és el nombre de valors únics, i només es produeix quan tots els valors únics apareixen amb la mateixa freqüència.
Hi ha un límit per a la mida del conjunt de dades? Sí. Aquesta calculadora accepta fins a 100.000 valors en un sol conjunt de dades. Les entrades més grans retornen un error.
En què es diferencia l’entropia de la variància? La variància mesura fins a quin punt els valors numèrics es dispersen al voltant de la seva mitjana. L’entropia mesura fins a quin punt és imprevisible el patró dels resultats, basant-se només en les probabilitats, independentment de la magnitud real dels nombres.
Referències
- Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
- Cover, T. M., i Thomas, J. A. (2006). Elements of Information Theory (2a ed.). Wiley-Interscience.
- MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.