Spring til indhold

Entropi-beregner - Beregn Shannon Entropi Online Gratis

Gratis entropi-beregner til øjeblikkelig Shannon entropi-beregning. Mål dataers tilfældighed, usikkerhed og informationsindhold med trinvise resultater. Perfekt til datavidenskab.

Entropiberegner

Indtast numeriske værdier adskilt af mellemrum eller kommaer afhængigt af det valgte format.

Dataformat

Frekvensdistribution

Indtast data for at se visualisering

Indlæsningsberegner...
📚

Dokumentation

Hvad er en entropiberegner?

En entropiberegner finder Shannon-entropien for et sæt tal. Shannon-entropi er en måde at måle, hvor uforudsigeligt et datasæt er. Et datasæt, hvor alle værdier er ens, har entropien nul, fordi der ikke er noget usikkert ved det. Et datasæt, hvor alle værdier har samme sandsynlighed for at forekomme, har den højest mulige entropi for sin størrelse.

Idéen stammer fra informationsteorien, et fagområde, som blev grundlagt af den amerikanske matematiker Claude Shannon i 1948. Shannon ville måle, hvor meget information en meddelelse indeholder. Han definerede entropi som den gennemsnitlige mængde »overraskelse« i en sekvens af symboler. Den samme formel bruges nu i datalogi, kryptografi, biologi og maskinlæring, alle steder hvor man har brug for at måle tilfældighed i et sæt udfald.

Shannon-entropiens formel

For et datasæt med unikke værdier fra x₁ til xₙ, hvor hver værdi forekommer med sandsynligheden p(xᵢ), er Shannon-entropien H:

H(X)=−∑i=1np(xi)log⁡2p(xi)H(X) = -\sum_{i=1}^{n} p(x_i) \log_2 p(x_i)

Med ord: For hver unik værdi multipliceres dens sandsynlighed med logaritmen til basen 2 af denne sandsynlighed, alle disse produkter lægges sammen, og fortegnet vendes derefter. Resultatet er altid nul eller positivt.

Denne beregner bruger altid logaritmer til basen 2, så resultatet måles i bits. Der findes andre baser til andre formål: Den naturlige logaritme giver enheder kaldet nats, og basen 10 giver enheder kaldet hartleys. Bits er standardenheden i datalogi og informationsteori, og derfor bruger denne beregner basen 2.

Hvorfor resultatet ikke kan være negativt

Hver sandsynlighed p(xᵢ) ligger mellem 0 og 1, så dens logaritme er nul eller negativ. Når en sandsynlighed multipliceres med en negativ eller nul logaritme, fås et negativt tal eller nul. Når disse tal lægges sammen, og fortegnet vendes, giver det altid et resultat på nul eller derover.

Den maksimalt mulige entropi

For et datasæt med n unikke værdier er entropien højest, når hver værdi forekommer lige ofte. Denne maksimumværdi er log₂(n) bits. Et datasæt med 4 lige hyppige unikke værdier kan højst nå 2 bits entropi, fordi log₂(4) = 2. Enhver ujævn fordeling af de samme 4 værdier giver en lavere entropi.

Sådan beregnes entropi: trin for trin

  1. Oplist de unikke værdier i datasættet, og tæl, hvor mange gange hver af dem forekommer.
  2. Divider hver optælling med det samlede antal værdier for at finde sandsynligheden for hver unik værdi.
  3. Beregn logaritmen til basen 2 af hver sandsynlighed, og multiplicer den derefter med den samme sandsynlighed.
  4. Læg alle disse produkter sammen, og multiplicer derefter summen med −1.

Denne beregner udfører automatisk de samme fire trin. Skriv tal ind i inputfeltet, adskilt af mellemrum eller kommaer, vælg det tilsvarende format, og entropien, sandsynlighedstabellen og et søjlediagram vises med det samme. En tabel under resultatet viser værdien, optællingen, sandsynligheden og p(x) × log₂(p(x)) for hvert unikt tal, så beregningen er synlig og ikke kun det endelige svar.

Regler for input

  • Kun numeriske værdier accepteres: heltal, decimaltal og negative tal fungerer alle.
  • Værdier adskilles af mellemrum (eksempel: 1 2 3 4) eller kommaer (eksempel: 1,2,3,4), afhængigt af det valgte format.
  • Et datasæt kan indeholde op til 100.000 værdier. Hvis der indtastes flere, vises en fejlmeddelelse, som beder om et mindre datasæt.
  • Videnskabelig notation accepteres, så 1e3 læses som 1000.
  • Tekst, symboler eller tomme poster mellem separatorer afvises med en fejl i stedet for at blive ignoreret uden videre.
  • Et tal, der er for stort til at kunne gemmes af en computer, f.eks. 1e400, afvises også. Den største værdi, beregneren kan indeholde, er cirka 1,8 x 10^308.

Regneeksempel

Betragt datasættet 1 2 3 1 2 1, som indeholder seks tal.

Først tælles hver unik værdi:

VærdiOptællingSandsynlighed
133/6 = 0,5
222/6 ≈ 0,3333
311/6 ≈ 0,1667

Anvend derefter formlen på hver række, og læg resultaterne sammen:

H=−(0.5log⁡20.5+0.3333log⁡20.3333+0.1667log⁡20.1667)H = -(0.5 \log_2 0.5 + 0.3333 \log_2 0.3333 + 0.1667 \log_2 0.1667) H=−(0.5×−1+0.3333×−1.585+0.1667×−2.585)H = -(0.5 \times -1 + 0.3333 \times -1.585 + 0.1667 \times -2.585) H≈1.4591 bitsH \approx 1.4591 \text{ bits}

Datasættet har 3 unikke værdier, så den maksimalt mulige entropi er log₂(3) ≈ 1,585 bits. Det faktiske resultat, 1,4591 bits, er lavere end maksimumværdien, fordi værdien 1 forekommer oftere end de andre, hvilket gør datasættet en smule mindre tilfældigt end en helt jævn fordeling.

Et datasæt uden usikkerhed

Datasættet 5 5 5 5 5 har kun én unik værdi, så dens sandsynlighed er 1. Da log₂(1) = 0, er hvert led i summen nul, og entropien er præcis 0 bits. Der er intet usikkert ved et datasæt, hvor alle værdier er identiske.

Sådan aflæses resultatet

  • Entropi tæt på 0 betyder, at dataene er gentagne og forudsigelige. Én eller få værdier dominerer.
  • Entropi tæt på log₂(n), hvor n er antallet af unikke værdier, betyder, at dataene er tæt på at være jævnt fordelt på alle deres unikke værdier.
  • Entropi på præcis 0 betyder, at alle værdier i datasættet er ens.

Entropi alene siger ikke, om et datasæt er »godt« eller »dårligt«. En adgangskodegenerator ønsker høj entropi, fordi det gør adgangskoden svær at gætte. En sensor, der skal måle en konstant temperatur, ønsker lav entropi, fordi det betyder, at målingen er stabil.

Hvor Shannon-entropi anvendes

  • Maskinlæring: Beslutningstræalgoritmer bruger entropi til at afgøre, hvilken egenskab der bedst opdeler et datasæt i forudsigelige grupper.
  • Datakomprimering: Entropi angiver den teoretiske grænse for, hvor lille en fil kan komprimeres uden tab af information.
  • Kryptografi: Entropi måler, hvor uforudsigelig en adgangskode eller en kryptografisk nøgle er.
  • Genetik: Entropi kan fremhæve usædvanlige eller meget variable områder i en DNA-sekvens.
  • Tekstanalyse: Hvis bogstaver eller ord behandles som »værdier«, kan entropi måle, hvor forudsigelig en tekst er.

Ofte stillede spørgsmål

Hvad er entropi i informationsteorien? Det er et tal, der måler, hvor usikkert eller uforudsigeligt et datasæt er. Det beregnes ud fra sandsynlighederne for hver unik værdi i dataene, ikke ud fra selve værdierne.

Hvordan beregner man Shannon-entropi i hånden? Tæl, hvor ofte hver unik værdi forekommer, divider hver optælling med det samlede antal for at få sandsynlighederne, multiplicer hver sandsynlighed med dens logaritme til basen 2, læg resultaterne sammen, og multiplicer med −1.

Kan entropi være negativ? Nej. Den lavest mulige værdi er 0 bits, hvilket forekommer, når alle værdier i datasættet er identiske.

Hvad er den maksimale entropi for et datasæt? Maksimumværdien er log₂(n) bits, hvor n er antallet af unikke værdier, og den forekommer kun, når hver unik værdi forekommer lige ofte.

Er der en grænse for datasættets størrelse? Ja. Denne beregner accepterer op til 100.000 værdier i et enkelt datasæt. Større input giver en fejl.

Hvordan adskiller entropi sig fra varians? Varians måler, hvor spredte numeriske værdier er omkring deres gennemsnit. Entropi måler, hvor uforudsigeligt mønstret af udfald er, baseret udelukkende på sandsynligheder og uanset tallenes faktiske størrelse.

Referencer

  1. Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
  2. Cover, T. M., & Thomas, J. A. (2006). Elements of Information Theory (2. udg.). Wiley-Interscience.
  3. MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.