Hopp til innhold

Entropi Kalkulator - Beregn Shannon Entropi Online Gratis

Gratis entropikalkulator for øyeblikkelig Shannon entropiberegning. Mål dataenes tilfeldighet, usikkerhet og informasjonsinnhold med trinnvise resultater. Perfekt for datavitenskap.

Entropi Kalkulator

Skriv inn numeriske verdier atskilt med mellomrom eller komma avhengig av valgt format.

Dataformat

Frekvensfordeling

Skriv inn data for å se visualisering

Lastekalkulator...
📚

Dokumentasjon

Hva er en entropikalkulator?

En entropikalkulator finner Shannon-entropien til et tallsett. Shannon-entropi er en måte å måle hvor uforutsigbart et datasett er på. Et datasett der alle verdiene er like, har entropi lik null, fordi det ikke er noe usikkert ved det. Et datasett der alle verdiene har samme sannsynlighet for å forekomme, har høyest mulig entropi for sin størrelse.

Ideen kommer fra informasjonsteori, et fagfelt som ble startet av den amerikanske matematikeren Claude Shannon i 1948. Shannon ønsket å måle hvor mye informasjon en melding inneholder. Han definerte entropi som den gjennomsnittlige mengden «overraskelse» i en sekvens av symboler. Den samme formelen brukes nå i datavitenskap, kryptografi, biologi og maskinlæring, overalt der man trenger å måle tilfeldighet i et sett med utfall.

Formel for Shannon-entropi

For et datasett med unike verdier x₁ til xₙ, der hver forekommer med sannsynlighet p(xᵢ), er Shannon-entropien H:

H(X)=−∑i=1np(xi)log⁡2p(xi)H(X) = -\sum_{i=1}^{n} p(x_i) \log_2 p(x_i)

Med ord: For hver unik verdi multipliserer man sannsynligheten med logaritmen med grunntall 2 av sannsynligheten, summerer alle disse produktene og snur deretter fortegnet. Resultatet er alltid null eller positivt.

Denne kalkulatoren bruker alltid logaritmer med grunntall 2, så resultatet måles i biter. Andre grunntall brukes til andre formål: Den naturlige logaritmen gir enheter kalt nat, og grunntall 10 gir enheter kalt hartley. Biter er standardenheten i databehandling og informasjonsteori, og derfor bruker denne kalkulatoren grunntall 2.

Hvorfor resultatet ikke kan være negativt

Enhver sannsynlighet p(xᵢ) ligger mellom 0 og 1, så logaritmen er null eller negativ. Når en sannsynlighet multipliseres med en negativ eller null logaritme, får man et negativt tall eller null. Summen av disse tallene, med snudd fortegn, gir alltid et resultat på null eller mer.

Maksimal mulig entropi

For et datasett med n unike verdier er entropien høyest når hver verdi forekommer like ofte. Denne maksimumsverdien er log₂(n) biter. Et datasett med 4 like vanlige unike verdier kan ha en entropi på høyst 2 biter, fordi log₂(4) = 2. Enhver ujevn fordeling av de samme 4 verdiene gir lavere entropi.

Slik beregnes entropi: trinn for trinn

  1. List opp de unike verdiene i datasettet og tell hvor mange ganger hver av dem forekommer.
  2. Del hvert antall på det totale antallet verdier for å finne sannsynligheten for hver unike verdi.
  3. Ta logaritmen med grunntall 2 av hver sannsynlighet, og multipliser den deretter med den samme sannsynligheten.
  4. Summer alle disse produktene, og multipliser deretter summen med −1.

Denne kalkulatoren utfører automatisk de samme fire trinnene. Skriv inn tall i inntastingsfeltet, atskilt med mellomrom eller komma, velg riktig format, så vises entropien, sannsynlighetstabellen og et stolpediagram med en gang. En tabell under resultatet viser verdien, antallet, sannsynligheten og p(x) × log₂(p(x)) for hvert unike tall, slik at mellomregningen er synlig, ikke bare det endelige svaret.

Regler for inndata

  • Bare numeriske verdier godtas: heltall, desimaltall og negative tall fungerer.
  • Verdier skilles med mellomrom (eksempel: 1 2 3 4) eller komma (eksempel: 1,2,3,4), avhengig av det valgte formatet.
  • Et datasett kan inneholde opptil 100 000 verdier. Hvis du skriver inn flere enn det, vises en feilmelding som ber om et mindre datasett.
  • Eksponentnotasjon godtas, så 1e3 tolkes som 1000.
  • Tekst, symboler eller tomme oppføringer mellom skilletegn avvises med en feilmelding i stedet for å bli ignorert uten videre.
  • Et tall som er for stort til å lagres i en datamaskin, for eksempel 1e400, avvises også. Den største verdien kalkulatoren kan lagre, er omtrent 1,8 x 10^308.

Regneeksempel

Ta datasettet 1 2 3 1 2 1, som har seks tall.

Tell først hver unik verdi:

VerdiAntallSannsynlighet
133/6 = 0,5
222/6 ≈ 0,3333
311/6 ≈ 0,1667

Bruk deretter formelen på hver rad og summer resultatene:

H=−(0.5log⁡20.5+0.3333log⁡20.3333+0.1667log⁡20.1667)H = -(0.5 \log_2 0.5 + 0.3333 \log_2 0.3333 + 0.1667 \log_2 0.1667) H=−(0.5×−1+0.3333×−1.585+0.1667×−2.585)H = -(0.5 \times -1 + 0.3333 \times -1.585 + 0.1667 \times -2.585) H≈1.4591 biterH \approx 1.4591 \text{ biter}

Datasettet har 3 unike verdier, så den maksimale mulige entropien er log₂(3) ≈ 1,585 biter. Det faktiske resultatet, 1,4591 biter, er lavere enn maksimumsverdien fordi verdien 1 forekommer oftere enn de andre. Datasettet er derfor litt mindre tilfeldig enn en helt jevn fordeling.

Et datasett uten usikkerhet

Datasettet 5 5 5 5 5 har bare én unik verdi, så sannsynligheten er 1. Siden log₂(1) = 0, er hvert ledd i summen null, og entropien er nøyaktig 0 biter. Det er ingenting usikkert ved et datasett der alle verdiene er identiske.

Slik tolkes resultatet

  • Entropi nær 0 betyr at dataene er repeterende og forutsigbare. Én eller noen få verdier dominerer.
  • Entropi nær log₂(n), der n er antallet unike verdier, betyr at dataene er omtrent jevnt fordelt på alle de unike verdiene.
  • Entropi på nøyaktig 0 betyr at alle verdiene i datasettet er like.

Entropi alene sier ikke om et datasett er «bra» eller «dårlig». En passordgenerator ønsker høy entropi, fordi det gjør passordet vanskelig å gjette. En sensor som skal måle en konstant temperatur, ønsker lav entropi, fordi det betyr at målingen er stabil.

Hvor Shannon-entropi brukes

  • Maskinlæring: Beslutningstrealgoritmer bruker entropi til å avgjøre hvilken egenskap som best deler et datasett inn i forutsigbare grupper.
  • Datakomprimering: Entropi angir den teoretiske grensen for hvor liten en fil kan komprimeres uten tap av informasjon.
  • Kryptografi: Entropi måler hvor uforutsigbart et passord eller en kryptografisk nøkkel er.
  • Genetikk: Entropi kan fremheve uvanlige eller svært variable områder i en DNA-sekvens.
  • Tekstanalyse: Når bokstaver eller ord behandles som «verdiene», kan entropi måle hvor forutsigbar en tekst er.

Ofte stilte spørsmål

Hva er entropi i informasjonsteori? Det er et tall som måler hvor usikkert eller uforutsigbart et datasett er. Det beregnes ut fra sannsynlighetene til hver unike verdi i dataene, ikke ut fra selve verdiene.

Hvordan beregner man Shannon-entropi for hånd? Tell hvor ofte hver unik verdi forekommer, del hvert antall på totalen for å få sannsynligheter, multipliser hver sannsynlighet med logaritmen med grunntall 2 av den, summer resultatene og multipliser med −1.

Kan entropi være negativ? Nei. Den lavest mulige verdien er 0 biter, og den oppstår når alle verdiene i datasettet er identiske.

Hva er den maksimale entropien for et datasett? Maksimumsverdien er log₂(n) biter, der n er antallet unike verdier, og den oppstår bare når hver unik verdi forekommer like ofte.

Finnes det en grense for datasettets størrelse? Ja. Denne kalkulatoren godtar opptil 100 000 verdier i ett datasett. Større inndata gir en feilmelding.

Hvordan skiller entropi seg fra varians? Varians måler hvor spredt numeriske verdier er rundt gjennomsnittet. Entropi måler hvor uforutsigbart mønsteret av utfall er, basert bare på sannsynligheter og uavhengig av selve størrelsen på tallene.

Referanser

  1. Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
  2. Cover, T. M., & Thomas, J. A. (2006). Elements of Information Theory (2. utg.). Wiley-Interscience.
  3. MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.