Entropijos Skaičiuoklė - Nemokamas Šenono Entropijos Skaičiavimas Internetu
Nemokama entropijos skaičiuoklė momentiniam Šenono entropijos skaičiavimui. Matuokite duomenų atsitiktinumą, neapibrėžtumą ir informacijos turinį su išsamiais rezultatais. Idealu duomenų mokslui.
Entropijos Skaičiuoklė
Įveskite skaitinius vertes, atskirtas tarpais arba kableliais, priklausomai nuo pasirinkto formato.
Dažnių Pasiskirstymas
Įveskite duomenis, kad pamatytumėte vizualizaciją
Dokumentacija
Kas yra entropijos skaičiuoklė?
Entropijos skaičiuoklė apskaičiuoja skaičių aibės Šanono entropiją. Šanono entropija parodo, kiek nenuspėjamas yra duomenų rinkinys. Duomenų rinkinio, kuriame visos reikšmės vienodos, entropija lygi nuliui, nes jame nėra nieko neapibrėžta. Duomenų rinkinio, kuriame kiekviena reikšmė pasirodo vienodai tikėtinai, entropija yra didžiausia galima pagal jo dydį.
Ši idėja kilo iš informacijos teorijos – srities, kurią 1948 m. pradėjo plėtoti amerikiečių matematikas Claude'as Shannonas. Shannonas norėjo išmatuoti, kiek informacijos perduoda pranešimas. Jis apibrėžė entropiją kaip vidutinį „netikėtumo“ kiekį simbolių sekoje. Ta pati formulė dabar taikoma duomenų moksle, kriptografijoje, biologijoje ir mašininiame mokyme – visur, kur reikia išmatuoti rezultatų aibės atsitiktinumą.
Šanono entropijos formulė
Duomenų rinkiniui, kurio unikalios reikšmės yra nuo x₁ iki xₙ ir kiekviena jų pasirodo su tikimybe p(xᵢ), Šanono entropija H yra:
Žodžiais tariant: kiekvienai unikaliai reikšmei jos tikimybė dauginama iš tos tikimybės logaritmo, kurio pagrindas yra 2, tada sudedamos visos šios sandaugos ir gautas rezultatas pakeičiamas priešingu ženklu. Rezultatas visada yra nulis arba teigiamas.
Ši skaičiuoklė visada naudoja logaritmus, kurių pagrindas yra 2, todėl rezultatas išreiškiamas bitais. Kiti pagrindai naudojami kitais tikslais: natūrinis logaritmas suteikia vienetus, vadinamus natais, o pagrindas 10 – hartliais. Bitai yra standartinis vienetas skaičiavimuose ir informacijos teorijoje, todėl ši skaičiuoklė naudoja pagrindą 2.
Kodėl rezultatas negali būti neigiamas
Kiekviena tikimybė p(xᵢ) yra tarp 0 ir 1, todėl jos logaritmas yra nulis arba neigiamas. Tikimybę padauginus iš neigiamo arba nulinio logaritmo, gaunamas neigiamas arba nulinis skaičius. Sudėjus šiuos skaičius ir pakeitus sumos ženklą, visada gaunamas nulis arba didesnis skaičius.
Didžiausia galima entropija
Duomenų rinkinio, turinčio n unikalių reikšmių, entropija yra didžiausia, kai kiekviena reikšmė pasirodo vienodai dažnai. Ši didžiausia reikšmė lygi log₂(n) bitų. Duomenų rinkinys, turintis 4 vienodai dažnai pasitaikančias unikalias reikšmes, gali pasiekti ne daugiau kaip 2 bitų entropiją, nes log₂(4) = 2. Bet koks netolygus tų pačių 4 reikšmių pasiskirstymas suteikia mažesnę entropiją.
Kaip apskaičiuoti entropiją: žingsnis po žingsnio
- Išvardykite unikalias reikšmes duomenų rinkinyje ir suskaičiuokite, kiek kartų kiekviena pasirodo.
- Padalykite kiekvieną pasikartojimų skaičių iš bendro reikšmių skaičiaus, kad gautumėte kiekvienos unikalios reikšmės tikimybę.
- Apskaičiuokite kiekvienos tikimybės logaritmą, kurio pagrindas yra 2, tada padauginkite jį iš tos pačios tikimybės.
- Sudėkite visas šias sandaugas, tada gautą sumą padauginkite iš −1.
Ši skaičiuoklė tuos pačius keturis veiksmus atlieka automatiškai. Įveskite skaičius į įvesties lauką, atskirdami juos tarpais arba kableliais, pasirinkite atitinkamą formatą, ir iškart bus parodytos entropija, tikimybių lentelė bei stulpelinė diagrama. Po rezultatu esančioje lentelėje kiekvienai unikaliai reikšmei pateikiama reikšmė, pasikartojimų skaičius, tikimybė ir p(x) × log₂(p(x)), todėl matomi ir skaičiavimai, ne tik galutinis atsakymas.
Įvesties taisyklės
- Priimamos tik skaitinės reikšmės: tinka sveikieji skaičiai, dešimtainiai skaičiai ir neigiami skaičiai.
- Reikšmės atskiriamos tarpais (pavyzdys:
1 2 3 4) arba kableliais (pavyzdys:1,2,3,4), atsižvelgiant į pasirinktą formatą. - Duomenų rinkinyje gali būti ne daugiau kaip 100 000 reikšmių. Įvedus daugiau, pateikiamas klaidos pranešimas, kuriame prašoma naudoti mažesnį duomenų rinkinį.
- Priimamas mokslinis formatas, todėl
1e3interpretuojamas kaip 1000. - Tekstas, simboliai arba tušti įrašai tarp skirtukų atmetami pateikiant klaidą, o ne tyliai ignoruojami.
- Taip pat atmetamas kompiuteriui išsaugoti per didelis skaičius, pavyzdžiui,
1e400. Didžiausia reikšmė, kurią gali apdoroti skaičiuoklė, yra maždaug 1,8 x 10^308.
Išspręstas pavyzdys
Paimkime duomenų rinkinį 1 2 3 1 2 1, kurį sudaro šeši skaičiai.
Pirmiausia suskaičiuokime kiekvieną unikalią reikšmę:
| Vertė | Pasikartojimų skaičius | Tikimybė |
|---|---|---|
| 1 | 3 | 3/6 = 0,5 |
| 2 | 2 | 2/6 ≈ 0,3333 |
| 3 | 1 | 1/6 ≈ 0,1667 |
Tada pritaikykime formulę kiekvienai eilutei ir sudėkime rezultatus:
Duomenų rinkinyje yra 3 unikalios reikšmės, todėl didžiausia galima entropija yra log₂(3) ≈ 1,585 bitų. Faktinis rezultatas, 1,4591 bitų, yra mažesnis už šią didžiausią reikšmę, nes reikšmė 1 pasirodo dažniau nei kitos, todėl duomenų rinkinys yra šiek tiek mažiau atsitiktinis nei visiškai tolygus pasiskirstymas.
Duomenų rinkinys be neapibrėžtumo
Duomenų rinkinyje 5 5 5 5 5 yra tik viena unikali reikšmė, todėl jos tikimybė yra 1. Kadangi log₂(1) = 0, kiekvienas sumos narys lygus nuliui, o entropija tiksliai lygi 0 bitų. Duomenų rinkinyje, kurio visos reikšmės vienodos, nėra jokio neapibrėžtumo.
Rezultato aiškinimas
- Entropija, artima 0, reiškia, kad duomenys yra pasikartojantys ir nuspėjami. Vyrauja viena arba kelios reikšmės.
- Entropija, artima log₂(n), kur n yra unikalių reikšmių skaičius, reiškia, kad duomenys beveik tolygiai pasiskirstę tarp visų unikalių reikšmių.
- Tiksliai 0 lygi entropija reiškia, kad visos duomenų rinkinio reikšmės yra vienodos.
Pati entropija neparodo, ar duomenų rinkinys yra „geras“, ar „blogas“. Slaptažodžių generatorius siekia didelės entropijos, nes dėl jos slaptažodį sunku atspėti. Jutikliui, turinčiam rodyti pastovią temperatūrą, reikalinga maža entropija, nes tai reiškia, kad rodmuo yra stabilus.
Kur naudojama Šanono entropija
- Mašininis mokymas: sprendimų medžių algoritmai naudoja entropiją, kad nustatytų, kuris požymis geriausiai padalija duomenų rinkinį į nuspėjamas grupes.
- Duomenų glaudinimas: entropija nustato teorinę ribą, iki kokio mažiausio dydžio galima suspausti failą neprarandant informacijos.
- Kriptografija: entropija parodo, kiek nenuspėjamas yra slaptažodis arba kriptografinis raktas.
- Genetika: entropija gali išryškinti neįprastus arba labai kintamus DNR sekos regionus.
- Teksto analizė: laikant raides arba žodžius „reikšmėmis“, entropija leidžia išmatuoti, kiek nuspėjama yra teksto ištrauka.
Dažnai užduodami klausimai
Kas yra entropija informacijos teorijoje? Tai skaičius, parodantis, kiek neapibrėžtas arba nenuspėjamas yra duomenų rinkinys. Ji apskaičiuojama pagal kiekvienos unikalios duomenų reikšmės tikimybes, o ne pagal pačias reikšmes.
Kaip rankiniu būdu apskaičiuoti Šanono entropiją? Suskaičiuokite, kaip dažnai pasirodo kiekviena unikali reikšmė, padalykite kiekvieną pasikartojimų skaičių iš bendro skaičiaus, kad gautumėte tikimybes, padauginkite kiekvieną tikimybę iš jos logaritmo, kurio pagrindas yra 2, sudėkite rezultatus ir gautą sumą padauginkite iš −1.
Ar entropija gali būti neigiama? Ne. Mažiausia galima reikšmė yra 0 bitų; ji gaunama, kai visos duomenų rinkinio reikšmės yra vienodos.
Kokia yra didžiausia duomenų rinkinio entropija? Didžiausia reikšmė yra log₂(n) bitų, kur n yra unikalių reikšmių skaičius; ji gaunama tik tada, kai kiekviena unikali reikšmė pasirodo vienodai dažnai.
Ar duomenų rinkinio dydis ribojamas? Taip. Ši skaičiuoklė viename duomenų rinkinyje priima ne daugiau kaip 100 000 reikšmių. Didesni įvesties duomenys grąžina klaidą.
Kuo entropija skiriasi nuo dispersijos? Dispersija parodo, kaip skaitinės reikšmės išsidėsčiusios aplink jų vidurkį. Entropija parodo rezultatų sekos nenuspėjamumą, remdamasi tik tikimybėmis, nepriklausomai nuo tikrojo skaičių dydžio.
Šaltiniai
- Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
- Cover, T. M. ir Thomas, J. A. (2006). Elements of Information Theory (2-asis leidimas). Wiley-Interscience.
- MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.