Kalkulator Entropii - Oblicz Entropię Shannona Online Bezpłatnie
Darmowy kalkulator entropii do natychmiastowego obliczania entropii Shannona. Zmierz losowość danych, niepewność i zawartość informacji z wynikami krok po kroku. Idealny dla nauki o danych.
Kalkulator Entropii
Wprowadź wartości numeryczne oddzielone spacjami lub przecinkami w zależności od wybranego formatu.
Rozkład Częstotliwości
Wprowadź dane, aby zobaczyć wizualizację
Dokumentacja
Czym jest kalkulator entropii?
Kalkulator entropii wyznacza entropię Shannona zbioru liczb. Entropia Shannona to sposób pomiaru tego, jak nieprzewidywalny jest zbiór danych. Zbiór danych, w którym każda wartość jest taka sama, ma entropię równą zero, ponieważ nie ma w nim żadnej niepewności. Zbiór danych, w którym każda wartość ma takie samo prawdopodobieństwo wystąpienia, ma największą możliwą entropię dla swojej wielkości.
Pojęcie to wywodzi się z teorii informacji, dziedziny zapoczątkowanej przez amerykańskiego matematyka Claude’a Shannona w 1948 roku. Shannon chciał zmierzyć, ile informacji niesie wiadomość. Zdefiniował entropię jako średnią ilość „zaskoczenia” w ciągu symboli. Ten sam wzór jest obecnie stosowany w nauce o danych, kryptografii, biologii i uczeniu maszynowym — wszędzie tam, gdzie trzeba zmierzyć losowość zbioru wyników.
Wzór na entropię Shannona
Dla zbioru danych o unikatowych wartościach od x₁ do xₙ, z których każda występuje z prawdopodobieństwem p(xᵢ), entropia Shannona H wynosi:
Słownie: dla każdej unikatowej wartości należy pomnożyć jej prawdopodobieństwo przez logarytm o podstawie 2 z tego prawdopodobieństwa, dodać wszystkie te iloczyny, a następnie zmienić znak wyniku. Wynik jest zawsze równy zero lub dodatni.
Ten kalkulator zawsze stosuje logarytmy o podstawie 2, dlatego wynik jest wyrażany w bitach. Do innych zastosowań używa się innych podstaw: logarytm naturalny daje jednostki nazywane natami, a podstawa 10 daje jednostki nazywane hartleyami. Bity są standardową jednostką w informatyce i teorii informacji, dlatego ten kalkulator stosuje podstawę 2.
Dlaczego wynik nie może być ujemny
Każde prawdopodobieństwo p(xᵢ) mieści się między 0 a 1, więc jego logarytm jest równy zero lub ujemny. Pomnożenie prawdopodobieństwa przez ujemny lub zerowy logarytm daje liczbę ujemną lub zero. Zsumowanie tych wartości i zmiana znaku zawsze daje wynik równy zero lub większy.
Maksymalna możliwa entropia
Dla zbioru danych zawierającego n unikatowych wartości entropia jest największa, gdy każda wartość występuje równie często. To maksimum jest równe log₂(n) bitów. Zbiór danych zawierający 4 równie częste unikatowe wartości może osiągnąć najwyżej 2 bity entropii, ponieważ log₂(4) = 2. Każdy nierównomierny rozkład tych samych 4 wartości daje niższą entropię.
Jak obliczać entropię: krok po kroku
- Wypisz unikatowe wartości w zbiorze danych i policz, ile razy występuje każda z nich.
- Podziel każdą liczność przez całkowitą liczbę wartości, aby uzyskać prawdopodobieństwo każdej unikatowej wartości.
- Oblicz logarytm o podstawie 2 każdego prawdopodobieństwa, a następnie pomnóż go przez to samo prawdopodobieństwo.
- Dodaj wszystkie te iloczyny, a następnie pomnóż sumę przez −1.
Ten kalkulator automatycznie wykonuje te same cztery kroki. Wpisz liczby w polu wejściowym, oddzielając je spacjami lub przecinkami, wybierz odpowiedni format, a natychmiast pojawią się entropia, tabela prawdopodobieństw i wykres słupkowy. Tabela pod wynikiem pokazuje wartość, liczność, prawdopodobieństwo oraz p(x) × log₂(p(x)) dla każdej unikatowej liczby, dzięki czemu widoczne są obliczenia, a nie tylko wynik końcowy.
Zasady wprowadzania danych
- Akceptowane są wyłącznie wartości liczbowe: działają liczby całkowite, dziesiętne i ujemne.
- Wartości oddziela się spacjami (przykład:
1 2 3 4) lub przecinkami (przykład:1,2,3,4), zależnie od wybranego formatu. - Zbiór danych może zawierać najwyżej 100 000 wartości. Wprowadzenie większej liczby powoduje wyświetlenie komunikatu o błędzie z prośbą o zmniejszenie zbioru danych.
- Akceptowany jest zapis naukowy, więc
1e3jest odczytywane jako 1000. - Tekst, symbole i puste wpisy między separatorami są odrzucane z komunikatem o błędzie, a nie ignorowane bez ostrzeżenia.
- Odrzucana jest również liczba zbyt duża, aby komputer mógł ją przechować, na przykład
1e400. Największa wartość, jaką kalkulator może przechować, to około 1,8 x 10^308.
Przykład obliczeniowy
Rozważmy zbiór danych 1 2 3 1 2 1, który zawiera sześć liczb.
Najpierw policzmy każdą unikatową wartość:
| Wartość | Liczba wystąpień | Prawdopodobieństwo |
|---|---|---|
| 1 | 3 | 3/6 = 0,5 |
| 2 | 2 | 2/6 ≈ 0,3333 |
| 3 | 1 | 1/6 ≈ 0,1667 |
Następnie zastosujmy wzór do każdego wiersza i dodajmy wyniki:
Zbiór danych ma 3 unikatowe wartości, więc maksymalna możliwa entropia wynosi log₂(3) ≈ 1,585 bitów. Rzeczywisty wynik, 1,4591 bitów, jest niższy od tego maksimum, ponieważ wartość 1 występuje częściej niż pozostałe, przez co zbiór danych jest nieco mniej losowy niż przy idealnie równym podziale.
Zbiór danych bez niepewności
Zbiór danych 5 5 5 5 5 ma tylko jedną unikatową wartość, więc jej prawdopodobieństwo wynosi 1. Ponieważ log₂(1) = 0, każdy składnik sumy jest równy zero, a entropia wynosi dokładnie 0 bitów. W zbiorze danych, w którym każda wartość jest identyczna, nie ma żadnej niepewności.
Odczytywanie wyniku
- Entropia bliska 0 oznacza, że dane są powtarzalne i przewidywalne. Dominuje jedna wartość lub kilka wartości.
- Entropia bliska log₂(n), gdzie n oznacza liczbę unikatowych wartości, oznacza, że dane są niemal równomiernie rozłożone między wszystkie unikatowe wartości.
- Entropia dokładnie równa 0 oznacza, że każda wartość w zbiorze danych jest taka sama.
Sama entropia nie mówi, czy zbiór danych jest „dobry”, czy „zły”. Generator haseł potrzebuje wysokiej entropii, ponieważ utrudnia to odgadnięcie hasła. Czujnik, który powinien wskazywać stałą temperaturę, potrzebuje niskiej entropii, ponieważ oznacza ona stabilny odczyt.
Zastosowania entropii Shannona
- Uczenie maszynowe: algorytmy drzew decyzyjnych wykorzystują entropię do określania, która cecha najlepiej dzieli zbiór danych na przewidywalne grupy.
- Kompresja danych: entropia wyznacza teoretyczną granicę stopnia zmniejszenia pliku bez utraty informacji.
- Kryptografia: entropia mierzy, jak nieprzewidywalne jest hasło lub klucz kryptograficzny.
- Genetyka: entropia może wskazywać nietypowe lub bardzo zmienne regiony sekwencji DNA.
- Analiza tekstu: potraktowanie liter lub słów jako „wartości” pozwala mierzyć za pomocą entropii, jak przewidywalny jest fragment tekstu.
Często zadawane pytania
Czym jest entropia w teorii informacji? Jest to liczba mierząca niepewność lub nieprzewidywalność zbioru danych. Oblicza się ją na podstawie prawdopodobieństw poszczególnych unikatowych wartości w danych, a nie na podstawie samych wartości.
Jak obliczyć entropię Shannona ręcznie? Policz, jak często występuje każda unikatowa wartość, podziel każdą liczność przez sumę, aby uzyskać prawdopodobieństwa, pomnóż każde prawdopodobieństwo przez jego logarytm o podstawie 2, dodaj wyniki i pomnóż sumę przez −1.
Czy entropia może być ujemna? Nie. Najniższa możliwa wartość to 0 bitów; występuje ona, gdy każda wartość w zbiorze danych jest identyczna.
Jaka jest maksymalna entropia zbioru danych? Maksimum wynosi log₂(n) bitów, gdzie n oznacza liczbę unikatowych wartości, i występuje tylko wtedy, gdy każda unikatowa wartość pojawia się równie często.
Czy istnieje limit wielkości zbioru danych? Tak. Ten kalkulator akceptuje najwyżej 100 000 wartości w jednym zbiorze danych. Większe dane wejściowe powodują błąd.
Czym entropia różni się od wariancji? Wariancja mierzy rozproszenie wartości liczbowych wokół ich średniej. Entropia mierzy nieprzewidywalność wzorca wyników wyłącznie na podstawie prawdopodobieństw, niezależnie od rzeczywistej wielkości liczb.
Piśmiennictwo
- Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
- Cover, T. M. i Thomas, J. A. (2006). Elements of Information Theory (2. wyd.). Wiley-Interscience.
- MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.