İçeriğe geç

Entropi Hesaplayıcı - Shannon Entropi'sini Çevrimiçi Ücretsiz Hesaplayın

Anında Shannon entropi hesaplaması için ücretsiz entropi hesaplayıcı. Adım adım sonuçlarla veri rastgeleliğini, belirsizliğini ve bilgi içeriğini ölçün. Veri bilimi için mükemmel.

Entropi Hesaplayıcı

Seçilen formata bağlı olarak sayısal değerleri boşluk veya virgülle ayırarak girin.

Veri Formatı

Frekans Dağılımı

Görselleştirmeyi görmek için veri girin

Yükleme hesaplayıcısı...
📚

Belgeler

Entropi hesaplayıcı nedir?

Entropi hesaplayıcı, bir sayı kümesinin Shannon entropisini bulur. Shannon entropisi, bir veri kümesinin ne kadar öngörülemez olduğunu ölçmenin bir yoludur. Her değerin aynı olduğu bir veri kümesinin entropisi sıfırdır; çünkü belirsiz hiçbir şey yoktur. Her değerin ortaya çıkma olasılığının eşit olduğu bir veri kümesi, boyutu için mümkün olan en yüksek entropiye sahiptir.

Bu fikir, Amerikalı matematikçi Claude Shannon tarafından 1948 yılında başlatılan bir alan olan bilgi kuramından gelir. Shannon, bir iletinin ne kadar bilgi taşıdığını ölçmek istedi. Entropiyi, bir sembol dizisindeki ortalama “şaşkınlık” miktarı olarak tanımladı. Aynı formül artık veri bilimi, kriptografi, biyoloji ve makine öğrenmesinde, bir sonuç kümesindeki rastgeleliği ölçmenin gerektiği her yerde kullanılır.

Shannon entropisi formülü

x₁'den xₙ'e kadar her benzersiz değerin p(xᵢ) olasılığıyla ortaya çıktığı bir veri kümesi için Shannon entropisi H şöyledir:

H(X)=−∑i=1np(xi)log⁡2p(xi)H(X) = -\sum_{i=1}^{n} p(x_i) \log_2 p(x_i)

Sözcüklerle ifade edersek: her benzersiz değer için olasılığını, bu olasılığın taban-2 logaritmasıyla çarpın; ardından tüm bu çarpımları toplayıp işareti değiştirin. Sonuç her zaman sıfır veya pozitiftir.

Bu hesaplayıcı her zaman taban-2 logaritmaları kullanır; dolayısıyla sonuç bit cinsinden ölçülür. Başka amaçlar için başka tabanlar da vardır: doğal logaritma nat adı verilen birimler verir, taban-10 ise hartley adı verilen birimler verir. Bit, bilişim ve bilgi kuramındaki standart birimdir; bu nedenle bu hesaplayıcı taban olarak 2 kullanır.

Sonuç neden negatif olamaz?

Her p(xᵢ) olasılığı 0 ile 1 arasındadır; bu nedenle logaritması sıfır veya negatiftir. Bir olasılığın negatif ya da sıfır bir logaritmayla çarpılması, negatif ya da sıfır bir sayı verir. Bunları toplamak ve işareti değiştirmek her zaman sıfır veya daha büyük bir sonuç üretir.

Mümkün olan en yüksek entropi

n benzersiz değere sahip bir veri kümesinde entropi, her değer eşit sıklıkta göründüğünde en yüksektir. Bu maksimum entropi log₂(n) bit olur. Eşit sıklıkta bulunan 4 benzersiz değere sahip bir veri kümesi en fazla 2 bit entropiye ulaşabilir; çünkü log₂(4) = 2. Aynı 4 değerin eşit olmayan herhangi bir dağılımı daha düşük entropi verir.

Entropi nasıl hesaplanır: adım adım

  1. Veri kümesindeki benzersiz değerleri listeleyin ve her birinin kaç kez göründüğünü sayın.
  2. Her benzersiz değerin olasılığını elde etmek için her sayımı toplam değer sayısına bölün.
  3. Her olasılığın taban-2 logaritmasını alın, ardından bunu aynı olasılıkla çarpın.
  4. Tüm bu çarpımları toplayın, ardından toplamı −1 ile çarpın.

Bu hesaplayıcı aynı dört adımı otomatik olarak gerçekleştirir. Sayıları giriş kutusuna boşluk veya virgülle ayırarak yazın, eşleşen biçimi seçin; entropi, olasılık tablosu ve çubuk grafik anında görüntülenir. Sonucun altındaki bir tabloda her benzersiz sayı için değer, sayım, olasılık ve p(x) × log₂(p(x)) gösterilir; böylece yalnızca nihai sonuç değil, hesaplama da görülebilir.

Giriş kuralları

  • Yalnızca sayısal değerler kabul edilir: tam sayılar, ondalık sayılar ve negatif sayılar kullanılabilir.
  • Seçilen biçime bağlı olarak değerler boşluklarla (örnek: 1 2 3 4) veya virgüllerle (örnek: 1,2,3,4) ayrılır.
  • Bir veri kümesi en fazla 100.000 değer içerebilir. Bundan fazlasının girilmesi, daha küçük bir veri kümesi istenen bir hata iletisi oluşturur.
  • Bilimsel gösterim kabul edilir; bu nedenle 1e3, 1000 olarak okunur.
  • Ayraçlar arasındaki metin, semboller veya boş girişler sessizce yok sayılmak yerine hata olarak reddedilir.
  • Bilgisayarın saklayamayacağı kadar büyük bir sayı, örneğin 1e400, yine reddedilir. Hesaplayıcının tutabileceği en büyük değer yaklaşık 1,8 x 10^308 değeridir.

Çözümlü örnek

Altı sayı içeren 1 2 3 1 2 1 veri kümesini ele alalım.

Önce her benzersiz değeri sayın:

DeğerSayıOlasılık
133/6 = 0,5
222/6 ≈ 0,3333
311/6 ≈ 0,1667

Ardından formülü her satıra uygulayın ve sonuçları toplayın:

H=−(0.5log⁡20.5+0.3333log⁡20.3333+0.1667log⁡20.1667)H = -(0.5 \log_2 0.5 + 0.3333 \log_2 0.3333 + 0.1667 \log_2 0.1667) H=−(0.5×−1+0.3333×−1.585+0.1667×−2.585)H = -(0.5 \times -1 + 0.3333 \times -1.585 + 0.1667 \times -2.585) H≈1.4591 bitH \approx 1.4591 \text{ bit}

Veri kümesinde 3 benzersiz değer vardır; bu nedenle mümkün olan en yüksek entropi log₂(3) ≈ 1,585 bittir. 1,4591 bitlik gerçek sonuç bu maksimumdan daha düşüktür; çünkü 1 değeri diğerlerinden daha sık görünür ve veri kümesini tamamen eşit dağılmış bir veri kümesine kıyasla biraz daha az rastgele hale getirir.

Belirsizlik içermeyen bir veri kümesi

5 5 5 5 5 veri kümesinde yalnızca bir benzersiz değer vardır; dolayısıyla olasılığı 1'dir. log₂(1) = 0 olduğundan toplam içindeki her terim sıfırdır ve entropi tam olarak 0 bittir. Her değerin aynı olduğu bir veri kümesinde belirsiz hiçbir şey yoktur.

Sonucun değerlendirilmesi

  • 0 değerine yakın entropi, verilerin tekrarlı ve öngörülebilir olduğu anlamına gelir. Bir veya birkaç değer baskındır.
  • log₂(n) değerine yakın entropi, burada n benzersiz değerlerin sayısıdır, verilerin tüm benzersiz değerlere neredeyse eşit dağıldığı anlamına gelir.
  • Tam olarak 0 entropisi, veri kümesindeki her değerin aynı olduğu anlamına gelir.

Entropi tek başına bir veri kümesinin “iyi” veya “kötü” olup olmadığını göstermez. Bir parola oluşturucu yüksek entropi ister; çünkü bu, parolanın tahmin edilmesini zorlaştırır. Sabit bir sıcaklık okuması gereken bir sensör ise düşük entropi ister; çünkü bu, okumanın kararlı olduğu anlamına gelir.

Shannon entropisinin kullanıldığı alanlar

  • Makine öğrenmesi: karar ağacı algoritmaları, bir veri kümesini öngörülebilir gruplara en iyi şekilde bölen özelliği seçmek için entropiyi kullanır.
  • Veri sıkıştırma: entropi, bilgi kaybı olmadan bir dosyanın ne kadar küçültülebileceğine ilişkin kuramsal sınırı belirler.
  • Kriptografi: entropi, bir parolanın veya kriptografik anahtarın ne kadar öngörülemez olduğunu ölçer.
  • Genetik: entropi, bir DNA dizisindeki alışılmadık veya değişkenliği yüksek bölgeleri belirginleştirebilir.
  • Metin analizi: harfleri veya sözcükleri “değerler” olarak ele almak, entropinin bir metin parçasının ne kadar öngörülebilir olduğunu ölçmesini sağlar.

Sık sorulan sorular

Bilgi kuramında entropi nedir? Bir veri kümesinin ne kadar belirsiz veya öngörülemez olduğunu ölçen bir sayıdır. Verilerin kendisinden değil, verilerdeki her benzersiz değerin olasılıklarından hesaplanır.

Shannon entropisi elle nasıl hesaplanır? Her benzersiz değerin kaç kez ortaya çıktığını sayın, olasılıkları elde etmek için her sayımı toplam sayıya bölün, her olasılığı taban-2 logaritmasıyla çarpın, sonuçları toplayın ve −1 ile çarpın.

Entropi negatif olabilir mi? Hayır. Mümkün olan en düşük değer 0 bittir; bu değer, veri kümesindeki her değer aynı olduğunda ortaya çıkar.

Bir veri kümesi için maksimum entropi nedir? Maksimum entropi, n'nin benzersiz değerlerin sayısı olduğu durumda log₂(n) bit olur ve yalnızca her benzersiz değer eşit sıklıkta göründüğünde ortaya çıkar.

Veri kümesinin boyutunda bir sınır var mı? Evet. Bu hesaplayıcı tek bir veri kümesinde en fazla 100.000 değeri kabul eder. Daha büyük girdiler hata döndürür.

Entropi varyanstan nasıl farklıdır? Varyans, sayısal değerlerin ortalamaları çevresinde ne kadar dağıldığını ölçer. Entropi ise sayıların gerçek büyüklüğünden bağımsız olarak, yalnızca olasılıklara dayanarak sonuç örüntüsünün ne kadar öngörülemez olduğunu ölçer.

Kaynaklar

  1. Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
  2. Cover, T. M. ve Thomas, J. A. (2006). Elements of Information Theory (2. baskı). Wiley-Interscience.
  3. MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.