Kalkulator Entropi - Hitung Entropi Shannon Secara Daring Gratis
Kalkulator entropi gratis untuk perhitungan entropi Shannon instan. Ukur keacakan data, ketidakpastian, dan konten informasi dengan hasil langkah demi langkah. Sempurna untuk ilmu data.
Kalkulator Entropi
Masukkan nilai numerik yang dipisahkan dengan spasi atau koma sesuai format yang dipilih.
Distribusi Frekuensi
Masukkan data untuk melihat visualisasi
Dokumentasi
Apa itu kalkulator entropi?
Kalkulator entropi menemukan entropi Shannon dari sekumpulan angka. Entropi Shannon adalah cara untuk mengukur seberapa tidak dapat diprediksi suatu dataset. Dataset yang setiap nilainya sama memiliki entropi nol, karena tidak ada hal yang tidak pasti tentangnya. Dataset yang setiap nilainya memiliki kemungkinan kemunculan yang sama memiliki entropi setinggi mungkin untuk ukurannya.
Gagasan ini berasal dari teori informasi, bidang yang dimulai oleh matematikawan Amerika Claude Shannon pada 1948. Shannon ingin mengukur seberapa banyak informasi yang dibawa suatu pesan. Ia mendefinisikan entropi sebagai jumlah rata-rata "kejutan" dalam suatu urutan simbol. Rumus yang sama kini digunakan dalam ilmu data, kriptografi, biologi, dan pembelajaran mesin, di mana pun seseorang perlu mengukur keacakan dalam sekumpulan hasil.
Rumus entropi Shannon
Untuk dataset dengan nilai unik xβ hingga xβ, yang masing-masing muncul dengan probabilitas p(xα΅’), entropi Shannon H adalah:
Dengan kata lain: untuk setiap nilai unik, kalikan probabilitasnya dengan logaritma berbasis 2 dari probabilitas tersebut, jumlahkan semua hasil kali ini, lalu ubah tandanya. Hasilnya selalu nol atau positif.
Kalkulator ini selalu menggunakan logaritma berbasis 2, sehingga hasilnya diukur dalam bit. Basis lain digunakan untuk keperluan lain: logaritma natural menghasilkan satuan yang disebut nat, sedangkan basis 10 menghasilkan satuan yang disebut hartley. Bit adalah satuan standar dalam komputasi dan teori informasi, sehingga kalkulator ini menggunakan basis 2.
Mengapa hasilnya tidak bisa negatif
Setiap probabilitas p(xα΅’) berada di antara 0 dan 1, sehingga logaritmanya nol atau negatif. Mengalikan probabilitas dengan logaritma negatif atau nol menghasilkan angka negatif atau nol. Menjumlahkan semua hasil tersebut lalu mengubah tandanya selalu menghasilkan nilai nol atau lebih.
Entropi maksimum yang mungkin
Untuk dataset dengan n nilai unik, entropi tertinggi terjadi ketika setiap nilai muncul sama seringnya. Nilai maksimum tersebut sama dengan logβ(n) bit. Dataset dengan 4 nilai unik yang sama seringnya dapat mencapai paling tinggi 2 bit entropi, karena logβ(4) = 2. Distribusi yang tidak merata dari nilai 4 yang sama menghasilkan entropi yang lebih rendah.
Cara menghitung entropi: langkah demi langkah
- Daftarkan nilai unik dalam dataset dan hitung berapa kali masing-masing muncul.
- Bagi setiap hitungan dengan jumlah total nilai untuk mendapatkan probabilitas setiap nilai unik.
- Ambil logaritma berbasis 2 dari setiap probabilitas, lalu kalikan dengan probabilitas yang sama.
- Jumlahkan semua hasil kali ini, lalu kalikan totalnya dengan β1.
Kalkulator ini melakukan empat langkah yang sama secara otomatis. Ketik angka ke dalam kotak masukan, pisahkan dengan spasi atau koma, pilih format yang sesuai, dan entropi, tabel probabilitas, serta diagram batang akan langsung muncul. Tabel di bawah hasil menampilkan nilai, hitungan, probabilitas, dan p(x) Γ logβ(p(x)) untuk setiap angka unik, sehingga proses perhitungannya terlihat, bukan hanya jawaban akhirnya.
Aturan masukan
- Hanya nilai numerik yang diterima: bilangan bulat, desimal, dan bilangan negatif semuanya dapat digunakan.
- Nilai dipisahkan dengan spasi (contoh:
1 2 3 4) atau koma (contoh:1,2,3,4), bergantung pada format yang dipilih. - Sebuah dataset dapat memuat hingga 100.000 nilai. Memasukkan lebih banyak dari jumlah tersebut akan menghasilkan pesan kesalahan yang meminta dataset lebih kecil.
- Notasi ilmiah diterima, sehingga
1e3dibaca sebagai 1000. - Teks, simbol, atau entri kosong di antara pemisah ditolak dengan pesan kesalahan, bukan diabaikan secara diam-diam.
- Angka yang terlalu besar untuk disimpan komputer, seperti
1e400, juga ditolak. Nilai terbesar yang dapat ditampung kalkulator adalah sekitar 1,8 x 10^308.
Contoh perhitungan
Ambil dataset 1 2 3 1 2 1, yang memiliki enam angka.
Pertama, hitung setiap nilai unik:
| Nilai | Jumlah | Probabilitas |
|---|---|---|
| 1 | 3 | 3/6 = 0,5 |
| 2 | 2 | 2/6 β 0,3333 |
| 3 | 1 | 1/6 β 0,1667 |
Selanjutnya, terapkan rumus pada setiap baris dan jumlahkan hasilnya:
Dataset ini memiliki 3 nilai unik, sehingga entropi maksimum yang mungkin adalah logβ(3) β 1,585 bit. Hasil sebenarnya, 1,4591 bit, lebih rendah daripada maksimum tersebut karena nilai 1 muncul lebih sering daripada nilai lainnya, sehingga dataset sedikit kurang acak dibandingkan pembagian yang benar-benar merata.
Dataset tanpa ketidakpastian
Dataset 5 5 5 5 5 hanya memiliki satu nilai unik, sehingga probabilitasnya adalah 1. Karena logβ(1) = 0, setiap suku dalam penjumlahan bernilai nol, dan entropinya tepat 0 bit. Tidak ada hal yang tidak pasti dalam dataset yang setiap nilainya identik.
Membaca hasilnya
- Entropi mendekati 0 berarti data bersifat repetitif dan mudah diprediksi. Satu atau beberapa nilai mendominasi.
- Entropi mendekati logβ(n), dengan n sebagai jumlah nilai unik, berarti data hampir tersebar merata di antara semua nilai uniknya.
- Entropi tepat 0 berarti setiap nilai dalam dataset sama.
Entropi, jika berdiri sendiri, tidak menunjukkan apakah suatu dataset "baik" atau "buruk". Pembuat kata sandi menginginkan entropi tinggi karena hal itu membuat kata sandi sulit ditebak. Sensor yang seharusnya membaca suhu konstan menginginkan entropi rendah karena hal itu berarti pembacaannya stabil.
Penggunaan entropi Shannon
- Pembelajaran mesin: algoritme pohon keputusan menggunakan entropi untuk menentukan fitur mana yang paling baik membagi dataset menjadi kelompok yang dapat diprediksi.
- Kompresi data: entropi menetapkan batas teoretis seberapa kecil suatu berkas dapat dikompresi tanpa kehilangan informasi.
- Kriptografi: entropi mengukur seberapa tidak dapat diprediksi suatu kata sandi atau kunci kriptografi.
- Genetika: entropi dapat menyoroti wilayah yang tidak biasa atau sangat bervariasi dalam suatu urutan DNA.
- Analisis teks: memperlakukan huruf atau kata sebagai "nilai" memungkinkan entropi mengukur seberapa dapat diprediksi suatu teks.
Pertanyaan yang sering diajukan
Apa itu entropi dalam teori informasi? Entropi adalah angka yang mengukur seberapa tidak pasti atau tidak dapat diprediksi suatu dataset. Entropi dihitung dari probabilitas setiap nilai unik dalam data, bukan dari nilai itu sendiri.
Bagaimana cara menghitung entropi Shannon secara manual? Hitung frekuensi kemunculan setiap nilai unik, bagi setiap hitungan dengan total untuk mendapatkan probabilitas, kalikan setiap probabilitas dengan logaritma berbasis 2-nya, jumlahkan hasilnya, lalu kalikan dengan β1.
Bisakah entropi bernilai negatif? Tidak. Nilai terendah yang mungkin adalah 0 bit, yang terjadi ketika setiap nilai dalam dataset identik.
Berapa entropi maksimum suatu dataset? Nilai maksimumnya adalah logβ(n) bit, dengan n sebagai jumlah nilai unik, dan nilai ini hanya terjadi ketika setiap nilai unik muncul sama seringnya.
Apakah ada batas ukuran dataset? Ya. Kalkulator ini menerima hingga 100.000 nilai dalam satu dataset. Masukan yang lebih besar menghasilkan kesalahan.
Apa perbedaan entropi dan varians? Varians mengukur seberapa tersebar nilai numerik di sekitar rata-ratanya. Entropi mengukur seberapa tidak dapat diprediksi pola hasil, hanya berdasarkan probabilitas, terlepas dari besarnya angka sebenarnya.
Referensi
- Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379β423.
- Cover, T. M., & Thomas, J. A. (2006). Elements of Information Theory (edisi ke-2). Wiley-Interscience.
- MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.