Calculadora de Entropia - Calcule a Entropia de Shannon Online Gratuitamente
Calculadora de entropia gratuita para cálculo instantâneo da entropia de Shannon. Meça a aleatoriedade dos dados, incerteza e conteúdo de informação com resultados passo a passo. Perfeito para ciência de dados.
Calculadora de Entropia
Insira valores numéricos separados por espaços ou vírgulas, dependendo do formato selecionado.
Distribuição de Frequência
Insira dados para ver a visualização
Documentação
O que é uma calculadora de entropia?
Uma calculadora de entropia encontra a entropia de Shannon de um conjunto de números. A entropia de Shannon é uma forma de medir o quanto um conjunto de dados é imprevisível. Um conjunto de dados em que todos os valores são iguais tem entropia zero, pois não há nada de incerto nele. Um conjunto de dados em que todos os valores têm a mesma probabilidade de aparecer tem a maior entropia possível para seu tamanho.
A ideia vem da teoria da informação, um campo iniciado pelo matemático americano Claude Shannon em 1948. Shannon queria medir quanta informação uma mensagem transmite. Ele definiu entropia como a quantidade média de “surpresa” em uma sequência de símbolos. A mesma fórmula agora aparece na ciência de dados, na criptografia, na biologia e no aprendizado de máquina, sempre que é necessário medir a aleatoriedade em um conjunto de resultados.
Fórmula da entropia de Shannon
Para um conjunto de dados com valores distintos x₁ até xₙ, cada um aparecendo com probabilidade p(xᵢ), a entropia de Shannon H é:
Em palavras: para cada valor distinto, multiplique sua probabilidade pelo logaritmo de base 2 dessa probabilidade, some todos esses produtos e, em seguida, inverta o sinal. O resultado é sempre zero ou positivo.
Esta calculadora sempre usa logaritmos de base 2, portanto o resultado é medido em bits. Existem outras bases para outras finalidades: o logaritmo natural produz unidades chamadas nats, e a base 10 produz unidades chamadas hartleys. Bits são a unidade padrão na computação e na teoria da informação, por isso esta calculadora usa a base 2.
Por que o resultado não pode ser negativo
Toda probabilidade p(xᵢ) está entre 0 e 1, portanto seu logaritmo é zero ou negativo. Multiplicar uma probabilidade por um logaritmo negativo ou zero produz um número negativo ou zero. Somar esses valores e inverter o sinal sempre produz um resultado igual ou maior que zero.
Entropia máxima possível
Para um conjunto de dados com n valores distintos, a entropia é máxima quando todos os valores aparecem com a mesma frequência. Esse máximo é igual a log₂(n) bits. Um conjunto de dados com 4 valores distintos igualmente frequentes pode atingir no máximo 2 bits de entropia, pois log₂(4) = 2. Qualquer distribuição desigual dos mesmos 4 valores produz uma entropia menor.
Como calcular a entropia: passo a passo
- Liste os valores distintos no conjunto de dados e conte quantas vezes cada um aparece.
- Divida cada contagem pelo número total de valores para obter a probabilidade de cada valor distinto.
- Calcule o logaritmo de base 2 de cada probabilidade e, em seguida, multiplique-o por essa mesma probabilidade.
- Some todos esses produtos e depois multiplique o total por −1.
Esta calculadora executa automaticamente os mesmos quatro passos. Digite os números na caixa de entrada, separados por espaços ou vírgulas, escolha o formato correspondente e a entropia, a tabela de probabilidades e um gráfico de barras aparecerão imediatamente. Uma tabela abaixo do resultado mostra o valor, a contagem, a probabilidade e p(x) × log₂(p(x)) para cada número distinto, de modo que o cálculo fique visível, e não apenas a resposta final.
Regras de entrada
- Apenas valores numéricos são aceitos: números inteiros, decimais e negativos funcionam.
- Os valores são separados por espaços (exemplo:
1 2 3 4) ou por vírgulas (exemplo:1,2,3,4), dependendo do formato selecionado. - Um conjunto de dados pode conter até 100.000 valores. Inserir mais do que isso produz uma mensagem de erro solicitando um conjunto de dados menor.
- A notação científica é aceita, portanto
1e3é interpretado como 1000. - Texto, símbolos ou entradas vazias entre separadores são rejeitados com um erro, em vez de serem ignorados silenciosamente.
- Um número grande demais para ser armazenado por um computador, como
1e400, também é rejeitado. O maior valor que a calculadora consegue armazenar é aproximadamente 1,8 x 10^308.
Exemplo prático
Considere o conjunto de dados 1 2 3 1 2 1, que contém seis números.
Primeiro, conte cada valor distinto:
| Valor | Contagem | Probabilidade |
|---|---|---|
| 1 | 3 | 3/6 = 0,5 |
| 2 | 2 | 2/6 ≈ 0,3333 |
| 3 | 1 | 1/6 ≈ 0,1667 |
Em seguida, aplique a fórmula a cada linha e some os resultados:
O conjunto de dados tem 3 valores distintos, portanto a entropia máxima possível é log₂(3) ≈ 1,585 bits. O resultado real, 1,4591 bits, é menor que esse máximo porque o valor 1 aparece mais vezes que os outros, tornando o conjunto de dados um pouco menos aleatório que uma divisão perfeitamente uniforme.
Um conjunto de dados sem incerteza
O conjunto de dados 5 5 5 5 5 tem apenas um valor distinto, portanto sua probabilidade é 1. Como log₂(1) = 0, cada termo da soma é zero, e a entropia é exatamente 0 bits. Não há nada de incerto em um conjunto de dados no qual todos os valores são idênticos.
Interpretação do resultado
- Entropia próxima de 0 significa que os dados são repetitivos e previsíveis. Um ou alguns valores predominam.
- Entropia próxima de log₂(n), em que n é a quantidade de valores distintos, significa que os dados estão distribuídos de forma quase uniforme entre todos os seus valores distintos.
- Entropia exatamente igual a 0 significa que todos os valores do conjunto de dados são iguais.
A entropia, por si só, não indica se um conjunto de dados é “bom” ou “ruim”. Um gerador de senhas busca uma entropia alta, pois isso torna a senha difícil de adivinhar. Um sensor que deveria registrar uma temperatura constante busca uma entropia baixa, pois isso significa que a leitura é estável.
Onde a entropia de Shannon é usada
- Aprendizado de máquina: algoritmos de árvores de decisão usam a entropia para decidir qual característica divide melhor um conjunto de dados em grupos previsíveis.
- Compressão de dados: a entropia define o limite teórico de quão pequeno um arquivo pode ser comprimido sem perda de informação.
- Criptografia: a entropia mede o quanto uma senha ou uma chave criptográfica é imprevisível.
- Genética: a entropia pode destacar regiões incomuns ou altamente variáveis em uma sequência de DNA.
- Análise de texto: tratar letras ou palavras como os “valores” permite que a entropia meça o quanto um trecho de texto é previsível.
Dúvidas frequentes
O que é entropia na teoria da informação? É um número que mede o quanto um conjunto de dados é incerto ou imprevisível. Ela é calculada a partir das probabilidades de cada valor distinto nos dados, não dos valores em si.
Como calcular a entropia de Shannon manualmente? Conte quantas vezes cada valor distinto ocorre, divida cada contagem pelo total para obter as probabilidades, multiplique cada probabilidade pelo seu logaritmo de base 2, some os resultados e multiplique por −1.
A entropia pode ser negativa? Não. O menor valor possível é 0 bits, o que ocorre quando todos os valores do conjunto de dados são idênticos.
Qual é a entropia máxima de um conjunto de dados? O máximo é log₂(n) bits, em que n é o número de valores distintos, e só ocorre quando cada valor distinto aparece com a mesma frequência.
Existe um limite para o tamanho do conjunto de dados? Sim. Esta calculadora aceita até 100.000 valores em um único conjunto de dados. Entradas maiores retornam um erro.
Qual é a diferença entre entropia e variância? A variância mede o quanto os valores numéricos estão dispersos em torno da média. A entropia mede o quanto o padrão dos resultados é imprevisível, com base apenas nas probabilidades, independentemente do tamanho real dos números.
Referências
- Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
- Cover, T. M., & Thomas, J. A. (2006). Elements of Information Theory (2.ª ed.). Wiley-Interscience.
- MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.