Como Criar um Gráfico de Densidade a partir de Dados em CSV ou Excel
Crie um gráfico de estimativa de densidade por kernel a partir de dados em CSV ou Excel sem precisar programar. Prepare as colunas de grupos e valores, ajuste a suavização, compare distribuições e edite no SciVis.
Uma curva de densidade excessivamente suavizada pode ocultar tantos detalhes quanto revelar. Uma suavização exagerada tende a mesclar subpopulações distintas; por outro lado, uma suavização insuficiente transforma o ruído de amostragem em uma sucessão de picos artificiais. Portanto, para construir um gráfico de densidade metodologicamente defensável, é indispensável contar com observações limpas e realizar uma verificação explícita de que a forma visualizada é estatisticamente estável.
O Density Plot Maker do SciDraw converte tabelas em formato CSV ou Excel em uma estimativa de densidade por kernel (KDE) e, em seguida, abre o resultado diretamente no SciVis para edição. O sistema disponibiliza seis conjuntos de dados de exemplo que cobrem distribuições de densidade única, comparação de grupos, dados assimétricos, bimodais, sobreposição de histograma e o estilo ridgeline.
Milhares de pesquisadores usam o SciDraw AI para criar em minutos figuras prontas para publicação em artigos, projetos e submissões a periódicos — sem experiência em design.
Tratar densidade como contagem absoluta: o eixo y representa a estimativa da densidade de probabilidade; a área total sob a curva normalmente integra um.
Ignorar a largura de banda (bandwidth): a largura de banda controla o nível de suavização da curva e pode alterar drasticamente o número aparente de modas (picos) na distribuição.
Comparar grupos em escalas distintas: as transformações matemáticas e as unidades de medida devem ser rigorosamente idênticas entre os grupos.
Utilizar amostras muito pequenas (dados esparsos): uma curva contínua e suave pode sugerir falsamente um volume de evidências maior do que a amostra realmente possui.
Cortar as caudas da distribuição: truncar os limites do eixo x pode ocultar observações extremas ou clinicamente relevantes para o estudo.
Organize seus dados em formato longo (long format), contendo uma única observação por linha:
Coluna
Função
Exemplo
sample_id
Identificador único da observação
Control_01
group
Grupo de comparação (opcional)
Control
value
Medida numérica contínua
38.92
Para entender a estrutura na prática, inspecione o CSV de densidade única ou o CSV de comparação de grupos. Certifique-se de manter as unidades de medida fora das células numéricas e padronize a representação de dados omissos (missing values).
Os gráficos de densidade são ideais para variáveis contínuas com um volume de observações suficiente para sustentar uma estimativa probabilística confiável. Para contagens discretas com poucos valores possíveis, um histograma, uma curva de distribuição empírica acumulada (ECDF) ou um gráfico de pontos (dot plot) costuma ser mais fidedigno. Se a amostra for pequena, sobreponha os pontos individuais dos dados brutos ou utilize o Beeswarm Plot Maker.
Acesse o Density Plot Maker, selecione um dos modelos de exemplo ou envie seu próprio arquivo nos formatos CSV, TSV, TXT, XLSX ou XLS. No caso de arquivos do Excel, a ferramenta importará a primeira planilha ativa. Certifique-se de que a coluna de medição esteja formatada como numérica e que os nomes dos grupos não contenham variações acidentais de grafia.
A curva gerada inicialmente serve como uma estimativa preliminar útil, mas não deve ser interpretada como a verdade absoluta da distribuição populacional. Compare o gráfico obtido aplicando larguras de banda ligeiramente menores e maiores. As estruturas principais da distribuição devem permanecer interpretáveis; picos que surgem apenas sob configurações extremas de suavização geralmente são ruídos e não devem fundamentar suas conclusões científicas.
Ao trabalhar com curvas sobrepostas, utilize preenchimentos com transparência (canal alfa) ou contornos bem definidos. Evite incluir mais grupos do que a legibilidade do gráfico permite e não dependa exclusivamente de cores para diferenciar os dados, garantindo a acessibilidade para leitores com daltonismo ou para impressões em tons de cinza.
Prossiga para o editor para ajustar os títulos dos eixos, rótulos dos grupos, paletas de cores, anotações e o layout de exportação. Adicionar marcações marginais (rug plot) ou sobrepor a curva a um histograma ajuda a demonstrar onde as observações reais estão concentradas, permitindo que o leitor diferencie um pico real de um mero artefato matemático de suavização.
Documente eventuais transformações logarítmicas e trate dados espúrios ou inválidos em uma etapa prévia de limpeza de dados que seja reprodutível, em vez de simplesmente ocultar pontos inconvenientes de forma manual dentro do editor gráfico.
O eixo x indica o valor medido da variável, enquanto a altura da curva (eixo y) representa a concentração relativa de observações em torno daquele valor. Compare a posição central, a dispersão, a assimetria e o comportamento das caudas entre os diferentes grupos. Como as curvas de densidade são normalizadas, duas curvas com alturas máximas idênticas não significam que os grupos possuam o mesmo tamanho amostral.
A área sob a curva entre dois pontos do eixo x representa a proporção estimada de observações apenas quando a densidade foi devidamente normalizada e os pressupostos do modelo estatístico são válidos.
Utilize o Histogram Maker quando a contagem absoluta de observações por intervalo (bin) for crucial para a análise.
Utilize o ECDF Plot Generator para visualizar a distribuição acumulada real sem a necessidade de arbitrar uma largura de banda de suavização.
Utilize o Violin Plot Maker para comparar distribuições de múltiplos grupos lado a lado de forma compacta.
Utilize o gráfico de densidade quando o objetivo principal for destacar a forma contínua da distribuição e comparar grupos por meio de sobreposição direta.
Ele indica a estimativa da densidade de probabilidade, e não a contagem direta de amostras. Os valores de densidade no eixo y podem ultrapassar um quando o intervalo do eixo x é muito estreito; o parâmetro fundamental é a área total sob a curva normalizada, que é igual a um.
Inicie com o algoritmo de seleção automática da ferramenta, explore valores ligeiramente maiores e menores e defina um parâmetro que revele a estrutura estável dos dados sem incorporar ruídos amostrais. Descreva o método de suavização adotado caso a forma da distribuição seja um argumento central do seu artigo.
Sim. As curvas normalizadas permitem comparar a forma e o comportamento das distribuições, mas ocultam a diferença no tamanho das amostras. Recomenda-se reportar o tamanho amostral ($n$) de cada grupo no texto ou plotar os pontos de dados brutos para fornecer esse contexto.
Comece agora mesmo utilizando o Density Plot Maker, valide a curva gerada em relação aos dados reais e consulte o nosso guia de visualização de dados científicos para selecionar outras representações caso a suavização por kernel não seja a abordagem mais indicada para o seu estudo.
Davie Chen is a researcher at the Faculty of Animation and Intermedia, University of Arts in Poznan, studying generative AI for scientific figure creation, patent illustration, and manuscript drafting. SciDraw AI is one of the research-to-product tools built from this work.