코딩 없이 CSV나 Excel 데이터를 활용해 커널 밀도 함수 그래프를 시각화해 보세요. 그룹 및 수치 열 지정, 평활화(Smoothing) 대역폭 조절, 분포 비교 및 SciVis 편집 기능을 제공합니다.
매끄럽게 다듬어진 밀도 곡선(Density curve)은 데이터의 본질을 보여주기도 하지만, 때로는 중요한 정보를 가리기도 합니다. 평활화(Smoothing)가 과도하면 서로 다른 하위 집단의 특성이 하나로 뭉개지고, 반대로 평활화가 너무 약하면 단순한 샘플링 노이즈가 마치 실제 존재하는 여러 개의 피크(Peak)처럼 왜곡되어 나타납니다. 따라서 학술적으로 신뢰할 수 있는 밀도 함수 그래프를 그리려면 정제된 관측 데이터를 사용해야 할 뿐만 아니라, 시각화된 곡선의 형태가 대역폭 설정에 따라 왜곡되지 않고 안정적인지 직접 검증해야 합니다.
SciDraw의 밀도 함수 그래프 생성기(Density Plot Maker)를 사용하면 CSV나 Excel 테이블을 정밀한 커널 밀도 추정(Kernel Density Estimation, KDE) 곡선으로 변환하고, 이를 학술 시각화 도구인 SciVis로 내보내 자유롭게 편집할 수 있습니다. 단일 분포, 그룹별 비교, 왜도(Skewed)가 큰 분포, 이봉성(Bimodal) 분포, 히스토그램 중첩, 리지라인(Ridgeline) 스타일 등 다양한 연구 데이터 유형에 맞춘 예제 데이터셋들이 준비되어 있어 직관적인 시작이 가능합니다.
밀도 함수 그래프는 연속형 변수이면서 분포 형태를 안정적으로 추정할 수 있을 만큼 관측치 수가 충분할 때 가장 효과적입니다. 가능한 값의 종류가 몇 개 없는 이산형 빈도 데이터의 경우에는 히스토그램, 경험적 누적분포함수(ECDF), 또는 도트 플롯(Dot plot)을 사용하는 것이 학술적으로 더 정직한 표현입니다. 표본 크기가 작다면 원본 데이터 포인트를 곡선 위에 겹쳐 그리거나 비 swarm 플롯 생성기(Beeswarm Plot Maker)를 활용하는 것을 권장합니다.
밀도 함수 그래프 생성기(Density Plot Maker)를 실행한 뒤, 준비된 예제를 선택하거나 분석하고자 하는 CSV, TSV, TXT, XLSX, XLS 파일을 업로드합니다. Excel 파일의 경우 첫 번째 워크시트를 자동으로 불러옵니다. 분석할 측정값 열이 수치형으로 올바르게 인식되었는지, 그룹명에 오탈자로 인한 중복 그룹이 생기지 않았는지 확인합니다.
처음 생성된 곡선은 데이터 분포를 파악하기 위한 초기 추정치일 뿐, 실제 모집단의 분포를 완벽히 대변하는 절대적인 형태는 아닙니다. 대역폭 값을 기본 설정보다 조금 더 좁게 혹은 넓게 조정해 보면서 그래프 형태가 어떻게 변하는지 비교 검증해야 합니다. 핵심적인 분포 구조는 대역폭이 변하더라도 일관되게 유지되어야 하며, 특정 극단적인 대역폭 설정에서만 일시적으로 나타나는 미세한 피크를 바탕으로 결론을 도출해서는 안 됩니다.
여러 그룹의 곡선이 겹칠 때는 반투명한 채우기 색상을 적용하거나 명확히 구분되는 테두리 선을 사용합니다. 한 화면에 너무 많은 그룹을 시각화하면 가독성이 떨어지며, 흑백 인쇄 환경이나 색약이 있는 독자들을 고려하여 색상 차이에만 의존해 그룹을 구분하지 않도록 주의합니다.
그래프 생성이 완료되면 편집기에서 축 제목, 그룹 레이블, 색상 팔레트, 주석, 전체 레이아웃을 세부적으로 조정합니다. 곡선 하단에 러그 플롯(Rug plot)을 추가하거나 히스토그램을 배경에 중첩하면, 실제 관측값이 어디에 분포해 있는지 직관적으로 보여줄 수 있어 독자가 평활화로 인한 왜곡과 실제 데이터 분포를 구분하는 데 큰 도움이 됩니다.
로그 변환(Log transformation) 등의 데이터 전처리를 수행한 경우 이를 피겨 설명에 명시해야 하며, 이상치나 부적절한 측정값은 그래프 편집기에서 임의로 삭제하는 대신 재현 가능한 데이터 정제(Data cleaning) 단계를 거쳐 공식적으로 제외해야 연구의 신뢰성을 지킬 수 있습니다.
x축은 측정된 데이터의 수치적 값을 나타내며, 특정 값에서 곡선의 높이가 높을수록 해당 구간 주변에 관측치가 상대적으로 조밀하게 집중되어 있음을 의미합니다. 여러 그룹을 비교할 때는 중심 위치(평균/중앙값), 퍼진 정도(분산), 비대칭성(왜도), 그리고 꼬리 부분의 형태를 종합적으로 비교합니다. 밀도 곡선은 각 그룹별로 정규화(Normalized)되어 표현되므로, 두 곡선의 최고점 높이가 같다고 해서 두 그룹의 실제 샘플 수까지 동일하다는 것을 의미하지는 않습니다.
특정 x값 구간 사이의 면적은 밀도 함수가 올바르게 정규화되고 모델 가정에 부합할 때에만 해당 구간에 속할 확률(추정 비율)로 해석할 수 있습니다.
프로그램이 자동으로 제안하는 초기 대역폭 값을 기준으로 시작하되, 값을 조금씩 넓히거나 좁혀보면서 데이터의 노이즈에 휘둘리지 않고 실제 물리적·생물학적 의미를 갖는 안정적인 분포 구조가 유지되는 최적의 설정을 선택합니다. 분포의 세부 형태가 논문의 핵심 주장과 직결되는 경우, 사용한 대역폭 설정 및 추정 방법론을 논문에 명시하는 것이 좋습니다.
네, 정규화된 밀도 곡선은 샘플 크기의 차이와 무관하게 순수한 분포의 형태(Shape)를 비교할 수 있도록 돕습니다. 다만 이 과정에서 실제 샘플 수의 차이가 은폐될 수 있으므로, 텍스트나 피겨 설명에 각 그룹의 샘플 수(n)를 명시하거나 그래프 하단에 원본 데이터 포인트를 함께 표시해 주는 것이 학술적으로 바람직합니다.
Davie Chen is a researcher at the Faculty of Animation and Intermedia, University of Arts in Poznan, studying generative AI for scientific figure creation, patent illustration, and manuscript drafting. SciDraw AI is one of the research-to-product tools built from this work.