다섯 개의 원으로 구성된 벤다이어그램(Venn diagram)은 정보 전달보다 오히려 혼란을 가중시키는 경우가 많습니다. 영역이 너무 좁아져 라벨을 붙이기 어렵고, 독자가 각 영역의 크기를 직관적으로 비교하기도 불가능하며, 누락된 교집합을 놓치기 쉽기 때문입니다. UpSet plot은 이처럼 서로 겹치는 복잡한 도형 대신, 명확한 교집합 매트릭스(intersection matrix)와 정렬된 막대그래프를 결합하여 데이터를 직관적으로 보여줍니다.
여러 유전자 목록, 코호트(cohort), 피처 세트, 생물 종, 대사 경로(pathway) 또는 실험 조건 간의 중복 관계를 분석해야 할 때는 SciDraw의 UpSet Plot Generator를 활용해 보세요. 구조화된 멤버십 테이블을 입력하면 시각화 결과가 생성되며, 이를 SciVis로 내보내어 세부적인 디자인을 완성할 수 있습니다.

UpSet plot 작성 시 자주 하는 실수
- 교집합 중복 계산: 막대가 배타적 교집합(exclusive intersections)을 나타내는지, 아니면 포괄적 중복(inclusive overlaps)을 나타내는지 명확히 정의해야 합니다.
- 일관되지 않은 식별자 사용:
Gene-1,gene1,Gene_1은 서로 다른 아이템으로 인식될 수 있습니다. - 세트 내 중복 데이터 방치: 멤버십은 기본적으로 이진(binary) 값이어야 합니다. 중복된 레코드로 인해 교집합 수치가 왜곡되지 않도록 주의하세요.
- 정렬 기준 미표기: 교집합 막대는 크기(size), 차수(degree) 또는 사전에 정의된 생물학적 우선순위에 따라 정렬할 수 있으며, 이 기준을 명시해야 합니다.
- 미미한 교집합의 과도한 표기: 너무 작은 교집합은 일정한 규칙에 따라 필터링하여 시각화하고, 전체 데이터는 별도로 보존하는 것이 좋습니다.
UpSet plot에 필요한 데이터 구조
SciDraw의 예제는 다음과 같은 가로로 넓은 이진 멤버십(binary-membership) 테이블 형식을 사용합니다.
| 열 이름 (Column) | 역할 | 예시 |
|---|---|---|
item | 고유 엔티티 식별자 | Gene_001 |





