一条平滑的密度曲线,在展现数据特征的同时,也可能带来误导。过度平滑会抹平本就存在的亚群结构,而平滑不足则会将随机抽样误差放大为一连串虚假的“波峰”。因此,绘制一张具有学术说服力的核密度图,不仅需要干净的原始观测数据,还需要仔细校验曲线形态在不同参数下的稳定性。
SciDraw 的核密度图生成器(Density Plot Maker)能够直接读取 CSV 或 Excel 表格,自动计算核密度估计(KDE),并将其无缝导入 SciVis 可视化编辑器中进行后期排版。我们提供了六种经典的示例数据集,涵盖单组、多组对比、偏态分布、双峰分布、直方图叠加以及山脊图(ridgeline)等多种常见科研场景。

核密度图的常见误区
- 将“密度”等同于“频数”: y 轴代表的是估计的概率密度,而非绝对频数。在标准状态下,曲线下方的总面积积分为一。
- 忽视带宽(Bandwidth)的影响: 带宽直接决定了曲线的平滑程度。带宽选择不当会人为改变图表中波峰的数量。
- 在不同尺度上对比分组: 对比多组数据时,必须确保数据转换方式(如对数转换)和物理单位完全一致。
- 样本量过小时强行拟合: 平滑的曲线容易给读者造成“样本量充足”的错觉。如果数据点稀疏,拟合曲线往往缺乏统计学支撑。
- 截断尾部数据: 盲目裁剪 x 轴的显示范围可能会掩盖极端值,而这些异常值在临床或工程实验中往往具有重要意义。
核密度图需要什么格式的数据?
请准备长格式(Long-format)表格,确保每行仅包含一个观测值:
| 列名 | 作用 | 示例数据 |
|---|---|---|
sample_id | 样本唯一标识符(可选) | Control_01 |
group | 分组变量(可选,用于多组对比) | Control |
value | 观测数值(必填) | 38.92 |
您可以参考我们的单组密度图 CSV 模板或多组对比 CSV 模板。请注意,数值单元格内不要混入单位符号,缺失值需使用统一的格式表示。





