t-SNE、PCA、UMAP 与 PaCMAP 怎样阅读和选择降维图

PCA、t-SNE、UMAP 和 PaCMAP 都能把高维样本变成二维或三维坐标,但它们保护的结构不同。降维图适合观察表示、发现疑点和形成待验证假设,模型性能仍需由独立测试集上的指标判断。

t-SNE 更像观察高维表示的显微镜。模型表现需要另外看成绩单。

从一张 GCN 隐藏表示图开始

图卷积网络会为每个节点学习一个隐藏向量。假设第 个节点的表示为

人无法直接查看十六维空间。降维方法接收全部节点组成的矩阵 ,为每个节点生成二维坐标 。研究者随后按论文类别给散点着色。

Kipf 与 Welling 的 GCN 论文在 Figure 1 中采用了这种做法。(Kipf & Welling, 2017) 同类节点在 t-SNE 图上形成局部聚集,可以支持一个有限判断。GCN 隐藏表示中存在类别相关的局部邻域。

这张图没有直接检验下面这些结论。

  • 分类准确率是否很高
  • 模型能否泛化到未见节点、未见图或分布变化
  • 二维图中的每个簇是否对应高维空间中的真实簇
  • 两个簇在图上相距很远时,它们在原空间是否同样遥远
  • 换一个随机种子或邻域参数后,图形是否保持稳定

降维算法重新安排了坐标。颜色通常只在投影完成后添加,用来检查投影与已知类别的对应关系。若使用标签参与监督式降维,则必须另外说明,图中的类别分离也不能再被当作独立发现。

四种方法各自保护什么

PCA 先寻找方差最大的线性方向

主成分分析把中心化后的数据投影到一组彼此正交的方向。第一主成分可以写成

表示中心化后的第 个样本, 是单位方向。这个目标寻找投影后方差最大的方向。

考虑四个二维点 。它们都落在对角线上。PCA 会选出 ,把二维点压成一个坐标,同时保留这组数据的全部变化。这个例子接近 PCA 的理想情况,数据的主要变化确实位于一条直线上。

PCA 适合作为快速、稳定的线性基线,也常用于先压缩特别高维且含噪的数据。Pearson 提出了最接近直线和平面的拟合问题,Hotelling 随后系统发展了主成分表述。(Hotelling, 1933; Pearson, 1901) 现代实现可参考 scikit-learn PCA

载荷把主成分轴翻译回原始变量

PCA 图上的每个点代表一个样本,但解释坐标轴时需要回到原始变量。设第 条主成分轴的单位方向为

个样本在这条轴上的坐标称为主成分得分

是样本 的第 个中心化或标准化变量, 是变量 构成主成分 时的系数。系数绝对值越大,主成分轴越朝向该变量;正负号表示变量沿这条轴变化的相对方向。

“载荷”在不同教材和软件中有两种常见约定,阅读结果时必须先确认采用了哪一种。

名称数学对象回答的问题
主成分方向或权重特征向量系数 条轴怎样由原始变量线性组合而成
相关载荷标准化数据中 原始变量 与主成分得分 的相关程度
主成分得分每个样本的 样本 在第 条轴上的位置

在机器学习和奇异值分解的语境中,特征向量系数 经常直接被称为 loading。较严格的多元统计表述则把载荷写成变量与主成分的相关系数。若输入变量已经标准化,主成分 的方差就是特征值 ,两种量通过 相连。NIST 的 PCA 说明 称为用于解释变量与主成分关系的 factor structure;scikit-learn 的 components_ 则返回主成分方向,也就是中心化数据的右奇异向量。

假设三个标准化变量得到下面这条示意性的主成分。

较高的 得分可以解读为建筑密度和 POI 密度较高、绿地率相对较低的综合方向。它不能证明这些变量具有因果作用,也不能把 直接解释为“67% 的重要性”。主成分轴的整体符号还可以同时翻转, 表示同一条轴,因此应比较同一主成分内部的相对大小和符号组合,而不要赋予正负方向固定的自然含义。

特征缩放同样影响解释。若建筑面积使用平方米、比例使用百分数且未标准化,方差较大的量纲可能主导主成分。需要跨变量比较载荷时,应先说明 PCA 基于协方差矩阵还是相关矩阵,以及输入是否经过标准化。

弯曲结构重叠属于线性投影的边界

设保留的 条主成分组成正交矩阵 ,低维坐标为

正交投影满足

它不会把两个样本的欧氏距离放大,却可能把不同点对的距离压缩到完全不同的程度。若两个样本的差异主要位于被丢弃的方向,它们在低维图中就会靠近甚至重合。

PCA 优化的是所有样本保留下来的总方差,等价地也可理解为最小化线性低秩重构的总体平方误差。这个目标没有承诺保住每一对样本的距离、局部邻域或流形上的路径距离。对于卷曲的“瑞士卷”结构,一张线性平面不能把各层展开,不同卷层可能投影到相近位置。

因此,这类重叠属于 PCA 在面对非线性几何时的预期边界,并非实现故障。数据若接近线性子空间,这种约束能够带来稳定和可解释性;问题若关心弯曲流形上的邻域,则应加入 t-SNE、UMAP 或 PaCMAP 作为补充,同时继续检查这些非线性方法自身的失真。

t-SNE 匹配局部邻域概率

t-SNE 先把高维空间中的邻近关系写成概率 ,再把低维空间中的邻近关系写成概率 。它通过最小化

来调整二维坐标。若一对高维近邻有 ,投影后却只有 ,这一项产生约 的损失。算法会强烈推动这对点在图上靠近。低维相似度采用重尾 Student 分布,从而缓解大量点拥挤在中心的现象。

这个不对称目标更重视保住高维近邻。簇的面积、密度和簇间距离可能明显失真。perplexity 决定高维邻域的有效尺度,初始化、学习率和随机种子也会改变布局。t-SNE 原始论文给出方法,2022 年的理论研究进一步分析了它在聚类数据和 early exaggeration 阶段的行为。(Cai & Ma, 2022; van der Maaten & Hinton, 2008)

原始 t-SNE 的计算和内存开销随样本量平方增长。Barnes-Hut t-SNE 用树近似把梯度计算降到约 (van der Maaten, 2014) 这项改进解释了 t-SNE 为什么能够长期留在常用工具箱中。它既有清楚的局部观察目标,也有成熟实现和较大规模近似。

UMAP 从邻域图构造低维布局

UMAP 先根据距离和近邻关系构造带权邻域图,再优化低维布局,使图中的局部连接关系尽量得到保留。它的理论表述使用模糊拓扑结构,实际结果仍受到距离度量、近邻搜索、初始化和优化过程影响。UMAP 论文将其定位为流形学习与降维方法。(McInnes et al., 2018)

两个参数尤其影响读图方式。n_neighbors 较小时,布局强调更小范围的邻居。取值增大后,算法会参考更宽的邻域。min_dist 控制低维点能够聚得多紧。较小取值通常产生更紧凑的团块。UMAP 官方参数说明展示了这些参数如何改变同一数据的图形。

UMAP 经常给出比 t-SNE 更连贯的宏观布局,但这种经验不能升级为全局距离保真保证。参数、度量和数据几何仍可能改变簇间位置。

PaCMAP 显式控制三类点对

PaCMAP 同时采样近邻点对、中近点对和远点对,并在优化的不同阶段调整三类关系的权重。近邻点对负责局部结构,远点对帮助展开整体布局,中近点对用于连接两个尺度。

PaCMAP 论文通过一组实验分析 t-SNE、UMAP、TriMap 与 PaCMAP 的局部和全局权衡。论文作者报告 PaCMAP 在其测试中能够兼顾两类结构。(Wang et al., 2021) 这是方法提出者在特定数据与评价设计下得到的证据,不能推出 PaCMAP 会在任意数据上胜出。

把选择问题放在同一张表里

方法主要保留目标最适合先回答的问题读图时最需警惕的地方
PCA大方差线性方向数据的主要线性变化是什么非线性邻域可能被压扁或重叠
t-SNE局部相似概率哪些样本在表示空间中互为近邻簇面积和簇间距离缺少直接原空间含义
UMAP多尺度邻域图局部群组怎样连接成较宽的布局n_neighborsmin_dist 和距离度量会改变图形
PaCMAP近邻、中近与远点对局部群组与整体位置能否同时获得较清楚的呈现方法作者的比较结果不能代替目标数据上的验证

没有一种方法在所有数据和问题上占优。下面的条件可以缩小选择范围。

  • 需要一个可解释的线性基线,先用 PCA。
  • 主要检查 embedding 的局部近邻,t-SNE 仍然合适。
  • 希望从邻域尺度和点团紧密程度调节布局,可以使用 UMAP。
  • 研究问题同时关注局部聚集和较宽的相对布局,可以把 PaCMAP 加入比较。
  • 结论依赖图形外观时,应固定同一批样本,并至少比较 PCA 与两种非线性方法。

降维图在模型评价中的位置

降维可视化位于表示分析支路。

样本或节点
→ 高维特征或隐藏表示
→ 预处理与距离定义
→ PCA、t-SNE、UMAP 或 PaCMAP
→ 二维散点图
→ 关于邻域和布局的探索性判断

模型评价走另一条支路。

训练集与独立测试集
→ 模型预测
→ 准确率、F1、校准或任务指标
→ 关于性能与泛化的判断

第一条支路回答模型学到了怎样的表示结构。第二条支路回答模型能否完成任务。两者可以互相解释,证据不能相互替代。

降维的存在意义在于给高维数据提供可观察界面。没有二维投影时,研究者仍可检查最近邻、距离分布、线性探针和任务指标,但很难一次看见大量样本之间的局部组织。若研究问题只关心预测性能,降维图属于可选分析。若研究问题涉及表示结构、异常点或类别混合,它会成为有用的探索工具,定量验证仍然不可省略。

怎样做一张经得住追问的图

  1. 先说明每个点代表什么,输入是原始特征、隐藏表示还是距离矩阵。
  2. 记录样本筛选、缺失值处理、标准化和可能的 PCA 预降维。
  3. 根据数据含义选择距离度量。不同量纲未经处理会改变邻域。
  4. 固定样本、标签颜色和绘图尺度,再比较不同方法。
  5. 报告实现与关键参数。PCA 报告方差解释率。t-SNE 报告 perplexity、初始化和学习率。UMAP 报告 n_neighborsmin_dist 与 metric。PaCMAP 报告邻居数、点对比例和初始化。
  6. 为非线性方法记录随机种子,并运行多个种子。稳定结论应在合理设置下重复出现。
  7. 若声称局部结构得到保留,在原空间检查最近邻保持情况。若声称全局结构得到保留,另行比较原空间距离、层级或已知连续变量。
  8. 将模型性能放在独立表格中。降维图只承担它真正检查过的表示问题。

scikit-learn 的 t-SNE 文档明确指出该目标非凸,不同初始化可能产生不同结果。高维输入先经过 PCA 或 TruncatedSVD 也常用于抑制噪声并降低距离计算成本。预处理必须写进方法说明,因为它参与定义最终看到的邻域。

常见图形怎样谨慎解释

图中现象可以提出的初步判断还需要什么证据
同色点局部聚集表示中的局部邻居与类别存在对应多随机种子、邻域保持度和独立分类指标
不同颜色大量混合当前投影没有呈现清楚的类别局部结构原空间近邻、其他参数和其他投影方法
两个簇相距很远当前二维优化把它们放得很远原空间距离或明确的全局结构指标
一个簇面积更大当前图中该点团占据更大区域原空间方差、密度和尺度分析
少量孤立点它们在当前设置下远离多数点数据质量、原空间近邻和异常检测结果

“图上出现了簇”和“数据中存在真实簇”是两个判断。投影可以生成清楚边界,也可以把原有连续结构切成若干团块。确认簇结构需要回到原空间、采样过程和独立的聚类稳定性分析。四种方法的 JMLR 比较研究也将误导性结构列为降维可视化的核心风险。

一条有用的发展线

时间方法发展改变了什么
1901Pearson 研究点集的最佳拟合直线和平面建立线性低维逼近的几何问题
1933Hotelling 系统发展 principal components把方差方向组织为统计方法
2008van der Maaten 与 Hinton 提出 t-SNE用概率邻域和重尾低维分布改善局部可视化
2014Barnes-Hut t-SNE用树近似降低大样本梯度计算成本
2018McInnes 等发布 UMAP用邻域图和拓扑表述组织可扩展的非线性降维
2021Wang 等提出 PaCMAP用三类点对和分阶段权重显式处理局部与全局权衡

截至 2026 年 9 月,这四种方法都仍有明确位置。PCA 提供线性基线和可解释方向。t-SNE 服务局部表示观察。UMAP 与 PaCMAP 提供不同的邻域组织和尺度权衡。方法数量增加没有消除二维投影的失真,也没有产生一个对所有数据都可靠的默认赢家。

附录中的几个术语

Embedding 指每个对象对应的高维数值向量。图节点、图像、词元或城市单元都可以有自己的 embedding。

投影 指把高维向量映射到较低维坐标。二维点的位置由算法目标决定,通常不能按原坐标逐轴解释。

局部邻域 指一个样本附近的若干相似样本。它依赖距离度量、特征缩放和邻居数量。

流形假设 指高维观测可能集中在维度更低的结构附近。UMAP 等方法利用这一假设组织邻域,但有限样本无法保证真实数据严格位于某个流形上。

降维方法输出用于观察的低维坐标。若问题转为估计每个样本附近的切空间、局部维度和内在梯度,可继续阅读 Riemannian Metric Matching 如何用去噪学习数据的局部几何

Perplexity 是 t-SNE 高维邻域的有效尺度。它可以近似理解为每个点重点关注多少邻居,但不等于固定的最近邻数量。

重尾分布 给较大距离保留相对更多概率质量。t-SNE 在低维空间使用 Student 分布,使不相似点更容易拉开。

随机种子 固定伪随机过程的起点。它有助于复现实验,却不能证明单次布局具有稳定性。

参考资料与证据边界

本文的算法机制与历史来自 PCA、t-SNE、UMAP 和 PaCMAP 的原始或正式发表论文。正文中的作者年份引用由站点根据 bibliography.bib 自动生成,完整论文条目见页面末尾的 References。参数行为参考以下官方文档,核验日期为 2026 年 9 月 9 日。

官方文档

PaCMAP 的局部与全局平衡结论主要来自方法提出者的 JMLR 论文。本文没有在统一数据、实现、计算预算和评价指标下重新运行四种方法,因此不给出总体性能排名。GCN 示例只说明怎样解释隐藏表示图,不评价该模型在其他数据或任务上的表现。

Cai, T. T., & Ma, R. (2022). Theoretical Foundations of t-SNE for Visualizing High-Dimensional Clustered Data. Journal of Machine Learning Research, 23(301), 1–54. https://www.jmlr.org/papers/v23/21-0524.html
Hotelling, H. (1933). Analysis of a Complex of Statistical Variables into Principal Components. Journal of Educational Psychology, 24(7), 498–520. https://doi.org/10.1037/h0070888
Kipf, T. N., & Welling, M. (2017). Semi-Supervised Classification with Graph Convolutional Networks. International Conference on Learning Representations. https://openreview.net/forum?id=SJU4ayYgl
McInnes, L., Healy, J., Saul, N., & Großberger, L. (2018). UMAP: Uniform Manifold Approximation and Projection. Journal of Open Source Software, 3(29), 861. https://doi.org/10.21105/joss.00861
Pearson, K. (1901). On Lines and Planes of Closest Fit to Systems of Points in Space. The London, Edinburgh, and Dublin Philosophical Magazine and Journal of Science, 2(11), 559–572. https://doi.org/10.1080/14786440109462720
van der Maaten, L. (2014). Accelerating t-SNE Using Tree-Based Algorithms. Journal of Machine Learning Research, 15(93), 3221–3245. https://www.jmlr.org/papers/v15/vandermaaten14a.html
van der Maaten, L., & Hinton, G. (2008). Visualizing Data Using t-SNE. Journal of Machine Learning Research, 9(86), 2579–2605. https://www.jmlr.org/papers/v9/vandermaaten08a.html
Wang, Y., Huang, H., Rudin, C., & Shaposhnik, Y. (2021). Understanding How Dimension Reduction Tools Work: An Empirical Approach to Deciphering t-SNE, UMAP, TriMap, and PaCMAP for Data Visualization. Journal of Machine Learning Research, 22(201), 1–73. https://www.jmlr.org/papers/v22/20-1061.html