MCM520 ← 资料站首页 方法选型决策指南:分类与聚类怎么选(深度版) 打开交互阅读器 →

方法选型决策指南:分类与聚类怎么选(深度版)

面对『归到哪类』,先问有没有标签:有标签用分类(监督),无标签用聚类(无监督)。

分类:⚙ 优化类 适用:客户分群、风险分级、模式识别、异常检测、样本无标签的结构发现

一、这个指南适合谁(适用场景)

  • 客户分群、风险分级
  • 模式识别、异常检测
  • 样本无标签的结构发现

二、选型决策要素

  1. 有标签吗?→ 分类 / 聚类
  2. 样本量、维度
  3. 类别是否重叠
  4. 要解释还是只要准
  5. 匹配算法→评估指标

三、选型的底层逻辑

分类与聚类的根本区别在于信息来源。分类(监督)利用标签提供的"已知答案",学习从特征到类别的判别边界,能用测试集客观评估;聚类(无监督)没有任何标签,只能从数据自身的"内聚性"中发现结构,评估因此主观(靠业务可解释性)。选方法的逻辑是:先看信息可得性(有标签→分类,无标签→聚类),再看数据形态——球形等密簇用 K-Means,任意形状/含噪声用 DBSCAN,高维稀疏要降维后再聚。建模赛事中可解释性常是硬约束,这往往否决纯黑箱(如深度网络),偏向决策树/逻辑回归这类能给出"为什么这么分"的模型。

四、决策模型与推导

贝叶斯错误率下界:两类条件分布 p(x∣ω1),p(x∣ω2)p(x\mid\omega_1),p(x\mid\omega_2) 重叠越大,任何分类器的理论极限错误率越高:

e∗≥∫min⁡(p(x∣ω1)P1, p(x∣ω2)P2) dx e^*\ge \int\min\bigl(p(x\mid\omega_1)P_1,\,p(x\mid\omega_2)P_2\bigr)\,dx

若 e∗e^* 已很高(类分布严重重叠),换更复杂的分类器收益极低——此时应先做特征工程拉开类间距离,而非纠结选哪个算法。这是"选方法前先评估可分性"的理论依据。

K-Means 目标:最小化簇内平方和

WCSS=∑k=1K∑x∈Ck∥x−μk∥2,μk=1∣Ck∣∑x∈Ckx \text{WCSS}=\sum_{k=1}^K\sum_{x\in C_k}\|x-\mu_k\|^2,\qquad \mu_k=\frac1{|C_k|}\sum_{x\in C_k}x

它对各向同性球形簇有效;若簇 elongated/密度不均,WCSS 最小化会把非球形簇切坏。

轮廓系数定 K:样本 ii 的轮廓

s(i)=b(i)−a(i)max⁡{a(i),b(i)}∈[−1,1] s(i)=\frac{b(i)-a(i)}{\max\{a(i),b(i)\}}\in[-1,1]

aa 为到同簇平均距离,bb 为到最近异簇平均距离。平均 ss 最大处对应的 KK 最合理——这就是"肘部/轮廓法定 K"的数学内核。

标准化必要性:距离度量前做 zj=(xj−μj)/σjz_j=(x_j-\mu_j)/\sigma_j,否则量纲大的特征在 ∥x−μ∥2\|x-\mu\|^2 中占主导,聚类被单维绑架。

五、选型流程(怎么选)

  1. 有标签、要预测新样本类别 → 分类:逻辑回归/SVM/决策树/随机森林。
  2. 无标签、要发现结构 → 聚类:K-Means/层次/DBSCAN。
  3. 类别数未知 → 用轮廓系数/肘部法定 K。
  4. 要可解释 → 决策树/逻辑回归;要精度 → 集成/XGBoost。
  5. 分类看准确率/F1,聚类看轮廓系数/业务可解释性。

六、问题 → 方法 映射

  • K-Means:球形簇、需指定 K;对量纲敏感,先标准化。
  • DBSCAN:任意形状、自动定簇数、抗噪;密度不均时小心。
  • 随机森林:分类精度高、可解释特征重要度。

七、常见误选与对策

  • 不标准化直接 K-Means → 量纲大的特征主导。
  • 硬定 K 不看轮廓系数 → 簇数不合理。
  • 聚类当分类用 → 概念混淆。
  • 只报准确率不看混淆矩阵 → 类别不平衡被掩盖。

八、选型自检清单

  • 已区分有/无标签
  • 数据已标准化(如需)
  • K 由指标确定(聚类)
  • 评估指标匹配任务
  • 结果业务可解释

九、配套资源与搭配

  • 算法速成手册(聚类分类)
  • Python 数据可视化模板
  • 建模避坑指南(建模雷区)

本指南由 MCM520 资料站自动生成(深度版),配套算法速成手册可在资源页下载。

10、实战案例

案例:分类问题选题

常见类型:信用评分、疾病诊断、图像识别
推荐模型:逻辑回归、SVM、随机森林


实战案例

分类与聚类选型实战

场景:拿到带标签数据做分类,或无标签数据做聚类,方法不同。
任务:根据有无标签与数据规模选算法。

完整代码(text)

决策树:
有标签?
 ├─ 是(分类)→ 数据量小? 逻辑回归/SVM
 │            → 数据量大? 随机森林/XGBoost
 │            → 需可解释? 决策树/朴素贝叶斯
 └─ 否(聚类)→ 形状规则? K-Means
              → 形状复杂? DBSCAN/层次
              → 概率分布? GMM

快速验证:先跑逻辑回归基线,再上复杂模型看提升。

运行效果

选型案例:

  • 信用评分(有标签, 需可解释)→ 逻辑回归
  • 图像分类(大数据)→ CNN/XGBoost
  • 客户分群(无标签)→ K-Means+肘部法选K
    错误选型:小数据硬上深度学习→过拟合欠泛化。