MCM520 ← 资料站首页 客户分群(泰迪杯 2019 E) 打开交互阅读器 →

客户分群(泰迪杯 2019 E)

历年真题解法库 · 本题为公开赛题要点整理,完整原题请到官方渠道获取(链接见下);
下方「练习数据」为本站生成的合成数据集,仅用于跑通方法,非官方原题数据。

一、赛题要点

  • 赛事:泰迪杯 2019 年 · 题号 E
  • 问题实质:基于消费行为数据,要求做客户分群与价值排序。

二、需要产出什么

建立客户特征矩阵;做聚类分群与价值评价。

三、数据说明(官方来源 + 练习数据集)

  • 官方数据/赛题:官方给出客户属性与交易;需做特征工程。
  • 官方获取渠道:http://www.tipdm.org(请以当年官网发布为准)
  • 本站练习数据集:data/tidy2019a.csv —— 按本题结构生成的合成数据(features 型),可下载后用上面的算法手册直接练手。
  • 字段说明:CSV 表头即各变量名;数值为合理量级的随机样本,仅用于方法验证,不代表真实赛题数据。

四、可用解法 → 对应手册

下面按本题涉及的题型,给出对应的「方法选型指南」与可直接套用的算法手册跳转。

题型:分类 / 聚类类

先看选型 👉 🧭 分类聚类选型指南

可套用算法手册:

题型:评价 / 决策类

先看选型 👉 🧭 评价类选型指南

可套用算法手册:

参考手册速查

📘 K-Means 聚类 · 📘 层次聚类 · 📘 模糊 C 均值 · 📘 决策树 · 📘 支持向量机 · 📘 贝叶斯分类 · 📘 逻辑回归 · 📘 层次分析法 AHP · 📘 TOPSIS · 📘 熵权法 · 📘 模糊综合评价 · 📘 灰色关联分析 · 📘 VIKOR · 📘 CRITIC 法 · 📘 PCA 综合评价

五、建模思路提示

  • 先构造 RFM 类特征
  • 用 K-Means/层次聚类分群
  • 价值用综合评价排序

六、常见坑与规避

  • 不要把赛题要点当原题照搬,先独立重述问题再建模。
  • 拿到数据先检查量纲、缺失与异常,再决定用预测/评价/优化哪类方法。
  • 方法选型别凭感觉:先看「方法选型决策指南」对应题型那本,再进具体算法手册。
  • 合成练习数据只验证逻辑,正式参赛务必用官方数据并做敏感性/误差分析。

七、三篇手写优秀范文

范文 内容 配图 附录
范文一·数据探索·特征标准化与 K-Means 从零 z-score 标准化、手搓 k-means++ 与 Lloyd、肘部法/轮廓系数/DBI 定 k=3、质心画像 手写 · 8 图 · 1 附录
范文二·方法对比·簇画像与 RFM 价值排序 K-Means vs 层次(single/complete) vs DBSCAN 对照、RFM 价值评分与客群/个体排名 手写 · 8 图 · 1 附录
范文三·业务画像·经营策略与稳健性 分群经营策略映射、随机种子/离群/k 三类稳健性检验、综合特征雷达 手写 · 8 图 · 1 附录

八、配套资源

九、权威数字速览(确定性真源,SEED=2019)

  • 数据:n=200,p=6(f1 近度R / f2 频次F / f3 金额M / f4 客单价A / f5 品类广度B / f6 价格弹性E),标准化后各特征均值≈0、标准差≈1;f1 与 f3 相关 0.624、与 f6 相关 −0.502
  • K-Means 定 k:Inertia k=2..5 为 745.8 / 413.54 / 384.7 / 368.84,肘点与轮廓系数峰值、DBI 谷值一致指向 k=3
  • 最优分群:轮廓系数 0.4412、DBI 0.8717、纯度 0.995、ARI 0.9841;质心间隙 3.154;三簇规模 58 / 73 / 69(占比 29.0% / 36.5% / 34.5%)
  • 三客群画像:簇0 高价值忠诚型(value 90.45, 贡献 43.7%) / 簇1 大额低频型(53.04, 32.3%) / 簇2 价格敏感低值型(41.77, 24.0%)
  • 方法对照:层次(complete) sil 0.4406、DBI 0.8701、纯度 0.985;层次(single) 退化为 198/1/1(sil −0.0642);DBSCAN(eps=1.381) 仅 2 簇、纯度 0.7062
  • 价值排序:Top10 价值客户全部来自簇0;Top20% 客户贡献 31.5% 价值(轻度帕累托)
  • 稳健性:随机种子扰动命中率 7/8(种子 2026 跌至 sil 0.2262,暴露初值敏感);剔除最远 020 个样本后 sil 仍稳于 0.4360.441