客户分群(泰迪杯 2019 E)
历年真题解法库 · 本题为公开赛题要点整理,完整原题请到官方渠道获取(链接见下);
下方「练习数据」为本站生成的合成数据集,仅用于跑通方法,非官方原题数据。
一、赛题要点
- 赛事:泰迪杯 2019 年 · 题号 E
- 问题实质:基于消费行为数据,要求做客户分群与价值排序。
二、需要产出什么
建立客户特征矩阵;做聚类分群与价值评价。
三、数据说明(官方来源 + 练习数据集)
- 官方数据/赛题:官方给出客户属性与交易;需做特征工程。
- 官方获取渠道:http://www.tipdm.org(请以当年官网发布为准)
- 本站练习数据集:
data/tidy2019a.csv—— 按本题结构生成的合成数据(features 型),可下载后用上面的算法手册直接练手。 - 字段说明:CSV 表头即各变量名;数值为合理量级的随机样本,仅用于方法验证,不代表真实赛题数据。
四、可用解法 → 对应手册
下面按本题涉及的题型,给出对应的「方法选型指南」与可直接套用的算法手册跳转。
题型:分类 / 聚类类
先看选型 👉 🧭 分类聚类选型指南
可套用算法手册:
题型:评价 / 决策类
先看选型 👉 🧭 评价类选型指南
可套用算法手册:
参考手册速查
📘 K-Means 聚类 · 📘 层次聚类 · 📘 模糊 C 均值 · 📘 决策树 · 📘 支持向量机 · 📘 贝叶斯分类 · 📘 逻辑回归 · 📘 层次分析法 AHP · 📘 TOPSIS · 📘 熵权法 · 📘 模糊综合评价 · 📘 灰色关联分析 · 📘 VIKOR · 📘 CRITIC 法 · 📘 PCA 综合评价
五、建模思路提示
- 先构造 RFM 类特征
- 用 K-Means/层次聚类分群
- 价值用综合评价排序
六、常见坑与规避
- 不要把赛题要点当原题照搬,先独立重述问题再建模。
- 拿到数据先检查量纲、缺失与异常,再决定用预测/评价/优化哪类方法。
- 方法选型别凭感觉:先看「方法选型决策指南」对应题型那本,再进具体算法手册。
- 合成练习数据只验证逻辑,正式参赛务必用官方数据并做敏感性/误差分析。
七、三篇手写优秀范文
| 范文 | 内容 | 配图 | 附录 |
|---|---|---|---|
| 范文一·数据探索·特征标准化与 K-Means 从零 | z-score 标准化、手搓 k-means++ 与 Lloyd、肘部法/轮廓系数/DBI 定 k=3、质心画像 | 手写 · 8 图 · 1 附录 | |
| 范文二·方法对比·簇画像与 RFM 价值排序 | K-Means vs 层次(single/complete) vs DBSCAN 对照、RFM 价值评分与客群/个体排名 | 手写 · 8 图 · 1 附录 | |
| 范文三·业务画像·经营策略与稳健性 | 分群经营策略映射、随机种子/离群/k 三类稳健性检验、综合特征雷达 | 手写 · 8 图 · 1 附录 |
八、配套资源
- 回到 📚 历年真题解法库首页
- 总入口:🗺️ 专题手册库
- 论文怎么写:📝 论文模板使用说明专区
- 避坑总览:⚠️ 建模避坑指南专区
九、权威数字速览(确定性真源,SEED=2019)
- 数据:n=200,p=6(f1 近度R / f2 频次F / f3 金额M / f4 客单价A / f5 品类广度B / f6 价格弹性E),标准化后各特征均值≈0、标准差≈1;f1 与 f3 相关 0.624、与 f6 相关 −0.502
- K-Means 定 k:Inertia k=2..5 为 745.8 / 413.54 / 384.7 / 368.84,肘点与轮廓系数峰值、DBI 谷值一致指向 k=3
- 最优分群:轮廓系数 0.4412、DBI 0.8717、纯度 0.995、ARI 0.9841;质心间隙 3.154;三簇规模 58 / 73 / 69(占比 29.0% / 36.5% / 34.5%)
- 三客群画像:簇0 高价值忠诚型(value 90.45, 贡献 43.7%) / 簇1 大额低频型(53.04, 32.3%) / 簇2 价格敏感低值型(41.77, 24.0%)
- 方法对照:层次(complete) sil 0.4406、DBI 0.8701、纯度 0.985;层次(single) 退化为 198/1/1(sil −0.0642);DBSCAN(eps=1.381) 仅 2 簇、纯度 0.7062
- 价值排序:Top10 价值客户全部来自簇0;Top20% 客户贡献 31.5% 价值(轻度帕累托)
- 稳健性:随机种子扰动命中率 7/8(种子 2026 跌至 sil 0.2262,暴露初值敏感);剔除最远 0
20 个样本后 sil 仍稳于 0.4360.441