医疗风险预测(泰迪杯 2022 B)
历年真题解法库 · 本题为公开赛题要点整理,完整原题请到官方渠道获取(链接见下);
下方「练习数据」为本站生成的合成数据集,仅用于跑通方法,非官方原题数据。
一、赛题要点
- 赛事:泰迪杯 2022 年 · 题号 B
- 问题实质:基于病历数据,要求预测疾病风险并做人群分层。
二、需要产出什么
建立风险预测模型;做分类与综合评价。
三、数据说明(官方来源 + 练习数据集)
- 官方数据/赛题:官方给出临床指标与结局;需做特征工程。
- 官方获取渠道:http://www.tipdm.org(请以当年官网发布为准)
- 本站练习数据集:
data/tidy2022a.csv—— 按本题结构生成的合成数据(series 型),可下载后用上面的算法手册直接练手。 - 字段说明:CSV 表头即各变量名;数值为合理量级的随机样本,仅用于方法验证,不代表真实赛题数据。
四、可用解法 → 对应手册
下面按本题涉及的题型,给出对应的「方法选型指南」与可直接套用的算法手册跳转。
题型:预测 / 回归类
先看选型 👉 🧭 预测类选型指南
可套用算法手册:
题型:分类 / 聚类类
先看选型 👉 🧭 分类聚类选型指南
可套用算法手册:
题型:评价 / 决策类
先看选型 👉 🧭 评价类选型指南
可套用算法手册:
参考手册速查
📘 线性回归 · 📘 多元回归 · 📘 BP 神经网络 · 📘 支持向量机 · 📘 逻辑回归 · 📘 贝叶斯分类 · 📘 K-Means 聚类 · 📘 层次聚类 · 📘 模糊 C 均值 · 📘 决策树 · 📘 层次分析法 AHP · 📘 TOPSIS · 📘 熵权法 · 📘 模糊综合评价 · 📘 灰色关联分析 · 📘 VIKOR · 📘 CRITIC 法 · 📘 PCA 综合评价
五、建模思路提示
- 风险用分类/回归预测
- 人群用聚类分层
- 用评价指标选模型
六、常见坑与规避
- 不要把赛题要点当原题照搬,先独立重述问题再建模。
- 拿到数据先检查量纲、缺失与异常,再决定用预测/评价/优化哪类方法。
- 方法选型别凭感觉:先看「方法选型决策指南」对应题型那本,再进具体算法手册。
- 合成练习数据只验证逻辑,正式参赛务必用官方数据并做敏感性/误差分析。
七、三篇手写优秀范文
| 范文 | 内容 | 配图 | 附录 |
|---|---|---|---|
| 范文一·数据刻画·风险指数·评分校准 | 趋势周期分解、平滑风险指数、逻辑回归评分、温度缩放校准 | 手写 · 8 图 · 1 附录 | |
| 范文二·人群分层·分层干预 | 分位数三分 vs K-Means 从零聚类、三层画像、差异化干预 RRR | 手写 · 8 图 · 1 附录 | |
| 范文三·切点调优·敏感性·筛查部署 | ROC 切点、特征扰动敏感性、成本-获益、运行部署流程 | 手写 · 8 图 · 1 附录 |
八、配套资源
- 回到 📚 历年真题解法库首页
- 总入口:🗺️ 专题手册库
- 论文怎么写:📝 论文模板使用说明专区
- 避坑总览:⚠️ 建模避坑指南专区
九、权威数字速览(确定性真源,SEED=2022)
- 序列 N=60,均风险 15.37,标准差 3.62,趋势斜率 0.1873,y0=8.73→y59=20.15
- 风险指数 窗口=5 平滑,首/中/末 = 8.73 / 16.66 / 19.23
- 评分模型 逻辑回归特征权重 lag1=2.27、roll_mean5=2.80、roll_std5=0.53、slope3=1.00;事件阳性 30
- 校准 原始 MAE=0.1806,温度缩放(T=0.7)后 0.1475
- 分层-分位数 规模 20/20/20,层均风险 11.22 / 15.46 / 19.45
- 分层-KMeans 规模 23/22/15,层均风险 12.01 / 16.06 / 19.52
- 干预 各层 RRR 8% / 18% / 28%,整体 RRR 19.78%(15.37→12.33)
- ROC AUC=0.9839,最优切点 15.57(灵敏度 100%、特异度 96.7%)
- 敏感性 指数 lag1/roll_mean5/roll_std5/slope3 = 0.030 / 0.037 / 0.007 / 0.013
- 成本-获益 最优切点 15.57,净获益 209(每检出获益 8、每标记成本 1)
- 稳健性 ±5% 扰动下层均风险最大位移 14.0%,个体标签一致率 60%