MCM520 ← 资料站首页 医疗风险预测(泰迪杯 2022 B) 打开交互阅读器 →

医疗风险预测(泰迪杯 2022 B)

历年真题解法库 · 本题为公开赛题要点整理,完整原题请到官方渠道获取(链接见下);
下方「练习数据」为本站生成的合成数据集,仅用于跑通方法,非官方原题数据。

一、赛题要点

  • 赛事:泰迪杯 2022 年 · 题号 B
  • 问题实质:基于病历数据,要求预测疾病风险并做人群分层。

二、需要产出什么

建立风险预测模型;做分类与综合评价。

三、数据说明(官方来源 + 练习数据集)

  • 官方数据/赛题:官方给出临床指标与结局;需做特征工程。
  • 官方获取渠道:http://www.tipdm.org(请以当年官网发布为准)
  • 本站练习数据集:data/tidy2022a.csv —— 按本题结构生成的合成数据(series 型),可下载后用上面的算法手册直接练手。
  • 字段说明:CSV 表头即各变量名;数值为合理量级的随机样本,仅用于方法验证,不代表真实赛题数据。

四、可用解法 → 对应手册

下面按本题涉及的题型,给出对应的「方法选型指南」与可直接套用的算法手册跳转。

题型:预测 / 回归类

先看选型 👉 🧭 预测类选型指南

可套用算法手册:

题型:分类 / 聚类类

先看选型 👉 🧭 分类聚类选型指南

可套用算法手册:

题型:评价 / 决策类

先看选型 👉 🧭 评价类选型指南

可套用算法手册:

参考手册速查

📘 线性回归 · 📘 多元回归 · 📘 BP 神经网络 · 📘 支持向量机 · 📘 逻辑回归 · 📘 贝叶斯分类 · 📘 K-Means 聚类 · 📘 层次聚类 · 📘 模糊 C 均值 · 📘 决策树 · 📘 层次分析法 AHP · 📘 TOPSIS · 📘 熵权法 · 📘 模糊综合评价 · 📘 灰色关联分析 · 📘 VIKOR · 📘 CRITIC 法 · 📘 PCA 综合评价

五、建模思路提示

  • 风险用分类/回归预测
  • 人群用聚类分层
  • 用评价指标选模型

六、常见坑与规避

  • 不要把赛题要点当原题照搬,先独立重述问题再建模。
  • 拿到数据先检查量纲、缺失与异常,再决定用预测/评价/优化哪类方法。
  • 方法选型别凭感觉:先看「方法选型决策指南」对应题型那本,再进具体算法手册。
  • 合成练习数据只验证逻辑,正式参赛务必用官方数据并做敏感性/误差分析。

七、三篇手写优秀范文

范文 内容 配图 附录
范文一·数据刻画·风险指数·评分校准 趋势周期分解、平滑风险指数、逻辑回归评分、温度缩放校准 手写 · 8 图 · 1 附录
范文二·人群分层·分层干预 分位数三分 vs K-Means 从零聚类、三层画像、差异化干预 RRR 手写 · 8 图 · 1 附录
范文三·切点调优·敏感性·筛查部署 ROC 切点、特征扰动敏感性、成本-获益、运行部署流程 手写 · 8 图 · 1 附录

八、配套资源

九、权威数字速览(确定性真源,SEED=2022)

  • 序列 N=60,均风险 15.37,标准差 3.62,趋势斜率 0.1873,y0=8.73→y59=20.15
  • 风险指数 窗口=5 平滑,首/中/末 = 8.73 / 16.66 / 19.23
  • 评分模型 逻辑回归特征权重 lag1=2.27、roll_mean5=2.80、roll_std5=0.53、slope3=1.00;事件阳性 30
  • 校准 原始 MAE=0.1806,温度缩放(T=0.7)后 0.1475
  • 分层-分位数 规模 20/20/20,层均风险 11.22 / 15.46 / 19.45
  • 分层-KMeans 规模 23/22/15,层均风险 12.01 / 16.06 / 19.52
  • 干预 各层 RRR 8% / 18% / 28%,整体 RRR 19.78%(15.37→12.33)
  • ROC AUC=0.9839,最优切点 15.57(灵敏度 100%、特异度 96.7%)
  • 敏感性 指数 lag1/roll_mean5/roll_std5/slope3 = 0.030 / 0.037 / 0.007 / 0.013
  • 成本-获益 最优切点 15.57,净获益 209(每检出获益 8、每标记成本 1)
  • 稳健性 ±5% 扰动下层均风险最大位移 14.0%,个体标签一致率 60%