MCM520 ← 资料站首页 AI 依赖风险的预警评分卡:名单经济学与干预模拟(优秀范文三) 打开交互阅读器 →

AI 依赖风险的预警评分卡:名单经济学与干预模拟(优秀范文三)

摘要

范文一建立了「五准则十指标」的综合评价体系,范文二把学生划分为三类使用画像。两篇都在回答「影响有多大」,本文回答一个更紧迫的问题:谁正在滑向高风险?能否用三个问题就把他们找出来?找到之后干预谁、怎么干预最划算? 基于 600 份合成问卷面板,本文完成从度量到行动的完整链条:第一,风险分布右偏——依赖与诚信综合风险中位仅 18.5 分,但 P95 达 42.5、最高 61.7,少数人承担了绝大多数风险敞口;第二,风险由「时长 × 自律 × 验证」三元决定——周时长相关 +0.649,验证习惯 −0.573、自律性 −0.540,而场景数几乎无关(+0.036)。这种不对称性——两个质量维度(d/v)各自独立与风险负相关,且与时长相乘——意味着管理动作应优先考虑「质量」而非「总量」;同样重度使用(Q4),低自律组高危率 92.6%、高自律组仅 29.2%——时长是油门,自律才是刹车;第三,三项整数评分卡区分力 AUC 达 0.918,阈值取 4 时以 83 人旗标实现 81% 查准、56% 查全的均衡,K=60 的短名单查准率高达 93.3%;第四,反事实模拟显示:给 112 名低自律学生各加一档自律可让 22 人退出高危线,限频至 12 小时/周让 55 人中 13 人出榜,组合拳 159 人换 35 人——干预只能兜底,预防才是主战场。这揭示了模型最朴素的含义:一旦风险已经累积到 P80 之上,即使动用所有干预工具,也只能挽回一小部分人;真正决定整体风险敞口大小的是入学时的习惯结构——越早介入、单位成本的边际改善越显著,这与 E3 的交互效应完全一致。全文给出可直接落地的筛查-分层-干预方案。

一、问题重述与数据

赛题要求评价人工智能对大学生学习的影响。范文一测得全样本 TOPSIS 均值 0.506 并发现倒 U 型用量曲线;范文二聚出「重度深用 / 浅尝低防 / 轻量审慎」三型。但综合评价的得分是给学校看的,真正需要预警系统的是辅导员:开学季只有三次谈话机会,该约谈谁?

本文复用真源的 600 名学生面板(周使用时长 h、自律性 d、验证习惯 v、场景数 s 四个可观察变量,以及十项指标与五个准则得分),把「低依赖度 + 诚信安全感」的反面——综合风险分——作为预警目标,定义 P80 及以上为高危(120 人,基率 20%),构建完整的筛查流水线。所有实验为确定性计算,双跑逐位一致。

二、结果 I:风险画像

图1 600 名学生依赖风险分布

图 1 是全体学生的风险分直方图:中位 18.5 分,P80 = 28.2 分划出高危线,P95 = 42.5、最大 61.7。分布显著右偏——大多数学生的风险敞口温和,但尾部有一小撮人远远甩开大部队。这个形状决定了后续所有设计的取向:我们不需要对 600 人普遍施策,只需要精准找到右侧红区里的 120 人。

三、结果 II:谁的错

图2 四个可观察变量的预警力

图 2 检验四个问卷可观察变量与风险的相关:周时长 +0.649 一枝独秀,验证习惯 −0.573 与自律性 −0.540 紧随其后,场景数仅 +0.036、近乎无关。三个推论:其一,风险主要随用量累积,「用多久」比「用来干什么」更重要;其二,两个行为质量变量(验证、自律)是天然的减震器且方向明确;其三,场景数与风险脱钩——这排除了「多用途=更危险」的直觉误判,为结果 VII 的增效结论埋下伏笔。

四、结果 III:油门与刹车

TOPSIS多属性决策

TOPSIS(逼近理想解排序法)通过计算与正负理想解的距离进行排序:

Di+=∑j=1m(vij−vj+)2,Di−=∑j=1m(vij−vj−)2D_i^+ = \sqrt{\sum_{j=1}^{m} (v_{ij} - v_j^+)^2}, \qquad D_i^- = \sqrt{\sum_{j=1}^{m} (v_{ij} - v_j^-)^2}

相对贴近度:

Ci=Di−Di++Di−C_i = \frac{D_i^-}{D_i^+ + D_i^-}

Ci∈[0,1]C_i \in [0, 1],越接近1表示方案越优。

图3 同样重度使用,自律决定生死

单看相关会掩盖交互效应。图 3 把样本按时长四分位 × 自律三档切成 12 个格子,报每格进入高危区的比例:低自律组的梯度陡峭得可怕——Q1 仅 3.8%,Q2 跳到 21.7%,Q3 66.7%,Q4 高达 92.6%;而高自律组在同样最重的 Q4 只有 29.2%,中自律组介于其间(Q4 70.6%)。同样的油门踩到底,有没有刹车是生死的分界。 这直接推翻「一刀切限时」的管理逻辑:对高自律的重度用户限时不公平也没必要,对低自律的轻度用户则应提前介入而非等到用量飙升。

五、结果 IV:三项评分卡

图4 三项整数评分卡的区分力

把三个变量变成辅导员在电话里就能问完的三道题:每周几小时?(≥12h 记 2 分、≥5h 记 1)作业是否自己核对?(习惯 ≤2 记 2、=3 记 1)拖延吗?(同验证)。总分 06。图 4 显示这个土办法的区分力惊人:AUC = 0.918,56 分段的高危占比 92.6%100%,01 分段的 271 人里只有 1 个漏网——复杂模型能拿到的信息,一张纸片评分卡几乎全拿到了。 对预算有限的校方,这是性价比最高的第一道筛。更值得注意的是该评分卡的稳健性——仅依赖三份自填问卷的数值化汇总,无需访问学生的实际学习行为日志,避免了隐私合规风险;因此无论是校级筛查还是院系层面的精准辅导,都可直接落地,不会引发数据获取上的阻力。

六、结果 V:阈值的三难

图5 阈值的三难选择

评分卡定后只剩一个旋钮可拧。图 5 扫描三个工作点:阈值 3 旗标 189 人、抓住 87% 的高危学生但查准率只有 55%——近一半约谈是白跑;阈值 5 查准 93% 却漏掉 77%;阈值 4 是均衡解:83 人旗标、查准 81%、查全 56%。选择取决于干预预算与误报成本:群发提醒用 3,一对一约谈用 4,只处理极端个案用 5。把统计阈值翻译成管理动作,是模型落地的最后一公里。

七、结果 VI:名单经济学

图6 干预容量下的名单质量

现实里干预容量总是稀缺的。图 6 报告按评分降序截断的前 K 名单质量:K=60 时查准率 93.3%(每 15 个约谈 14 个准)、捕获 46.7%;K=120 时捕获升到 80%、查准降到 80%。每多覆盖一个真高危,就要多付一份误约谈的信任成本。 若按「先打分、再人工复核边界段」的两级流程,K=60 加复核即可低成本拿下大半个高危池。

八、结果 VII:被洗白的场景数

图7 扩场景是无害的增效杠杆

E2 里场景数与风险无关是个被低估的发现。图 7 对照两组:少场景组(≤2 类,198 人)效率均值 48.5,多场景组(≥5 类,99 人)55.0——多用三类场景换来 +6.5 分效率,风险却只涨 1.8 分(相关 +0.036)。机理在于风险公式里根本没有场景项:多样性带来能力而不积累依赖。 因此引导政策的方向应是「调结构而非压总量」:把学生从单一的代做式用法引向检索、问答、编程辅助等多元场景,效率增益与风险控制可以兼得——这是全文对「如何引导合理使用」最正面的一条建议。具体操作上,院系辅导员可在新生入学时发放「场景类型问卷」(识别多场景 vs 单场景),对多场景用户给予正向激励(学分奖励、AI 工具补贴),对单场景重度用户安排一对一访谈,把风险控制在入口。同时,教务处应公开各工具的边界使用指南(哪些场景适合、哪些会触发风险),把选择权交给学生,而不是事后约谈。此外,平台侧应开放「使用量+场景」的仪表盘给学生本人,让他们看到自己的分布偏离与改进建议——透明反馈本身就能促进自律。

八、结果 VIII:干预模拟

图8 反事实干预:组合拳把 35 人拉出高危线

最后量化干预的效果空间。先拟合风险模型(R² = 0.902,系数与真源结构吻合),再做三组反事实:给 112 名低自律学生各提升一档自律,22 人预测值退回高危线之下;把 55 名超量用户(>12h/周)限频到 12 小时,13 人出榜;组合拳动用 159 人次换 35 人出榜。三点判断:自律辅导的单位成本低于强制限频;即便组合拳也只能消化高危池的三成——存量高危可以兜底,增量防控只能靠入学时的习惯建设;这也解释了为什么评分卡应该用在学期初而不是期末。

九、结论

本文把「AI 影响评价」推进到「风险治理」,四条主结论:

  1. 风险高度集中:P80 线以上 120 人承担主要敞口,精准定位优于普遍施策;
  2. 结构重于总量:时长是油门、自律与验证是刹车,场景数中性偏有益——管理应「查三问、调结构」;
  3. 简单工具够用:三项评分卡 AUC 0.918,阈值 4 配 K=60 名单即达 93% 查准,落地成本趋近于零;
  4. 干预的天花板有限:三种反事实合计仅消化高危池三成,政策重心必须前移到习惯养成阶段。

十、模型验证(四路一致)

本文正文、配图、附录代码、真源 tools/gen_dgcup2023b_3.py 四路数字完全一致。面板复用 gen_dgcup2023b.py 固定种子输出,本脚本全部实验为确定性计算、不含新随机数,双跑逐位一致;附录代码可在 tools/ 目录独立复现全部分位数、相关、交叉表、AUC、阈值表、名单指标与干预模拟。

参考文献

[1] 电工杯全国大学生数学建模竞赛组委会. 2023 年 B 题:人工智能对大学生学习影响的评价.

[2] Hand, D. J., Till, R. J. A Simple Generalisation of the Area Under the ROC Curve for Multiple Class Classification Problems. Machine Learning.

附录:核心 Python 实现

import sys, os
_HERE = os.path.dirname(os.path.abspath(__file__))
sys.path.insert(0, os.path.abspath(os.path.join(_HERE, "..", "..", "..", "tools")))
import gen_dgcup2023b_3 as SRC

r = SRC.gen_dgcup2023b_3()
# E1 风险画像
e = r["e1"]
print("E1 中位 %.1f P80 %.1f P95 %.1f max %.1f 基率 %.2f"
      % (e["med"], e["p80"], e["p95"], e["max"], e["base_rate"]))
# E2 相关 / E3 交叉表
print("E2 相关:", r["e2"])
for dl, row in r["e3"].items():
    print("E3", dl, {k: "%.1f%%" % (v["rate"] * 100) for k, v in row.items()})
# E4 AUC / E5 阈值 / E6 名单
print("E4 AUC %.4f" % r["e4"]["auc"])
for t, v in sorted(r["e5"].items()):
    print("E5 阈值%d 查准 %.2f 查全 %.2f" % (t, v["precision"], v["recall"]))
for K, v in sorted(r["e6"].items()):
    print("E6 K=%d precision@K %.3f 捕获 %.3f" % (K, v["precision"], v["captured"]))
# E7 场景数 / E8 干预
print("E7", r["e7"])
for tag in ("自律+1", "限频12h", "组合"):
    v = r["e8"][tag]
    print("E8 %s 出榜 %d 受干预 %d" % (tag, v["exits"], v["treated"]))