预测 Wordle(美赛 2023 MCM-C · Predicting Wordle Results)
历年真题解法库 · 本题为公开赛题要点整理,完整原题请到官方渠道获取(链接见下);
下方「练习数据」为本站生成的合成数据集,仅用于跑通方法,非官方原题数据。
一、赛题要点
- 赛事:美赛 2023 年 · 题号 MCM-C
- 问题实质:基于 Wordle 每日对局数据(从 Twitter 挖掘,覆盖 2022-01-07 至 2022-12-31),建立模型刻画玩家表现。数据字段含日期、赛号、当日单词、报告结果数、困难模式数,以及 1–6 次猜中与 X(六次内未解出)的百分比。
- 官方背景(联网查证确认):本题要求解释"报告结果数逐日变化"并为 2023-03-01 给出预测区间;由单词属性预测其得分分布;按难度对单词分级;并以单词 EERIE 为例给出具体预测与置信度;最后给《纽约时报》谜题编辑写一封总结信。
二、需要产出什么
- 参与度时间序列:解释每日报告结果数的变化,为 2023-03-01 给出预测(而非置信)区间。
- 单词属性→结果分布:对给定未来单词,预测其 1、2、3、4、5、6、X 各档百分比,并讨论不确定性。
- 难度分类:开发按难度分级单词的模型,识别每类对应的属性画像(以 EERIE 为例)。
- 其它有趣特征与一封给 NYT 编辑的信(≤25 页 PDF)。
三、数据说明(官方来源 + 练习数据集)
- 官方数据/赛题:Wordle.xlsx(2022 全年每日结果),本题为真实建模与数据分析题。
- 官方获取渠道:COMAP 官网(请以当年官网发布为准)
- 本站练习数据集:
data/mcm2023c.csv—— 由tools/gen_mcm2023c.py(SEED=2024 确定性)生成的单词级合成数据,含 360 个五字母单词及其语言学特征、潜在难度、得分分布百分比与参与度。可下载后用上面的算法手册直接练手。 - 字段说明:
word单词;day天序;N_reported报告结果数;hard_mode_n困难模式数;hard_mode_frac困难模式占比;difficulty潜在难度 d;mean_guesses平均猜词次数;fail_rate失败率;p1–p6、pX各档百分比;f_freq/f_rep/f_vowel/f_rare/f_start/f_bigram六项语言学特征。
四、可用解法手册(按题型跳转)
- 预测 / 回归类(属性→得分分布):🧭 预测类选型指南 → 📘 线性回归 · 📘 多元回归 · 📘 逻辑回归
- 时间序列类(每日报告数预测):🧭 时间序列选型指南 → 📘 时间序列 ARIMA · 📘 指数平滑
- 分类 / 聚类类(难度分级):🧭 分类聚类选型指南 → 📘 K-Means 聚类 · 📘 决策树
- 论文写作:📝 论文模板使用说明专区 · ⚠️ 建模避坑指南专区
五、权威数字速览(SEED=2024 确定性,详见 tools/gen_mcm2023c.py)
| 指标 | 数值 |
|---|---|
| 样本量(单词数) | 360 |
| 整体平均失败率 | 0.1766 |
| 整体平均猜词次数 | 3.883 |
| 失败率回归 R² | 0.9516 |
| 平均猜词回归 R² | 0.9575 |
| 测试集 MAE(失败率) | 0.0052 |
| 5 折交叉验证 MAE | 0.0068 |
| 难度三分类(Easy/Mod/Hard) | 43 / 236 / 81 |
| 难度分类准确率 | 0.9194 |
| 最难词 | jazzy(d=0.947,失败率 0.296) |
| 最易词 | earth(d=0.315,失败率 0.100) |
| EERIE 预测 | d=0.575,失败率 0.183,平均猜词 3.920,类=Moderate |
| 推荐未来单词 top10 | abuse, burst, crime, court, great, charm, march, doubt, eaten, blast |
| 2023-03-01 预测报告数 | 48745(95% 区间 45448–52280),参与度模型 R²=0.9927 |
结论:Wordle 单词难度主要由"常见词形、字母频率与重复字母"三项语言学属性驱动(常见双字母词形与难度相关系数达 −0.665);线性模型即可对得分分布给出 R²>0.95 的预测;每日参与度呈指数衰减并趋稳,预测 2023-03-01 报告数约 4.87 万。选词应以"难度居中(d≈0.5)"为主,兼顾少量高话题度难词。
六、优秀范文(本站手写,三种视角)
| 范文 | 视角 | 链接 |
|---|---|---|
| 范文一 | 数据探索与难度模型构建(特征工程 + 潜在难度 + 响应模型) | mcm2023c-1.md |
| 范文二 | 回归预测、验证与难度分类(含 EERIE 实例) | mcm2023c-2.md |
| 范文三 | 参与度预测、推荐系统与模型稳健性(含致 NYT 信) | mcm2023c-3.md |
七、配套资源
- 真源:
tools/gen_mcm2023c.py(确定性,零依赖,独立运行复现上表) - 配图:
tools/fig_mcm2023c.py→assets/problems/papers/mcm2023c-{1,2,3}-fig{1..8}.svg(24 张) - 注册:已并入
tools/gen_data.py(gen_mcm2023c()) - 回到 📚 历年真题解法库首页 · 总入口:🗺️ 专题手册库
八、常见问题
- 练习数据是官方原题吗? 不是。本站用 SEED=2024 确定性合成 360 词及每日参与度,结构合理、可稳定复现与教学;正式参赛请以 COMAP 官方 Wordle.xlsx 为准。
- "失败率"指什么? 指六次内未能解出(赛题记为 X)的玩家百分比;本数据集整体均值 0.1766。
- EERIE 为何是 Moderate 而非 Hard? 本练习数据中 EERIE 的高频字母与常见开头抵消了重复字母的影响,模型给其中等难度(d=0.575);真实赛题以官方数据代入同一框架即可得官方意义上的数值。
- 为何用线性回归而非黑箱模型? 线性模型系数可解释、与相关性分析一致,且满足赛题对"属性如何影响结果"的解释性要求;其外样本 MAE 仅约 0.006,已足够可靠。
九、更新记录
- 2026-08-14:新建 stub 并补全真题要点;收官真源、24 张配图、3 篇手写优秀范文与九节权威数字。