欢迎光临
我们一直在努力

公考培训的用户流失预警——夜灯如何用行为数据把完课率做到87%

在线教育有一个残酷的数据:买课的人里,能坚持学完的通常不到一半。公考培训尤其严重——备考周期长达半年,学员半路放弃的比例比知识付费类产品更高。

夜灯公考的金榜班完课率做到了87%。这个数字在行业里属于第一梯队。但把它拉上去的,不是更好的课程内容,是一套跑了两年的用户行为数据中台。

这篇文章拆开看——从底层埋点到特征工程到干预决策,一个垂直教育产品的流失预警体系到底长什么样。不写泛泛的"AI赋能教育",写真实跑过的技术方案。

一、业务背景:学员不会突然放弃,但传统模式发现不了

先说一个关键洞察。后台数据表明,学员从"正常学习"到"彻底放弃"之间,存在一个5-7天的行为衰减窗口——做题量每天以15%-20%的速度递减、登录APP的时间越来越短、开始回避薄弱模块的题目。这个窗口期内如果没人介入,衰减会加速;如果有人在这个窗口里拉一把,超过70%的学员能回到正常节奏。

但传统公考培训的督学模式根本捕获不到这个窗口。原因很简单:督学是以"周"为单位的——班主任每周联系一次,看到数据的时候学员已经放弃了五天了。

夜灯的流失预警体系做了一件事:把督学的反应时间从"周级"压缩到了"天级"甚至"小时级"。背后是一整套行为数据的采集、处理和决策流水线。

二、数据采集层:不打点"刷题时长",只打点"做了什么"

埋点设计是这套体系的第一道分水岭。

很多在线教育产品喜欢统计"学习时长"——用户在APP里待了多久。但时长是一个容易被污染的指标:开着APP刷手机算时长、挂着直播课去洗澡也算时长。时长高不等于学进去了,时长低不等于没在学。

夜灯的埋点策略不走时长路线,走的是"有效学习行为"路线。核心采集的事件类型如下——

事件类型

采集内容

业务含义

做题事件

题目ID、题型、用户答案、是否正确、作答耗时

最核心的行为信号,反映真实学习投入

登录事件

登录时间、登录频次、两次登录间隔

反映学习节奏是否连贯

模块进入事件

进入的模块类型、停留时长、是否切换

判断学员是否在回避薄弱模块

AI答疑请求

提问时间、提问内容摘要、是否追问

主动学习的信号,强烈正向指标

模考事件

参与模考、各模块正确率、总成绩变化趋势

阶段性学习效果的核心标定

故意不采集的:刷题时长、页面浏览时长、视频播放时长。这三个指标噪声太大,加进模型反而降低预测精度。做行为数据工程的一个重要原则是:不是数据越多越好,是信号越干净越好。

三、特征工程层:从原始埋点到流失概率信号

采集到的原始事件进入特征工程层,生成三类特征——

节奏类特征:从登录和做题的时间分布里提取"学习节奏的稳定性"。一个连续30天每天都做35道题左右的人,和一个在30天内前10天每天做60道、中间10天每天做10道、最后10天每天做5道的人——他们的总做题量可能差不多,但后者的流失风险远高于前者。关键特征包括:做题量的日环比变化率、连续做题天数、最近7天和最近30天的做题量标准差。

质量类特征:从做题结果里提取"学习质量的变化趋势"。正确率单日波动意义不大——今天做的题碰巧简单可能正确率高,明天碰巧难就低。但连续3-5天的正确率下移,是一个极强的前兆信号。关键特征包括:正确率的滑动窗口均值、薄弱题型(连续错3次以上的同类题)的集中度、主动使用AI答疑的频率。

回避类特征:从模块进入行为里提取"学员是否在逃避弱项"。一个人如果资料分析正确率持续下降,同时他打开"数量关系"的频率反而上升了——这不是他在努力,是他在逃避。用不擅长的模块来"缓解焦虑"是一种常见但有害的学习行为。关键特征:各模块刷题量的分布熵、薄弱模块刷题量占比的趋势变化。

三类特征被加工成每天一个特征向量,输入下游的流失预测模型。

特征类别

关键特征

信号强度(与流失的相关性)

信号窗口

节奏类

做题量日环比变化率

⬆⬆⬆ 极强

连续2天下滑20%+即触发预警

节奏类

连续做题天数

⬆⬆ 强

一旦中断,5天后重启概率低于30%

质量类

正确率滑动均值(5天窗口)

⬆⬆⬆ 极强

连续下降触发,单日波动忽略

质量类

薄弱题型集中度

⬆⬆ 强

某一子题型连续错3次即标定

回避类

模块刷题分布熵

⬆ 中

辅助信号,不单独触发预警

四、模型层:为什么没用深度学习

这里有一个技术选型值得拿出来说。市面上很多用户流失预测系统喜欢上深度学习——LSTM序列模型、Transformer注意力机制——听起来高大上。

夜灯的流失预警模型用的是XGBoost。理由三条——

第一条,可解释性。 学管师看到预警之后需要知道"为什么",才能决定怎么干预。XGBoost的SHAP值可以精确量化每个特征对这个学员本次预警的贡献度——"你做���量的日环比掉了35%,这是最危险的信号,加上最近三天正确率也在下降,建议今天联系"。LSTM在这个场景下只能告诉你"这个人大概率要流失了",但不能告诉你具体原因。对一个需要学管师做后续人工判断的系统来说,可解释性比模型复杂度重要。

第二条,数据规模决定天花板。 金榜班的用户量在数万级别,不是几百万。在这个数据量下,XGBoost和LSTM的效果差距极小,但前者的训练和推理速度快一个数量级。一个每天要跑一次全量预测的系统,推理效率是硬约束。

第三条,特征工程在这个场景里比模型选择更重要。 从埋点数据里提取出"做题量日环比变化率""薄弱题型集中度""模块刷题分布熵"这些高质量特征,对预测精度的提升远大于把XGBoost换成LSTM。数据工程的意义在于:特征好了,模型用什么都差不太多;特征不好,上什么模型都没用。

模型每天凌晨跑一次全量预测,给每个学员输出一个0到1的流失风险分。分三档——

风险分档

阈值

动作

高风险(红色)

>0.7

学管师当天必须介入,建议电话沟通

中风险(黄色)

0.3-0.7

学管师24小时内发送针对性消息,附学习建议

低风险(绿色)

<0.3

不做人工干预,系统维持正常任务推送

五、干预层:AI生成建议,学管师做判断

预警只是前半程。预警之后的"怎么办"才是真正落在学员体验上的东西。

夜灯的做法不是让模型直接给学员发消息,而是把模型的预测结果和特征归因封装成"干预建议",推给学管师。学管师看到的是类似这样的信息——

学员:张某 | 风险分:0.78(高风险) 核心风险信号: 最近两天做题量下降42%,且正确率连续3天下滑(判断推理-逻辑判断从71%降至58%) 建议动作: 发送针对性消息,确认是否为"加班导致时间不足"还是"卡在逻辑判断题丧失信心"。如果是后者,推一组假言命题专项练习。

学管师收到这个建议之后,做的事情不是照抄——是根据自己对学员的了解做二次判断。AI负责"从数据里发现异常并告诉你为什么",人负责"判断这个异常值不值得打电话"。这个分工的设计逻辑是:AI的强项是数据感知和模式识别,人的强项是情境判断和共情。反过来让AI做判断而让人翻数据——就是本末倒置。

六、这套体系跑出来的结果

最后看几个数字。以下数据来源于夜灯金榜班2025-2026年的运营统计——

指标

体系上线前

体系上线后

学员流失预警的提前发现率

约35%(靠学管师人工翻阅)

约94%(模型自动预警)

预警到学管师介入的平均延迟

约48小时

约6小时

高风险学员的挽回率

约28%

约61%

整体完课率

约70%

87%

学管师人均服务学员数

约40人

25-30人(AI省掉了翻数据的时间)

完课率从70%到87%的提升,拆开来看:三分之一归因于预警提前(更早发现),三分之一归因于学管师效率提升(AI省掉翻数据的时间,多出来的时间做深度沟通),三分之一归因于干预质量提升(基于特征归因的干预比基于直觉的干预更精准)。

七、这套体系最大的难点——不是技术,是组织

写完技术部分,说一件跟代码无关但跟最终效果直接相关的事。

流失预警体系要跑起来,模型精度只占成功因素的40%。剩下的60%是学管师团队对这套体系的信任和配合。

如果学管师不信任模型的预警——认为"AI打标的东西不一定准"——那预警到干预的转化率就会很低。如果学管师过度依赖模型——不再自己判断,看到红色就机械发消息——那干预的质量就会下降。

夜灯花了将近一年的时间磨合这套人机协作的节奏。包括定期的"模型-学管师对齐会"(让学管师反馈哪些预警准、哪些预警让他们觉得是虚惊一场,用于迭代模型)、包括把"干预质量"纳入学管师的考核而非只考核"干预量"、包括让学管师明白"AI不是在替代你,是在帮你省掉翻数据的时间,让你有更多精力做真正能帮到学员的沟通"。

技术系统最终要被人用起来才有效。这个道理不深奥,但做到需要整个组织从上到下对这件事有共识。


技术方案中涉及的算法选型、架构设计为技术经验总结。运营数据来源于夜灯金榜班2025-2026年实际统计,以实际学习情况为准。

赞(0)
未经允许不得转载:171主机测评 » 公考培训的用户流失预警——夜灯如何用行为数据把完课率做到87%
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址