数据评估
在用数据做预测或训练模型之前,需要先了解数据质量是否过关。数据评估会从 完整性 和 可预测性 两个角度给数据打分,并计算出一个 综合评分。分数越高,代表数据质量越好,越适合用于后续建模与预测分析。
开始评估
进入数据评估页面后,选择需要评估的数据集,点击「开始评估」即可。
评估完成后,页面会展示完整性、可预测性和综合评分,并在评估记录中保留本次结果。点击「查看」可以查看明细结果。
三个评估结果
完整性
这个分数告诉你:数据有没有缺、关键字段全不全。
传感器掉线、网络抖动、重复上报、字段缺失……这些问题都会让时间序列数据出现空洞、重复或结构不完整。完整性分数反映的就是这些问题的严重程度。
| 分数 | 意味着什么 | 建议 |
|---|---|---|
| 80–100 | 数据完整性良好,关键字段齐全,满足建模要求 | 可直接使用 |
| 60–79 | 存在少量缺失数据,对分析结果影响有限 | 建议治理后使用 |
| 0–59 | 数据缺失较多,可能影响模型训练效果 | 建议优先治理 |
如果完整性分数低,后续的预测或分析结果会受到影响。建议先处理缺失值、重复数据、时间戳异常或关键字段不完整等问题,再继续建模。
可预测性
这个分数告诉你:这条数据「有没有规律可循」。
有些数据天然有规律,比如每天固定时段的用电量、随季节变化的温度。有些数据则更像随机波动。可预测性分数反映的就是序列规律的强弱。
| 分数 | 意味着什么 | 建议 |
|---|---|---|
| 80–100 | 时序特征稳定,适合构建预测模型 | 适合建模 |
| 60–79 | 数据具有一定规律性,可进行预测分析,但模型效果可能受波动影响 | 可以尝试建模,结合业务判断结果 |
| 0–59 | 数据波动较大,预测难度较高 | 需要评估数据或预测策略 |
如果可预测性分数低,并不一定代表数据有问题,而是说明这条序列本身波动性强、难以预测。此时需要结合业务判断,决定是否引入其他变量辅助预测,或降低对预测精度的期望。
综合评分
这个分数告诉你:这份数据整体是否适合继续用于建模和预测分析。
综合评分会结合完整性和可预测性,给出一个整体质量判断。它适合用来快速判断数据是否可以进入后续流程,也可以帮助优先定位需要治理的数据集。
| 分数 | 意味着什么 | 建议 |
|---|---|---|
| 80–100 | 数据质量良好,适合建模与预测分析 | 可优先使用 |
| 60–79 | 数据质量基本满足要求,治理后可获得更优效果 | 建议根据短板进行治理 |
| 0–59 | 当前数据不满足高质量建模要求,模型预测效果可能不稳定 | 建议完成治理后再建模 |
如果综合评分低,通常说明数据在完整性或可预测性上存在明显短板。建议先查看明细结果,定位具体问题,再进行数据治理。
快速参考
| 指标 | 核心问题 | 分数低说明什么 |
|---|---|---|
| 完整性 | 数据是否完整?关键字段是否齐全?有没有缺失、重复或时间戳异常? | 数据存在缺失、重复、时序错乱或字段不完整 |
| 可预测性 | 序列有没有周期性、趋势性或稳定变化规律? | 序列接近随机波动,难以从历史推断未来 |
| 综合评分 | 数据整体是否适合用于建模和预测分析? | 数据质量存在短板,建议治理后再使用 |