1456 条文献数据 · LightGBM · SHAP 解释 · 保形预测区间
SCM 混凝土强度预测与智能配合比系统
将长达 28 天养护试错搬到计算机端数秒预判。从 1,456 条文献提取 8 项工程特征,选型 LightGBM 配合 KNN-RSCP 计算自适应预测区间,测试集达 R² 0.862 与 90.1% 覆盖率,交付 Python 包与 Web 应用。
R² 0.862冻结测试集
6.62 MPa测试集 RMSE
90.1%90% 目标覆盖率下的经验覆盖率
为什么要在做试验前先跑机器学习?
在混凝土工程中,引入粉煤灰、硅灰和矿渣等补充胶凝材料(SCM)是减少水泥用量、降低碳排放的核心途径。然而,材料掺量、水胶比等变量交织在一起,每调整一次配合比,就需要成型试块并养护 28 天后才能做抗压强度试验,单组试错的时间与材料成本居高不下。
庞大的配合比空间无法靠试验穷举,但过去的文献里沉淀了大量历史数据。我的真实动机是在物理试验前,利用机器学习模型对强度进行预判,将低效或性能不达标的候选方案在计算机端提前过滤,把原本长达数周的试验试错转移到数秒完成的计算模拟阶段。
特征换算与可靠性思考
数据来自多篇文献收集汇总的 1,456 条 试验记录。由于多源数据格式混乱,我先进行了字段核对与清洗。直接输入原始用量无法反映水化反应的物理本质,于是我将原始配合比拆解并换算为水胶比、骨胶比、砂率以及各类 SCM 替代率等 8 项工程特征。
在比对了随机森林、XGBoost、LightGBM 等 5 类模型后,基于直方图算法的 LightGBM 表现最佳,在独立冻结测试集上取得了 R² 0.862、RMSE 6.62 MPa 的预测精度。
为了让模型预测结果敢在工程中参考,我还做了两件事:
- 用 SHAP 做归因解释:展示水胶比与各类材料掺量对强度的影响趋势,确认模型逻辑符合材料学常识;
- 用保形预测(KNN-RSCP)量化风险:根据待测配合比在数据空间中的位置自适应伸缩预测区间,在 90% 目标覆盖率下实现了 90.1% 的真实经验覆盖,给出一个有概率保障的范围而不是死板的单点数值。
系统长什么样:最终完成的工程交付形态
在完成研究验证后,我按照软件规范将代码解耦重构,交付包含三个完整层面:
- Python 核心包(
scm_concrete_ml):封装了数据校验、8 项特征工程计算、模型训练预测接口及 KNN-RSCP 保形预测计算模块。 - 命令行工具(CLI):通过
scm-concrete-ml demo命令,可以在终端一键完成数据批量导入、特征转换、强度点预测与区间导出,自动生成summary.json指标汇总与predictions.csv结果。 - 中文 Streamlit 交互界面:提供开箱即用的 Web 页面。用户不仅可以手动拉动滑动条调整配合比参数、实时查看抗压强度预测与概率区间,还能使用扩展的多目标优化模块(结合 Pareto 非支配解识别与 TOPSIS 综合排序),在强度、成本与 SCM 替换率之间快速筛选候选配合比方案。
使用边界与开源声明
为保持客观严谨,系统使用中明确了以下边界:
- 预测与排序仅用于前置初筛,真正用于工程的配合比仍须通过物理试块成型试验与现行规范校核。
- 项目代码与 Web 应用已在 GitHub 仓库 全量开源(包含合成样例数据,原文献合并数据集因版权独立不随仓库分发)。