研究 02 / SCM2025—2026个人科研项目 · 核心流程已开源

ENGINEERING ML · UNCERTAINTY · DECISION SUPPORT

用机器学习预测 SCM 混凝土强度

从多来源试验数据出发,我做了一套强度预测、解释分析和不确定性评估流程,后来又把可以公开的部分整理成了工程项目。

R² 0.862冻结测试集
6.62 MPa测试集 RMSE
90.1%90% 目标覆盖率下的经验覆盖率

工程问题

补充胶凝材料(SCM)混凝土能够降低熟料用量,但材料来源、掺量组合和配合比参数会一起影响抗压强度。研究主要回答三个问题:预测是否可靠、模型为什么这样判断、候选方案如何比较。

数据与特征

原研究汇总了 1,456 条 SCM 混凝土圆柱体抗压强度记录。基于原始配合比构建胶凝材料总量、水胶比、骨胶比、砂率、外加剂胶凝比以及不同 SCM 替代率等 8 项工程特征,并对多来源数据执行字段检查、异常检查与统计分析。

数据来自多个第三方文献来源。公开仓库只提供合成数据和可迁移代码,不重新分发原研究合并数据。

统一建模与验证

在统一协议下比较随机森林、XGBoost、LightGBM、SVR 和 MLP,使用重复交叉验证与 Optuna/TPE 搜索评估模型。最终采用的 LightGBM 在冻结测试集上取得 R² 0.8620、RMSE 6.6175 MPa、MAE 4.2178 MPa

这些指标来自原研究的冻结结果。开源仓库使用合成数据,运行结果会不同。

解释与不确定性

使用 SHAP 和二维响应面观察关键材料参数及交互关系;同时构建 KNN-RSCP 自适应区间,在 90% 目标覆盖率下取得 0.9007 的经验覆盖率与 20.2764 MPa 的平均区间宽度。

SHAP 用于说明模型如何使用输入特征,材料因果关系仍需另行验证。保形预测报告的是当前评估设置下的边际覆盖率;不同材料体系和强度区间的覆盖情况可能有差异。

从研究到开源工具

公开仓库将可迁移核心流程重构为 Python 包、命令行工具和中文 Streamlit 应用,包含特征工程、五模型接口、评估、调参、区间预测、Pareto 非支配解识别、TOPSIS 排序、单元测试和 GitHub Actions。

多目标筛选与 Web 应用是研究完成后的工程扩展,用于展示“性能评估—方案初筛—权衡比较”的工作流。页面将这部分与论文实验结果分开呈现,候选方案还要经过试验验证。

使用边界

  • 文献汇总数据训练的模型不能自动推广到新的材料、养护制度和试验标准。
  • 预测与排序用于候选方案初筛;实际应用还要进行试验验证与规范校核。
  • 代码许可证与数据许可证彼此独立,MIT 许可证不授予第三方数据使用权。