Materials Design Report — Sn-Bi-In-Ti 钎料体系:最大化目标 T
Status: complete(预测为候选假设,需实验验证)
1. 数据集审计 (Dataset audit)
数据来源:train.xlsx,27 行 × 5 列,无缺失值,无重复行。单位均为质量分数 wt%。
| 变量 | 角色 | 类型 | 观测范围 | 与 T 的 Pearson 相关 |
|---|---|---|---|---|
| Sn | 可控设计变量 | 连续 (wt%) | 86.8–92.9 | −0.93 |
| Bi | 可控设计变量 | 连续 (wt%) | 1.5–5.5 | +0.82 |
| In | 可控设计变量 | 连续 (wt%) | 2.5–5.5 | +0.49 |
| Ti | 可控设计变量 | 连续 (wt%) | 0.1–0.7 | +0.63 |
| T | 优化目标(最大化) | 连续 | 62.59–113.44 | — |
成分闭合约束:所有 27 行严格满足 Sn + Bi + In + Ti = 98.5(标准差 ~1e-14)。因此 4 个变量线性相关,有效自由度为 3。为避免共线导致的核退化,建模使用 3 个独立变量 (Bi, In, Ti),Sn 由 Sn = 98.5 − Bi − In − Ti 导出。设计空间内每个候选均强制满足闭合约束。
目标方向:最大化 T。当前最优观测值为 T = 113.44(Sn=86.9, Bi=5.5, In=5.5, Ti=0.6)。
目标冲突评估:单目标最大化,无多目标权衡。
2. 模型验证 (Validation)
5 折分层交叉验证(random_state=42),所有学习步骤(标准化、拟合)均在训练折内进行。模型对比(3 自由度特征 Bi, In, Ti):
| 模型 | R² | MAE | RMSE | Spearman |
|---|---|---|---|---|
| ExtraTrees | 0.933 | 3.066 | 3.671 | 0.941 |
| GPR (RBF) | 0.917 | 3.226 | 4.107 | 0.963 |
| RandomForest | 0.903 | 3.399 | 4.436 | 0.944 |
| GradientBoosting | 0.900 | 4.010 | 4.496 | 0.935 |
| Ridge | 0.795 | 5.410 | 6.439 | 0.837 |
| SVR | 0.748 | 4.969 | 7.137 | 0.919 |
模型选择:采用双模型共识策略——ExtraTrees(点预测最优)与 GPR(提供不确定性估计,Spearman 排序最优)并行,最终推荐同时展示两种预测。




局限性:n=27 样本量小;GPR 高 T 区略保守(对最优观测 113.44 附近的预测均值约 109–110),ET 则给出最高 113.4 的预测,模型间存在约 3–4 的分歧,说明最优区域预测不确定性偏大。
3. 搜索空间 (Search space)
来源:在观测范围内生成(用户选择不做外推)。以 (Bi, In, Ti) 为自由网格,Sn 由闭合约束导出,并限制 Sn ∈ [86.8, 92.9]。
- Bi ∈ [1.5, 5.5] 步长 0.5
- In ∈ [2.5, 5.5] 步长 0.1
- Ti ∈ [0.1, 0.7] 步长 0.1
- Sn = 98.5 − Bi − In − Ti,且 Sn ∈ [86.8, 92.9]
原始候选 1805 个,去除训练集中已测成分后 1778 个未测试候选。所有候选满足闭合约束且完全位于观测范围(in-domain)。
候选文件:candidate_space.csv;预测文件:candidates_predictions.csv
4. 推荐 (Recommendations)
采集函数设置:最大化 T;当前最优 y* = 113.44(观测最优);GPR 后验均值 µ 与标准差 σ;EI = (µ−y*)Φ(z)+σφ(z),UCB = µ + 2σ。
| 候选 (Sn, Bi, In, Ti) | T_pred_ET | T_mean_GPR | σ_GPR | EI | UCB | 说明 |
|---|---|---|---|---|---|---|
| 87.0, 5.5, 5.5, 0.5 | 109.7 | 109.9 | 3.4 | 0.25 | 116.6 | 首选:GPR 均值最高且两模型一致(差 0.2) |
| 87.0, 5.5, 5.4, 0.6 | 113.4 | 109.4 | 3.2 | 0.15 | 115.7 | 备选:ET 预测最高,接近观测最优区域 |
| 87.1, 5.5, 5.5, 0.4 | 108.9 | 109.7 | 3.7 | 0.30 | 117.1 | 与首选成分极近(Ti 差 0.1) |
| 87.2, 5.5, 5.5, 0.3 | 108.0 | 109.4 | 4.1 | 0.36 | 117.6 | EI 较高,兼具探索性 |
核心结论:最优区域集中在低 Sn(≈87.0–87.2)、高 Bi(5.5,观测上限)、高 In(5.4–5.5,接近观测上限)、Ti 中等(0.3–0.6)。这与 T 与 Sn 强负相关、与 Bi/In 正相关的趋势一致。预测均值(109–110)低于当前观测最优 113.44,说明在当前观测范围内进一步显著提升 T 的空间有限;候选 87.0/5.5/5.4/0.6 的 ET 预测 113.4 表明该区域接近最优平台。
验证计划(推荐小批量实验)
- 首选验证批次:87.0 / 5.5 / 5.5 / 0.5(两模型共识高、不确定性低)与 87.0 / 5.5 / 5.4 / 0.6(ET 认为最高)
- 每组至少 2 个重复样,报告均值与散布;建议同时重测当前最优 86.9 / 5.5 / 5.5 / 0.6 作为共同基线对照
- 实验完成后,将新数据加入训练集重拟合模型,再进行下一轮优化
- 若允许外推(Sn<86.8 或 Bi>5.5),趋势提示 T 可能继续上升,但需明确获得授权后才能扩展搜索域
5. 可复现性 (Reproducibility)
- Python 3.9 (miniconda);numpy 1.26.4, pandas 2.2.2, scikit-learn 1.5.2, matplotlib 3.7.1
- 随机种子:所有模型 random_state=42;5 折 CV shuffle random_state=42
- 数据:
../../../../train.xlsx(原始文件未修改) - 输出文件:
candidate_space.csv(候选空间)、candidates_predictions.csv(全部预测)、shortlist_*.csv(三视角榜单)、model_comparison.csv(模型对比)
所有预测均为模型外推的候选假设,必须经实验或高保真计算确认后方可视为材料结论。
6. 局限与后续 (Limitations and next steps)
- 样本量仅 27,且目标 T 的测量噪声未知;GPR 白色噪声层 ~0.037(归一化后)说明噪声贡献小,但未验证重复性
- 训练数据中的成分呈网格状分布,高 Bi 高 In 区域样本稀疏(仅 3 个 Sn≈86.8–86.9 的点),模型在该角落的外推可信度较低
- 观测范围搜索下,预测提升幅度(相对 113.44)有限;若实验允许,下一轮建议授权小幅外推(Sn 低至 86.0、Bi 高至 6.0)并补充该角落样本
- 未考虑加工工艺、成本、可靠性等附加约束;若存在,请提供以便加入硬约束