PIE·INDUSTRIAL
案例研究 C · 诚实的失败

那场诚实失败的运行。

求解器运行 · 对照证据核查这些数字

这就是一台不能撒谎的引擎在犯错时的样子。

发生了什么

一次 1,063 代的深度运行,在与 案例研究 A 相同的预注册包络下 进化支架方案,由一个快速的在环代理模型驱动。代理模型评出的冠军 方案看起来就是真正的奖品:0.817 kg—— 比传统基准更轻——预测安全系数为 1.586 proxy — advisory。 十二个候选方案被送去做 CalculiX 认证。

认证结果
0 / 12 passed

真实的扭转安全系数结果为 0.97–1.28,全部低于 1.5 的合格线。 该冠军方案的认证结果为 0.898 kgSF 1.082 CalculiX-certified。没有一个方案交付。

失败候选支架 g00296 失败候选支架 g00552 失败候选支架 g00835,即代理模型的冠军方案
十二个失败候选方案中的三个,由其认证 STL 渲染而成。右图: 代理模型的冠军方案。全部十二个方案现已归档进失败博物馆, 作为未来运行的证据。
冠军候选方案的认证记录 certification.json ✕ FAIL
{
  "candidate_id": "bracket_g00835_709fb11c95094",
  "evidence_tier": "validated_sidecar_calculix_gmsh",
  "proxy_predicted": { "mass_kg": 0.817, "safety_factor": 1.586 },
  "mass_kg": 0.8980,
  "governing_case": "torsion",
  "governing_safety_factor": 1.0821,
  "passes": false,
  "failures": ["governing_safety_factor<1.5"]
}
ledger record edd966f3… · failure museum record · proxy prediction shown for contrast, advisory tier

随后系统对自己的代理模型展开了核查

  1. 现实残差检测器测得代理模型偏乐观 40.1%

    在全部候选方案上,代理模型与 CalculiX 在控制性安全系数上的 配对平均相对误差——12 个中有 12 个都被高估了。 recompute-verified

  2. 报告的准确度被低估了约 81×

    基于代理模型标签训练出的替代模型报告的误差为 0.0056。 其相对真实情况的实际误差为 0.454。原来的准确度关卡衡量的 只是对标签的保真度,从未衡量对真实情况的保真度——因此现在 新增了一个专门计算这一差距的检测器。

  3. 其置信区间把真实值排除在约 48σ 之外

    近乎绝对的信心,却对应一个严重错误的数值。该替代模型的 证据记录如今不能再只写“关卡通过”,而必须同时附上这三个数字。

  4. 全部 12 次失败都成为了证据

    在失败博物馆中形成带上下文标签、附重访优先级的记录—— 作为参考性证据引导未来的搜索远离已知的失效区域,而绝非 黑名单。

这是重点,而不是尴尬

代理模型提出方案,真实求解器做出裁决。关卡守住了,预注册的 主张上限也意味着这个海市蜃楼从一开始就不可能被发布。多数 工程 AI 系统会把那个 0.817 kg 的支架发布出去。 PIE 的架构决定了它不能这样做。

支架战役目前的诚实状态:唯一通过认证的支架 仍然是 g00095(案例研究 A)—— 更重,但能够幸存。代理模型正在按每次运行重新校准, 而不是从旧的几何数据中直接沿用。当一个经认证的减重方案落地时, 它会带着与这次失败同样的证据被公布。

返回证据页 抓住这次失败的架构