发生了什么
一次 1,063 代的深度运行,在与 案例研究 A 相同的预注册包络下 进化支架方案,由一个快速的在环代理模型驱动。代理模型评出的冠军 方案看起来就是真正的奖品:0.817 kg—— 比传统基准更轻——预测安全系数为 1.586 proxy — advisory。 十二个候选方案被送去做 CalculiX 认证。
真实的扭转安全系数结果为 0.97–1.28,全部低于 1.5 的合格线。 该冠军方案的认证结果为 0.898 kg 与 SF 1.082 CalculiX-certified。没有一个方案交付。
{
"candidate_id": "bracket_g00835_709fb11c95094",
"evidence_tier": "validated_sidecar_calculix_gmsh",
"proxy_predicted": { "mass_kg": 0.817, "safety_factor": 1.586 },
"mass_kg": 0.8980,
"governing_case": "torsion",
"governing_safety_factor": 1.0821,
"passes": false,
"failures": ["governing_safety_factor<1.5"]
} 随后系统对自己的代理模型展开了核查
-
现实残差检测器测得代理模型偏乐观 40.1%
在全部候选方案上,代理模型与 CalculiX 在控制性安全系数上的 配对平均相对误差——12 个中有 12 个都被高估了。 recompute-verified
-
报告的准确度被低估了约 81×
基于代理模型标签训练出的替代模型报告的误差为 0.0056。 其相对真实情况的实际误差为 0.454。原来的准确度关卡衡量的 只是对标签的保真度,从未衡量对真实情况的保真度——因此现在 新增了一个专门计算这一差距的检测器。
-
其置信区间把真实值排除在约 48σ 之外
近乎绝对的信心,却对应一个严重错误的数值。该替代模型的 证据记录如今不能再只写“关卡通过”,而必须同时附上这三个数字。
-
全部 12 次失败都成为了证据
在失败博物馆中形成带上下文标签、附重访优先级的记录—— 作为参考性证据引导未来的搜索远离已知的失效区域,而绝非 黑名单。
这是重点,而不是尴尬
代理模型提出方案,真实求解器做出裁决。关卡守住了,预注册的 主张上限也意味着这个海市蜃楼从一开始就不可能被发布。多数 工程 AI 系统会把那个 0.817 kg 的支架发布出去。 PIE 的架构决定了它不能这样做。
支架战役目前的诚实状态:唯一通过认证的支架 仍然是 g00095(案例研究 A)—— 更重,但能够幸存。代理模型正在按每次运行重新校准, 而不是从旧的几何数据中直接沿用。当一个经认证的减重方案落地时, 它会带着与这次失败同样的证据被公布。
返回证据页 抓住这次失败的架构