封閉測試集上的標量分數與整條價值鏈的端到端效用之間,隔著一道無法單射還原的降維投影。本文從 Epic 敗血症模型外部驗證的 AUC 崩塌回推極值順序統計量與 Best-of-K 挑選膨脹,推導多重檢定下的偽發現機制,並以 Benjamini-Hochberg 校正與脫站點盲測建立可反駁的效用宣稱防線。
從超大候選池中挑出最佳模型,這個動作本身就是一次高強度的擬合。本文推導候選規模如何把抽樣噪聲的高端極值膨脹成看似真實的能力增益,拆解同一批資料兼任參數擬合、候選挑選與能力證明時的角色衝突,並以事前資料隔離與假發現率控制建立可落地的估計折價規範。