損失曲線單調下降,不等於模型學到了可泛化的規律。本文把最佳化拆成求導正確、步幅收斂與泛化成立三道串聯關卡,以二次近似推導學習率的穩定邊界,說明 Hessian 條件數失衡如何在陡峭與平緩方向之間形成幾何陷阱,並以數值求導檢驗把每道門變成可驗證的步驟。