創新的「象徵性區間值迴歸模型」 解決區間上下界交錯難題

發表者 SPEC科學推展中心

21 觀看次數

撰稿 / 張鳳吟(科學推展中心執行編輯)

審訂 / 林良靖教授(國立成功大學統計與資料科學學系)


  近年來,由於各項技術的發展,短時間區間的資料擷取已變得相當便利,例如每 10 分鐘或每小時收集一次的氣象與污染觀測值。然而,在許多統計分析的實務應用中,研究人員更希望探討更寬廣時間範圍的變數關係,像是「日與日之間」的關聯。象徵性資料分析(symbolic data analysis) 是為解決此種問題所發展出來的延伸統計方法,它不僅提供宏觀的統計推論,同時也能盡可能地保留微觀資料的資訊。其中的常見作法是將這些微觀資料重新整理為區間值資料(interval-valued data)――不同於單一值,區間值資料包含區間內的最大、最小值――再針對這些區間值開發相應的迴歸模型。
  2000年,Billard與Diday首次針對區間值資料發展出一套線性迴歸模型,隨後2002年他們考慮「最大-最小法」,將各種標準線性迴歸擬合至區間值資料端點的所有組合;2008年Lima-Neto 與 De Carvalho發展「中心值與範圍法」(center and range method),分別針對區間的中心值與範圍擬合迴歸直線。然而,這兩種方法都碰到一樣的問題:若參數為負值,無法保證預測的區間上界必然大於下界。為此,Lima-Neto 與 De Carvalho限制所有參數皆為正值;González-Rivera與Lin則限制殘差(residuals,觀測值與統計量估計值的差)的分布,以維持上下界的自然順序。
  在最新發表於《統計理論與應用期刊》(Journal of Statistical Theory and Applications)的研究中[1],成功大學統計與資料科學學系林良靖教授提出創新的「象徵性區間值迴歸模型」,此模型利用最大、最小的順序統計量(order statistics)將微觀資料重新整理成區間,利用順序統計量的性質,可確保區間上界永遠大於下界,不須額外的限制。除此之外,新的模型不受傳統模型仰賴均勻分布假設的限制,展現其適應性與彈性,並可嚴格推導其漸進結果。

 

象徵性區間值迴歸模型
  考慮 X = { X1, …, Xm }, Y = { Y1, …, Ym } 為觀測區間值資料集,其中Xi = [Xu,, X,i ], Yi = [ Yu,, Y,i ]T,自變數與依變數的上下界 X,i > X,, Y,i > Y,i = 1, …, m 。模型假設殘差區間 εi = (εu,, ε,i )T 來自 n 個獨立同分佈的常態隨機變數
(0, σ2 ) 的最大值(ε, i)與最小值(ε, i),因此可建構一個簡單的一元線性模型為:
Yi = β+ β1X+ ε,       = 1, …, m
並要求


如此不論 β> 0 或 β< 0,都能確保 Y,i > Y, 的順序。林良靖教授從順序統計量的機率密度函數出發,推導參數
θ = (β 0, β 1, σ 2 )的完整概似函數,進而得到最大概似估計量(maximum likelihood estimators,MLEs)及其費雪訊息矩陣(Fisher information matrix),證明MLEs具有漸進常態性(asymptotic normality)。此外,模型亦可推廣至p個自變數的多元情況,並同樣推導出了對應的MLEs。
檢驗與應用
  為了檢驗模型的表現,林良靖教授以偏差(bias)與均方根誤差(RMSE)作為衡量指標,進行蒙地卡羅模擬與現實資料分析。蒙地卡羅模擬以三種情景進行,結果顯示新模型在各種情景的有效性,尤其在資料非同步取樣的情形誤差明顯小於傳統的平均法。現實資料包括:(1)心臟學區間值資料,以收縮壓與舒張壓的區間,預測患者的脈搏率區間。(2)台灣南部PM2.5實測濃度,濃度為每小時取樣,溫度及風速為每10分鐘取樣。結果顯示,與上述其它方法相比,新模型的RMSE皆為最小,而擬合結果也揭露,風速上升會降低 PM2.5濃度,溫度上升則會增加 PM2.5 濃度。

 

References
Liang-Ching Lin,” Symbolic Interval-Valued Regression Model”. J Stat Theory Appl 25, 26 (2026)

 

留言迴響
我要留言