撰稿 / 張鳳吟(科學推展中心執行編輯)
審訂 / 林良靖教授(國立成功大學統計與資料科學學系)
近年來,由於各項技術的發展,短時間區間的資料擷取已變得相當便利,例如每 10 分鐘或每小時收集一次的氣象與污染觀測值。然而,在許多統計分析的實務應用中,研究人員更希望探討更寬廣時間範圍的變數關係,像是「日與日之間」的關聯。象徵性資料分析(symbolic data analysis) 是為解決此種問題所發展出來的延伸統計方法,它不僅提供宏觀的統計推論,同時也能盡可能地保留微觀資料的資訊。其中的常見作法是將這些微觀資料重新整理為區間值資料(interval-valued data)――不同於單一值,區間值資料包含區間內的最大、最小值――再針對這些區間值開發相應的迴歸模型。
2000年,Billard與Diday首次針對區間值資料發展出一套線性迴歸模型,隨後2002年他們考慮「最大-最小法」,將各種標準線性迴歸擬合至區間值資料端點的所有組合;2008年Lima-Neto 與 De Carvalho發展「中心值與範圍法」(center and range method),分別針對區間的中心值與範圍擬合迴歸直線。然而,這兩種方法都碰到一樣的問題:若參數為負值,無法保證預測的區間上界必然大於下界。為此,Lima-Neto 與 De Carvalho限制所有參數皆為正值;González-Rivera與Lin則限制殘差(residuals,觀測值與統計量估計值的差)的分布,以維持上下界的自然順序。
在最新發表於《統計理論與應用期刊》(Journal of Statistical Theory and Applications)的研究中[1],成功大學統計與資料科學學系林良靖教授提出創新的「象徵性區間值迴歸模型」,此模型利用最大、最小的順序統計量(order statistics)將微觀資料重新整理成區間,利用順序統計量的性質,可確保區間上界永遠大於下界,不須額外的限制。除此之外,新的模型不受傳統模型仰賴均勻分布假設的限制,展現其適應性與彈性,並可嚴格推導其漸進結果。
象徵性區間值迴歸模型
考慮 X = { X1, …, Xm }, Y = { Y1, …, Ym } 為觀測區間值資料集,其中Xi = [Xu,i , Xl ,i ]T , Yi = [ Yu,i , Yl ,i ]T,自變數與依變數的上下界 Xu ,i > Xl ,i , Yu ,i > Yl ,i ,i = 1, …, m 。模型假設殘差區間 εi = (εu,i , εl ,i )T 來自 n 個獨立同分佈的常態隨機變數
N (0, σ2 ) 的最大值(εu , i)與最小值(εl , i),因此可建構一個簡單的一元線性模型為:
Yi = β0 + β1Xi + εi , i = 1, …, m
並要求

如此不論 β1 > 0 或 β1 < 0,都能確保 Yu ,i > Yl ,i 的順序。林良靖教授從順序統計量的機率密度函數出發,推導參數
θ = (β 0, β 1, σ 2 )的完整概似函數,進而得到最大概似估計量(maximum likelihood estimators,MLEs)及其費雪訊息矩陣(Fisher information matrix),證明MLEs具有漸進常態性(asymptotic normality)。此外,模型亦可推廣至p個自變數的多元情況,並同樣推導出了對應的MLEs。
檢驗與應用
為了檢驗模型的表現,林良靖教授以偏差(bias)與均方根誤差(RMSE)作為衡量指標,進行蒙地卡羅模擬與現實資料分析。蒙地卡羅模擬以三種情景進行,結果顯示新模型在各種情景的有效性,尤其在資料非同步取樣的情形誤差明顯小於傳統的平均法。現實資料包括:(1)心臟學區間值資料,以收縮壓與舒張壓的區間,預測患者的脈搏率區間。(2)台灣南部PM2.5實測濃度,濃度為每小時取樣,溫度及風速為每10分鐘取樣。結果顯示,與上述其它方法相比,新模型的RMSE皆為最小,而擬合結果也揭露,風速上升會降低 PM2.5濃度,溫度上升則會增加 PM2.5 濃度。
References
Liang-Ching Lin,” Symbolic Interval-Valued Regression Model”. J Stat Theory Appl 25, 26 (2026)