本文へ移動

予測区間:定義、計算、解釈と用途

予測区間は、将来の個々の観測値が指定された確率で収まると見込まれる範囲を示す。予測、回帰、予測的推論で用いられる。

概要

統計学において、予測区間(PI)とは、すでに観測されたデータに基づき、単一の将来観測値または少数の新しい観測値が存在する可能性の高い位置に関する不確実性を表す区間推定である。信頼区間のようにパラメータに関する不確実性を数量化する区間とは異なり、予測区間は結果の不確実性を数量化する。予測、回帰モデリング、および個々の将来値を見通す必要があるあらゆる用途で広く用いられる。

特性と基本的な考え方

予測区間は通常、指定した被覆確率(たとえば95%)について、「確率1−αで下限から上限まで」として示される。概念的には、推定したモデルに関する不確実性(パラメータ不確実性)と、個々の観測値がもつ自然なランダム変動(削減不能なノイズ)という、二つの不確実性の源を組み合わせたものである。観測値の変動性を含むため、同じモデルと水準における予測区間は、一般に信頼区間より広くなる。

計算と一般的な形式

単純なパラメトリック仮定、たとえば独立で正規分布に従う誤差と一定の分散をもつ線形回帰モデルの下では、説明変数x0における予測値ŷの周囲の予測区間は、ŷ ± tα/2, df × spredの形をとる。予測標準誤差spredは、推定された回帰の不確実性と新たな観測値の残差変動の両方を考慮する。このため、標本サイズと、元のデータに対するx0の位置に依存する。モデル仮定が成り立たない場合、実務では残差またはケースを再標本化して将来観測値の標本分布を近似する、ブートストラップ予測区間などのノンパラメトリック手法がしばしば使用される。

仮定と方法

  • 代表的な仮定には、観測値の独立性、モデル仕様の正しさ、等分散性(分散が一定であること)、および古典的な公式では誤差の正規分布がある。
  • 仮定に疑いがある場合は、ロバスト回帰の変種、異分散性を許容する予測バンド、またはブートストラップ法・シミュレーション法によって区間を構成する。
  • 時系列では、予測区間は系列相関を考慮しなければならない。手法にはARIMAの予測区間やシミュレーションに基づく手法がある。

用途、例と重要性

予測区間は、個々の結果に対する予測が重要となる場面で用いられる。例として、翌月の売上高の範囲の推定、臨床場面における一人の患者の反応の予測、気象モデルや経済モデルにおける単一予測の不確実性の報告が挙げられる。予測区間は、意思決定者に実務上の不確実性を伝える。たとえば在庫計画担当者には、平均予測だけでなく、個別需要に対する予測区間が必要となる。

区別とよくある注意点

重要な区別として、信頼区間はパラメータの不確実性(たとえば平均)を対象とするのに対し、予測区間は将来の観測値を対象とする。誤解も多い。95%の予測区間は、あらゆるデータセットについて将来の個々の観測値の95%が必ずその区間に入ることを保証するものではない。同じモデルの下でこの手続きを何度も繰り返した場合に、新しい観測値をおよそ95%の割合で含むことを意味する。元のデータの範囲を大きく超えて予測区間を外挿する際にも注意が必要であり、その場合はモデル誤差やバイアスが支配的になり得る。

さらに技術的な資料や応用例は、一般的な統計学の参考資料およびモデリングの手引きで利用できる(統計学の資料を参照、または予測区間のチュートリアル)。

関連項目

著者

AlegsaOnline.com 予測区間:定義、計算、解釈と用途

URL: https://ja.alegsaonline.com/art/78695

共有