本文へ移動

ランダムフォレスト:分類・回帰のためのアンサンブル決定木アルゴリズム

ランダムフォレスト・アルゴリズムの概要。分類と回帰に用いる決定木のアンサンブル、木の構築と集約、OOB誤差、変数重要度、実用上の留意点を解説する。

ランダムフォレストは、機械学習において分類および回帰の課題に広く用いられる、統計的なアンサンブルアルゴリズムである。複数の決定木を構築し、その出力を組み合わせて単一の予測を得る。これにより、個々の木と比べて分散を低減し、多くの場合で精度を向上させる。

基本的な考え方

学習時には、元のデータから異なる標本を用いて多数の木を成長させる。各木では、利用可能な変数のランダムな部分集合から分割に使用する変数を選べるため、木の多様性が確保される。新しい事例に対しては、各木が予測を出し、フォレスト全体でそれらを集約する。分類では多数決、回帰では平均を用い、新たなデータ点にラベルまたは値を割り当てる。

画像ギャラリー

1 画像

構築方法

  1. 学習集合からブートストラップ標本、すなわち復元抽出によるランダム標本を取得する。
  2. この標本上で決定木を成長させる。各分割では、すべての予測変数ではなく、ランダムに選んだ予測変数の部分集合の中から最良の分割を選択する。
  3. 手順1と2を繰り返し、数十本から数千本に及ぶ多数の木を作成する。
  4. 木の予測を集約する。分類には多数決を、回帰には予測値の平均を使用する。

代表的な特徴と診断指標

  • 袋外(OOB)誤差:各木はブートストラップ標本で学習されるため、その標本に含まれなかった観測値を検証集合として使用できる。これにより、別個のホールドアウト集合なしに予測誤差を推定できる。
  • 変数重要度:フォレストから得られる指標により、どの予測変数が予測性能に最も寄与しているかを示せる。
  • 分割時の特徴量サブサンプリングにより、高次元の入力や、多数の相関した特徴量も比較的適切に扱える。
  • 多くの実装では、欠損値、およびカテゴリ型と数値型が混在するデータ型に対応できる。

利点

  • 木をまたいだ平均化により、多くの実際的な問題で過学習に対して頑健である。
  • 大規模な特徴量設計を行わなくても、多数の予測変数や複雑な相互作用に有効に機能する。
  • 誤差と変数重要度の内部推定値を提供するため、モデル評価を簡素化できる。

限界と注意点

  • 単一の決定木より解釈しにくく、アンサンブルは単純な大域的モデルを提供しない。
  • クラスが著しく不均衡な場合には偏りが生じることがある。リサンプリングやクラス重み付けなど、特別な配慮が必要となる場合がある。
  • フォレストが非常に大きい場合、またはデータが巨大な場合には、多くのメモリと計算時間を要する可能性がある。
  • 回帰問題では、学習データの範囲を超えた外挿には適していない。

応用

ランダムフォレストは、バイオインフォマティクス、リモートセンシング、金融など、信頼できる予測性能と多数の入力変数の処理が重要となる幅広い分野で利用される。精度と使いやすさの均衡が求められる場合の、標準的ですぐに利用できる手法である。

実務上の注記

  • 主な調整項目には、木の本数、各分割で考慮する変数の数、木の深さがある。
  • 多くのソフトウェアパッケージは効率的な実装と診断機能を提供している。利用者は、モデリング上の判断を導くために、OOB誤差と変数重要度を監視すべきである。
  • ランダムフォレストは既定の設定でも良好に機能することが多いが、交差検証または別のテスト集合によるモデル検証は依然として推奨される。

関連項目

著者

AlegsaOnline.com ランダムフォレスト:分類・回帰のためのアンサンブル決定木アルゴリズム

URL: https://ja.alegsaonline.com/art/81114

共有