例題一覧に戻る
重回帰分析多重共線性VIF分散拡大係数ダミー変数ダミー変数の罠

重回帰分析の診断(多重共線性・VIFの算出とダミー変数の設定)

作成者: kuma / bearworks.uk公開日: 2026-09-05内容更新日: 2026-09-05

問題文

ある不動産アナリストがマンションの家賃 y を予測するため、複数の説明変数を用いた重回帰分析を検討している。 (1) 説明変数として「最寄り駅からの徒歩分数 X_1」と「主要ターミナル駅までの乗車時間 X_2」をモデルに投入したところ、両変数間の相関係数が r = 0.80 と高かった。このとき、X_1 を X_2 に単回帰した際の決定係数は R_1^2 = r^2 = 0.64 である。多重共線性の診断指標である分散拡大係数(VIF: Variance Inflation Factor)を算出しなさい(小数第2位まで)。また、無相関(VIF=1)の場合と比較して偏回帰係数の推定値の標準誤差が約何倍に拡大するか求めなさい(√2.78 ≒ 1.67 とする)。 (2) さらに立地条件を表す質的変数「エリア区分」(都心部、準都心部、郊外 の3カテゴリー)を重回帰モデルに説明変数として導入したい。定数項(切片)を含む回帰モデルを構築する場合、多重共線性の発生(ダミー変数の罠)を避けるために投入すべき独立なダミー変数の個数と、その設定方法について最も適切な説明を選びなさい。

与えられた条件

項目値
2つの説明変数間の相関係数 (r)0.80
決定係数 (R_1²)0.64 (0.80²)
VIF の平方根 (√2.78)1.67
質的変数のカテゴリー数 (k)3(都心部、準都心部、郊外)

解答・途中計算

1

分散拡大係数(VIF)の算出

VIF = 1 / (1 - R_1^2) = 1 / (1 - 0.64) = 1 / 0.36 = 100 / 36 = 25 / 9 ≒ 2.78

VIFは他の説明変数との相関によって偏回帰係数の分散が何倍に拡大するかを示す指標です。決定係数が 0.64 のとき、VIF ≒ 2.78 となります。一般にVIFが10以上(研究分野によっては5以上)で深刻な多重共線性があると判断されます。

2

偏回帰係数の標準誤差への影響の評価

標準誤差の拡大倍率 = √VIF = √2.78 ≒ 1.67 倍

偏回帰係数の標準誤差は √VIF に比例して増大します。2変数間の相関が 0.80 あることにより、推定量の標準誤差は無相関の場合に比べて約1.67倍に膨らみ、t値が小さくなって真に効果がある変数が統計的有意となりにくくなります。

3

ダミー変数の設定と「ダミー変数の罠」の回避

必要なダミー変数数 = k - 1 = 3 - 1 = 2 個

カテゴリー数が k の質的変数を定数項のある回帰モデルに投入する場合、独立なダミー変数は k - 1 個設定します。例えば「郊外」を参照カテゴリー(基準)とし、D_1(都心なら1、他は0)および D_2(準都心なら1、他は0)の2つを投入します。仮に3つすべてのダミー変数を定数項とともに投入すると、D_1 + D_2 + D_3 = 1(定数項)という完全な線形従属(完全多重共線性)が生じ、推計パラメータが一意に定まらなくなります。これを「ダミー変数の罠(Dummy Variable Trap)」と呼びます。

最終結論

結論

(1) 分散拡大係数は VIF ≒ 2.78 であり、標準誤差は約1.67倍に拡大する。(2) 定数項を含むモデルでは「ダミー変数の罠」を回避するためカテゴリー数より1つ少ない k - 1 = 2個のダミー変数を投入し、残る1つ(例:郊外)を参照カテゴリーとして係数を相対的に解釈する設計が最も適切である。

誤答しやすい考え方

典型的な誤り:VIF = 5.00 (相関係数 r = 0.80 を用いて 1 / (1 - 0.80) と計算する誤り)

理由・解説:分母で 1 - R²(決定係数)ではなく 1 - r(相関係数)を直接差し引いてしまう典型的な計算ミスです。

典型的な誤り:ダミー変数は3カテゴリー全てに対応して3個投入し、定数項もそのまま含めるのが最も適切である

理由・解説:3個すべてのダミー変数と定数項を同時に投入すると、ダミーの和が常に1となって定数項と完全な線形関係が生じる『ダミー変数の罠』に陥り、通常の最小二乗法では逆行列が存在せず回帰係数が推定不能になります。

典型的な誤り:VIF = 2.78 であるため、直ちに多重共線性が極めて深刻であり変数を必ず削除しなければならない

理由・解説:一般的に多重共線性が危険視される目安は VIF > 10(または厳格な基準で VIF > 5)であり、VIF ≒ 2.78 は注意は要するものの直ちに変数を削除すべき水準ではありません。

参照資料

この概念をアプリで練習する

統計検定2級の演習・復習アプリ機能です。実際に手を動かして理解を深めましょう。

本サイトの例題はすべて架空のデータを元に独自に作成されたものです。出題意図や難易度調整の基準については問題作成方針をご確認ください。

問題作成方針を見る

制作・検証情報

執筆・構成
kuma / bearworks.uk(問題設計・テーマ指定)
検算・内容確認
Antigravity(問題作成・独立検算・実装確認)、Codex(学術レビュー・実装監査【合格】)
最終公開確認
kuma / bearworks.uk

AIを使用した工程

第5バッチ(問26〜30)は公式参考書・問題集の未出題重要論点(2つの母比率の差の検定、指数分布、時系列分析、二元配置分散分析、重回帰診断とダミー変数)に基づき、Antigravityが問題・与件・解説・誤答分析を独自に設計・作成し、PythonとSciPyで独立検算しました。Codexが統計学・表記・出典の整合性を読み取り専用で監査・レビューし、指摘事項の反映を確認しました。

人が確認した工程

運営者が公式テキスト・問題集に基づく未出題5問の構成案を承認し、独立検算・Codexレビュー【合格】・Linux CI合格を踏まえて、最終公開内容を承認しました。専門家による第三者査読ではありません。

更新・訂正履歴

  • 初版第5バッチ5問をAntigravityが独自設計・実装・SciPy検算し、Codex監査レビュー【合格】を経て運営者が公開内容を承認しました。

内容の誤りや再検証のご連絡は、お問い合わせページから受け付けています。

誤りを報告する