統計検定準1級 線形モデル 要点まとめノート【第16〜21章】
この記事の役割
線形モデル(第16〜21章)の復習ノートです。連載の各回が「なぜそうなるのか」を実験しながら追う記事なのに対し、こちらは押さえるべきことだけを1ページに集めたものです。詳しい導出や検算は各回へのリンクから読んでください。
- 同じ形式のノート:確率の土台編(第1〜7章)・推測統計編(第8〜13章)・確率過程編(第14〜15章)・多変量解析編(第22〜26章)・発展編(第27〜32章)
- 連載全体の目次は 統計検定準1級 独学記事インデックス にあります。
- 使い方:試験前は「つまずきやすいところ」の表だけを見返すのが効率的です。
- 筆者は統計の専門家ではありません。試験対策として使う場合は必ず公式テキストで確認してください。
この範囲の全体像
推測統計編は「1つか2つの変数で、母集団のパラメータを当てる」話でした。ここからは変数が増えます。そして6つの章はばらばらの手法集ではなく、全部が同じ1本の式の変形でした。
| 章 | 何を変えたか | 出てくる道具 |
|---|---|---|
| 16 | に列を増やした | 偏回帰係数・VIF・射影 |
| 17 | 仮定が崩れたときを調べた | てこ比・クック距離・ロバストSE |
| 18 | を0/1やカウントに変えた | ロジット・IRLS・GLM |
| 19 | が打ち切られた/ を縮めた | ハザード・部分尤度・Lasso |
| 20 | をダミーだけにした | 平方和分解・F検定・直交表 |
| 21 | データの取り方を設計した | 層別・ネイマン配分・設計効果 |
第16〜17章は同じ行列を表と裏から見ています。 ハット行列 が、第16章では「射影=当てはめ」の道具として出て、第17章では対角成分 が「てこ比=その点の発言力」として出てきます。同じものです。
第18章で「線形」の意味が分かります。 ロジスティック回帰はグラフがS字カーブなのに線形モデルと呼ばれる。理由は線形とは について1次という意味で、グラフの形の話ではないからです。ここが分かると の の部分(線形予測子)だけが共通の骨格で、リンク関数と分布を差し替えているだけだと見えます。
第20章は第16章の特殊ケースそのものです。 分散分析はダミー変数だけの重回帰で、F値が小数第6位まで一致しました(8.223350)。「分散分析と回帰は別の手法」ではありません。
第21章だけ向きが逆です。 第16〜20章が「手元のデータをどう解釈するか」なのに対し、第21章は「データを取る前に何ができるか」。 を増やさずに設計で精度を上げる話です。
そしてこの編を通して繰り返し出てくるのが多重比較の構造でした。無意味な変数100本で5.55本が偽陽性(第16章)、クック距離の で なら誤検出100%(第17章)、3群でt検定を繰り返すと誤り率が約12%(第20章)。同じデータで判定を何度もくり返すと報告する不確実性が嘘になる、という同一の現象です。
章と回の対応
| 章 | 章タイトル | 対応する回 |
|---|---|---|
| 第16章 | 重回帰分析 | 第16回 |
| 第17章 | 回帰診断法 | 第17回 |
| 第18章 | 質的回帰 | 第18回 |
| 第19章 | 回帰分析その他 | 第19回 |
| 第20章 | 分散分析と実験計画法 | 第20回 |
| 第21章 | 標本調査法 | 第21回 |
用語集
言葉で説明できるかを先に確認する用です。
第16章 重回帰分析
| 用語 | 記号 | 意味 |
|---|---|---|
| 偏回帰係数(partial regression coefficient) | 他の変数の影響を除いた効果。「偏」は偏微分の偏と同じ発想 | |
| 多重共線性(multicollinearity) | — | 説明変数どうしが強く相関している状態 |
| 分散拡大係数(VIF, Variance Inflation Factor) | 他の説明変数との重複度。。 を一切使わない | |
| ハット行列(hat matrix) | 。 に帽子をかぶせる行列。対称・冪等 | |
| 交絡(confounding) | — | 第三の変数が説明変数と被説明変数の両方に矢を出す構造 |
| 合流点(collider) | — | 両方から矢が刺さる先。条件付けると無かった相関が生まれる |
| 最良線形不偏推定量(BLUE) | — | ガウス・マルコフの定理が保証する OLS の地位。正規性は不要 |
| 調整済み決定係数 | 。「 が小さくなったか」を見ている |
第17章 回帰診断法
| 用語 | 記号 | 意味 |
|---|---|---|
| てこ比(leverage) | 説明変数の空間で中心からどれだけ離れているか。 を見ずに計算できる | |
| 外れ値(outlier) | — | の方向にズレている観測。てこ比とは別概念 |
| 影響力(influence) | — | 実際に結果をどれだけ動かしたか。外れ値とてこ比の掛け算 |
| クック距離(Cook's distance) | その1点を抜いたら予測値全体がどれだけ動くか | |
| 不均一分散(heteroscedasticity) | — | 誤差の分散が観測ごとに違う状態。反対語は等分散 |
| スチューデント化残差(外部・削除残差) | 点 を抜いた で割る。 に従う | |
| マスキング(自己隠蔽) | — | 外れ値が自分で を膨らませて平凡に見せる現象 |
| ダービン・ワトソン比(Durbin-Watson) | 誤差の1次自己相関の指標。範囲0〜4、 |
第18章 質的回帰
| 用語 | 記号 | 意味 |
|---|---|---|
| オッズ(odds) | 起こる確率と起こらない確率の比 | |
| ロジット(logit=logistic unit) | オッズの対数。 を に伸ばす | |
| オッズ比(odds ratio) | 。確率比とは別物で、両群とも稀なときだけ近い | |
| 反復重み付け最小二乗法(IRLS) | — | 重み付き最小二乗を繰り返して最尤解に到達する手順 |
| 一般化線形モデル(GLM) | — | 線形予測子+リンク関数+分布の3点セットの枠組み |
| 線形予測子 | GLM で共通の骨格。「線形」は について1次の意味 | |
| オフセット項 | 係数を1に固定した項。カウントを率に直す | |
| 過分散(overdispersion) | 分散が平均を超える状態。放置すると偽陽性が増える | |
| 限界効果(marginal effect) | を1単位動かしたときの確率の変化。場所で変わる |
第19章 回帰分析その他
| 用語 | 記号 | 意味 |
|---|---|---|
| 打ち切り(censoring) | — | 「」という不等式の情報を持つ観測。欠測とは違う |
| 生存関数 | 時刻 を超えて生き残る確率 | |
| ハザード(hazard) | 生き残った人の中での瞬間的な発生率。確率ではなく率(1を超える) | |
| カプラン=マイヤー推定量 | 階段状の生存関数の推定。非パラメトリック最尤解 | |
| ログランク検定 | — | 2群の生存曲線の差の検定 |
| 比例ハザードモデル(Cox) | ベースラインハザードを推定せずに係数だけ出す | |
| 部分尤度(partial likelihood) | — | 「いつ」を諦めて「誰に起きたか」だけを使う。 が比で消える |
| リッジ回帰 | 係数の2乗和で罰則。縮むがゼロにはならない | |
| Lasso | 絶対値で罰則。角に当たると係数がゼロになる(変数選択) |
第20章 分散分析と実験計画法
| 用語 | 記号 | 意味 |
|---|---|---|
| 平方和(sum of squares) | (全体=群間+群内)に分解する | |
| 平均平方(mean square) | 平方和を自由度で割った値。 が の推定 | |
| 族全体の誤り率(FWER, Family-Wise Error Rate) | — | 複数の比較で1つでも誤る確率 |
| 偽発見率(FDR, False Discovery Rate) | — | 有意と言った中の誤りの割合。BH法が守る |
| イータ2乗 | 。一元配置なら回帰の と同じ量 | |
| 交互作用 | セル平均から行・列・総平均で説明できる分を引いた残り | |
| 乱塊法(局所管理) | — | 邪魔なばらつきをブロックとして取り出す。実験前に決める |
| 擬似反復(pseudo-replication) | — | 測り直しだけ。名目上の誤差自由度だけが水増しされp値が不当に小さくなる |
| 直交表 | 少ない回数で複数要因を混ざらずに測る組合せ。添字は行数 |
第21章 標本調査法
| 用語 | 記号 | 意味 |
|---|---|---|
| 層(stratum) | すべてから標本を取る集団。中が均質なのが理想 | |
| クラスター(cluster, 集落) | 選ばれたものだけから取る集団。中が縮図なのが理想 | |
| 設計効果(deff, design effect) | — | 単純無作為に比べて分散が何倍になるか |
| 有効標本サイズ | 「400人に聞いたが情報量は83人分」の83 | |
| クラスター内相関係数(ICC) | 同じ集落の2人の相関係数そのもの | |
| 有限母集団修正 | 非復元抽出だから付く係数。抽出率 で決まる | |
| ネイマン配分 | 大きさ×ばらつきに比例。1社追加の効きを揃える | |
| 比推定 | 「1あたりの量」を掛け戻す。切片を0に固定した回帰推定 | |
| MCAR / MAR / MNAR | — | 回答率が一律/層内でランダム/層内でも差が残る |
記号の注意: が「パラメータの数」と「p値」の2つで使われます。この連載ではパラメータ数を 、有意確率を「p値」と書き分けています。また は第17章では誤差の自己相関、第21章では ICC を指します。
第16章 重回帰分析
「他の変数を固定したとき」の正体は残差
偏回帰係数は、その変数を他の説明変数で回帰した残差と の単回帰の傾きに一致します(フリッシュ=ウォー=ローヴェルの定理)。実測で残差回帰の傾きが 、行列で解いた該当成分も で差は でした。
固定には代償があります。文字数の平方和が 364.5106 から 57.6248 へ、比 0.158088()に減る。標準誤差はその逆数の平方根で 倍になります。
変数を入れるかどうかは3種類で判断が違う
同じ「 と相関している第三の変数 」でも、構造次第で答えが正反対でした(各4,000回、、真値は交絡 ・媒介 ・合流点 )。
| 構造 | なし | あり | 判断 |
|---|---|---|---|
| 交絡因子 | 入れる | ||
| 媒介変数 | 問いで決める(総効果なら入れない) | ||
| 合流点 | 入れない |
合流点は独立に生成した気温とアイス売上(相関 、p値 0.695)に熱中症患者数を入れると、気温の係数が 、p値が計算上ゼロと表示される水準まで化けました。関係しそうな変数を全部入れるのは安全ではありません。
標準誤差は4つの要素に分解できる
残差の大きさ 、その変数の散らばり 、データ数 、そして他の変数との重複 。 の仮定は等分散・無相関・ 固定の3つだけで、正規性は不要です(正規性が必要なのはt分布・p値・信頼区間のほう)。
4000回の実測sd 4.6353 に対し、1回のデータからの公式SE 4.6920(比 0.9879)で一致しました。 の法則も両対数の傾き で確認できます。
VIF は「捨てた情報の量」ではなく「重複の量」
で、 を一切使いません。同じ「文字数」の列でも、一緒に入れる変数次第で 1.0046 から 6.3256 まで変わります。
VIF が高いだけで変数を消すのは危険です。 消すとSEは 4.69 → 4.64 と改善するのに、係数が と符号ごと逆転しました。RMSE で比べると 4.680 対 105.110 で、残したほうが圧勝です。消してよいのは同じ情報の重複(千字版と字版など)だけで、これは情報が失われないので副作用がありません。
多重共線性で情報が消えるわけではありません。 のとき個々の係数のsdは 5.166 まで暴れますが、2つの合計のsdは 0.214( のときの 0.294 よりむしろ小さい)。分解できないだけです。
決定係数は乱数でも上がる
で乱数113本を入れると に達しますが、 は 35.62 から 79.51 になりました(真の )。ただしこれは残差自由度が1しかない極端にばらつく1標本で、500回試すと は真値付近のまま不偏( の中央値 21.7)。 が確実に悪化するのではなく、当てにならなくなるのが実害です。調整済み が上がる境界は ちょうどで、有意の境界(約1.98)より甘い。乱数でも は約30%起きます。
F と t が食い違う
相関0.99の3変数(真の係数は全部 )では、個別のt検定が3本とも非有意(p値 0.7636/0.0751/0.8120)なのに で全体は有意(p値 台)でした。合計 を1本の変数にすると 、p値 。「どれか要る」は分かるが「どれが要る」は分からない状態です。
→ 第16回。
第17章 回帰診断法
傾きは の加重和で、重みは だけで決まる
重み は を見る前に確定しています。 の点の重みは で、1票も持っていません。端から2番目 0.03000 対 中央から2番目 0.01000 でちょうど3倍。最小二乗法が平等なのは残差の扱いだけで、係数への寄与は最初から不平等です。
外れ値・てこ比・影響力は別の概念
てこ比は「自分の予測値を自分でどれだけ決めているか」の割合で、 を見ずに計算できます。2×2で整理すると()、
| てこ比が低い | てこ比が高い | |
|---|---|---|
| がズレていない | 何も起きない(傾き変化 ) | 何も起きない( 0.560 でも 0.000) |
| がズレている | 切片だけ動く(、傾きは不動) | 傾きが半減(1.123→0.585、 9.681) |
クック距離が掛け算になっているのがこの表の理由です。
は非線形で、 で 1.000、0.9 で 9.000、0.99 で 99.000。てこ比が高い領域で急激に効きます。
生の残差は使えない
てこ比が高い点は残差が小さく出ます。 の点の残差は 0.030 しかなく、 倍の補正が必要でした。
標準化(内部)残差にも上限があります。 なので、・ では 3.162 を絶対に超えません(6万回まわして最大 3.0723)。「 なら外れ値」という判定はここで破綻します。
マスキングが理由です。外れ値が自分で を 0.925 → 2.768 と3倍に膨らませ、内部残差は 4.005 で飽和する。点 を抜いた で割る外部(スチューデント化)残差なら 11.792 まで伸び、ちょうど に従うので検定できます。
不均一分散が壊すのはSEだけ
推定値は不偏のままです( の設定で OLS 1.500377、真値1.5)。壊れるのはSEで、名目95%の被覆率が 93.74%、棄却率が 6.55% になりました。HC3 ロバストSEなら 95.30%/5.00% に戻ります。
「必ず過小評価」ではありません。 向きはてこ比との相関で決まります。
| 分散の形 | 報告SE ÷ 本当のSD |
|---|---|
| (右で大) | 0.918(過小) |
| (左で大) | 0.712(過小) |
| 中央で大・端で小 | 2.262(過大) |
重み が(比だけでも)分かるなら WLS が有効で、分散が 55.5% 減りました(SD 0.0926 → 0.0618)。
クック距離の は閾値ではない
正常なデータでも誤検出します(、各3000回)。
| 超が1点以上 | |||
|---|---|---|---|
| 15 | 0.267 | 81.3% | 9.6% |
| 50 | 0.080 | 98.3% | 0.1% |
| 200 | 0.020 | 100.0% | 0.0% |
原因は の分布が縮まないことではありません。 で同じ速さで縮み、 は常に平均の約4倍=上位5〜9%の線です。本当の原因は判定を 回くり返す多重比較で、 なら平均10.71個が引っかかります。第16章の「無意味な変数100本で5.55本が偽陽性」とまったく同じ構造です。
逆に は見逃します。重心にある外れ値は を6ずらしても検出率 0%( なら 99.6%)。 との併用が必要です。
外れ値を削除すると被覆率が下がる
誤差が 、、真のモデルは正常という設定で、
| 手順 | 被覆率 | 区間幅 |
|---|---|---|
| 削除しない | 95.73% | 0.3972 |
| を1回削除 | 91.07% | 0.2863 |
| 繰り返し削除 | 80.55% | — |
点推定のRMSEだけは改善します(0.10190 → 0.08423、Huber なら 0.08000)。第16章の「有意でない変数を消すと偽陽性が生まれる」と同じ構造で、同じデータで選抜と推定を繰り返すと報告される不確実性が嘘になります。
なお Huber も 方向しか守りません。汚染点が まで離れると OLS 0.740 対 Huber 0.735 で同じく壊れます。
DW が小さくても自己相関とは限らない
誤差を完全に独立に生成した曲線データで が出ました。 を入れたら 2.092 に戻ります。まず線形性を疑うべきです。
自己相関の害も向きが変わります。 で が単調増加なら報告SE÷本当のSD が 0.412(過小)、 が 0,1,0,1,… と交替すると 2.216(過大)。
→ 第17回。
第18章 質的回帰
「線形」はグラフの形ではない
この章の最大の収穫がこれでした。ロジスティック回帰のグラフはS字カーブなのに線形モデルと呼ばれます。理由は、
線形とは について1次という意味。
について1次である必要はありません。 の右辺が の1次式なので線形モデルです。判定法は「設計行列 を作れるか」。 や を入れても線形モデルのままで、 や が出たら非線形になります。
0/1 を OLS で当てはめると4通りに壊れる
実データ()で となり、予測範囲が 〜、1を超えるものが21件(5.2%)、負が16件(4.0%)。ほかに等分散が成り立たない(残差分散が予測値の4分割で 0.0595/0.1025/0.2389/0.1207)、残差が2値になる、効果が一定に強制される、という問題が並びます。
重いのは効率と「効果一定の強制」で、正規性の破れは頑健標準誤差を使えば漸近推論は成立します。
オッズ比は確率比ではない
近いのは両群とも稀なときだけ。 でも なら です。
限界効果も場所で全く違います。同じ「1分の増加」が 2分で 、4分で 、6分で 、8分で 、14分で 。2〜8分で7.3倍、14分までで1291倍の差でした。 の位置(分)で変化が最大 0.219/分 になります。
解析解がないので IRLS で解く
重み付き最小二乗を繰り返すと収束します。実測の収束履歴は 1.9→1.1→0.51→0.085→0.0019→→ で7回。深層学習の交差エントロピーは そのもので、勾配降下1万回と IRLS 7回が同じ値 0.38695101 に到達しました。
完全分離とワルド検定の破綻
完全に分離できるデータでは最尤推定量が存在しません。30回目の反復で 、SE=777292、、p値 0.9999。効果が強すぎるのに「有意でない」と出る(Hauck-Donner 効果)ので、こういうときは尤度比検定を使います( の比は で 0.989、3.0 で 0.373 と連続的に乖離)。
GLM の3点セット
| モデル | 分布 | リンク関数 | 使う場面 |
|---|---|---|---|
| 線形回帰 | 正規 | 恒等 | 連続値 |
| ロジスティック回帰 | 二項 | ロジット | 0/1 |
| ポアソン回帰 | ポアソン | 対数 | カウント |
| プロビット回帰 | 二項 | プロビット | 0/1 |
カウントを率に直すにはオフセット項(係数を1に固定した )を入れます。実測では率比 1.4707 が単純集計と一致し、オフセットなしだと 1.4047 とずれました。
過分散はピアソン統計量で判定します( が 0.964 対 3.476)。放置すると偽陽性が 0.0440 → 0.2600 に増え、準ポアソンで 0.0447 に戻りました。素の分散÷平均で判定してはいけません(ポアソンでも 2.54 が出る)。
→ 第18回。
第19章 回帰分析その他(生存時間解析・正則化)
打ち切りは欠測ではない
ここが出発点でした。「6ヶ月時点でまだ解約していない」というデータは、何も分からないのではなく「 という不等式の情報」を持っています。扱いを3通りで比べると(真値12ヶ月)、
| 扱い | 推定値 | 誤差 |
|---|---|---|
| 打ち切りを捨てる | 2.7504ヶ月 | −77.1% |
| イベント扱いにする | 4.7192ヶ月 | −60.7% |
| 尤度に正しく入れる | 11.9858ヶ月 | −0.1% |
理論値も 、 と一致しました。捨てると壊滅的です。
尤度は「枠」で分布は「中身」
この形はどの分布でも共通です。指数分布で整理すると
となり、打ち切りは総観測時間には入るがイベント数には入らないことが見えます。
ハザードと密度の違いは分母だけ
密度は「最初の全員」を分母にし、ハザードは「そのとき生き残っている人」を分母にします。だからハザードは確率ではなく率で、1を超えます(速度メーターと同じ)。
カプラン=マイヤー推定量は階段状になりますが、これも最尤推定量です(分布族を狭めずに全分布上で最大化すると、観測時刻に確率を集める離散分布が解になる)。Gehan の 6-MP データで教科書値と7点完全一致しました(0.8571/0.8067/0.7529/0.6902/0.6275/0.5378/0.4482)。ログランク検定も 、 で一致。
部分尤度は「いつ」を諦めて「誰に」だけを使う
Cox 回帰はベースラインハザード を推定しません。リスク集合の中で比を取ると が共通因子として約分で消えるからです。3種類の異なるベースラインで HR が 1.982/2.007/1.942(真値2.0)と同じ値を返しました。被覆率も で 0.932、 で 0.946 と妥当です。
なお比例ハザードの意味は誤解しやすく、HRが2倍でも平均寿命は半分になりません。ワイブル分布では 倍で、 なら 0.315倍、 なら 0.758倍、(指数分布)のときだけ 0.5 倍です。
リッジと Lasso の違いは角があるかどうか
制約領域が円(リッジ)か菱形(Lasso)かの違いで、菱形の角に当たると係数がゼロになります。 で Lasso が 、リッジが でした。
過学習の実測(多項式の次数を上げる)では、訓練誤差が15次 0.0606・16次 0.0592 と下がり続けるのに、テスト誤差は6次で最小になりました。ただし「訓練誤差が を下回るのは過学習の証拠」ではありません。 なので、バイアスが消えれば必ず下回ります。
→ 第19回。
第20章 分散分析と実験計画法
なぜ3群でt検定を繰り返してはいけないのか
同じデータ(各群6個・40,000回)で対比較t検定を繰り返すと偽陽性率 0.1192、分散分析なら 0.0483 でした。群を増やすと悪化します。
| 群数 | 対比較t検定 | 分散分析 |
|---|---|---|
| 2 | 0.0508 | 0.0508(完全一致) |
| 3 | 0.1192 | 0.0483 |
| 6 | 0.3661 | 0.0499 |
| 10 | 0.6298 | 0.0497 |
で一致するのは だからです。分散分析は3群以上専用ではありません。
膨張率の計算は3通りあって、値が違います()。
| 計算 | 値 | 意味 |
|---|---|---|
| (足し算) | 0.1500 | ボンフェローニの根拠。最も粗い上限 |
| 0.1426 | 独立なら正確 | |
| 実測(相関あり) | 0.1090 | 3つの比較は独立でない(各群3個の設定) |
掛け算になるのは「全部セーフ」の側で、誤りはその補集合です。、誤り 。足し算版は で 2.25 という確率としてありえない値になります。
実測値が群サイズで動く点にも注意が要ります。各群3個なら 0.109、各群6個なら 0.119、各群100個なら 0.122 と、誤差自由度が増えるにつれ上がります。ただし上限側の2つ(0.1500 と 0.1426)が実測を上回る関係はどの設定でも変わりません。
分散分析はダミー変数の重回帰と同じ計算
同じデータを両方の手順で解くと完全に一致しました。
| 分散分析 | 重回帰 | 値 |
|---|---|---|
| 826.0000 | ||
| 432.0000 | ||
| 394.0000 | ||
| 0.5230 | ||
| 8.223350 |
コーディングを変えても F は 8.223350 で不変です(基準セル方式・効果コーディング・切片なしダミー3本)。ただし切片+ダミー3本はランク落ちします(ダミー変数の罠)。
9個のデータでの手計算も押さえておくと速い。群A 4,6,8/群B 7,9,11/群C 10,12,14 で 、、、( の5%点 5.1433 を超える、)。
交互作用があると主効果が消える
という交互作用があるデータでは、主効果Bが平均されて になり で有意でなくなりました。同じデータで交互作用は 、 です。交互作用が有意なら主効果を単独で解釈してはいけません。
交互作用の検定はモデル比較そのもので、 が分散分析表と小数第6位まで一致します。
多重比較の臨界値の順序は状況で入れ替わる
・各群 ・誤差自由度15での臨界値。
| 手法 | 臨界値 | 守る範囲 |
|---|---|---|
| 補正なし | 2.1314 | 守らない |
| ダネット | 2.4377 | 対照群との比較のみ |
| テューキー | 2.5975 | すべての対比較 |
| ボンフェローニ | 2.6937 | 指定した比較 |
| シェッフェ | 2.7138 | すべての線形対比 |
テューキーがボンフェローニより甘い(2.597 < 2.694)ことに注意。そしてボンフェローニとシェッフェの大小は で交差します( では 3.2875 対 3.2073 で逆)。全対比較を単一ステップで扱うならテューキーが最も甘い点は54通りのスキャンで反例0件でした(比較を絞ればダネットが甘く、段階的手法のホルムには負けることがあります)。
「F が有意なら補正不要」(Fisher's LSD)は でしか成立しません。1群だけ離れた部分帰無仮説では で 0.1180、 で 0.2719 に膨張します(テューキーは 0.0295/0.0355)。
実験計画法の3原則
局所管理(乱塊法) は分母を小さくします。処理平方和は 55.860 のまま変わらず、誤差平方和が 469.984 → 70.924、 が 52.220 → 11.821(真の )。F は 0.5348 → 2.3628 に改善しました。ブロック効果が無いときでも検出力は 0.5590 対 0.4770 でほぼ互角なので、誤差自由度に余裕があれば迷わずブロック化でよい。ただし総観測数が少なくブロック数が多いと自由度の損が効きます(3×3 のラテン方格は誤差自由度が2しか残らず実用に耐えません)。
ただしブロックは実験前に決めなければなりません。結果 を見てブロックを作ると第一種の誤り率が 0.3897(5%の7.8倍) になります。
無作為化 はバイアスを分散に変換する操作です。時間順に固めると有意率 1.0000(真の効果はゼロ)、推定値の偏り 。無作為化すると 0.0530/ になりますが、標準偏差は 1.50 → 3.42 に増えます。
反復 は分母(誤差の推定)を作ります。ただし精度は でしか上がらず、半幅を半分にするには を4倍必要。測り直しは擬似反復で、実質的な情報は増えないのに名目上の誤差自由度だけが水増しされます。 が小さくなるので F や t が過大に、p値が不当に小さく出ます。
直交表は「1と2しかないのに内積が0」
の列は 1/2 で書かれますが、これはただの名札です。内積は表記で変わります。
| 表記 | 列1・列2 の内積 |
|---|---|
| 1/2 | 9 |
| 0/1 | 1 |
| +1/−1 | 0 |
直交していれば効果が混ざりません。 で A は (真値8)、B は (真値4)、C は (真値0)と3つとも当たりました。逆にAとBを常に同時に変えると A の推定が 12(真の効果8+Bの効果4)になります。
実験計画法は「回数を減らす技術」ではなく「交互作用の情報を捨てる代わりに回数を減らす」交換です。 の列3にCを置くと、Cの真の効果が0なのに A×B の交互作用 の半分である 2.5 が出ます。どちらが原因かは原理的に分からず、回数を増やしても永久に分離できません(交絡)。
実務では覗き見がいちばん危ない
真の差がゼロのデータを30日間毎日検定すると誤り率 0.2898(約29%)。30日後に1回だけなら 0.0495 です。覗き見だけで誤り率が5.9倍になり、しかも「有意になったら止める」止め方が効果量を過大推定させます。
必要標本数の目安(検出力80%、)は、3群で効果量 なら各群52・総156(月31PVで5.0か月)、 なら各群322・総966(2.6年)。
→ 第20回。
第21章 標本調査法
「分散」が2つある
この章でいちばん詰まったのがここでした。
| 何のばらつきか | を増やすと | |
|---|---|---|
| (A) 母分散 | データそのもの(世帯によって年収が違う) | 変わらない(199万円) |
| (B) 標本平均の分散 | 推定値(調査をやり直すと答えが揺れる) | 縮む(199→62→20万円) |
この章の「分散」はほぼ全部 (B) です。見分け方は「 で割られていたら (B)」。 そして では両者が一致します(実測 39701 と 39385)。1人しか聞かないならその人の値がそのまま推定値になるからです。
なお計算に母平均 は要りません。標本分散は を引いて作るので、 の調査1回から標準誤差 48.5 が出ます。
母集団サイズが効かないのは「 を固定したとき」
有限母集団修正が付く理由は「母集団が有限だから」ではなく非復元抽出だからです。復元抽出なら は一切効きません。
そして効くかどうかは ではなく抽出率 で決まります()。・ の実測では、
| 修正係数 | 誤差幅 | |
|---|---|---|
| 2500人() | 0.4473 | ±0.98pt |
| 1万人 | 0.8945 | ±1.96pt |
| 1億人 | 1.0000 | ±2.19pt |
実務の目安は で入れる。 抽出率を固定して を動かせば精度は上がり続けるので、第8回の「 は効かない」と矛盾しません。
層別とクラスターは抽出の向きが逆
| 層別抽出 | クラスター抽出 | |
|---|---|---|
| 集団の作り方 | 集団内が似るように | 集団内が母集団の縮図 |
| 抽出の対象 | 集団の中の人 | 集団そのもの |
| 標本に入る集団 | 全部 | 選ばれたものだけ |
| 効く条件 | 集団間の差が大きい | 集団間の差が小さい |
| 採用理由 | 精度 | コスト・名簿 |
| deff | 1以下(比例配分なら) | 1より大きい(ICC>0 なら) |
理想の集団の姿が正反対だと押さえるのが早い。層別は集団間の差を味方にし、クラスターは集団間の差にやられます。
層別で消えるのは層間分散だけ(比例配分のとき)
比例配分だと層間の項が消えます。全体分散の97.9%が層間なら分散比 0.0208(48分の1)、層間0.0%なら 1.0000 で効果ゼロ。比例配分では「層内分散の割合」がそのまま分散比になります。
この保証は比例配分に付くもので、配り方を大きく誤ると単純無作為より悪くなります(大規模層に1社だけ配れば 1059.6 対 562.0)。
ネイマン配分は「1社追加で減る分散」を揃える操作
比例配分では効きがバラバラですが、ネイマン配分では揃います。
| 層 | 比例配分での効き | ネイマン配分での効き |
|---|---|---|
| 小規模(8000社) | 0.0024 | 0.02995 |
| 中規模(1800社) | 0.0873 | 0.03009 |
| 大規模(200社) | 14.7162 | 0.03014 |
大規模層に1社足すと小規模層より6000倍以上効くので、そこへ移す。移すと効きが落ちるので、やがて釣り合う。経済学の限界効用の均等化と同じ構造です。
結果、母集団の2%の層が標本の46.7%(187社)を取り、分散は比例配分の20分の1・単純無作為の86分の1(SE 11.60 → 2.56)。 を3倍・0.4倍に外しても悪化は2.52倍で、比例配分(20.58倍)より8.2倍良いので、当て推量でも使う価値があります。
設計効果は共分散が 個足される分
ICC は「同じ集落の2人の相関係数」そのもの(ICC=0.5 の設定で実測 )。 なら順序つきペアが380個あるので、1個あたり0.1でも合計で効きます。
| ICC | deff | 400人調査の実質 |
|---|---|---|
| 0.05 | 1.95 | 205人分 |
| 0.10 | 2.90 | 138人分 |
| 0.20 | 4.80 | 83人分 |
ICC=1 なら20人聞いても1人分です(分散 0.9330 が一致)。なおこの式は楽観側の見積りで、等サイズ集落・一定 ・独立抽出を前提にしています。集落サイズがばらつくと deff はさらに大きくなります。
それでもクラスター抽出を使う理由はコスト
地点コスト5000円・面接500円・予算50万円で計算すると、
| 総人数 | 移動費 | deff | 有効標本 | |
|---|---|---|---|---|
| 1 | 90人 | 45万円 | 1.00 | 90人分 |
| 10 | 500人 | 25万円 | 1.90 | 263人分 |
| 50 | 800人 | 8万円 | 5.90 | 136人分 |
では予算の9割が移動費に消えて90人しか調べられません。1人あたりの精度では負けるが1円あたりの精度では勝つ。最適値は で実測の10と一致します。
比推定は切片を0に固定した回帰推定
決めるパラメータが1つか2つかの違いです。使い分けは分散比を見ると明らかです。
| A:原点を通る | B:切片あり | C:無相関 | |
|---|---|---|---|
| 比推定 | 0.063 | 7.541 | 3.284 |
| 回帰推定 | 0.063 | 0.198 | 1.006 |
迷ったら回帰推定(最悪でも標本平均並みの1.006)。比推定が残る理由は、原点を通るのが本当なら小標本で有利( で9.3%、 では0.3%)、誤差の分散が に比例するとき最適、そして「比そのもの」を知りたいときは答えが直接出るから。
なお比の平均と平均の比は別物です(2.39516 対 2.38923、真値 2.38956)。サイト全体の RPM を知りたいなら が正しい。
系統抽出は間隔が周期の倍数だと壊れる
曜日効果のある日次データで にすると、開始点が月曜で 100.2、土曜で 178.7(真値 127.1)。・(7と互素)なら幅1〜2に収まります。逆に単調トレンドなら暗黙の層別として有利(開始点によるばらつき 0.38 対 単純無作為 4.70)。並び順の確認が実務の第一歩です。
無回答バイアスは で消えない
若年層の回答率20%・高齢層60%、支持率が層で30%/70% という設定で、偏り +10.7pt。
| 依頼数 | 標準偏差 | 偏り |
|---|---|---|
| 1000 | 0.0268 | +10.7pt |
| 100万 | 0.0008 | +10.7pt |
を1000倍にしても偏りは動かず、区間が縮む分だけ確実に外れていきます。ウェイト調整(事後層化)で +0.0pt に消えますが、これは MAR(層の中ではランダムに欠けている)という仮定に乗っています。層内でも差が残る MNAR では調整後も −12.0pt が残り、そして仮定の正しさは非回答者のデータがないので原理的に検証できません。
→ 第21回。
つまずきやすいところ
試験前に見返す用の一覧です。
| よくある誤解 | 正しい理解 | 章 |
|---|---|---|
| 「他の変数を固定」は比喩 | 残差を取ることと同じ(残差回帰の傾きが で一致) | 16 |
| 関係しそうな変数は全部入れれば安全 | 交絡は入れる、合流点は入れない。合流点を入れると効果0が に化ける | 16 |
| 媒介変数は間違った因果 | 媒介は本物の因果。総効果を知りたいなら入れない( が に) | 16 |
| VIF はその変数の情報量 | 他の変数との重複度。同じ列でも 1.0046〜6.3256 と変わる | 16 |
| VIF が高い変数は消すべき | 消すと係数が と符号反転(RMSE 4.680 対 105.110)。消してよいのは同じ情報の重複だけ | 16 |
| 多重共線性で情報が消える | 分解できないだけ。 でも合計のsdは 0.214 | 16 |
| が高ければ良いモデル | 。乱数113本で 0.9977 だが は 35.6→79.5 と当てにならなくなる | 16 |
| 調整済み が上がれば入れる価値がある | 境界は で有意の1.98より甘い。乱数でも30%起きる | 16 |
| はいつでも成立 | 切片が必要。外すと で崩れる | 16 |
| F が有意ならどれかのtも有意 | 相関0.99なら3本とも非有意で 。逆も起きる | 16 |
| 有意でない変数を消すのは良い手順 | 全部無意味でも 82.7% の確率で「有意な変数」が残る | 16 |
| 最小二乗法は全部の点を平等に扱う | 平等なのは残差だけ。 の点の重みは | 17 |
| 外れ値なら傾きが動く | の外れ値では傾き不動、動くのは切片だけ | 17 |
| てこ比が高ければ危険 | それだけでは何も起きない。 0.182→0.518 で は改善(0.913→0.945) | 17 |
| 外れ値・てこ比・影響力は同じ | は掛け算。両方そろって初めて傾きが半減(1.024→0.350) | 17 |
| 生の残差プロットで危険な点が分かる | 。 の点の残差は 0.030 | 17 |
| なら外れ値 | 内部残差は が上限。 では 3.162 を超えない | 17 |
| 内部残差で十分 | マスキングで が3倍に膨らむ。外部なら 4.005 対 11.792 | 17 |
| 不均一分散は推定値を壊す | 壊すのはSEだけ。推定値は不偏(1.500377、真値1.5) | 17 |
| 不均一分散はSEを必ず過小評価 | 中央で分散が大きい形なら比 2.262 で過大。てこ比との相関で決まる | 17 |
| ロバストSEなら何でも直る | 対角しか置き換えないので自己相関には効かない(HACが必要) | 17 |
| を超えたら影響が大きい | 正常データで なら誤検出100%。原因は 回の多重比較 | 17 |
| なら安全に拾える | 重心の外れ値は を6ずらしても検出率 0% | 17 |
| DW が小さければ自己相関 | 独立な誤差の曲線データで 0.368。 を入れると 2.092 | 17 |
| 自己相関は必ずSEを過小評価 | が交替する設計なら比 2.216 で過大 | 17 |
| 残差の平均に意味がある | 切片があれば常に厳密に0。診断の材料にならない | 17 |
| 外れ値を削除すれば良くなる | 被覆率が 95.73%→91.07%(繰り返すと 80.55%) | 17 |
| 正規性が4つの仮定で最重要 | CLTで救われるので優先度は最低(個々の予測区間は別) | 17 |
| ロジスティック回帰は非線形モデル | 線形は について1次の意味。グラフの形ではない | 18 |
| 0/1 を OLS で困るのは確率が1を超えるだけ | ①範囲外・②等分散不成立・③残差が2値・④効果一定の強制の4つ。重いのは②と④(①③は頑健SEで漸近的に救える) | 18 |
| オッズ比は確率が何倍になるかを表す | 。 でも RR=10 なら OR=19 | 18 |
| 係数が同じなら効果も同じ | 限界効果は場所で変わる。2分 、4分 、14分 | 18 |
| 有意でない=効果がない | 完全分離では なのに p値 0.9999(Hauck-Donner) | 18 |
| 過分散は分散÷平均で判定できる | ポアソンでも 2.54 が出る。ピアソン統計量で見る(0.964 対 3.476) | 18 |
| 打ち切りは欠測 | 「」という情報を持つ。捨てると −77.1% の過小推定 | 19 |
| ハザードは確率 | 率なので1を超える。分母が「生き残った人」である点だけが密度と違う | 19 |
| KM推定量は最尤法を使わない | 分布族を狭めない最尤解。 | 19 |
| Cox はベースラインを推定している | 比で約分されて消える。3種類のベースラインで HR が 1.982/2.007/1.942 | 19 |
| HR が2倍なら寿命は半分 | ワイブルでは 倍。 なら 0.315倍 | 19 |
| 訓練誤差が を下回るのは過学習の証拠 | なのでバイアスが消えれば必ず下回る | 19 |
| 分散分析は3群以上専用 | 2群でも使え、t検定と完全一致(、0.0508 対 0.0508) | 20 |
| 分散分析と重回帰は別の手法 | 同じ計算。F が 8.223350 まで一致し | 20 |
| 誤りリスクは で膨らむ | それは独立なとき。実測 0.1090 対 計算値 0.1426 | 20 |
| 守る範囲が広いほど臨界値が厳しい | ボンフェローニとシェッフェは で交差 | 20 |
| F が有意なら後の比較で補正不要 | でしか成立せず、 では 0.2719 に膨張 | 20 |
| 交互作用があっても主効果は読める | が打ち消して ・ | 20 |
| 局所管理はデータを見てグルーピング | 実験前に決める。 を見て作ると誤り率 0.3897 | 20 |
| 測り直しを増やせば反復になる | 擬似反復は名目上の自由度だけ水増しされp値が不当に小さくなる。独立にやり直すのが反復 | 20 |
| 実験計画法は回数を減らす技術 | 交互作用の情報を捨てる代わりに減らす交換。列3にCを置くと交絡 | 20 |
| 直交表の 1/2 はそのまま計算に使う | ただの名札。 に直すと内積が0(1/2 表記なら9) | 20 |
| 「分散」は1つの言葉 | データのばらつき と推定値のばらつき は別物 | 21 |
| 母平均を知らないと分散が計算できない | は を引くので は不要 | 21 |
| 有限母集団修正は母集団が有限だから付く | 非復元抽出だから。復元抽出なら は効かない | 21 |
| 母集団サイズ は効かない | を固定したときの話。抽出率 なら効く | 21 |
| 層別すれば層間分散が消える | 比例配分のとき。配り方を誤ると単純無作為より悪化 | 21 |
| 層別はいつでも効く | 層間分散が大きいときだけ。層間0.0%なら分散比 1.0000 | 21 |
| 小さい層を多く取ると偏る | 偏らない。 で母構成に戻している | 21 |
| を知らないとネイマン配分は使えない | 3倍外しても 2.52倍の悪化。比例配分(20.58倍)より8.2倍良い | 21 |
| が実際の膨らみ | 楽観側の見積り。集落サイズがばらつくとさらに大きい | 21 |
| クラスター抽出は劣った方法 | 同じ予算なら有効標本が3倍(90人分 → 263人分) | 21 |
| 比推定は回帰推定の別物 | 切片を0に固定した回帰推定。外すと標本平均の7.5倍に悪化 | 21 |
| 「1あたり」は各単位の比を平均する | 比の平均(2.39516)と平均の比(2.38923、真値 2.38956)は別物 | 21 |
| 系統抽出は単純無作為の簡便版 | 間隔が周期の倍数だと壊れる(100.2 対 178.7、真値 127.1) | 21 |
| を増やせば真値に近づく | 非標本誤差には効かない。100万人でも偏り +10.7pt | 21 |
| ウェイト調整で無回答が解決する | MAR のときだけ。MNAR では −12.0pt が残り検証もできない | 21 |
この範囲で、連載がまだ扱っていないこと
正直に書いておきます。
| 章 | 未収録の項目 |
|---|---|
| 16 | 情報量規準(AIC・BIC)とモデル選択の詳細(第32回)、交差検証、予測値の信頼区間と個々の の予測区間の区別、一般化最小二乗法の一般形、標準偏回帰係数、Mallows の 、線形制約 の検定、パス解析・構造方程式モデル(第27回) |
| 17 | MM推定・最小刈り込み二乗法(LTS)、DFBETAS・DFFITS の具体的な運用、ブロイシュ・ゴッドフレイ検定・Ljung-Box 検定、HAC(Newey-West)標準誤差の計算、スプライン、Box-Cox の の最尤推定、HC0〜HC3 の違い、条件数による多重共線性の診断、部分残差プロット |
| 18 | 多項ロジット・順序ロジットの詳細(用語レベルのみ)、条件付きロジット、正確ロジスティック回帰、ゼロ過剰モデル、GEE・混合効果ロジット、判別分析との関係(第25回) |
| 19 | ワイブル回帰などパラメトリック生存モデルの詳細、時間依存共変量、競合リスク、Cox のタイの処理(Breslow/Efron の使い分け)、Elastic Net、正則化パラメータの選び方(交差検証の実装)、平滑化スプライン・LOESS の詳細 |
| 20 | 等分散性・正規性の診断(Levene 検定・Bartlett 検定)、ランダム効果モデル・混合効果モデル(分散成分)、Tukey-Kramer 法(各群不同数)、 など3水準系直交表、応答曲面法、逐次検定(群逐次デザイン・α消費関数)、共分散分析(ANCOVA)の詳細 |
| 21 | 確率比例抽出(PPS)とホルビッツ・トンプソン推定量、二相抽出、レイキング・キャリブレーション推定、複雑な標本設計での分散推定(テイラー展開法・ジャックナイフ・繰り返し複製ウェイト)、多段抽出の分散の具体式、循環系統抽出 |
とくにモデル選択(第16章の変数選択で AIC・BIC を表で紹介しただけになっている部分)は第32回で扱いました。第19章の正則化がその一部を先取りしているので、両方を並べて読むと「罰則で選ぶ」と「規準で選ぶ」の対比が見えるはずです。
分散分析と混合効果モデルも残っています。第20章では要因をすべて固定効果として扱いましたが、ブロックや被験者を変量効果とみなす枠組みは扱っていません。乱塊法のブロックがまさにその候補です。
次
線形モデル編はここで一区切りです。振り返ると6つの章はすべて の変形で、ばらつきをどう分解するかの変奏でした。回帰は説明できる分と残差に分け、分散分析は要因ごとに分け、標本調査は層内と層間に分けた。同じ道具を違う場所に当てていたわけです。
次は確率過程編(第14章 マルコフ連鎖・第15章 確率過程の基礎)と多変量解析編(第22章 主成分分析ほか)に入ります。ここまでは「1つの を説明する」問題でしたが、 が複数あるとき、あるいは と の区別すらないときにどうするか。第20章で出てきた「平方和を直交する方向に分解する」発想が、主成分分析にそのままつながります。
→ 連載の目次:統計検定準1級 独学記事インデックス
この連載は、うまくいった記録だけでなく詰まった箇所も含めて書いています。同じく準1級を目指している方、一度挫折した方の参考になれば嬉しいです。