統計検定準1級 推測統計 要点まとめノート【第8〜13章】
この記事の役割
推測統計(第8〜13章)の復習ノートです。連載の各回が「なぜそうなるのか」を実験しながら追う記事なのに対し、こちらは押さえるべきことだけを1ページに集めたものです。詳しい導出や検算は各回へのリンクから読んでください。
- 同じ形式のノート:確率の土台編(第1〜7章)・線形モデル編(第16〜21章)・確率過程編(第14〜15章)・多変量解析編(第22〜26章)・発展編(第27〜32章)
- 連載全体の目次は 統計検定準1級 独学記事インデックス にあります。
- 使い方:試験前は「つまずきやすいところ」の表だけを見返すのが効率的です。
- 筆者は統計の専門家ではありません。試験対策として使う場合は必ず公式テキストで確認してください。
この範囲の全体像
確率の土台編は「分布が分かっているとき、データはどうなるか」でした。ここから向きが逆になります。データが手元にあって、分布のパラメータを知りたい。その流れは一本道です。
| 章 | 問い | 出てくる道具 |
|---|---|---|
| 8 | 1つの数字で答えるには | 最尤法・不偏性・フィッシャー情報量 |
| 9 | 幅をつけて答えるには | ピボット量・反転・標本サイズ設計 |
| 10 | 「差がある」と言うには | 尤度比・NP補題・ワルド/スコア/尤度比 |
| 11 | 正規分布を前提にすると | t検定の使い分け・ウェルチ・F検定 |
| 12 | 正規分布でないときは | 適合度検定・漸近検定 |
| 13 | 分布を当てにしないなら | 順位検定・並べ替え検定 |
第8〜9章は同じ式を2回使っています。 フィッシャー情報量から標準誤差が出て、それを1.96倍すると信頼区間の半幅になる。
第9〜10章は同じものを別の角度から見ています。 信頼区間は「その検定で棄却されない を全部集めた集合」(双対性)。だから覚える個数は検定の個数と同じです。
第11〜13章は「分母のばらつきをどう見積もるか」の変奏です。 第11章は母集団の分散を推定して自由度を消費し、第13章は数え上げで分散を確定させる。同じ問いに対する2つの答え方でした。
章と回の対応
| 章 | 章タイトル | 対応する回 |
|---|---|---|
| 第8章 | 統計的推定の基礎 | 第10回 |
| 第9章 | 区間推定 | 第11回 |
| 第10章 | 検定の基礎と検定法の導出 | 第12回 |
| 第11章 | 正規分布に関する検定 | 第13回 |
| 第12章 | 一般の分布に関する検定法 | 第14回 |
| 第13章 | ノンパラメトリック法 | 第15回 |
用語集
言葉で説明できるかを先に確認する用です。
| 章 | 用語 | 記号 | 意味 |
|---|---|---|---|
| 8 | 推定量 / 推定値 | / | データを入れると数値を返す関数 / 実際に出てきた数値 |
| 8 | 不偏性 | 標本分布の中心が真の値に乗っているか | |
| 8 | 一致性 | で潰れていく、その先が か | |
| 8 | 平均二乗誤差(MSE) | — | 。偏りと分散の総合点 |
| 8 | フィッシャー情報量 | 対数尤度の山の尖り具合。 | |
| 8 | スコア | 対数尤度の1階微分 | |
| 8 | クラメール・ラオの下限 | 不偏推定量の分散が到達できる限界 | |
| 8 | 標準誤差(SE) | 推定量の標準偏差。新しい概念ではない | |
| 9 | ピボット量 | — | パラメータを含むのに、分布がその値によらない量 |
| 9 | 反転 | — | 不等式をパラメータについて解く操作 |
| 9 | 双対性 | — | 信頼区間=棄却されない帰無仮説の集合 |
| 9 | 信用区間 | — | ベイズの区間。「真の値が入る確率」を言えるのはこちら |
| 9 | 効果量(コーエンの ) | 差が標準偏差の何倍か。必要な はこれで決まる | |
| 9 | ウィルソン区間 | — | SE の を未知のまま2次方程式を解いた比率区間 |
| 10 | 第一種/第二種の誤り | / | が真なのに棄却 / が真なのに棄却しない |
| 10 | ネイマン・ピアソンの補題 | 尤度比の大きい順に棄却域へ入れると検出力最大 | |
| 10 | 一般化尤度比 | と全体でそれぞれ最尤推定して比べる | |
| 10 | ウィルクスの定理 | は が課した制約の本数(セル数の とは別) | |
| 10 | ワルド/スコア/尤度比 | — | 同じ曲線の横の距離/接線の傾き/縦の高さの差 |
| 10 | FWER / FDR | — | 1つでも偽陽性が出る確率 / 棄却したうち偽陽性の割合 |
| 11 | プールした分散 | 両群の分散が共通だと仮定してまとめて推定した分散 | |
| 11 | ウェルチの検定 | 分散が違ってよいt検定。サタスウェイト近似で自由度を出す | |
| 11 | 頑健性 | — | 前提が少し崩れても結論が大きく狂わない性質 |
| 11 | Fisher の z 変換 | を に引き伸ばして の歪みを直す | |
| 12 | 適合度検定 | , | 観測度数が想定した分布に乗っているかを測る |
| 12 | 尤度比版の統計量 | ピアソンの とは別物(漸近的には同じ ) | |
| 12 | Chernoff–Lehmann | — | 生データから推定すると自由度が と の間に来る現象 |
| 12 | イェーツ補正 | — | 2×2表の連続性補正。行き過ぎて保守的になる |
| 13 | ノンパラメトリック | — | 分布の形をパラメータで指定しない方法 |
| 13 | 分布によらない | — | のもとでの統計量の分布が母集団によらない性質 |
| 13 | 漸近相対効率(ARE) | — | 同じ検出力を出すのに必要な標本数の比 |
| 13 | タイ(同順位) | 同じ値が複数あって順位が決まらない状態 | |
| 13 | 確率的優越 | 順位和検定が敏感な方向。中央値とは別 | |
| 13 | 交換可能性 | — | 並べ替え検定が厳密になるための前提 |
記号の注意:(母分散・定数)、(標本分散・確率変数)、(標本平均の分散)は3つ別物です。、 の例では 、 と桁が違います。記号全般で迷ったら 統計の記号がややこしいのは軸が2本あるからだった を参照してください。
第8章 統計的推定の基礎
不偏性と一致性は独立な性質
4通りすべてに実例があります(母集団 、各4万回)。
| 推定量 | 不偏 | 一致 | の偏り | のSD |
|---|---|---|---|---|
| ○ | ○ | 0.19 | ||
| (1個目だけ) | ○ | × | 5.98 | |
| × | ○ | 0.19 | ||
| × | × | 0.17 |
- は SD 0.17 で最小なのに一致性なし。縮んでいく先が で真の値ではないから。一致性は「幅が縮むか」だけでなく「寄っていく先が か」まで含む。
- で割るのは不偏性の話。・ で、 割り 28.82(理論 )、 割り 36.03。真の を使えば 割りでも 36.00。 で割ることが悪いのではなく、 を使ったことが原因。
最尤法は「仮定する分布」で答えが変わる
- データ で は中央値 5 で 23、平均 8 で 26。頑健推定は「別の分布を仮定した最尤法」として導ける。
- 対数を取る理由は微分の都合だけでなくアンダーフロー回避。、 は厳密に 0.0(倍精度の下限がおよそ )。丸め誤差ではなく値そのものが消える。
- 正規分布の分散の MLE は 割り(不偏でない)。MSE で採点すると 割り 466.56 対 割り 648.00 で MLE が勝つ。MSE 最小は 割りだが使わない(正規前提でしか最適でなく、利得も で 2.0%)。
フィッシャー情報量の使い道
- 計算は4手:①2回微分 ②式全体の期待値 ③符号反転 ④最後に 倍。「 に を代入」と覚えると誤り(正規分布の では が必要)。
- 情報量が負になったらその時点で計算ミス(逆数が分散なので分散が負になる)。
- の壁:目標 SE 4%/2%/1%/0.5% に必要な は 142/569/2,275/9,100。世論調査が2000人前後なのはこの計算。
- 効率: で標本平均の分散 0.03999(、CRLB に張り付く)対 標本中央値 0.06194()。効率 なので、中央値で平均と同じ精度を出すには 57% 多く集める必要。
- 前提が要る。①独立性: の AR(1) で なら実効 は 133。②正則条件: の は で縮む( より速い。台の端が で微分と積分の交換が成立しないため)。
→ 第10回。
第9章 区間推定
公式は4つではなく手順が1つ
①ピボット量を作る ②分位点で挟む ③不等式をパラメータについて解く(反転)。( 既知/未知)・・ の4つはすべてこの手順です。
- 母分散の区間では分位点の大小が入れ替わる(下端に )。 が分母にいるからで、符号ミスではない。
- 分散の区間はとにかく広い。上端/下端の比は で 23.003、 で 7.044、 で 2.849、 で 1.751。
- 未知なのに を使うと被覆率が で 81.0%、 で 91.8%、 で 94.7%。
- 「 既知」は「 が独立な未知パラメータとして存在しない」と読み替える。ベルヌーイは 、ポアソンは なので 。特別なのは正規分布のほう( と が独立に動く2パラメータ)。ただしこれは「 が本当に既知」と同じ強さではなく、比率の 区間は厳密に95%にはならない(後述の Wald 型の問題)。
信頼係数は手続きに付いている数字
- から2個取り、区間を(最小, 最大)とすると全体の被覆率は 0.50065(理論 1/2)。しかし幅 > 0.5 の回は被覆率 1.00000、幅 ≤ 0.5 の回は 0.33400。手元の1本を見て「これは95%です」と言うことに意味はない。
- 誤り:「真の がこの区間に入る確率は95%」→ 観測後は も区間も定数なので確率は 0 か 1。「真の値が入る確率」を言いたいならベイズの信用区間。誤解は日本語の問題ではなく、別の流派の正しい言明を頻度論の道具に貼り付けているのが本質。
2本の区間の重なりで差を判断してはいけない
足せるのは分散です。(素朴な足し算 2.0 ではない)。
- 素朴な足し算 3.9199 の被覆率 0.9944(広すぎ)、正しい で 0.9499。素朴な足し算は「狭すぎる」のではなく「無駄に広い」ので、実際にある差を見逃す方向に間違える。
- 2.77〜3.92 が「重なっているが差はある」ゾーン。
プールかウェルチか → ウェルチ無条件
被覆率(各20万回、名目95%)。
| 条件 | プール | ウェルチ |
|---|---|---|
| 20/20、 1:1 | 0.9493 | 0.948〜0.952 |
| 20/10、 1:4 | 0.8374 | 同上 |
| 25/5、 1:4 | 0.6489 | 同上 |
| 5/25、 1:4 | 0.9996 | 同上 |
- 振れる向きが の組み合わせで逆転します(小さい の群の が大きいときに過信側)。
- 等分散が真のときの損は幅 0.2%増だけ。避けられる事故が なので迷う理由がない。
- R の
t.test()は既定がウェルチ、Python のscipy.stats.ttest_indは既定がequal_var=Trueなので明示的にFalseを指定する。
標本サイズ設計
| 半幅 () | 必要な |
|---|---|
| ±10pt | 97 |
| ±5pt | 385 |
| ±3pt | 1,068 |
| ±2pt | 2,401 |
| ±1pt | 9,604 |
- 精度設計()の検出力はちょうど50%(実測 0.4998)。真の差が 2pt で半幅も 2pt なら、観測される差は 2pt を中心に散らばるので半分が超える。
- 検出力80%にする倍率は 、90%なら 2.7353。 にも にもよらず一定。覚えるのは 。
- 効果量別(検出力80%):(小)で 393、(中)で 63、(大)で 25。心理学・医学で 前後が多いのは ・検出力80%・ がテンプレだから。
- 途中でのぞくと崩壊:1回 0.0521、5回 0.1465、20回(毎日)0.2497、50回 0.3262(真の差ゼロ)。
- を積むより を厳しくするほうが安い。事前確率5%で を20倍にしても的中率は 0.51 で止まるが、 を 0.05→0.01 にすると 1.5倍で 0.808。
Wald 型の比率区間は使ってはいけない
厳密被覆率(名目95%)。
| 条件 | Wald 型 | ウィルソン |
|---|---|---|
| , | 0.1821 | 0.9831 |
| , | 0.6389 | 0.9245 |
| , | 0.8775 | 0.9659 |
- 原因は SE に を入れていること( が下に外れたときに限って区間が狭くなる)。 では になる確率が36%あり、そのとき区間は に潰れる。
- 付近ではウィルソンのほうが狭い(期待幅 0.3927 対 0.4268)=上位互換。
- Agresti–Coull の「+2/+4」はウィルソンの近似(、)。
- は甘い線。 でも 88〜89% なので「使ってよい」ではなく「これ未満は論外」の目安。
ブートストラップの弱点3つ
- 小標本で狭すぎる: で t区間の62%、被覆率 0.8430。対策はブートストラップ( でも 0.9503)。実務の既定は BCa。
- 分布の端では原理的に壊れる: の最大値は被覆率 0.0000( でも 0)。
- 離散データでは区間が格子状になる。
→ 第11回。
第10章 検定の基礎と検定法の導出
なぜ遠回りするのか
知りたいのは ですが、これは事前確率がないと出ません。測れるのは だけなので背理法の形にします。
- 非対称性は設計であって欠陥ではない。()は分布を1つに確定させるが、()は無数の分布の集まりなのでどの分布で確率を計算すべきか決まらない。だから「採択する」は存在しない。
- が真ならp値は一様分布(20万回で50%点 0.4981)。 での検出力がちょうど になるのが検算ポイント。
を守るのは最低条件
同じ でも棄却域は無数にあり、検出力は 0.8038(右の裾)から 0.0000(左の裾)まで変わります。中央 なら 0.0022。
- NP補題を6面サイコロ1回( 通り)で総当たり検証。 の15通りで検出力の順位が尤度比の和の順位と完全一致。64通りを 平面に置くと尤度比順の点列が上限の壁になる。
- 裾を棄却域にするのは慣習ではなく、尤度比を大きい順に取った結果。単調でない問題では裾が最適にならない。
- t検定は尤度比検定そのもの( が の単調減少関数)。ただしピアソンの 適合度検定は尤度比検定ではなくスコア検定で、尤度比版は という別の統計量。
ウィルクスの定理の自由度は「制約の本数」
4モデルで検算しました。正規平均(縛り1)で平均 1.0032・分散 2.0006、多項5カテゴリ(縛り4)で 3.9940・7.9535。モデルの中身に依存しません。
- 正則条件が必要。 のように が境界上にあると極限が にならない。
- 小標本では漸近が効かない。 の臨界点 3.8415 を使った第一種の誤りは で 0.0979、 で 0.0593、 で 0.0509。棄却域の形は同じでも臨界値の精度が違う。
ワルド・スコア・尤度比は同じ曲線の3つの測り方
| 検定 | 測るもの | 必要な当てはめ | 得意な場面 |
|---|---|---|---|
| ワルド | 横の距離 | のみ | 回帰係数一覧( を変えても再計算不要) |
| スコア | 接線の傾き | のみ | 小標本・ が0付近、適合度検定 |
| 尤度比 | 縦の高さの差 | 両方 | 尺度変換して報告、複数変数まとめて落とす |
小標本での第一種の誤り率(、厳密な二項確率)。
| ワルド | スコア | 尤度比 | |
|---|---|---|---|
| 10 | 0.5998 | 0.0861 | 0.0115 |
| 20 | 0.3611 | 0.0755 | 0.0159 |
| 50 | 0.0801 | 0.0378 | 0.0887 |
| 1000 | 0.0583 | 0.0496 | 0.0514 |
- ワルドの 0.5998 の内訳は が 0.5987。 で推定分散が 0 になり計算不能になるのが本当の破綻点。
- 3つの優劣は と で入れ替わる。 では3つの棄却域が整数レベルで完全一致するので差が出ない。
- ワルドが普及しているのは優れているからではなく計算が1回で済むから。
- ワルドの倒錯した挙動:完全分離(ロジスティック回帰)で反復を回すと 5.75 → 0.0000。効果が強すぎると有意でなくなる(ホーク・ドナー効果)。
- 尺度依存: で測るか logit で測るかで、 の p値が 0.0935(棄却しない)→ 0.0053(強く棄却) に化ける。
- 相関 0.997 の説明変数(真の係数は両方 1.0):個別のワルドは と で「どちらも要らない」、2変数同時の尤度比は 。個別p値だけで変数選択するとモデルを壊す。
双対性で覚える量が3分の1になる
信頼区間はその検定で棄却されない の集合なので、定義の言い換えです( を 0.005 刻みで走査して 199/199 点一致)。
| 検定 | 対応する区間 | での区間 |
|---|---|---|
| ワルド | ワルド区間 | [0.5249, 0.7151] |
| スコア | ウィルソン区間 | [0.5221, 0.7090] |
| 尤度比 | プロファイル尤度区間 | [0.5227, 0.7112] |
方法を混ぜると食い違います。 ではワルド区間 [0.0247, 0.3753] が「有意でない」のにスコア検定(9.4737)は棄却。
多重比較
のうち5個に効果がある設定。
| 方法 | FWER | 検出力 |
|---|---|---|
| 補正なし | 0.534 | 0.850 |
| ボンフェローニ | 0.037 | 0.489 |
| ホルム | 0.042 | 0.502 |
| BH法 | 0.154 | 0.650 |
- ホルムはボンフェローニの上位互換(1番小さいp値には同じ厳しさ、2番目以降が緩む)。唯一の例外は同時信頼区間で、区間も並べるならボンフェローニ。
- 手続きの違い:ホルムは「先頭から順に見て条件を満たさなくなったら止める」、BHは「条件を満たす最大の順位を探しそこ以下を全部棄却」(後戻りを許すぶん緩い)。
- ボンフェローニの弱点は相関。実際の FWER は相関 0.00 で 0.0500、0.99 で 0.0043(名目の1/12)。
- BH法は FDR を守る一方 FWER は最大 0.786。これは設計。負の相関が混じるならベンジャミニ・イェクティエリ法。
p値の正体
- p値は で「以上」が本質。密度の値 0.0175 は「このデータの確率」ではない(連続分布では1点の確率は0)。
- リンドリーのパラドックス:p値を 0.05 に保ったまま を増やすと が で 0.366、 で 0.993。「p = 0.012 なら が正しい確率は 1.2%」は桁が違うレベルで誤り。
- フィッシャー流(p値=証拠の強さ、対立仮説不要)とネイマン・ピアソン流( と棄却域を事前に決める)の折衷が現代の実務。教科書の書き方に揺れがあるのはこのため。
→ 第12回。
第11章 正規分布に関する検定
すべての検定は「差 ÷ ばらつき」
分子はどれも引き算なので、覚えるのは分母の列だけです。
| 検定 | 分母(SE) | 自由度 |
|---|---|---|
| 1標本t | ||
| 2標本t(プール) | ||
| 対応あり | ( はペア数) | |
| 母比率 | なし | |
| 相関 |
- 母比率に自由度がないのは推定していないので引くものがないから。帰無仮説 を立てた瞬間、分散も と確定する(帰無仮説が平均と分散を同時に指定)。
- 相関の自由度が なのは実質「回帰直線の傾きがゼロか」を調べていて傾きと切片の2個を推定しているから。
- 使い分けは統計の判断ではなくデータの取り方。「Excelの1行が何を表しているか」で決まる。1行が2つの数字を持てば対応あり。2群の が違っていたら必ず対応なし。
等分散仮定の破綻は向きで逆転する
真の平均差ゼロ・名目5%・20万回。
| 条件 | プール | ウェルチ |
|---|---|---|
| 10/10、 4倍 | 6.06% | 4.8〜5.3% |
| 20/10 | 16.37% | 同上 |
| 25/5、 | 35.08% | 同上 |
| 5/25、 | 0.04% | 同上 |
- 理由: は自由度で重みづけした平均なので、サンプルが多いほうの分散が小さいと が小さくなり が大きくなって棄却しすぎる。覚え方は「サンプルが多いほうの分散が小さいときに偽陽性」。
- ウェルチの自由度は で、山型(両端が最小・途中が最大)。 なら 付近でぴったり 38。
- ウェルチ常用の代金は ずつで pt。既定値にしてよい。
「F検定で等分散を確かめてからt検定」は推奨されない
- 2段階手順はプール常用よりましだが5%を守れない: 25/5 で 6.66%、逆向きの 10/20 では 3.86% と保守的すぎ。
- F検定そのものが正規性に極端に弱い(真に等分散、名目5%):正規は で 5.13/5.06/5.01%、 は 12.59/17.69/22.05%、指数は 22.88/28.29/30.85%。「壊れた体温計で熱を測って、体温計が正しいかを判断している」。
- F検定を「分散そのものを知りたい」目的で使うのは正当。ダメなのはt検定の前提チェックに使う用途。
平均は で直り、分散は で悪化する
| 検定 | 母集団 | を増やすと |
|---|---|---|
| 平均のt検定 | 指数分布 | 4.33% → 5.02%(直る) |
| 分散のχ²検定 | 対数正規 | → 65.65%(、悪化) |
| 分散のχ²検定 | 一様分布 | → 0.23%(潰れる) |
- 仕組み: に対し、χ²分布は ()を想定。実際の幅と基準の幅の比 から が消える。
- 指数分布は なので比 2。棄却率は 32.7% に落ち着く。発散していたのではなく、間違った水準に収束していた。 を増やすと「間違った答えに、より確実に到達する」。
- 平均を守っているのは中心極限定理。分散の検定は守られていない。
- 最も危険なのは「歪んだ分布+標本サイズの不均衡」。 10/30 の指数分布でウェルチでも 6.63%。「 を揃える」という実験計画の基本が効く。
対応のあるt検定の利益は 倍
ペア・真の差 での検出力。
| 対応あり | 対応なし | |
|---|---|---|
| 0 | 32.18% | 33.70% |
| 0.5 | 56% | 28% |
| 0.8 | 91.74% | 21.30% |
| 0.95 | 100% | 14% |
- では負けます。 で得がゼロのとき、自由度を半分(19 対 38)にした損だけが残る。ペアの取り方に意味があることが前提。
- 逆に、対応があるのに2標本t検定をすると真の差ゼロでの誤り率が で 0.00%。「安全側」に見えて検定の感度を失っている(保守的な間違いは気づきにくいぶん危ない)。
母比率は帰無仮説の で SE を作る
- Wald 型( を使う)は で 66.82%、 でも 12.96%( を満たしても壊れている)。スコア型は 2.99〜6.55%。
- 帰無仮説が分散まで指定しているので、 で推定し直すのは既知の情報を捨てる行為。
- A/Bテストの比率の差はプールする。 1000/100 で 4.64% 対 8.19%。ここでも引き金は標本サイズの不均衡。
相関係数の検定
有意になる の下限。
| 下限 | |
|---|---|
| 5 | 0.878 |
| 10 | 0.632 |
| 30 | 0.361 |
| 100 | 0.197 |
- 10点の散布図で は証拠にならず、 なら実質どうでもいい弱い相関が有意になる。
- の検定には Fisher の z 変換。 の分布は で歪度 。 でt検定を使うと 83.70% 棄却してしまうが、Fisher の z は 4.99% を保つ。
A/Bテストの優先順位
- 事前にサンプルサイズを決めて途中で見て止めない(影響は数十%)
- 多重比較の補正(数十%)
- ウェルチを使う(数%)
3番目を完璧にやっても1番目を破っていたら無意味です。
→ 第13回。
第12章 一般の分布に関する検定法
3分類は「どの分布か」で分かれていない
分ける基準は ①厳密な分布が書けるか ②漸近近似に頼るか ③分布族を仮定しないか です。「一般の分布に関する検定」=適合度検定ではなく、主流は尤度比・ワルド・スコア検定で、適合度検定はその特別な一員でした。
帰無仮説は「点」ではなく「曲線」
- 適合度検定の帰無仮説は「この確率ベクトルに等しいか」ではなく 「この分布族という曲線に乗っているか」。だから自由度が推定した個数 ぶん減ります。
- パラメータ推定は目的ではなく手段。 曲線までの距離を測るための足場で、 は結論に登場しない。
- Wilks の (制約の本数)と適合度検定の (推定した個数)は別物。
- 自由度が減る理由は第7回(偏差の和が0という厳密な制約)とは別の原理で、「平均して1だけ削られる」。実際に差が負になることが10.4%ある。
- 最尤推定 ≠ 最小カイ二乗推定。「推定すれば は必ず小さくなる」は誤り。
- 生データから推定すると自由度は と の間に来る(Chernoff–Lehmann)。ずれの大きさはセルの粗さで決まる。
「期待度数5以上」は思うより緩い
- 崩れても多くは保守的な方向で、・期待度数1でも 0.0335。ただし単調ではなく、期待度数 1.6 付近で 0.054、単一の極小セル()で 0.0537 とわずかに5%を超える領域もある。
- は が小さくても偏っていても厳密に成立する。ただし に真の確率を使う場合のみで、パラメータを推定した場合は成立しません(正規分布の例で 4.9458)。
- 危ないのは最小期待度数が小さいとき(偏った表ではここが真っ先に小さくなる)と、スパースなセルが大量にあるときの (0.1624)。
- と の優劣は状況で逆転する。 一様な多セルでは が頑健、偏った表では によって入れ替わる。
- 正確検定は構造的に保守的(p値が階段状にしか動かない)。フィッシャーは10対10で実サイズ 0.0128、代金は検出力10ポイント。イェーツ補正はさらに行き過ぎる。
- 最小期待度数 11.4 で目安を満たしていても p ≈ 4e−06 で棄却される。 目安は近似の話で、当てはまりの話ではない。
「正規性を検定してからt検定」も機能しない
- 2標本ならサイズは壊れないので検出力の問題。ただし1標本では歪度でサイズが壊れる(対数正規で 0.0862)。
- 平均は中心極限定理に守られるが、分位点は守られない。 正規仮定の99%点の区間は被覆率 1.6% まで崩壊する。
- 適合度検定は判定装置ではなく診断装置。p値ではなくセルごとの寄与を読む。
→ 第14回。
第13章 ノンパラメトリック法
順位に直すと分布を忘れる(2段構え)
主張1: で は単調非減少だから、 が連続なら確率1で順序が保たれる。だから順位のパターンは元の分布の情報を持たない。
主張2:忘れた結果、 のもとで全割り当てが等確率になり、帰無分布が数え上げで確定する。
- 検証:コーシー・対数正規を含む4分布で40万回ずつ回して、 通りの厳密分布と最大誤差 0.0012 で一致。
- パラメトリック検定は母集団の分散を推定するために自由度を消費する。順位検定は分散を数え上げで確定させる。 これが設計思想の分かれ目。
失うのは正規分布で4.5%
| 母集団 | ARE(t検定の必要 ÷ 順位和の必要 ) |
|---|---|
| 正規 | |
| 一様 | 1.0000 |
| ロジスティック | |
| 二重指数 | 1.5 |
| 1.90 | |
| コーシー |
- 正規は最悪ケースではありません。 あらゆる連続分布での下限は (ホッジス=レーマンの下限)。正しい保証は「正規で4.5%、どんな分布でも14%以内」。
- 崩れると逆転:2群 で外れ値10%混入なら 0.2263 対 0.4376、対数正規で 0.3460 対 0.6073。
- t検定は外れ値混入で が 0.030 に落ちる。安全マージンではなく検出力の漏れ。
結論が食い違ったら向きを見る
| 状況 | t検定のみ有意 | 順位和のみ有意 | 読み方 |
|---|---|---|---|
| 正規・差なし | 0.0103 | 0.0094 | 対称 → 偶然 |
| 外れ値混入 | 0.0002 | 0.2901 | 非対称 → t検定が鈍っている |
- 順位和の が保証されるのは のときだけ。 形や分散が違う2群では保証が消える(マン=ホイットニーのベーレンス=フィッシャー問題)。厳密にやるならブルンナー=ムンツェル検定。
- 中央値の検定と読むには位置ずれモデル が必要。 順位和が敏感な方向は確率的優越 。
並べ替えと頑健性は直交している
「並べ替え」は帰無分布の作り方であって、頑健性は統計量の選び方から来る。
- 同じデータで「生の値の平均差の並べ替え」と「順位に置換してからの並べ替え」が両方 p = 0.0317。
- しかし外れ値を大きくすると、平均差版は 0.0317 → 0.4603 と崩壊し、順位和は 0.0317 で不動。並べ替えても統計量が弱ければ弱い。
- 並べ替えの売りは検出力ではなく の正確さ(全条件で 0.048〜0.051、t検定は 0.0253/0.0355)。
- 並べ替えにも交換可能性という前提が要る。「平均だけが等しく分散が違う」では厳密にならない。
- 順位検定が今も使われる理由3つ:①重い裾で検出力が上 ② 大で正規近似が一瞬(億)③帰無分布が表になっていて手計算・査読できる。
6手法は一本の原理の変奏
| 手法 | 何を並べ替えるか | 統計量 | 平均 | 分散 |
|---|---|---|---|---|
| 符号検定 | 各個体の符号 | 正の個数 | ||
| 符号付順位 | 各個体の符号 | |||
| 順位和 / U | 群のラベル | |||
| クラスカル=ウォリス | 群のラベル(多群) | — | ||
| スピアマン | 片方の順位の並び | 順位のピアソン | 0 | |
| ケンドール | 片方の順位の並び | 0 |
- 「何を並べ替えるか」の列が設計そのもの。 ここを間違えると p が 0.0060 → 0.7929 に飛ぶ(個人差 SD 68.0 を差の SD 7.6 の代わりに使う=ノイズを9倍にする)。
- 分散の列の 12・4・24・ は全部「順位の平方和が最初から決まっている」ことから来ている。
- は独立和なので有限母集団修正が要らない(対称性の仮定から絶対値の順位と符号が独立になる)。順位和の は非復元抽出の名残。
- 対応ありは引き算して1標本問題に変換するだけ。帰無分布は群ラベルでなく各人の符号を 入れ替える 通り。
タイ(5段階評価アンケート)
なら補正項が自動的に消えて元の式に戻ります。
| データ | 値の種類 | p 補正あり | p 正確 | |
|---|---|---|---|---|
| 連続値 | 20 | 1.0000 | 0.0002 | 0.0000 |
| 5段階 | 4 | 0.9211 | 0.0040 | 0.0044 |
| 3段階 | 3 | 0.8895 | 0.0005 | 0.0004 |
| 2値 0/1 | 2 | 0.7444 | 0.0318 | 0.0698 |
- 最後の行が警告。補正しても正規近似そのものが破綻している(有意/非有意が逆転)。粗いときは正確検定。
- 2値データでは順位和検定の帰無分布は超幾何分布そのもので、フィッシャーの正確検定と片側が恒等的に一致します(両側は p の定義次第)。実務では2値なら素直にフィッシャーか比率の検定を使う。
クラスカル=ウォリスと順位相関
- 正体は「順位に対する一元配置分散分析」。SST は常に一定なので、F 比のような「割り算の分布」を考えずχ²で済む。
- にすると順位和の と完全一致()。
- は(タイがなければ)厳密だが分散は足りない(2.72 対 4)→ χ²近似は保守的(正確 0.000904 に対し近似 0.006806)。
- スピアマンは「順位に対するピアソン」、ケンドールは「2点選んで順番が合う確率」。母相関0.5のときケンドールはちょうど ()なので、 だから弱い、と読むのは誤り。
- 外れ値耐性:1点いじるとピアソン 0.9394 → 0.5229、順位版は 0.9515/0.8222 で不動。
- 分散が公式と一致しても近似が使えるとは限らない。 の で は厳密一致しているのに、正規近似 0.047761 対 正確 0.061012 で の判定が逆転する(形=裾が正規から外れている)。
→ 第15回。
つまずきやすいところ
試験前に見返す用の一覧です。
| よくある誤解 | 正しい理解 | 章 |
|---|---|---|
| SD と SE は同じもの | SE は「推定量に対する SD」。SD は世界のばらつき、SE は自分の知識の不確かさ | 8 |
| 不偏でないなら悪い推定量 | 不偏性は偏りしか見ない。MSE なら MLE が勝つ場合がある | 8 |
| 一致性は「幅が縮むこと」 | 縮んで寄っていく先が かまで含む | 8 |
| フィッシャー情報量は計算するもの | 逆数の平方根が SE。用途を先に知る | 8 |
| 情報量の期待値は に を代入 | 式全体の期待値。負になったら計算ミス | 8 |
| で割るのは分散の定義 | 不偏性の話。真の を使えば 割りでも不偏 | 8 |
| 真の値がこの区間に入る確率は95% | 観測後は定数なので 0 か 1。95%は手続きの性質 | 9 |
| 母比率の区間推定は新しい話 | 0/1 データの平均なので同じ式の特殊ケース | 9 |
| 区間が重なれば差はない | 足せるのは分散。2.77〜3.92 は「重なるが差はある」 | 9 |
| 素朴に足した SE は狭すぎて危険 | 無駄に広い(被覆率 0.9944)ので差を見逃す | 9 |
| 母分散の区間も下端に | が分母なので大小が入れ替わる | 9 |
| の設計なら差が見つかる | 検出力はちょうど 50%。80%なら 2.0432 倍 | 9 |
| 教科書に載っている順が正しさの順 | Wald 型比率区間は で被覆率 18% | 9 |
| ブートストラップは万能 | で t区間の62%、 の最大値は被覆率 0 | 9 |
| を採択できる | は無数の分布の集まりなので確率が計算できない | 10 |
| を守れば正しい検定 | 同じ で検出力は 0.80 から 0.00 まで変わる | 10 |
| 裾を棄却域にするのは慣習 | 尤度比を大きい順に取った結果 | 10 |
| ピアソンの 検定は尤度比検定 | スコア検定。尤度比版は | 10 |
| ウィルクスの自由度はモデルで決まる | が縛ったパラメータの本数 | 10 |
| ワルド検定は標準的だから安全 | で誤り率 0.5998。普及の理由は計算が1回で済むから | 10 |
| 個別のp値で変数選択してよい | 相関が高いと両方「要らない」と出る(同時なら ) | 10 |
| 信頼区間は検定と別に覚えるもの | 双対性で1対1。ウィルソン=スコア、プロファイル=尤度比 | 10 |
| ボンフェローニは厳しすぎるが確実 | ホルムが上位互換(例外は同時信頼区間)。相関があると FWER 0.0043 | 10 |
| p < 0.05 なら は 5% 未満 | リンドリーのパラドックス。 大では が 0.993 | 10 |
| t検定の種類は統計的に選ぶ | データの取り方で確定。1行が2つの数字なら対応あり | 11 |
| F検定で等分散を確かめてからt検定 | F検定自体が指数分布で 30.85% まで壊れる | 11 |
| 等分散版はウェルチの下位互換 | 厳密にt分布に従う・分散分析の土台という役割がある | 11 |
| 対応ありは常に有利 | では負ける(自由度を半分にした損が残る) | 11 |
| 正規性が崩れたときの答えは一つ | 平均は で直り、分散は で悪化する | 11 |
| 誤り率が名目より低いのは安全 | 検出力の漏れ。対応を無視すると 0.00% まで落ちる | 11 |
| 母比率の SE は で作る | 帰無仮説の で作る。 だと 66.82% | 11 |
| が大きいほど相関の検定は信頼できる | なら で有意。弱い相関が通る | 11 |
| 「一般の分布の検定」=適合度検定 | 主流は尤度比・ワルド・スコア。適合度はその一員 | 12 |
| 適合度検定の は確率ベクトル | 分布族という「曲線」に乗っているか。だから 本減る | 12 |
| 推定すれば は必ず小さくなる | 最尤推定 ≠ 最小カイ二乗推定 | 12 |
| 期待度数5未満は危険 | 崩れても多くは保守的側(単調ではない)。危ないのは最小期待度数とスパースな | 12 |
| はいつでも厳密 | 真の を使う場合のみ。推定すると成立しない(4.9458) | 12 |
| 目安を満たせば当てはまっている | 目安は近似の話。最小期待度数 11.4 でも p ≈ 4e−06 | 12 |
| 正確検定は厳密だから安心 | 構造的に保守的(実サイズ 0.0128、検出力−10pt) | 12 |
| 正規性を検定してからt検定すればよい | 2標本は検出力の損、1標本は歪度でサイズが壊れる | 12 |
| が大きければ分位点も信頼できる | 平均はCLTに守られるが分位点は守られない(被覆率 1.6%) | 12 |
| 順位検定は信頼区間や効果量が苦手 | 指標が平均差でないだけ。U・効果量・ホッジス=レーマンがある | 13 |
| 正規分布が ARE の最悪ケース | 下限は 。正規は底ではない | 13 |
| 並べ替え検定なら前提が不要 | 交換可能性が必要。統計量が弱ければ 0.4603 まで崩壊 | 13 |
| 順位和は中央値の検定 | 確率的優越が本体。中央値と読むには位置ずれモデルが必要 | 13 |
| なら相関が弱い | 母相関 0.5 でちょうど 。 とは別スケール | 13 |
| 分散が公式と一致すれば近似できる | の で判定が逆転。形が違う | 13 |
この範囲で、連載がまだ扱っていないこと
正直に書いておきます。
| 章 | 未収録の項目 |
|---|---|
| 8 | 因子分解定理・完備性とラオ・ブラックウェルの定理、指数型分布族の一般論、ベイズ推定量(事後平均・MAP)、EMアルゴリズム |
| 9 | 予測区間と許容区間の区別、同時信頼領域 |
| 10 | 一様最強力検定の存在条件、不偏検定、順序制約のある検定、逐次検定(SPRT) |
| 11 | 分散分析への接続(多群の平均)、多重比較法の具体手順(テューキー・ダネット) |
| 12 | 分割表の詳細(第30回で扱う予定)、コルモゴロフ=スミルノフ検定、正規性検定の各手法(シャピロ=ウィルクなど) |
| 13 | 大標本での正規近似の切り替え基準、順位に基づく信頼区間の具体的な作り方、ムード検定などの尺度の検定、ブルンナー=ムンツェル検定 |
とくに分散分析への接続(第11章の等分散版t検定が土台になる話)は第20回で扱いますが、多群の平均の比較という文脈では推測統計編の続きでもあります。第13章のクラスカル=ウォリス検定がその順位版にあたるので、両方を並べて読むと見通しがよくなるはずです。
次
推測統計はここで一区切りです。次は線形モデル編(第16章 重回帰分析)に入ります。ここまでは1つか2つの変数を扱ってきましたが、変数が3つ以上になると「どの変数がどの変数に効いているのか」という新しい問いが出てきます。
→ 連載の目次:統計検定準1級 独学記事インデックス
この連載は、うまくいった記録だけでなく詰まった箇所も含めて書いています。同じく準1級を目指している方、一度挫折した方の参考になれば嬉しいです。