統計検定準1級 多変量解析 要点まとめノート【第22〜26章】

この記事の役割

多変量解析(第22〜26章)の復習ノートです。連載の各回が「なぜそうなるのか」を実験しながら追う記事なのに対し、こちらは押さえるべきことだけを1ページに集めたものです。詳しい導出や検算は各回へのリンクから読んでください。

この範囲の全体像

線形モデル編は「1つの yy を複数の xx で説明する」話でした。ここからは説明する側とされる側の区別が消えます。変数が横に並んでいるだけの表を渡されて、そこから構造を取り出す。

そして5つの章は、ばらばらの手法集ではありませんでした。ほぼ全部が「行列を1つ作って固有値分解(または特異値分解)し、大きい固有値の軸から順に使う」という同じ型です。違うのは、その行列の作り方だけです。

何を分解するか出てくる道具
22分散共分散行列(または相関行列)固有値・寄与率・負荷量・マハラノビス距離
23群内変動の逆行列 × 群間変動 W1BW^{-1}B線形判別関数・事前確率・交差確認法
24(分解しない。距離を直接くっつける)連結法・デンドログラム・シルエット係数
25相関行列の対角を共通性に差し替えた行列因子負荷量・共通性・回転・偏相関
26距離行列の二重中心化/分割表の「観測 − 期待」を 期待\sqrt{\text{期待}} で割った行列MDS・正準相関分析・対応分析

第22章と第25章は同じ機械に別のものを入れているだけでした。主成分分析は相関行列をそのまま、因子分析は対角を共通性に差し替えてから分解します。「矢印の向きが逆」という考え方の違いは、計算上はこの対角の扱いにだけ現れるのでした。

RLL主成分分析:対角も含めて近似R=ΛΛ+Ψ因子分析:Ψが対角を引き受ける\underbrace{R \approx LL^\top}_{\text{主成分分析:対角も含めて近似}} \qquad \underbrace{R = \Lambda\Lambda^\top + \Psi}_{\text{因子分析:}\Psi\text{が対角を引き受ける}}

そして第26章がこの編の地図でした。横軸に「正解ラベルがあるか(教師なし/教師あり)」、縦軸に「変数(列)の関係を相手にするのか、個体(行)を相手にするのか」を取ると、5章の手法が4つのマスに収まります。

教師なし教師あり
変数(列)を相手にする主成分分析・因子分析・正準相関分析・対応分析重回帰分析(線形モデル編)・数量化I類
個体(行)を相手にするクラスター分析・MDS判別分析・数量化II類

「量的か質的か」は第一の軸ではありません。 判別分析は説明変数が量的で目的変数が質的、数量化I類はその逆なので、データの型を軸にすると置き場所が決まりません。データの型は3番目の区別です。

この地図で見ると、第26章が「その他」の寄せ集めではないことが分かります。第24〜27回で埋まっていたのは左上の量的なマスと左下、右下の判別分析だけで、質的データを相手にするカードが1枚も無かった。第26章の4手法はそこを埋めに来ています。

章と回の対応

章タイトル対応する回
第22章主成分分析第24回
第23章判別分析第25回
第24章クラスター分析第26回
第25章因子分析・グラフィカルモデル第27回
第26章その他の多変量解析手法第28回

この編は確率過程編(第14〜15章)の後に置いていますが、内容として直接受けるのは線形モデル編です。とくに第16回の決定係数・多重共線性・偏回帰係数と、第20回の平方和の分解が繰り返し出てきます。

用語集

言葉で説明できるかを先に確認する用です。

第22章 主成分分析

用語記号意味
主成分分析(PCA, Principal Component Analysis)正体は「Σ\Sigma の非対角成分が0になる座標に乗り換えること」
分散共分散行列Σ\Sigma対角に分散、非対角に共分散。非対角は等確率楕円を傾ける唯一の担当
相関行列RR「全変数を標準化してから作った Σ\Sigma」。別の道具ではない
固有値λ\lambdaその主成分の分散そのもの
寄与率固有値 ÷ 固有値の合計
主成分得点 / 主成分負荷量得点は個体に付く(nn 個)、負荷量は変数に付く(pp 個)。負荷量は主成分と元の変数の相関
等確率楕円z2=z^2 = 一定1変数の 1σ1\sigma2σ2\sigma の線が2次元で楕円になったもの
マハラノビス距離dMd_Mばらつきの形をものさしに組み込んだ距離
白色化回転してから各軸を λ\sqrt{\lambda} で割り、どの方向も同じばらつきにする操作
主成分回帰(PCR, Principal Component Regression)固有値の小さい主成分を捨ててから回帰する
マスキング効果外れ値が Σ\Sigma を膨らませて自分の異常度を薄める現象

第23章 判別分析

用語記号意味
線形判別関数z=wx+cz = w^\top x + c符号で群を決める式。値 zz を判別得点という
線形判別分析 / 2次判別分析(LDA / QDA)Linear / Quadratic Discriminant Analysis。境界が超平面/2次曲線
プールした共分散行列(群内共分散行列)S=W/(ng)S = W/(n-g)群ごとの散らばりをまとめて1つに推定したもの。分母は ngn-g
事前確率πg\pi_gデータを見る前の「この群である割合」。有病率がこれ
見かけの誤判別率ルールを作ったのと同じデータで測った誤判別率。平均的に楽観側に偏る
交差確認法 / 1個抜き(LOO, Leave-One-Out)分割して学習・評価を繰り返す。LOOはわずかに悲観側に偏る
ウィルクスのラムダΛ=W/T\Lambda = \lvert W\rvert / \lvert T\rvert群内に残っている変動の割合。小さいほうがよい(決定係数と向きが逆)
ホテリングの T2T^2T2T^22群の平均が等しいかを多変量で検定する統計量。t検定の多変量版
サポートベクターマシン(SVM, Support Vector Machine)マージン(境界から最近点までの幅)を最大化する。本質的に2群専用

第24章 クラスター分析

用語記号意味
階層的クラスタリング近いものから順に融合して木を作る。n1n-1 回の融合で終わる
連結法(linkage method)クラスター間の距離の定義。手法名の違いはここだけ
デンドログラム融合の履歴の樹形図。dendro(樹)+ gram(図)
クラスター内平方和WSS\mathrm{WSS}各点と自分のクラスターの重心との平方距離の合計。誤差平方和 ESS\mathrm{ESS} と同じもの
鎖効果(chaining effect)最短距離法で点が数珠つなぎになり細長いクラスターができる現象
ウォード法の融合コストΔESS\Delta\mathrm{ESS}ninjni+njxˉixˉj2\dfrac{n_i n_j}{n_i+n_j}\lVert \bar x_i - \bar x_j\rVert^2。重心間の平方距離にサイズの係数が掛かる
シルエット係数sis_i(biai)/max(ai,bi)(b_i - a_i)/\max(a_i,b_i)1-111 で、大きいほどよい
コーフェネティック距離デンドログラム上で2点が初めて同じ枝に入る高さ
ギャップ統計量Gap(k)\mathrm{Gap}(k)構造のないデータの logWk\log W_k と実データの差

第25章 因子分析・グラフィカルモデル

用語記号意味
共通因子 / 独自因子ff / eie_i複数の変数に共通して効く見えない変数/その変数だけに効く要因
因子負荷量λij\lambda_{ij}, Λ\Lambda因子が観測変数に与える影響の大きさ
共通性hi2h_i^2その変数の分散のうち他の変数と一緒に動く分
独自性ψi\psi_i, Ψ\Psi(対角行列)共通性の残り。相関行列を分析するなら ψi=1hi2\psi_i = 1 - h_i^2
単純構造各変数が1つの因子にだけ大きな負荷を持つ状態
バリマックス回転 / プロマックス回転直交を保つ/因子間相関を許す(斜交)回転
ヘイウッドケース独自性が負(=分散が負)になる不適解
精度行列K=R1K = R^{-1}相関行列の逆行列。非対角から偏相関が読める
偏相関係数rXYZr_{XY\mid Z}他の変数の線形の影響を除いた2変数の相関
合流点(コライダー)XZYX \to Z \leftarrow Y2変数から矢印を受ける変数。条件づけると偽の相関が生まれる

第26章 その他の多変量解析手法

用語記号意味
多次元尺度構成法(MDS, Multidimensional Scaling)距離(非類似度)の行列だけから座標を作る。日本語の正式名は多次元尺度構成法
古典的MDS距離の値そのものを使い、二重中心化して固有値分解する。別名主座標分析(PCoA)
非計量MDS距離の順序だけを使い、単調回帰で当てはめてストレスを最小化する
二重中心化B=12JD2JB = -\frac{1}{2}JD^2J距離行列を内積行列に変換する操作。J=I1n11J = I - \frac{1}{n}\mathbf{1}\mathbf{1}^\top
正準相関分析(CCA, Canonical Correlation Analysis)rkr_k変数群2つの合成変数の相関を最大化する。XXYY に向きは無い
対応分析(CA, Correspondence Analysis)分割表の行と列を同じ平面に置く。数量化III類と同じ計算
総イナーシャχ2/n\chi^2/n分割表のズレの総量。nn は表の度数の合計
ガットマン効果(馬蹄形効果)順序構造+一峰性の反応があると弧を描く現象
数量化I〜IV類I=ダミー重回帰、II=判別分析、III=対応分析、IV=MDSと同じ問題設定
カテゴリースコア / レンジカテゴリに割り当てた数値/アイテム内の最大−最小。レンジは標準化されていない

記号の注意Λ\Lambda が2つの意味で使われます。第23章のウィルクスのラムダ(スカラー、W/T\lvert W\rvert/\lvert T\rvert)と、第25章の因子負荷量行列p×mp \times m 行列)です。前者は 0Λ10 \le \Lambda \le 1 のスカラーなので文脈で区別できます。

WW も2つあります。第23章の群内変動行列S=W/(ng)S = W/(n-g)WW)と、第24章のクラスター内平方和 WkW_kWSS\mathrm{WSS})です。どちらも「群の内側のばらつき」を表す量なので発想は近く、実際ウォード法は第20章の平方和の分解を階層的に繰り返しています。

SS は第23章でプールした共分散行列、第24章のマハラノビス距離では単に共分散行列を指します。

第22章 主成分分析

多次元正規分布は「拡張」ではなく書き換え

z2=(xμ)Σ1(xμ)z^2 = (\mathbf{x} - \boldsymbol{\mu})^\top \Sigma^{-1} (\mathbf{x} - \boldsymbol{\mu})

1変数の z2=(xμ)2/σ2z^2 = (x-\mu)^2/\sigma^21/σ21/\sigma^2Σ1\Sigma^{-1} に置き換わっただけです。密度の前の係数も σ\sigmaΣ1/2\lvert\Sigma\rvert^{1/2} になります。1次元では Σ=[σ2]\Sigma = [\sigma^2] なので元の式に戻ります。

  • 非対角成分は「傾き」の唯一の担当。非対角が0なら絶対に傾かない。ただし傾きの角度そのものは対角成分にも依存する(非対角0.8のまま対角が (1,1)(1,1) なら45.0度、(2.25,0.36)(2.25, 0.36) なら20.1度)
  • z2z^2 の値と確率は一致しない。 1次元の z2=1z^2=1 は68.3%だが、2次元では39.3%z2=4z^2=4 で86.5%(95.4%ではない)、z2=9z^2=9 で98.9%。2次元の確率は 1ez2/21 - e^{-z^2/2}
  • 共分散は単位で変わり相関係数は変わらない。秒→分にすると共分散は 568.3333 → 9.4722(ちょうど 1/601/60)、ρ\rho は 0.988727 のまま
  • 2変数の相関行列の固有値は 1+ρ1+\lvert\rho\rvert1ρ1-\lvert\rho\rvert これは2変数限定(6指標の相関行列の固有値は 3.349, 2.560, 0.066, 0.025, 0.0002, 0.00004 でこの形をしていない)。楕円の細長さは固有値の比の平方根 λ1/λ2\sqrt{\lambda_1/\lambda_2} で、ρ=0.9\rho=0.9 なら 1.9/0.1=4.36\sqrt{1.9/0.1} = 4.36

分散最大化が固有値問題になる

uu 方向に落としたときの分散は uΣuu^\top \Sigma u で、これは定義ではなく導ける事実です。展開すると第3回V[aX+bY]=a2V[X]+2abCov[X,Y]+b2V[Y]V[aX+bY] = a^2V[X] + 2ab\,\mathrm{Cov}[X,Y] + b^2V[Y] そのものになります。

  • 角度を0度から180度まで0.05度刻みで3601通り総当たりすると、最大は29.6度で 1329.3、最小は 119.6度で 5.6。Σ\Sigma の固有値と比べると 1329.316304 対 1329.316406(差 1.02×1041.02\times10^{-4}で、差はスキャンの刻み幅による誤差
  • 最大の方向と最小の方向の角度差はちょうど 90.0000 度Σ\Sigma が対称行列なので固有ベクトルが必ず直交する
  • Σu=λu\Sigma u = \lambda u を満たせば分散は u(λu)=λu^\top(\lambda u) = \lambda固有値がそのまま主成分の分散
  • 主成分の座標に乗り換えると非対角成分が消える(実測 8.095×1014-8.095\times10^{-14})。分散の総量は 1006.666667 + 328.222222 = 1334.888889 = 1329.316406 + 5.572483 で完全に保存され、配分だけが 1006.7/328.2 → 1329.3/5.6 に変わる

寄与率は決定係数と同じもの

  • 6指標の例で、kk 個の主成分から復元した説明率と累積寄与率が小数第9位まで一致k=1k=1 で 0.558142887 / 0.558142887、k=2k=2 で 0.984726599 / 0.984726599)
  • ただし一致するのは全変数を合計した分散に対する割合。変数ごとの R2R^2 は PV 0.5561・平均滞在秒 0.3329・被リンク数 0.6826 とばらつき、その平均が 0.558143。「第1主成分で各指標が56%説明できる」は誤りで、正しくは「全体を平均すると56%」
  • 一致には条件が2つ。(1) 主成分分析と同じ計量で残差を測ること(相関行列で分析したのに生の単位で測ると k=1k=1 で 0.5553 になりずれる)。(2) 全変数の合計に対する割合であること

負荷量の公式は簡約形

負荷量jk=ujkλksj\text{負荷量}_{jk} = \frac{u_{jk}\sqrt{\lambda_k}}{s_j}

「固有ベクトル ×\times 固有値\sqrt{\text{固有値}}」は相関行列で分析した場合限定sj=1s_j = 1 なので分母が消える)。共分散行列版でこれをやると [1136.67, 835.37, ...] のように ±1\pm 1 を大きく超えます。正しい一般形で計算すれば [0.99999, 0.99995, −0.0859, ...] に収まります。

  • 検算1「負荷量の2乗和 = λ1\lambda_1」は標準化した場合限定
  • 検算2「各変数で全主成分の負荷量2乗和 = 1.000000」は一般形を使えばどちらでも成立

相関行列か分散共分散行列か

  • PVの分散 1,292,063 と被リンク数の分散 16 で約8万倍の差。Σ\Sigma 版の第1主成分は PV 0.8058・セッション 0.5922 でほぼ決まり寄与率 99.71%RR 版は6指標が 0.32〜0.45 に散って寄与率 55.81%
  • PVを「千PV」に変えるだけで Σ\Sigma 版は 99.7066% → 99.1828% と変わり、RR 版は 55.8143% のまま
  • 原則は相関行列。 分散共分散行列を選ぶのは「全変数が同じ単位で、かつ分散の差そのものに意味があるとき」(同一試験の各科目の点数など)。単位が混在していたら選択の余地はない
  • カイザー基準「固有値 > 1」は相関行列のときだけ意味を持つ。Σ\Sigma の固有値は単位に依存する(この例では 1989946 など)ので1と比べても無意味

マハラノビス距離は方向を選ばない

dM2=k=1pzk2λkd_M^2 = \sum_{k=1}^{p} \frac{z_k^2}{\lambda_k}

主成分座標を λ\sqrt{\lambda} で割ってユークリッド距離を取った値と一致します(最大の差 2.66×10152.66\times10^{-15})。分母が小さい方向のズレが強く効きます。

  • ユークリッドとマハラノビスで外れ値の順位が逆転する。 点A はユークリッド 148.17・マハラノビス 2.30、点B はユークリッド 124.69・マハラノビス 7.05。ユークリッドのトップ5では点Bが4位まで落ちる
  • 点Bの生のズレは第2主成分方向に 37.09 しかないが、第2主成分の標準偏差が 5.44 なので 6.81σ\sigma
  • マハラノビス距離は可逆な線形変換すべてに不変。 Σ\Sigma で計算しても標準化して RR で計算しても 2.2992282507 / 7.0496091167 で同じ(差 4.44×10164.44\times10^{-16})。単位を変えても動かない
  • いっぽう主成分分析は動く(第1主成分の角度が 12.2640° → 86.1901° → 0.1237° と変わる)。捨てる(方向を選ぶ)操作が入ると、その前のスケールが効いてくる
  • dM2d_M^2χ2(p)\chi^2(p) に従うのは μ\muΣ\Sigma が既知のときだけ。 同じ標本から推定した場合はベータ分布に関係する量で、dM2(n1)2/nd_M^2 \le (n-1)^2/n という上限が付くn=62n=62 なら 60.02)。上側5%は χ2(2)\chi^2(2) 近似で 5.9915、厳密には 5.7954 で、近似のほうが甘く外れ値を見逃す側
  • idM2=(n1)p\sum_i d_M^2 = (n-1)pトレースの恒等式なので正規分布かどうかと無関係に成立。だから62点の dM2d_M^2 の平均は p=2p=2 ではなく (n1)/n×p=(n-1)/n \times p = 1.9677
  • マスキング効果:外れ値2点を除いて Σ\Sigma を再計算すると点Bの dMd_M7.05 → 17.05(約2.4倍)に跳ね上がる。外れ値自身が Σ\Sigma を膨らませて自分を隠していた

主成分回帰で効いているのは「捨てる」ステップ

  • x1 と x2 の相関 0.989834。OLSでは R2=R^2 = 0.966616 と当てはまりは良好なのに x2 の t値が 1.800(5%基準 2.0281)で有意にならず、p値 = 0.0803。VIF は x1 49.61、x2 49.67、x3 1.01 で標準誤差が 7.0倍
  • 原因は固有値の逆数。相関行列の固有値 2.0006, 0.9893, 0.0101 の最小値が逆行列で 99 に化ける
  • 全部の主成分を使うと OLS と完全に一致するR2=0.966616R^2 = 0.966616)。回帰は座標の回転で不変なので、無相関にするだけでは何も改善しない
  • k=1k=1 にすると累積寄与率 66.69% で捨てすぎ、x3 の係数が 0.7 → 0.1783 に潰れる(第2主成分が x3 をほぼ全部担っていた)。k=2k=2(累積 99.66%)なら 0.8849 / 0.5289 / 0.7458 で3つとも真の値に近い
  • Leave-One-Out の振れ幅は x1 が OLS 0.3081 → PCR 0.0257(0.083倍)。ただし x3 は 1.016倍でほぼ変わらない
  • PCR は一般には不偏性を失う。ただし真の β\beta が残した主成分の空間に入っていれば不偏。「捨てた方向に真の係数の成分があるか」が分かれ目

FAQ:ワークブックの例題を解いていて詰まった点

公式ワークブックの例題を解く過程で自分が実際に引っかかった疑問と、数値で確かめた答えです。

Q1. 主成分得点と主成分負荷量はどう使い分けるのか

同じデータ行列の「行」と「列」を見ている、と整理すると混乱しません。

主成分得点主成分負荷量
何に付くか個体(行)。記事・人・企業変数(列)。指標・項目
個数nnpp
答える問いこの個体はどの位置か」この主成分は何を表すか」
範囲制限なし(分散が λ\lambda−1 〜 +1(相関係数)
用途プロット・回帰の説明変数・クラスタリング主成分に名前を付ける

実務では両方使います。まず負荷量で軸の意味を決め、次に得点で個体を並べる。 バイプロットはこの2つを1枚に重ねた図です。

Q2. なぜ固有ベクトルのままではなく、負荷量にして議論するのか

λk\sqrt{\lambda_k} は主成分ごとの定数なので、同じ主成分の中では順位が変わりません(実測で6変数すべて順位が一致)。だから「第1主成分の中でどの変数が効いているか」を見るだけなら、どちらでも結論は同じです。差が出るのは次の3点です。

  1. 絶対的な水準が言える。 負荷量 0.577 は「相関が中程度」と判断できるが、固有ベクトルの 0.315 は基準がない。しかも固有ベクトルの成分の大きさは変数の数に依存する ── 全変数が等しく効く場合、各成分は 1/p1/\sqrt{p} になるので、p=6p=6 で 0.408、p=100p=100 なら 0.100。「0.3 は小さい」と言えない
  2. 主成分をまたいで比較できる。 PV の固有ベクトルは第1で 0.4075、第3で 0.3628 とほぼ同じに見えるが(比 1.12)、λ1=3.349\lambda_1=3.349λ3=0.066\lambda_3=0.06650.6倍の差がある。負荷量なら 0.7457 と 0.0934 で約8倍の差が出る
  3. 2乗すると「説明できた割合」になる。 固有ベクトルの成分を2乗しても意味のある量にならない

共分散行列版では順位そのものが入れ替わります。 被リンク数は固有ベクトルでは 0.0027 で4位(ほぼ0に見える)ですが、負荷量は 0.9536 で3位。単位の大きさに埋もれていたので、固有ベクトルを見ると判断を誤ります。

Q3. 負荷量の2乗は何を表すのか(寄与率との関係)

その変数の分散のうち、その主成分が拾った割合です。全主成分で足すと必ず 1 になります。

指標第1主成分第2主成分第1+第2(共通性)全部
PV0.55610.43380.99001.0000
平均滞在秒0.33290.63680.96981.0000
被リンク数0.68260.28780.97031.0000
平均0.55810.42660.98471.0000

寄与率は「負荷量2乗の平均」でした(第1主成分の列の平均 0.5581 = 寄与率 55.81%)。だから「累積寄与率と決定係数が一致するのは平均に対してだけ」という話がここで具体的に見えます。平均滞在秒は第1主成分だけでは 33% しか説明できていません。 これは固有値と寄与率だけ見ていては分からず、どの変数が置いていかれたかは負荷量を計算しないと出てきません

採用した主成分までの2乗和を共通性(communality)と呼び、変数が捨てられていないかのチェックに使えます(この例は全指標 0.97 以上)。

Q4. 固有ベクトルは変数の数だけあるのか

はい、pp 変数なら pp 本、固有値も pp 個です。 2次元の図だけ見ていると軸が2本しかなく(しかも第2=最小)、一般の姿が見えません。

  • 固有ベクトル行列 VVp×pp \times p の正方行列。1本の長さも pp 成分(変数ごとに1つの重み)
  • pp 本すべてが互いに直交(内積の表が単位行列。VV=IV^\top V = I が実測で True)。つまり pp 次元空間の正規直交基底
  • pp 本すべて使えば情報の損失はゼロ(元データの復元誤差 8.88×10168.88\times10^{-16}

だから主成分分析そのものは「元の次元を保ったまま、直交する方向へ座標変換する手法」です。次元圧縮は主成分分析の一部ではなく、そのあとで上位 kk 本だけ採用する別の操作です。この構造から「主成分回帰で k=pk=p にすると OLS と完全一致する」ことも説明が付きます。

圧縮しても固有ベクトル1本の長さは pp のままという点に注意してください。k=2k=2 なら VkV_kp×2p \times 2 で、本数が減るだけです。復元すると列数は pp に戻り(6指標の形に戻る)、変わるのはランクが kk になることです。

kkVkV_k の形得点 ZkZ_k復元 X^\hat{X}ランク
6(6, 6)(12, 6)(12, 6)6
2(6, 2)(12, 2)(12, 6)2
1(6, 1)(12, 1)(12, 6)1

例外:nn が小さいと軸が足りません。 形式上は pp 本出てきますが、非ゼロ固有値は min(n1, p)\min(n-1,\ p)です(中心化で自由度が1つ失われる)。p=6p=6 に固定して確かめると、n=5n=5 なら4本、n=3n=3 なら2本しかありません。pnp \gg n のデータ(遺伝子データなど)では最初から n1n-1 本しか使えず、これが適用上の制約になります。

完全な線形従属でも同じことが起きます。x3=2x1+3x2x_3 = 2x_1 + 3x_2 とした3変数の固有値は [12.15, 0.78, 0.0000] で、3変数だが実質2次元。これが多重共線性の極限(Σ\Sigma の逆行列が存在しない状態)です。

第24回

第23章 判別分析

フィッシャーの判別基準は分散分析のF値

J(u)=uBuuWu,w=S1(xˉ1xˉ2),S=WngJ(u) = \frac{u^\top B\, u}{u^\top W\, u}, \qquad w = S^{-1}(\bar x_1 - \bar x_2), \quad S = \frac{W}{n-g}
  • 分離比に (n2)(n-2) を掛けると、射影後データの一元配置分散分析のF値と一致する。 実測 3.775252 × 158 = 596.489833 に対しF値 596.489833、差 1.1×10121.1\times10^{-12}(n2)(n-2) は方向によらない定数なので最大化の答えが変わらない
  • 第20回は同じ量を「検定するために読み」、ここでは「最大化して方向を探す」。態度が違うだけで量は同じ
  • 2群の平均を結ぶ向きは最良ではない。 平均を結ぶ0度方向の分離比 1.146 に対し、ピークは 139度で 3.775
  • SS の分母は ngn-gn1n-1 ではない。群の数を引く)

マハラノビス距離を使う理由

  • 同じユークリッド距離 2.50 の2点で、マハラノビス距離が 1.84 と 6.45(3.51倍)になる。出どころは Σ\Sigma の固有値 1.85 と 0.15 で、比は 1.85/0.15=3.512\sqrt{1.85/0.15} = 3.512
  • 10人の例では、ユークリッド距離で「近いほうに割り当てる」と2人(20%)を誤判別し、マハラノビス距離なら誤判別0人。テスト点500個すべてで「マハラノビス距離が小さいほう」と「線形判別関数の符号」の判定が一致
  • 「その方向の標準偏差いくつ分か」という読み方が成り立つのは主軸(固有ベクトル)方向に限る。 一般の方向では約1.9倍ずれる。厳密には Σ1/2\Sigma^{-1/2} で等方化してからユークリッド距離で測ったもの
  • 共通の共分散行列という仮定は「平均も同じ」という意味ではない。 平均は違ってよく、ばらつき方だけが共通。幾何的には全群の等確率楕円が合同(平行移動だけで重なる)

事前確率と誤判別コストは切片にだけ入る

z(x)=wx+c+logπ1π2+logc(21)c(12)z(x) = w^\top x + c + \log\frac{\pi_1}{\pi_2} + \log\frac{c(2 \mid 1)}{c(1 \mid 2)}
  • w=(5,14)w = (5, -14) は事前確率やコストを変えても完全に不変で、切片だけが 17.0000-17.000018.6094-18.6094(見逃し5倍)/18.3863-18.3863(解約8割)に動く
  • 有病率1%なら境界が中点 1.5 から 3.0317 に動く(1.5log(0.01/0.99)/31.5 - \log(0.01/0.99)/3
  • そのとき陽性的中率は 12.36% → 80.19% に上がるが、感度は 93.32% → 48.74% に落ちる(総誤判別率は 6.68% → 0.63%)。総誤判別率の最小化は人数の多い群を優先する操作なので、少数派の見逃しが増える。だから誤判別コストが必要になる
  • 見逃しを5倍重く見るなら足すのは log(1/5)=1.6094\log(1/5) = -1.6094。「解約の見逃し」は真が解約なのに継続と判定することなので c(12)c(1\mid 2)、つまり分母にあたる。符号は計算で決めず「見逃しを重く見る=そちらと判定されやすくする=その領域が広がる」という意味で検算する

見かけの誤判別率は当てにならない

  • 真の誤判別率が50%(判別不可能)なデータでも、各群10人・p=18p=18 なら見かけの誤判別率は 0.24% になる。同条件で LOO は 51.10%、ホールドアウトは 49.55%
  • pp を増やすほど楽観側に振れる:p=1p=1 で 42.92%、p=5p=5 で 28.69%、p=10p=10 で 15.53%、p=15p=15 で 3.86%。p=18p=18 では共分散行列だけで 18×19/2=17118\times19/2 = 171 個のパラメータを推定している
  • 見かけの誤判別率が真の値を下回るのは「平均的に」であって、個々の標本で必ずそうなるわけではない
  • LOO はわずかに悲観側に偏る(50.60〜52.17%)。n1n-1 件で学習した規則を評価しているから。見かけの誤判別率の楽観側の外れに比べれば無視できる

線形と2次の使い分け

  • 等分散が真なのに2次を使う損は、標本を増やせば消える:各群 n=10n=10 で +2.27pt(21.46% 対 23.73%)、n=50n=50 で +0.18pt、n=1000n=1000 で +0.01pt
  • 分散が本当に違うのに線形を使う損は、標本を増やしても消えないn=10n=10 で 24.14%、n=1000n=1000 でも 21.97% のまま(2次なら 14.08% まで下がる)
  • この非対称性が判断の軸。間違ったモデルはバイアスなので消えず、無駄に複雑なモデルはバリアンスなので消える
  • ただし pp が大きいと2次の優位も消える:p=8p=8 で各群 n=12n=12 なら 31.29% 対 29.33% でほぼ差がない(n=50n=50 なら 27.08% 対 9.94%)
  • Box のM検定を機械的に採用するのは勧められない(標本が大きいと些細な違いでも有意になり、正規性からのずれにも敏感)。交差確認法で両方測るのが確実
  • 平均が同じなら線形判別は不能w=S1(μ0μ1)=0w = S^{-1}(\mu_0-\mu_1) = 0)だが、2次判別なら分散の違いだけで分けられる。群0 = N(0,12)N(0,1^2)、群1 = N(0,1.52)N(0,1.5^2) なら群0と判定されるのは 1.208<x<1.208-1.208 < x < 1.208 で、群1が左右2つに分断される
  • 2次判別の境界は必ず曲線ではない。 2次項の行列 Q=12(S11S01)Q = \frac{1}{2}(S_1^{-1}-S_0^{-1}) の固有値に0が混じると平行2直線になる(実例で x1=2.745x_1 = -2.7451.2071.207 の縦2直線)

ウィルクスのラムダと変数選択

Λ=WT,Λ=11+T2/(n2)\Lambda = \frac{\lvert W \rvert}{\lvert T \rvert}, \qquad \Lambda = \frac{1}{1 + T^2/(n-2)}
  • Λ\Lambda は小さいほうがよい第16回1R21-R^2 と同じ形なので、決定係数と向きが逆)
  • 無関係な変数 x3x_3 は単独で Λ=0.9995\Lambda = 0.9995。前向き選択で 1.0000 → 0.7219 → 0.6401 → 0.3238 と下がり、最後に x3x_3 を足しても 0.3238 → 0.3236 しか動かないのにF値は 80.733 → 60.100 に落ちる
  • 貪欲法は組み合わせとしての最良を保証しない。 1番目に選ばれた x4x_4Λ=0.7219\Lambda = 0.7219)は x1x_1(0.7280)とわずかな差で、しかも両者の相関は 0.95
  • Λ\LambdaT2T^2 の対応は小数10桁まで一致Λ=0.314098\Lambda = 0.314098T2=869.12T^2 = 869.12

ロジスティック回帰・SVMとの対比

  • 前提(多変量正規)は「最適性の保証」のためにあり、「動作の条件」ではない。 0/1変数20個のスパム判定でも n=200n=200 以上ならむしろ線形判別分析が勝つ(7.62% 対 8.57%、n=1000n=1000 で 5.70% 対 5.96%)
  • 完全分離のとき、ロジスティック回帰は標準誤差が 10510^510610^6 に発散するが、線形判別分析は有限の値を返すw=(18.67,18.67)w = (-18.67, -18.67)、切片 186.67)
  • 教科書の「線形判別分析のほうが効率がよい」は差が出る条件が限定的D=1D=1 ではほぼ互角(超過誤差の比 0.99〜1.03倍)、D=4D=4 で 2.83〜4.35倍。しかも実害は D=4D=4n=25n=25 で 2.54% 対 3.42%(差 0.88pt)
  • 外れ値への強さも限定つき。極端な外れ値では両者とも偶然水準まで壊れる(20.4% → 53%)。差が見えるのは中程度のときで、そこはロジスティック回帰が約2pt よい(32.81% 対 34.66%)
  • 速度は nn を増やす方向では判別分析が圧勝(n=800n=8000.106ms 対 184.3ms、1743倍)。ただし pp を増やすと p=1600p=1600 で逆転(100.9ms 対 24.7ms)。「どちらが速いか」は測る軸で答えが変わる
  • p>ngp > n-gSS が特異になり計算不能になるn=50n=50p=60p=60 で行列式 3.0×102023.0\times10^{-202}、条件数 3.9×10173.9\times10^{17})。ただし S+λIS + \lambda I を使うリッジ判別分析なら pnp \gg n でも動くp=1000p=1000n=200n=200 で 0.00%)。代わりに λ\lambda という調整パラメータが増える
  • SVM は CCγ\gamma の選び方だけで誤判別率が 0.0% から 50.0%(偶然水準)まで動く。判別分析には調整パラメータがない
  • 無関係なノイズ列を足すと SVM も同程度に悪化する(11.94% → 30.06%)。SVMが得意なのは「意味のある列が大量にある」場合

第25回

第24章 クラスター分析

失われるのは「1列」ではなく採点する能力

判別分析との違いは入力としては正解ラベルの有無ですが、「だけ」ではありません。交差確認法という命綱が使えなくなるので、「結果が手法に依存する」「正しさを検定できない」が派生します。

  • クラスター分析は隠れた正解を発掘する装置ではなく、与えた距離のものさしで見て目立つ構造を返す装置。真の群が左右にあっても上下の散らばりが大きければ上下に切る(ウォード法の一致率 50.8%、同じデータにラベル付きの判別分析なら正答率 85.0%
  • kk を指定すれば必ず kk 個返す。 「有意差なし」に相当する出力が無い

標準化は精度向上ではなく恣意性の除去

  • 年齢(標準偏差 7.49歳)と年収(206万円)を標準化せずに使うと、距離への寄与が年齢 0.0000000013% / 年収 99.9999999987%(約770億分の1)になる。標準化すれば 50.00% / 50.00%
  • そのとき2変数の分割と、年収1変数だけの分割が完全に一致する(120人全員が同じクラスター)
  • 年収の単位を変えるだけで純度が動く:円 0.7500 / 万円 0.7500 / 十万円 1.0000 / 百万円 0.8417 / 億円 0.8250
  • ただし標準化が裏目に出ることもある。 無情報な変数6本(標準偏差 約0.05、本物の40分の1)が混ざると純度 1.00 → 0.96 に落ちる。標準化しないほうがよいのは「すべて同じ単位・同じ意味」のとき(各科目の点数、各月の売上)
  • 回帰との重さの違い:回帰では標準化しても係数のスケールが変わるだけで決定係数は変わらないが、クラスター分析は距離が主役なので分割そのものが変わる
  • 生データにマハラノビス距離を使うと純度 1.00(標準化と相関の補正を距離に組み込んでいる)

連結法の性質はデータの形との相性

データの形最短最長群平均重心ウォード
鎖状(三日月2つ)1.00000.83330.76670.77780.7667
サイズ不均衡(80/12/12)1.00000.88460.97120.97121.0000
橋でつながった2群0.47130.91950.91950.91950.9195

同じ鎖効果が、三日月データでは唯一の勝者にし、橋のあるデータでは唯一の敗者にします。 手法の性質に良い悪いはなく、データの形との相性しかありません(橋渡しの点は7個・全体の8%だけ)。

  • 構造のないデータ(一様分布・200回試行)で最大クラスター÷最小クラスターを見ると、最短距離法 108.0(最小が5未満だった割合 99.5%)、最長 2.4、群平均 2.7、ウォード 2.2、k-means 1.5
  • 「ウォード法はサイズが揃う」は構造が無いときの傾向で、強制ではない。 100/10/10 の不均衡な構造ならそのまま再現する(純度 1.0000)。しかもいちばん揃うのはウォード法ではなく k-means
  • 距離を二乗して渡すかを気にしなくてよいのは最短距離法と最長距離法だけmin\min/max\max は単調変換で不変)。群平均法は変わり(10点の乱数300セットで 21% が不一致)、重心法・ウォード法は平方ユークリッド距離を渡すのが正しい定義ward.D に素の dist(X) を渡すと 8〜10点の乱数300セットで 42% が融合順序ごと変わる

デンドログラムの縦軸は手法で違う

ΔESS=ninjni+njxˉixˉj2\Delta\mathrm{ESS} = \frac{n_i n_j}{n_i + n_j}\lVert \bar x_i - \bar x_j \rVert^2
  • ウォード法の縦軸は距離ではなく平方和の増分。 比較可能なのは同じデンドログラム内の高さの大小だけで、異なるデータの高さを比べても意味がない
  • 目盛りには3流儀がある:ΔESS\Delta\mathrm{ESS}(教科書)/2ΔESS2\Delta\mathrm{ESS}(Rの ward.D に平方距離を渡した場合)/2ΔESS\sqrt{2\Delta\mathrm{ESS}}(scipy、Rの ward.D2)。この3つの間では木の形は完全に同じ(単調変換だから)
  • 横軸の順序に意味はない(枝を左右に入れ替えても同じ木)。2点の近さは「どの高さで初めて同じ枝に入るか」=コーフェネティック距離で読む
  • 同じ高さの融合が複数並ぶと作れない kk がある(高さ 1.0 に融合が3つ重なると k=4,5k=4,5 が作れず6個から3個に飛ぶ)。実データで完全に同じ高さになることは稀
  • n=6n=6 の例で融合コストが 1.0 → 1.0 → 1.0 → 29.000048.3333 で、合計 80.3333 が全体の平方和と一致する
  • この「総和=全体の平方和」はウォード法固有の性質ではない。 ΔESS\Delta\mathrm{ESS} は WSS の増分なのでどんな順番で融合しても総和は同じ(望遠鏡和)。ウォード法に固有なのは支払いをできるだけ後半に回すこと

ウォード法と k-means は同じ量を測るタイミングが違う

  • 最小化しているのはどちらも WSS。k-means は「各点→自分の中心の平方距離/現在の状態」、ウォード法は「2群の重心間の平方距離/くっつけた後の変化」で、さらに ninjni+nj\frac{n_i n_j}{n_i+n_j} の係数が掛かる
  • ウォード法は貪欲法なので一般には k-means の最適解に一致する保証はない。実際、構造のないデータではウォード法の WSS が k-means の最良解より大きかった割合が100%
  • k-means の初期値依存(同じデータ・k=3k=3・300回):WSS 75.87 が219回・73.0%(最良解)、144.31 が20回・6.7%、149.07 が3回・1.0%(最悪解)。異なる解が全部で22通り出て、純度は 0.96 → 0.67 に落ちる
  • ただし WSS で判定できるので複数回試すだけで解決する。 ランダム1回 73.0% → k-means++ 86.0% → 2回試行 95.0% → 3回試行 100.0%scikit-learn は既定で n_init=10init="k-means++" なので普通に使えば対策済み
  • k-means が有限回で止まる理由は「単調に減るから」では不十分(減少列は無限に続けられる)。割り当てが変わるときは狭義に減るので同じ割り当てが二度現れず、分割の総数が有限だから止まる。止まるのは中心が動かなくなる点で、大域的最小とは限らない

クラスター数の決め方

  • 真の k=4k=4 の例で、WSS の減少率は k=4k=477.5%k=5k=5 で 12.8%。平均シルエット係数は k=4k=40.7483 が最大、ギャップ統計量も k=4k=41.348 が最大。3基準が一致
  • エルボー法の問題は「主観的」より「肘が存在しない場合」のほうが深刻。 一様分布では肘がどこにもなく、細長い1つのかたまりでは k=2k=2 で 1590 → 547 と急落して偽の肘に見える
  • シルエット係数は構造がまったく無いデータでも0にならない。 2次元標準正規分布を k=3k=3 に切ると n=200n=200 で 0.355、n=2000n=2000 でも 0.330 で下がらない。一様分布なら 0.38〜0.43。目安表(0.7以上/0.5〜0.7/…)は判定基準ではなく経験則で、正しい使い方は「構造がないときのベースラインと比べて明確に高いか」
  • ギャップ統計量の1標準誤差基準で k=1k=1 が出るのはバグでも符号の問題でもない。 移項すると Gap(k+1)Gap(k)sk+1\mathrm{Gap}(k+1) - \mathrm{Gap}(k) \le s_{k+1}、つまり最初の平坦点で打ち切る規則k=12k=1\to2 の増分 0.0265 が s2=0.0481s_2 = 0.0481 に埋もれていた。BB を 30 → 150 に増やしても係数が 1.0161.0031.016 \to 1.003 に変わるだけで直らない。対処は「大域的な最大値から1標準誤差以内に入る最小の kk を採る」変種
  • コーフェネティック相関係数が高い手法が良い手法とは限らない。 三日月データで最短距離法はこの指標で最下位(0.5357)なのに純度では唯一の満点(1.0000)

nn が小さいと「無い構造」が見つかる

  • 構造のない1つの正規分布を3分割したときの平均シルエット係数は n=10n=100.4040(最大 0.6038、0.5超えが 5.0%)、n=200n=200 で 0.3043。nn が小さいほど高く出る
  • セグメント間で差を検定するのは循環論法(double dipping/選択的推測)。滞在時間の差が大きくなるようにクラスターを作ったのだから、ほぼ確実に有意になる。別データで検証するのが原則
  • メモリの壁:n=10,000n=10{,}000 で距離行列 0.8 GB(データ本体は 0.24 MB)、n=44,721n=44{,}721 で 16 GB。ただし避けられないのはメモリではなく計算回数のほうで、SLINK 法や fastcluster の最近傍連鎖方式なら O(n)O(n) メモリにできる。「n2n^2 より速くできない」も一般の非類似度行列を入力とする限りの話で、2次元のユークリッド空間なら最短距離法は O(nlogn)O(n\log n)

第26回

第25章 因子分析・グラフィカルモデル

主成分分析は変換、因子分析はモデル

R=ΛΛ+ΨR = \Lambda\Lambda^\top + \Psi

主成分分析は変換なので、正しいか間違っているかを問う余地がありません。座標軸を回すのと同じで必ず実行できます。因子分析はモデルなので、「背後に2つの因子がある」という仮説がデータと合わないことがありえます。

  • 決定的な違いは相関行列を再現できるか。因子分析は非対角の最大誤差 0.000000(実際は 8×10138\times10^{-13})、主成分2個は 0.144371。対角も 0.000000 対 0.298764
  • 主成分2個では対角が1にならず 0.70〜0.83 にとどまる。非対角も文系3科目間が 0.73〜0.78 と元の 0.59〜0.70 より大きく出る
  • Ψ\Psi が対角行列なので、対角のずれは常にゼロにでき、残る誤差は非対角にしか現れない。これが「誤差の置きどころ」の構造的な違い
  • ただし 0.000000 はこのデータがちょうど2因子モデルから作られているからの値。6変数2因子なら自由度4なので、一般には残差が残る

反証できるのは自由度が正だから

p(p1)2(pmm(m1)2)=12[(pm)2(p+m)]\frac{p(p-1)}{2} - \left(pm - \frac{m(m-1)}{2}\right) = \frac{1}{2}\left[(p-m)^2 - (p+m)\right]
  • 6変数なら m=1m=1 で 9、m=2m=2 で 4、m=3m=3 で 0(検証不可)m=4m=43-3(識別不可)
  • 同じ相関行列に1因子を当てると非対角の最大残差 0.3440・不適合度 F=1.254075F = 1.254075 が残り、2因子なら 0.0000 / 0.000000
  • n=300n=300 の標本で検定すると1因子は χ2=347.698\chi^2 = 347.698・自由度9・pp 値 0.00000 で棄却、2因子は χ2=1.5952\chi^2 = 1.5952・自由度4・pp 値 0.80965 で棄却されない
  • 帰無仮説が「モデルは正しい」なので pp 値が大きいほどモデルが良い。 第12回の「棄却されないことは正しさの証明ではない」もそのまま当てはまる
  • 自由度0は「どんなデータでも完璧に当てはまる」ではなく「検証する余地が消える」p=6,m=3p=6,m=3 でランダムな相関行列を試すと残差が残る場合が多く、無理に合わせるとヘイウッドケースになる
  • 3変数1因子なら r12r13r23=λ12\frac{r_{12}r_{13}}{r_{23}} = \lambda_1^2見えない因子の値を一度も使わずに負荷量が逆算できる。決まるのは λ12\lambda_1^2 であって λ1\lambda_1 ではない。0.9, 0.8, 0.6 なら λ12=1.2000\lambda_1^2 = 1.2000ψ1=0.20\psi_1 = -0.20ヘイウッドケース(相関行列としては最小固有値 0.052 で正当)、0.5, 0.5, 0.3-0.3 なら λ12=0.8333\lambda_1^2 = -0.8333 で実数解なし

回転で変わるのは解釈だけ

ΛΛ=ΛTTΛ=ΛΛ\Lambda^*\Lambda^{*\top} = \Lambda TT^\top\Lambda^\top = \Lambda\Lambda^\top
  • 回転角を 0°〜123.4° に振っても不適合度 FF は0、共通性の和は 3.962700 で一定。動くのはバリマックス基準だけ(0.009590 → 0.422155)
  • 回転で変わるのは負荷量と解釈だけで、共通性・独自性・因子数・当てはまりは不変
  • バリマックス回転の効果:基準 0.009590 → 0.424519、絶対値0.7超の負荷量が 12個中2個 → 6個、ホフマンの複雑度 1.7453 → 1.0843。最適角は 42.84°-42.84°(全探索と一致)
  • 目的関数は厳密に V(θ)=K+Mcos(4θφ)V(\theta) = K + M\cos(4\theta - \varphi) の形(最大残差 4.4×10164.4\times10^{-16})で周期90°・単峰。2θ2\theta の項が消えるのは「4次式だから」ではなく「共通性が回転で不変だから」
  • tan4θ\tan 4\theta の式を素朴に arctan\arctan に入れると θ=+2.158°\theta = +2.158°基準値 0.0072 の最小のほうに着く。分子と分母の符号を別々に見て象限を決める必要がある
  • 共通性が「負荷量の2乗和」で出るのは直交回転のときだけ。 斜交では diag(ΛΦΛ)\mathrm{diag}(\Lambda\Phi\Lambda^\top) が必要(国語で 0.7804 は誤り、正しくは 0.7325)。再現される相関行列も ΛΦΛ\Lambda\Phi\Lambda^\top
  • プロマックス回転の因子間相関は 0.3748κ=4\kappa=4)。κ=2\kappa=2 なら 0.2975
  • 斜交のパターン行列では真の負荷量が正(国語の理系 0.10)なのに 0.073-0.073 と負に振れることがある。単純構造を強く追った結果で、小さな負の値は「ほぼゼロ」と読むべき場合がある
  • 主成分分析も回転できるが、回転すると分散の配分が平準化されて(3.0203/1.5979 → 2.2737/2.3446)分散最大という売りを失い、もはや主成分ではなくなる。 しかも回転後は列が直交しないので 2.2737 と 2.3446 は互いに独立な取り分ではない

同じ機械に、対角だけ違う行列を入れている

  • 因子分析のコードから対角の差し替えを外すと、固有ベクトルの符号を除いて主成分分析の負荷量と完全に一致する
  • 対角を1のまま top2(主成分法)にすると非対角の最大誤差 0.144371・負荷量の最大誤差 0.1164、対角を共通性にすると 0.000000・0.0022
  • 歪みは「系統的な過大」ではなく「コントラストが強く出る」。主たる負荷量は過大(社会 真0.700 → 0.816)だが、小さいほうは過小(国語の理系 真0.100 → 0.089)
  • 歪みの大きさは独自性に比例する。独自性の平均 0.736 で誤差 0.2247、0.340 で 0.1164。だから共通性が高い変数ばかりなら主成分法でも実用上問題ない(主成分法も教科書にある実在の方法)
  • 対角を1にした固有値の合計は 6.00 で、そのうち 2.04(34%)が独自性
  • 反復が必要なのは固有値分解が難しいからではなく、分解に渡すべき行列そのものが未知だから。共通性の推定には循環がある(3変数の例で 93回、最尤法のEMなら 181回)
  • Ψ1/2RΨ1/2\Psi^{-1/2}R\Psi^{-1/2} の固有値が1超の個数=因子数」は使えない。 成り立つのは因子数を正しく指定してモデルが厳密に当てはまるときだけで、1因子を当てると1超が3個になる
  • 対角を共通性に置き換えて負の固有値が出るのは正常(共通性が推定値で、真の値より下がりがちだから)。真の共通性を置けば 2.6836, 1.2791, 0, 0, 0, 0 で負は出ない

因子数の決め方と因子得点の限界

  • 6基準すべてが2因子を指した例:固有値 3.0203, 1.5979, 0.4277, …/平行分析の95%点 1.2754, 1.1508, …/対角を共通性にした固有値 2.5551, 1.1394, 0.0883-0.0883, …/累積寄与率 76.97%
  • カイザー基準の閾値1は nnpp に依存する。 無相関のランダムデータでも n=300n=300p=6p=6 なら第1固有値が 1.2754 出る(n=1000n=1000 で約1.15、n=100n=100 で約1.48)。実務では因子数を多く見積もる傾向があると指摘されるが、変数の数が少ない場合など逆に過小になることもある
  • 因子得点は真の因子との相関が文系 0.9204・理系 0.9345 で1に届かない。これは推定の失敗ではなく原理的な上限diag(ΛR1Λ)\sqrt{\mathrm{diag}(\Lambda^\top R^{-1}\Lambda)} が 0.9173 / 0.9310)。n=200,000n=200{,}000 に増やしても 0.917 / 0.931 で改善しない(個人の得点はその人の回答だけから推定するので独自因子を分離しきれない)
  • バートレット法は不偏だが分散は1にならない(1.157 / 1.190)。回帰法は縮む(0.866 / 0.843)代わりに真の因子との相関が最大。不偏性と分散が1になることは別の性質
  • 標本誤差で理論上限をわずかに超えることは普通に起きる(40回試すと半分強)。列の判別は番号ではなく負荷量パターンで見る(バリマックス後の列の順序は一意でない)

偏相関と条件付き独立

rXYZ=rXYrXZrYZ(1rXZ2)(1rYZ2),rij他すべて=kijkiikjjr_{XY \mid Z} = \frac{r_{XY} - r_{XZ}r_{YZ}}{\sqrt{(1-r_{XZ}^2)(1-r_{YZ}^2)}}, \qquad r_{ij\mid\text{他すべて}} = -\frac{k_{ij}}{\sqrt{k_{ii}k_{jj}}}
  • 擬似相関の例では r(X,Y)=0.4800r(X,Y) = 0.4800=0.8×0.6= 0.8\times0.6)に対し偏相関が 0.0000000000。精度行列の該当成分も 0.0000。精度行列から読むときはマイナスが付く
  • 偏相関は残差同士の相関と一致する(n=200,000n=200{,}000 で公式 0.0002・残差同士 0.0002)。第16回の偏回帰係数と同じ構造
  • 「偏相関ゼロ=条件付き独立」は一般にはどちらの向きも成り立たない。 偏相関が除去するのは他の変数の線形の影響だけX=Z2+e1X = Z^2+e_1, Y=Z2+e2Y = Z^2+e_2 では r(X,Y)=0.6668r(X,Y) = 0.6668 に対し偏相関も 0.6668 でゼロにならないのに、ZZ を狭い区間に固定した条件付き相関は 0.0034(条件付き独立は成立)。多変量正規分布のもとでは条件付き期待値が線形になるので同値
  • 合流点(コライダー)で条件づけると、独立な2変数に偽の相関が生まれるW=X+Y+W = X+Y+誤差で条件づけると r(X,YW)r(X,Y\mid W) が理論 0.800000-0.800000・実測 0.800440-0.800440。「交絡を防ぐために変数はできるだけ入れておく」は誤り
  • 逆行列を使う計算では行列式を確認する。 W=X+YW = X+Y(誤差なし)だと相関行列が特異(行列式 1.5×10151.5\times10^{-15})で、同じ計算が1回目 +1.0000+1.0000、2回目 1.0000-1.0000 を返した
  • 主成分分析では第3主成分を足しても第1・第2は変わらないが、因子分析で2因子から3因子に増やすと共通性の推定値が変わるので全部の負荷量が変わりうる

第27回

第26章 その他の多変量解析手法

新しい仕組みは3つだけ

手法位置づけ
MDS新規(入力が距離行列という点だけが新しい)
正準相関分析新規(重回帰の一般化)
対応分析新規(カイ2乗の分解)
数量化I類ダミー変数の重回帰と同じ
数量化II類判別分析と同じ
数量化III類対応分析と同一の計算
数量化IV類MDSと同じ問題設定・違う定式化

4類の区別は「目的変数があるか/それが量的か質的か」の2点だけで決まります。I・II類は教師あり、III・IV類は教師なし。I類の目的変数は量的、II類は質的。

数量化IV類だけは「同じ計算」と書けません。 親近性のデータから配置を作るという問題は同じですが、定式化は i,jeij(xixj)2\sum_{i,j} e_{ij}(x_i-x_j)^2 の最小化で、二重中心化ではありません。

MDSは主成分分析と同じ計算

B=12JD2J,J=I1n11B = -\frac{1}{2}JD^2J, \qquad J = I - \frac{1}{n}\mathbf{1}\mathbf{1}^\top

距離行列を二重中心化して固有値分解します。都市間の距離だけ(緯度経度は与えない)から日本地図が復元でき、累積寄与率 99.99%・実際の位置との残差RMS 27km(都市間平均851kmの3.2%)。

  • 一致するのは「分散共分散行列による主成分分析」と「同じ変数のユークリッド距離を使ったMDS」のとき。 座標の差 5.33×10155.33\times10^{-15}、寄与率も 76.8472% で一致。相関行列版と比べるなら距離の側も標準化してから測る必要がある
  • MDSの固有値は主成分分析の固有値の (n1)(n-1) 倍。 理由は中心化ではなく共分散を n1n-1 で割っている(不偏共分散)ことの裏返しで、nn で割る流儀なら nn 倍。全軸が同じ倍率なので寄与率は一致する
  • 古典的MDSの別名は主座標分析(PCoA)。生態学で標準なのは、非ユークリッドな非類似度(ブレイ・カーティス、ジャッカード、遺伝的距離)も受け取れるから
  • 計量MDS ⊋ 古典的MDS。 計量MDSには最小二乗MDS(Sammonマッピング)も含まれる。「閉じた式で解ける/反復で解く」と「距離の値を使う/順序だけ使う」は別の軸
  • 軸の意味は内部と外部で答えが違う。 古典的MDSは主軸で返るので第1軸は分散最大(だから寄与率が定義できる)。無いのは東西・価格などの外的な意味で、回転・反転が自由
  • 負の固有値は「どんな次元のユークリッド空間にも埋め込めない」サイン(「次元が足りない」とは別)。12個体のマンハッタン距離では4個出て最小 10.2704-10.2704、これは第1固有値の 5.7%。8都市の大円距離では 776.1-776.1 で第1固有値の 0.02% しかない。大きさは第1固有値との比で判断する
  • 距離の種類だけでは決まらない。 マンハッタン距離でも一直線に並んだ点なら負は0個。逆に3点でも三角不等式を破れば出るd12=1,d13=1,d23=5d_{12}=1, d_{13}=1, d_{23}=5 で固有値 12.5, 0, 3.5-3.5)。d\sqrt{d} を取ると消える

正準相関分析には向きが無い

  • 入れ子構造:相関係数 ⊂ 重回帰 ⊂ 正準相関分析YY を1変数にすると正準相関 0.81946950R2\sqrt{R^2}(差 1.1×10161.1\times10^{-16})、XX も1変数にすると \lvertピアソン相関\rvert
  • ただし正準相関分析に説明・被説明の向きはありません。 XXYY を入れ替えても正準相関の値も正準変量も変わらない
  • 組の個数は min(rankX,rankY)\min(\mathrm{rank}\,X, \mathrm{rank}\,Y)(フルランクなら min(p,q)\min(p,q))。多い方ではない
  • 保証されるのは r1r_1 だけ。 r1r_1 は個別の相関の絶対値の最大以上(0.7915 → 0.8481)だが、r2r_2 以降には保証がない(共通因子が2本あるデータでは r=[0.9970,0.9968]r = [0.9970, 0.9968] に対し個別の絶対値の最大が 0.9831)
  • 2組目は1組目と無相関(実測 7×1017-7\times10^{-17}
  • 検定はウィルクスのラムダ Λ=k(1rk2)=W/T\Lambda = \prod_k (1-r_k^2) = \lvert W\rvert/\lvert T\rvert第25回の判別分析の検定と同じ統計量第12回のウィルクスの定理とは別物)

数量化法は既習手法の言い換え

  • I類:ダミー変数の重回帰(R2=0.995248R^2 = 0.995248)。当てはまりは決定係数 R2R^2 と重相関係数 R2\sqrt{R^2} で見る。カテゴリースコアは偏回帰係数と定数分だけずれる(基準カテゴリで中心化するか加重平均で中心化するかの流儀差。レンジは不変)。レンジは立地 7.1548 > 築年数 3.6548
  • II類:判別分析。正解率12/12、正準相関 0.88191710R2\sqrt{R^2}相関比 η2=R2=0.777778\eta^2 = R^2 = 0.777778(群間変動÷全変動を手計算して6桁一致)
  • 相関比 η2\eta^2 は群を必要とする量なので、目的変数が量的なI類では定義できません。 II類の指標です
  • レンジは標準化されていないので、アイテム間で比べるならカテゴリー数や度数が同程度かを確認する。標準化された指標としては偏相関比を併用する

対応分析はカイ2乗を軸に分解する

総イナーシャ=χ2n=128.8452375=0.343587\text{総イナーシャ} = \frac{\chi^2}{n} = \frac{128.8452}{375} = 0.343587
  • nn は表の度数の合計(回答者数とは限らない)。0/1の反応表の例では n×n \times 総イナーシャ = 22.0 の nn1の個数の合計 18で、人数8ではない
  • 軸ごとの貢献を足すとカイ2乗そのもの:110.2593 + 15.6486 + 2.9373 = 128.8452。第1軸だけで 85.58% なのでこのズレはほぼ1次元的
  • 総イナーシャはマス(行の重み)で重み付けしたカイ2乗距離の和で、行から見ても列から見ても同じ値(どちらから計算しても 0.343587)
  • カイ2乗距離は行プロファイルのズレを列の割合 cjc_j で割って測るj(pij/picj)2/cj\sum_j (p_{ij}/p_{i\cdot} - c_j)^2/c_j
  • 軸の本数は min(I,J)1\min(I,J)-1(上限)。差の行列の行和・列和が0で、期待\sqrt{\text{期待}} で割る操作は階数を保つ
  • 行と列の距離を直接比べてはいけない。 行と列は別の空間の座標なので、方向(角度)の一致として読む。非対称正規化なら行と列の内積が「観測の割合 ÷ 期待の割合 1-1」になる(ピアソン残差ではない。実測の差 7.8×10167.8\times10^{-16}
  • 主座標がカイ2乗距離を厳密に再現するのは全軸を使ったときだけ(3軸すべてなら 1.465034 でカイ2乗距離と6桁一致、上位2軸の図では落とした第3軸の 2.28% 分だけ近似になる)
  • ガットマン効果(馬蹄形)には順序構造だけでなく一峰性の反応も必要。 出たら「実質1次元の順序構造がある証拠」と読み、第2軸に別の解釈を与えない。補正にはデトレンド対応分析(DCA)がある
  • 数量化III類の0/1表を第1軸で並べ替えると1が対角線上に階段状に並ぶ
  • 多重対応分析は指示行列に対応分析をかけるもの(指示行列は行和が変数の数で一定)

第28回

試験で問われる計算パターン

第22章

  1. 固有値と寄与率2×22\times2 なら λ2(トレース)λ+(行列式)=0\lambda^2 - (\text{トレース})\lambda + (\text{行列式}) = 0 を解く。相関行列なら固有値の合計は必ず pp。2変数の相関行列なら 1±ρ1\pm\lvert\rho\rvert で暗算
  2. 固有ベクトルの向き(ΣλI)u=0(\Sigma - \lambda I)u = 0 を1行だけ使って比を出し、長さ1に正規化。符号はどちらでもよい
  3. 負荷量 … 相関行列なら ujkλku_{jk}\sqrt{\lambda_k}、共分散行列なら sjs_j で割る。検算は「各変数で全主成分の負荷量2乗和 = 1」
  4. マハラノビス距離2×22\times2 なら Σ1=1Σ(s22s12s12s11)\Sigma^{-1} = \frac{1}{\lvert\Sigma\rvert}\begin{pmatrix} s_{22} & -s_{12} \\ -s_{12} & s_{11} \end{pmatrix}s11s_{11}s22s_{22} が入れ替わる)。判定は χ2(p)\chi^2(p) の上側で、p=2p=2 の5%なら 5.9915(母数が既知のときの近似
  5. 等確率楕円の確率 … 2次元なら 1ez2/21-e^{-z^2/2}。1変数の 68/95/99.7 を持ち込まない

第23章

  1. 線形判別関数S=W/(ng)S = W/(n-g) を作り、w=S1(xˉ1xˉ2)w = S^{-1}(\bar x_1-\bar x_2)、切片は中点を代入して c=wxˉ1+xˉ22c = -w^\top\frac{\bar x_1+\bar x_2}{2}。符号は意味で検算
  2. 事前確率・コスト込みの境界logπ1π2\log\frac{\pi_1}{\pi_2}logc(21)c(12)\log\frac{c(2\mid1)}{c(1\mid2)}切片に足すだけww は変わらない
  3. 理論上の誤判別率Φ(D/2)\Phi(-D/2)引数は DD ではなく D/2D/2D=2D=2 で 15.87%、D=4D=4 で 2.28%)
  4. ウィルクスのラムダW/T\lvert W\rvert/\lvert T\rvert。小さいほうがよい。T2T^2 とは Λ=1/(1+T2/(n2))\Lambda = 1/(1+T^2/(n-2)) で対応
  5. 交差確認法 … 「同じデータで測るとどう偏るか」を言葉で答える形が多い。見かけは楽観側、LOOはわずかに悲観側

第24章

  1. 手計算のウォード法ΔESS=ninjni+njxˉixˉj2\Delta\mathrm{ESS} = \frac{n_i n_j}{n_i+n_j}\lVert\bar x_i-\bar x_j\rVert^2 を全ペアで出して最小を選ぶ。係数を忘れると順序が変わる(重心間 29.0 と 42.5 でコストが 29.0 と 28.3333 に逆転する)
  2. 連結法の識別 … 「細長いクラスターができる」=最短距離法、「サイズが揃いやすい」=ウォード法・k-means、「鎖効果」=最短距離法
  3. デンドログラムの読み取り … 切断線と kk の対応、縦軸が何の量か(ウォード法なら平方和の増分)、横軸の順序に意味はないこと
  4. シルエット係数(biai)/max(ai,bi)(b_i-a_i)/\max(a_i,b_i) に代入。aia_i は同クラスター内の平均距離、bib_i最も近い他クラスターへの平均距離
  5. 距離の計算 … ユークリッド/マンハッタン/マハラノビス/コサインの4つを同じ2点で出す(A(3,0)A(3,0), B(0,4)B(0,4) なら 5.0000 / 7.0000 / …)

第25章

  1. 共通性と独自性 … 直交なら hi2=jλij2h_i^2 = \sum_j \lambda_{ij}^2ψi=1hi2\psi_i = 1-h_i^2(相関行列のとき)。斜交なら diag(ΛΦΛ)\mathrm{diag}(\Lambda\Phi\Lambda^\top)
  2. 自由度p(p1)2(pmm(m1)2)\frac{p(p-1)}{2} - (pm - \frac{m(m-1)}{2})。0以下なら検証不可・識別不可
  3. 3変数1因子の逆算λ12=r12r13/r23\lambda_1^2 = r_{12}r_{13}/r_{23}。1を超えたらヘイウッドケース
  4. 偏相関 … 3変数なら公式に代入、多変数なら精度行列から kij/kiikjj-k_{ij}/\sqrt{k_{ii}k_{jj}}マイナスを忘れない
  5. 回転の不変量 … 「回転で変わらないもの」を選ぶ問題(共通性・独自性・当てはまり・因子数は不変、負荷量は変わる)

第26章

  1. 総イナーシャχ2/n\chi^2/nnn は表の度数の合計。軸ごとの固有値 ×n\times n を足すとカイ2乗に戻る
  2. 軸の本数 … 対応分析は最大 min(I,J)1\min(I,J)-1、正準相関は min(rankX,rankY)\min(\mathrm{rank}\,X,\mathrm{rank}\,Y)、MDSは正の固有値の個数(最大 n1n-1
  3. MDSと主成分分析の関係 … 「(共分散行列版の主成分分析と)ユークリッド距離なら一致」「固有値は (n1)(n-1) 倍」「寄与率は同じ」の3点
  4. 数量化法の対応 … I=ダミー重回帰、II=判別分析、III=対応分析、IV=MDSと同じ問題設定。目的変数の有無と型で機械的に決める
  5. 正準相関と重相関YY が1変数なら正準相関 = R2\sqrt{R^2}

つまずきやすいところ

よくある誤解正しい理解
多次元正規分布は1変数の拡張で、新しい分布として覚えるもの同じ式の書き換え。 1/σ21/\sigma^2Σ1\Sigma^{-1}σ\sigmaΣ1/2\lvert\Sigma\rvert^{1/2} になっただけ。1次元では元の式に戻る22
2次元の z2z^2xxyy を別々に標準化して足せばよい両者が独立ならそれで正解だが、相関があると間違った距離になる。その修正が非対角成分の仕事22
2σ\sigma の楕円だから内側の確率は95%対応するのは z2z^2 の値だけ。 2次元では z2=4z^2=4 で 86.5%。2次元の確率は 1ez2/21-e^{-z^2/2}22
非対角成分だけが楕円の傾きを決める傾きを生むのは非対角だけ(0なら絶対に傾かない)だが、角度そのものは対角成分にも依存する22
相関行列の固有値は 1±ρ1\pm\lvert\rho\rvert2変数限定。 6指標では 3.349, 2.560, 0.066, … でこの形にならない22
楕円の細長さは固有値の差比の平方根 λ1/λ2\sqrt{\lambda_1/\lambda_2}22
Σu=λu\Sigma u = \lambda u を満たす方向が第1主成分停留点の条件にすぎない。 最小固有値の方向でもズレは0(変数が3個以上なら鞍点も)。pp 本すべて求めて固有値が最大のものを選ぶ22
uΣuu^\top\Sigma u は分散の定義導ける事実。 展開すると第3回の V[aX+bY]V[aX+bY] の公式そのもの22
主成分は無相関だから独立元のデータが多変量正規分布に従うなら独立が導けるが、一般には導けない。保証されるのは無相関まで22
固有ベクトルの符号や主成分得点の正負に意味がある符号は決まらない。 ソフトによって反転する22
第1主成分で各指標が56%説明できる全体を平均すると56%。 平均滞在秒は 0.333 しか復元できていない22
負荷量 = 固有ベクトル × 固有値\sqrt{\text{固有値}}相関行列で分析した場合限定。 一般形は sjs_j で割る。共分散版で簡約形を使うと 1136.67 のような値が出る22
カイザー基準(固有値1以上)相関行列のときだけ意味を持つ。Σ\Sigma の固有値は単位に依存する22
主成分分析は常に相関行列を使う原則そうだが、全変数が同じ単位で分散の差自体に意味があるなら共分散行列(同一試験の各科目など)22
主成分分析は相関行列を推奨するのに、マハラノビス距離が共分散行列でよいのは矛盾矛盾しない。マハラノビス距離はどちらでも同じ答えΣ1\Sigma^{-1} が白色化を内蔵)。可逆な線形変換すべてに不変22
dM2d_M^2χ2(p)\chi^2(p) に従うμ\muΣ\Sigma が既知のときだけ。 同じ標本から推定した場合は上限 (n1)2/n(n-1)^2/n が付く。χ2\chi^2 近似は甘い側(5.9915 対 厳密 5.7954)22
dM2d_M^2 の平均は pp になるはず(n1)/n×p(n-1)/n \times p idM2=(n1)p\sum_i d_M^2 = (n-1)p はトレースの恒等式で、正規分布かどうかと無関係22
dM2d_M^2 の平均が理論値に届かないのはバグマスキング効果。 外れ値自身が Σ\Sigma を膨らませて自分を隠す。除いて再計算すると 7.05 → 17.0522
主成分回帰は主成分が無相関になるから改善する効いているのは捨てるステップ。 全部使うと OLS と完全一致(回帰は座標の回転で不変)22
固有値が小さいものを捨てればよい捨てる主成分がどの変数を担っているかを負荷量で確認する。k=1k=1 で x3 の係数が 0.7 → 0.1783 に潰れた22
多重共線性があるから対処が必要壊れるのは個々の係数の解釈だけ。 予測は R2=0.966616R^2 = 0.966616 で問題ない。ただし内挿の範囲に限る(共線性の方向に外挿すると予測も不安定)22
主成分分析は次元を減らす手法減らすのは後工程。 本体は「元の次元を保ったまま直交方向へ座標変換する」操作で、pp 本すべて使えば損失ゼロ(復元誤差 8.88×10168.88\times10^{-16}22
固有ベクトルは第1・第2くらいしかない変数の数 pp 本ある(固有値も pp 個)。VVp×pp\times p の正方行列で、pp 本は互いに直交する正規直交基底22
kk 本に圧縮すると固有ベクトルも短くなる1本の長さは常に pp 成分。 減るのは本数だけ。復元すると列数は pp に戻り、変わるのはランクが kk になること22
固有ベクトルは必ず pp 本使える非ゼロ固有値は min(n1, p)\min(n-1,\ p) 本。 中心化で自由度が1減る。p=6p=6 でも n=3n=3 なら2本しかない22
固有ベクトルの成分を見れば変数の重要度が分かる同じ主成分の中でなら順位は同じλ\sqrt{\lambda} は定数倍)。ただし絶対的な水準は言えず、成分の大きさは変数の数に依存(全変数が等しく効くと 1/p1/\sqrt{p}pp=100 なら 0.100)22
固有ベクトルでも負荷量でも結論は同じ共分散行列版では順位が入れ替わる。 被リンク数は固有ベクトル 0.0027(4位)だが負荷量 0.9536(3位)22
寄与率55.8%なら各変数を55.8%説明できている平均の話。 負荷量2乗の平均が寄与率。平均滞在秒は第1主成分だけでは 0.3329(33%) しか説明できていない22
主成分得点と主成分負荷量は似たもの得点は個体(行)に nn 個、負荷量は変数(列)に pp 個。 負荷量は相関係数なので ±1\pm1 に収まる22
フィッシャーの判別基準と分散分析のF値は形が似ているだけ定数倍で厳密に一致。 (n2)(n-2) は方向によらないので最大化の答えが変わらない23
2群の平均を結ぶ向きが最良の射影方向違う。平均を結ぶ向きの分離比 1.146 に対しピークは 3.77523
プールした共分散行列の分母は n1n-1ngn-g 群の数を引く23
マハラノビス距離は「その方向の標準偏差いくつ分か」主軸方向に限った読み方。 一般の方向では約1.9倍ずれる23
共通の共分散行列は平均も同じという仮定平均は違ってよい。 ばらつき方だけが共通で、幾何的には等確率楕円が合同23
総誤判別率を最小にすれば良い判別人数の多い群を優先する操作なので少数派の見逃しが増える。6.68% → 0.63% の裏で感度が 93.32% → 48.74%23
誤判別コストは見逃しの重みの対数をそのまま足す見逃しを5倍重く見るなら log(1/5)=1.6094\log(1/5) = -1.6094符号は意味で検算する(重く見る=その領域が広がる)23
見かけの誤判別率は必ず真の値より小さい平均的に小さい。個々の標本で必ずとは限らない23
LOO交差確認法は不偏わずかに悲観側に偏るn1n-1 件で学習した規則を評価するから)23
2次判別のほうが柔軟だから常によい損の非対称性で判断する。 無駄に複雑な損は nn を増やせば消える(+2.27pt → +0.01pt)が、間違ったモデルの損は消えない(21.97% のまま)23
平均が同じなら判別できない線形判別は不能だが、2次判別なら分散の違いだけで分けられる23
2次判別の境界は必ず曲線QQ の固有値に0が混じると平行2直線になる。「2次式で表される図形」であって必ず曲がるわけではない23
等分散かどうかは Box のM検定で決める標本が大きいと些細な違いでも有意になる。交差確認法で両方測るのが確実23
ウィルクスのラムダは大きいほうがよい小さいほうがよい。 1R21-R^2 と同じ形なので決定係数と向きが逆23
前向き選択は最良の変数組を選ぶ貪欲法なので保証はない。 1番目に選ばれた変数が2番目の候補と相関 0.95 だった23
前提(多変量正規)が崩れたら使えない前提は最適性の保証のためで動作の条件ではない。0/1データでも n=200n=200 以上ならロジスティック回帰に勝った23
SVMは3点だけで境界が決まるから速い逆。 「どの点が効くか」を突き止める最適化が重い。n=800n=800 で判別分析が1743倍速い。ただし p=1600p=1600 で逆転23
pp が大きいと判別分析は使えない素の判別分析の話。 リッジ判別分析なら pnp \gg n でも動く(代わりに λ\lambda の調整が必要)23
SVMは変数が多くても強いから変数選択は不要無関係な列を足すとSVMも同程度に悪化(11.94% → 30.06%)。強いのは「意味のある列が大量にある」場合23
判別分析との違いは正解ラベルの有無だけ入力の違いはそうだが、失われるのは採点する能力そのもの。そこから「手法依存」「検定できない」が派生する24
クラスター分析は隠れた正解を発掘する与えた距離のものさしで目立つ構造を返すだけ。 真の群が左右にあっても上下の散らばりが大きければ上下に切る24
標準化は精度を上げるための前処理恣意性の除去。 「どの単位で記録したか」に結果が左右されないようにする操作24
標準化は常にやるべき無情報な変数のノイズも同じ大きさに持ち上げる(純度 1.00 → 0.96)。同じ単位・同じ意味の変数だけなら不要24
標準化の重さは回帰と同じ回帰では係数のスケールが変わるだけだが、クラスター分析は分割そのものが変わる24
鎖効果は単なる欠点同じ性質が三日月データでは唯一の勝者(1.0000)にし、橋のあるデータでは唯一の敗者(0.4713)にする24
デンドログラムの縦軸は距離手法で違う。 ウォード法は平方和の増分。比較できるのは同じ図の中の大小だけ24
縦軸の目盛りは1通りΔESS\Delta\mathrm{ESS}2ΔESS2\Delta\mathrm{ESS}2ΔESS\sqrt{2\Delta\mathrm{ESS}} の3流儀があるが木の形は同じ。ただし ward.D に素の距離を渡すと融合順序ごと変わる(42%が不一致)24
距離を二乗して渡すかは気にしなくてよい最短距離法と最長距離法だけが不変。重心法・ウォード法は平方ユークリッド距離が正しい定義24
横軸で近い葉は近い横軸の順序に意味はない。 近さは「どの高さで初めて同じ枝に入るか」で読む24
切断線で任意のクラスター数が作れる同じ高さの融合が並ぶと作れない kk がある(6個から3個に飛ぶ)24
高さの総和=全体の平方和はウォード法の良い性質固有ではない。 どんな順番で融合しても総和は同じ。固有なのは支払いを後半に回すこと24
ウォード法はサイズが揃う構造が無いときの傾向で強制ではない。 100/10/10 ならそのまま再現。しかもいちばん揃うのは k-means24
ウォード法と k-means は別物最小化する量は同じ WSS。 測るタイミングが違い、ウォード法には ninjni+nj\frac{n_in_j}{n_i+n_j} が掛かる。貪欲法なので最適解の保証はない24
ウォード法は万能だから常用される安全な既定値という意味。 球状で同程度のサイズを前提にした手法なので細長い形は苦手24
k-means の初期値依存は深刻27%の確率で誤った構造を出すが、WSSで判定できるので3回試せば100%最良解に届く。ライブラリの既定で対策済み24
k-means は目的関数が単調減少するから止まる単調減少だけでは足りない(減少列は無限に続けられる)。割り当てが変わるとき狭義に減り、分割の総数が有限だから止まる24
エルボー法の問題は主観的なこと肘が存在しない場合のほうが深刻。 一様分布には肘が無く、細長いかたまりには偽の肘が出る24
シルエット係数の目安表で構造の有無を判定できる構造がゼロでも 0.33〜0.43 が残るnn を増やしても消えない)。ベースラインと比べて明確に高いかを見る24
ギャップ統計量で k=1k=1 が出たのはギャップが負だから符号は式に関与しない。 移項すると「最初の平坦点で打ち切る規則」。BB を増やしても直らない24
コーフェネティック相関が高い手法が良い手法そうではない。 三日月データで最短距離法はこの指標で最下位なのに純度は満点24
nn が小さいとクラスターが見つからない逆。存在しないクラスターが見つかり、シルエット係数まで高く出るn=10n=10 で 0.4040)24
作ったセグメント間で差を検定すればよい循環論法(差が大きくなるように作ったのだから有意になる)。別データで検証する24
階層的手法は n2n^2 より速くできない/n2n^2 メモリは必須どちらも入力の条件つき。低次元ユークリッドなら O(nlogn)O(n\log n)、SLINK法などで O(n)O(n) メモリ。避けられないのは計算回数のほう24
因子分析なら必ず相関を完全再現できる0.000000 はデータがちょうど2因子モデルから作られているから。自由度が正なら一般には残差が残る25
独自性は測定誤差その変数固有の性質も含む。 0.470 は「47%が誤差」ではない25
回転で当てはまりが同じなら結論も恣意的変わるのは負荷量と解釈だけ。 共通性・独自性・因子数・当てはまりは不変25
共通性は負荷量の2乗の和直交回転のときだけ。 斜交では diag(ΛΦΛ)\mathrm{diag}(\Lambda\Phi\Lambda^\top)(0.7804 は誤りで 0.7325)25
cos4θ\cos4\theta になるのは4次式だから共通性が回転で不変だから2θ2\theta の係数が厳密に0になる)。結論は合うが理由が違う25
tan4θ\tan4\theta の式を arctan\arctan に入れれば最適角最小側に着く+2.158°+2.158°)。分子と分母の符号で象限を決める25
カイザー基準(固有値1以上)は信頼できる無相関のランダムデータでも 1.2754 出るn=300,p=6n=300, p=6)。閾値は nnpp に依存する25
自由度0ならどんなデータでも完璧に当てはまる検証する余地が消えるだけ。 残差が残る場合が多く、無理に合わせるとヘイウッドケース25
対角を共通性にして負の固有値が出るのは異常共通性が推定値だから起きる正常な現象。 真の共通性なら負は出ない25
Ψ1/2RΨ1/2\Psi^{-1/2}R\Psi^{-1/2} の固有値が1超の個数=因子数因子数を正しく指定して厳密に当てはまるときだけ。 1因子を当てると1超が3個になる25
対角を1にすると負荷量が系統的に過大コントラストが強く出る。 主たる負荷量は過大だが小さいほうは過小(0.100 → 0.089)25
主成分法(対角=1で top k)は間違った方法実在する方法。 歪みは独自性の大きさに比例するので、共通性が高い変数ばかりなら実用上問題ない25
因子分析だから文系/理系に分かれる回転のおかげ。 回転前の第1因子は 0.622〜0.715 で「総合学力」。主成分分析を回転しても同じように分かれる25
主成分分析も回転すればいい回転すると分散の配分が平準化され(3.0203/1.5979 → 2.2737/2.3446)もはや主成分ではなくなる25
因子分析の直交性は主成分分析と同じ主成分分析は固有ベクトルの性質として自動的に成り立つが、因子分析は置いた仮定。しかも推定した因子得点は無相関にならない(0.048)25
因子得点が真の因子と相関1にならないのは推定の失敗原理的な上限。 n=200,000n=200{,}000 に増やしても 0.917 / 0.931 で改善しない25
バートレット法は不偏だから分散も1別の性質。 分散は 1.157 / 1.190 で1より大きい25
因子分析の χ2\chi^2 検定は pp 値が小さいほどよい帰無仮説が「モデルは正しい」なので pp 値が大きいほどよい25
偏相関ゼロ=条件付き独立一般にはどちらの向きも成り立たない。 除去するのは線形の影響だけ。多変量正規分布のもとでのみ同値25
交絡を防ぐため変数はできるだけ入れる合流点で条件づけると偽の相関が生まれる(実測 0.800440-0.80044025
次元を増やしても既存の結果は変わらない主成分分析ならそうだが、因子分析では因子数を増やすと共通性が変わり全部の負荷量が変わりうる25
MDSと主成分分析は同じ分散共分散行列による主成分分析と、同じ変数のユークリッド距離のときだけ。 相関行列版なら距離側も標準化が必要26
MDSの固有値が (n1)(n-1) 倍なのは中心化のため共分散を n1n-1 で割っているから。 nn で割る流儀なら nn26
MDSの第1軸には意味がない内部的にはある(主軸で返るので分散最大=寄与率が定義できる)。無いのは東西・価格などの外的な意味26
計量MDS = 古典的MDS計量MDS ⊋ 古典的MDS。 最小二乗MDSも計量MDSに含まれる26
MDSの負の固有値は計算ミスどんな次元のユークリッド空間にも埋め込めないサイン(次元不足とは別)。大きさは第1固有値との比で見る(5.7% と 0.02%)26
マンハッタン距離なら必ず負が出る出ないこともある。 一直線に並んだ点なら0個26
点が3つなら負は出ない三角不等式を満たしていれば出ない。破れば3点でも出る(1,1,51,1,53.5-3.526
正準相関の組は max(p,q)\max(p,q)min(rankX,rankY)\min(\mathrm{rank}\,X,\mathrm{rank}\,Y) 個。 フルランクなら min(p,q)\min(p,q)26
正準相関分析は XXYY を説明する手法向きは無い。 入れ替えても結果は同じ26
正準相関は個別の相関より必ず大きい保証されるのは r1r_1 だけ(個別の絶対値の最大以上)。r2r_2 以降は上回ることも下回ることもある26
相関比は R2\sqrt{R^2}η2\eta^2 は2乗された量。 R2\sqrt{R^2} は重相関係数26
相関比は数量化I類の指標II類の指標。 群を必要とするので目的変数が量的なI類では定義できない26
数量化IV類はMDSと同じ計算問題設定が同じだけ。 IV類は2次形式の最小化で二重中心化ではない26
総イナーシャはカイ2乗そのものχ2/n\chi^2/n nn は表の度数の合計(回答者数とは限らない)26
カイ2乗距離は行の割合をそのまま引いて距離を測る列の割合で割る重みが入る。 2乗のズレを cjc_j で割る(=ズレを cj\sqrt{c_j} で割ってから距離を測る)26
対応分析で行と列の距離を直接比べる比べられない。 別の空間の座標なので方向(角度)の一致として読む26
馬蹄形が出たら順序構造がある順序+一峰性の反応が必要。出たら「実質1次元」と読み、第2軸に別の解釈を与えない26
数量化III類と対応分析は別の手法同じ計算。 呼び名が違うだけ26

この範囲で、連載がまだ扱っていないこと

正直に書いておきます。

未収録の項目
22頑健な共分散行列推定(最小共分散行列式法 MCD・MVE)の実装、スパース主成分分析、カーネル主成分分析、部分最小二乗回帰(PLS)の詳細、主成分分析の推定量の漸近分布と固有値の信頼区間、球面性検定、因子回転を主成分に適用する場合の是非の一般論、3相データの主成分分析
23正則化判別分析の λ\lambda の選び方、正準判別分析(3群以上の判別空間の次元)の詳細、kk 近傍法・決定木・ランダムフォレストとの比較、SVMの双対問題とカーネルトリックの数理、ROC曲線とAUCによる評価、クラス不均衡データのリサンプリング、多群での誤判別コスト行列の一般形
24混合正規分布モデルとEMアルゴリズムによるクラスタリング(第31回・第33回で扱う予定)、DBSCANなど密度ベース手法、スペクトラルクラスタリング、自己組織化マップ、調整ランド指数(ARI)と正規化相互情報量による外部評価、共クラスタリング、Calinski-Harabasz 指数・Davies-Bouldin 指数の詳細、分割を条件づけた推測
25最尤法の反復計算(EMアルゴリズム)の中身、構造方程式モデリング(SEM)とパス図の一般論、適合度指標(CFI・RMSEA・SRMR)、確認的因子分析のモデル修正、階層因子モデル・双因子モデル、項目反応理論との関係、グラフィカル Lasso の実装、有向非巡回グラフ(DAG)と因果探索アルゴリズム、dd 分離
26非計量MDSの反復計算(SMACOF)の中身、ストレスの水準の解釈基準、個人差MDS(INDSCAL)、正準相関分析の検定の逐次手順とバートレット近似、正準負荷量と冗長性係数、正準対応分析(生態学のCCA)、多重対応分析の固有値補正(Benzécri・Greenacre)、デトレンド対応分析(DCA)の手順、数量化IV類の実際の解法

とくに混合正規分布モデルはこの範囲の空白です。クラスター分析を「確率モデル」として書き直すと、各点がどのクラスターに属するかを確率で表せるようになり、クラスター数の選択も情報量規準(第32回)の枠に乗ります。EMアルゴリズムは第31回(第29章 不完全データ)で、混合モデルは第33回(第31章 ベイズ法)で扱う予定です。

構造方程式モデリングも残っています。第25章の確認的因子分析はその一部で、因子どうしの因果関係まで書けるように拡張したものが SEM です。

多変量解析編はここで一区切りです。振り返ると5つの章は固有値分解という1つの機械に、何を渡すかで名前が変わっていただけでした。分散共分散行列を渡せば主成分分析、対角を共通性に差し替えれば因子分析、群内変動で割れば判別分析、距離行列を二重中心化すればMDS、分割表の「観測 − 期待」を 期待\sqrt{\text{期待}} で割った行列を渡せば対応分析。第28回で地図を描いてよかったのは、それが一望できたからです。

次は発展編(第27章 時系列解析)に入ります。ここまではデータの行(個体)に順序がありませんでした。誰が1行目でも結果は同じです。時系列ではこれが崩れ、行に時間の順序が入って隣同士のデータが相関します。第16回以降の回帰が前提にしていた「誤差が互いに独立」が真正面から壊れる世界です。

第25章の偏相関が偏自己相関として再登場し、自己回帰モデルの次数を決める道具になります。そして第23回のランダムウォークが単位根過程という名前で戻ってきて、「見せかけの回帰」の原因として現れます。

→ 連載の目次:統計検定準1級 独学記事インデックス


この連載は、うまくいった記録だけでなく詰まった箇所も含めて書いています。同じく準1級を目指している方、一度挫折した方の参考になれば嬉しいです。