2値データの要因解析
1データ
1 行が 1 件(1 回の試験・1 個の観測)です。結果の列(合格/不合格、あり/なし、1/0 など 2 種類の値)と、説明に使う数値の列を並べます。区分(種類・グループなど)の列も使えます。
Excel の表を見出しの行ごとコピーして、表の左上のセルに貼り付けると、列名ごと読み取ります。列名は表の 1 行目で変えられます。
データはこの端末の中だけで計算し、外部に送信しません。入力は自動でこの端末に保存します。
2変数の設定
| 列 | 使い方 | 種類 | 2乗項 | 基準の水準 | データの要約 |
|---|
自動:データが分離している(ある値を境に結果が完全に分かれる)ときだけ Firth 法を使います。
2値データの要因解析の解説
「合格・不合格」「発生した・しなかった」「成功・失敗」のように結果が 2 通りのデータと、温度・時間・濃度などの測定値との関係を、ロジスティック回帰で調べます。
どんなときに使うか
- 結果に効いている変数はどれか、どのくらい効いているかを調べる
- 「不合格の確率を 1% 以下にするには、温度を何度以下にすればよいか」のように、確率が目標になる条件を求める
- 2 つの変数の組み合わせで、起きやすい領域を図にする
結果が数値で取れるなら、普通の回帰分析の方が少ないデータで多くのことが分かります。合否しか記録がないとき、または結果が本質的に 2 値のときに使います。
モデル
「起きた方の結果」(設定で選んだ側)の確率を p として、そのロジット(対数オッズ)が説明変数の一次式になると考えます。
log( p / (1 − p) ) = b0 + b1·x1 + b2·x2 + …
p = 1 / (1 + exp(−(b0 + b1·x1 + b2·x2 + …)))
- オッズ p / (1 − p):起きる確率と起きない確率の比。p = 20% ならオッズは 0.25
- オッズ比 exp(b):x が 1 増えたとき、オッズが何倍になるか。1 より大きければ起きやすくなる
- 確率は S 字の曲線で変わるので、同じ 1 増えでも、確率が 50% 付近と 1% 付近では確率の増え方が違います。オッズ比は一定です
1σ あたりのオッズ比
「温度 1 ℃」と「時間 1 分」では 1 単位の重みがまったく違うので、各変数のデータの標準偏差(1σ)だけ増えたときのオッズ比を並べて比べます。影響の大きさの比較には、尤度比 χ²(大きいほど結果をよく説明する)も使えます。
区分の変数
材料の種類・グループ・担当者などは、基準の水準に対するオッズ比で表します(基準は「変数の設定」で選べます)。水準が k 種類なら係数は k − 1 個です。
2乗項・交互作用
- 2乗項:温度が低すぎても高すぎても失敗する、のように確率が途中で最小(最大)になる関係を表します
- 交互作用:温度が高いときだけ時間が効く、のように一方の値でもう一方の効き方が変わる関係を表します
どちらも入れるとオッズ比が一定でなくなるので、効き方は効果の曲線と確率の地図で見てください。
推定と検定
- 最尤法:観測された結果が最も起こりやすくなる係数を、ニュートン法で求めます
- 変数ごとの p 値:その変数(2乗項・交互作用・ダミー変数を含めて)を除いたモデルとの尤度比検定です。係数表の p 値(Wald 検定)より正確です
- モデル全体の p 値:説明変数をすべて除いたモデルとの尤度比検定
分離と Firth 法
「温度が 40 ℃ を超えたものはすべて不合格、それ以下はすべて合格」のように、ある値を境に結果が完全に分かれることを分離といいます。分離していると、最尤法の係数は無限大に発散し、標準誤差も p 値も意味を持ちません。少ないデータの試験ではよく起こります。
Firth 法は、対数尤度に 0.5 × log|情報行列| を足した罰則つき尤度を最大にする方法で、分離していても有限の係数を返し、少数データでの係数の過大な推定(偏り)も抑えます。「自動」では分離を検出したときだけ Firth 法に切り替えます。Firth 法の p 値は罰則つき尤度比検定(Heinze & Schemper, 2002)です。
必要なデータの量
少ない方の結果の件数が、推定する係数 1 個あたり 10 件以上あるのが目安です。少ない方が 15 件なら、説明変数は 1〜2 個が限度です。少ないと係数が過大に出やすく、予測確率も極端になります。
当てはまりの確認
- AUC:起きたものを、起きなかったものよりも高い確率で予測できている組の割合。0.5 は当て推量、0.7 以上でまずまず、0.8 以上で判別力が高い
- Hosmer-Lemeshow 検定:予測確率の小さい順に約 10 組に分け、組ごとの予測件数と実際の件数を比べます。p が小さい(0.05 未満)と、モデルの形(2乗項・交互作用・変数の不足)を見直す余地があります
- McFadden R²:1 − 対数尤度 ÷ 帰無モデルの対数尤度。普通の回帰の R² より小さく出るのが普通で、0.2〜0.4 でもよく当てはまっています
- VIF:説明変数どうしの相関の強さ。10 を超えると係数が不安定で、どちらが効いているか区別できません
- 効果の曲線のオレンジの点:データを件数の等しい区間に分けた実際の割合。曲線から大きく外れていれば、形が合っていない可能性があります
予測と逆算
条件を入れると、確率とその信頼区間を計算します。「目標の確率」を入れると、各数値変数について、ほかの条件を固定したときに確率が目標になる値を求めます。不良のように目標以下にしたいときと、成功のように目標以上にしたいときを選べます。
- 推定:予測確率がちょうど目標になる値
- 確実な側:目標以下にしたいときは予測確率の信頼区間の上限が、目標以上にしたいときは下限が目標になる値。「この値なら、確率は目標を満たすと(信頼度 95% で)言える」範囲です。管理値を決めるときはこちらを使います
データの範囲の外の値は外挿なので、計算はできても裏付けがありません。
使うときの注意
- 関連があることは、原因であることを意味しません。同じ時期のデータは条件が似通うなど、隠れた要因で関連が生まれることがあります。要因を確かめるには、条件を計画的に変えた試験(実験計画法)が必要です
- 起きなかった方の結果も必ず記録に残してください。起きたものだけでは解析できません
- 測り方や判定の基準がそろっていないデータを混ぜると、その差が誤差や見かけの効果になります