A/B検定有意性カルキュレーター
A/Bテストの訪問者数とコンバージョン数を入力するだけで、その差が統計的に有意かどうかを判定する無料ツール。二比率のz検定に基づき、p値、z値、95%信頼区間、2つのバリアント間の相対リフト(コンバージョン率の変化率)を同時に算出し、結果が偶然によるものか確からしいものかをすぐに確認できる。
A/B検定有意性カルキュレーター
各バリアントの訪問者数とコンバージョン数を入力して、差が実際のものかノイズだけかを確認してください。
結果
統計的に有意
差は選択した信頼水準での偶然によるものである可能性は低いです。
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
ドキュメンテーション
A/Bテストの有意差計算ツールで分かること
A/Bテストの有意差計算ツールは、ウェブページ、メール、購入ボタンなど2つのバージョンの差が実際の効果なのか、単なる偶然なのかを判定します。各バージョンの訪問者数とコンバージョン数を入力すると、p値、zスコア、信頼区間を返します。コンバージョンとは、購入、登録、クリックなど、成功とみなす行動です。
計算ツールの使い方
この計算ツールには4つの数値が必要です。
- 訪問者数(コントロール):元のバージョンであるバージョンAを見た人数。
- コンバージョン数(コントロール):そのうちコンバージョンに至った人数。
- 訪問者数(バリエーション):新しいバージョンであるバージョンBを見た人数。
- コンバージョン数(バリエーション):そのうちコンバージョンに至った人数。
さらに2つの設定によって、結果の判定方法が変わります。
- 信頼水準は検定の厳しさを設定します。95%が一般的な初期値です。99%のように信頼水準を高くすると、結果を有意と判定する前に、より強い証拠が求められます。
- 仮説は問いの方向を設定します。両側検定では「Bはどちらの方向であれAと異なるか」を問い、片側検定では「BはAより良いか」だけを問いません。片側検定は、データが得られる前に、かつBの結果が悪くても意思決定が変わらない場合に限って選ぶべきです。
数値を入力すると結果が更新されます。入力値はページのウェブアドレスに保存されるため、結果をブックマークしたり、リンクとして共有したりできます。
A/Bテストの計算式(2標本比率のz検定)
この計算ツールは、2つの比率を比較するために、統計学入門で標準的な手法として教えられる2標本比率のz検定を使用します。
ステップ1。各グループのコンバージョン率。
ここではコンバージョン数、は訪問者数を表し、コントロール(1)とバリエーション(2)について計算します。
**ステップ2。プールされたコンバージョン率。**このステップでは、検定上の仮定として、両グループが1つの真の基礎率を共有するとみなします。
ステップ3。差の標準誤差。プールされた率を基に算出します。
ステップ4。zスコア。2つの率の差を標準誤差単位で表したものです。
ステップ5。p値。標準正規分布から求めます。両側検定では、片側検定ではです。
**ステップ6。判定。**p値がより小さいとき、結果は統計的に有意とみなされます。ここでです。95%の信頼水準では、となります。
この計算ツールは、差の大きさの信頼区間も示します。この区間には、両グループが同じ率を共有すると仮定しない、別の標準誤差を使用します。
区間はで、は信頼水準90%で1.6449、95%で1.96、99%で2.5758です。区間にゼロが含まれなければ、その信頼水準で差は有意です。
計算例
| 訪問者数 | コンバージョン数 | 率 | |
|---|---|---|---|
| コントロール(A) | 1,000 | 100 | 10.00% |
| バリエーション(B) | 1,000 | 150 | 15.00% |
プールされた率は、つまり12.5%です。プールされた標準誤差は約0.0148です。zスコアはです。
両側検定では、p値は約0.00072になります。これは通常の0.05のしきい値を下回るため、95%の信頼水準で差は統計的に有意です。2つのバージョンの実際の成績が同じなら、これほど大きい、またはそれ以上の差が偶然だけで現れるのは、10,000回の検定ごとに約7回です。
絶対差は5.00パーセントポイントです。相対的な上昇率は50%で、Bの率がAの1.5倍だからです。真の差の95%信頼区間は、およそ2.11%から7.89%です。
結果を正しく読む
統計的に有意な結果が、行動を起こす価値のある結果とは限りません。実際に存在するわずかな上昇でも、リリースにかかるコストに見合わない場合があります。計算が終わった後も、ビジネス上の判断は重要です。
p値を毎日確認し、0.05を超えた瞬間に検定を止めると、偽陽性の確率が高まります。あらかじめサンプルサイズまたは実施期間を決め、結果を確認する前に検定を最後まで行うほうが適切です。
この検定が依存する正規近似は、各グループに少なくとも約10件のコンバージョンと10件の非コンバージョンがある場合に最もよく機能します。数が少ない場合、結果は確定的な答えではなく、大まかな傾向として扱うべきです。
95%の信頼水準は、Bが実際に優れている確率が95%という意味ではありません。同じ検定を何度も繰り返した場合、この手法が誤って有意と判定する割合が最大でも5%になるという意味です。これは今回の結果ではなく、手法についての説明です。
一度に多くの指標やバリエーションを検定すると、少なくとも1つの比較が純粋に偶然で有意に見える可能性が高まります。検定開始前に指標を1つ選んでおくと、この問題を避けられます。
よくある質問
A/Bテストにはどの程度のサンプルサイズが必要ですか? 意味のある上昇が実際に有意として現れるだけの訪問者数が必要です。大まかな下限は、バージョンごとに数百件のコンバージョンです。基準率と検出したい最小の上昇幅を使う専用のサンプルサイズ計算ツールを利用すれば、テスト開始前により確かな数値を得られます。
検定は片側と両側のどちらにすべきですか? 両側検定がより安全な初期設定です。BがAより良い場合も悪い場合も検出できるためです。片側検定は改善に対してより敏感ですが、悪化は検出できません。そのため、Bの結果が悪くても意思決定が変わらない場合に限って使用すべきです。
なぜ計算ツールは信頼区間を示すのですか? 信頼区間は、有意か有意でないかのラベルだけでなく、真の差が含まれる可能性の高い範囲を示します。ゼロをまたぐ幅の広い区間は、通常、検定にさらにデータが必要であることを意味します。
これはベイズ計算ツールですか? いいえ。A/Bテストで最も一般的に教えられ、使われている頻度主義のz検定を使用します。ベイズ手法のツールは、代わりにBがAを上回る確率を示します。どちらも妥当な方法ですが、答える問いが少し異なります。
計算ツールにエラーが表示された場合はどうすればよいですか? コンバージョン数が負の場合、訪問者数を超えている場合、または両グループを合わせたコンバージョン率が0%または100%の場合にエラーが表示されます。この場合、z検定の式で標準誤差がゼロとなり、ゼロで割ることができないためです。