A/Bテスト計算ツール
複数のバリエーションに対応したA/Bテストの統計的有意性を確認でき、リフト値の信頼区間やサンプルサイズの計画も可能です。
テスト結果
最良の結果
-
テストデータを入力してください
| グループ | コンバージョン率 | 絶対差 | 相対リフト | 差の95%信頼区間 | z | p値 | 結果 |
|---|
使い方
A/Bテストの有意差計算ツールは、2標本比率のz検定を使い、対照群と1つ以上のバリエーション群のコンバージョン率の差が単なる偶然ではないかを判定します。サンプルサイズ計画ツールは、テスト開始前に必要な訪問者数を算出します。
- データの入力
コントロール群の訪問者数とコンバージョン数を入力し、続いてテストした各バリエーション群の値を入力してください。
- 信頼水準の選択
一般的に95%がデフォルトとして使用されます。複数のバリエーションをテストした場合は、2つ目または3つ目のバリエーションを追加してください。
- p値の確認
p値が有意水準を下回っていれば、その差が偶然に生じた可能性は低いと判断できます。
2標本比率のz検定
z = (rate(バリエーション) − rate(コントロール)) / √(統合率 × (1−統合率) × (1/n(コントロール) + 1/n(バリエーション)))
統合率は、両グループの合計コンバージョン数を合計訪問者数で割った値です。p値は標準正規分布から求めます。両側検定では良い方向と悪い方向の両方の差を調べ、片側検定では改善だけを調べます。p値が有意水準(信頼水準95%なら0.05)を下回れば、結果が偶然に生じた可能性は低いと判断できます。
テスト実行前のサンプルサイズ
n = (z(信頼水準) + z(検出力))² × (p1(1−p1) + p2(1−p2)) / (p2 − p1)²
p1はベースラインの率、p2は検出したい率です。事前に計画すれば、結果がたまたま有意に見えた時点でテストを早期終了し、偽陽性を増やしてしまう「途中確認によるバイアス」を避けられます。最小検出可能効果が小さいほど、また信頼水準が高いほど、必要なサンプルサイズは大きくなります。
勝者を宣言する前に
有意差が早く現れても、曜日による変動を捉えられるよう、少なくとも1回の業務サイクル(通常1~2週間)にわたってテストを実施してください。信頼できる結果を得るには、通常、各グループで少なくとも100件のコンバージョンが必要です。統計的に有意な結果でも、公開後に改善幅が維持される保証はありません。このデータでは偶然による差とは考えにくいことを示すものです。
よくある質問
A/Bテストにおける統計的有意性とは何ですか?
統計的有意性とは、コントロール群とバリエーション群の間で観測されたコンバージョン率の差が、偶然に生じた可能性が低いことを意味します。95%の信頼水準では、p値が0.05未満であれば、その結果が単なる偶然である確率は5%しかないことになります。これは本番環境でリフトが維持されることを保証するものではありませんが、妥当な確信を持って結果に基づき判断するための統計的な根拠があることを示しています。
A/Bテストの有意性を確認するには、何件のコンバージョンが必要ですか?
決まった件数はありません。必要な件数はベースラインのコンバージョン率と、検出したいリフトの大きさによって変わります。一般に、信頼できる結果を得るには各グループで少なくとも100件、理想的には数百件のコンバージョンが必要です。「サンプルサイズ計画」モードでベースライン率と最小検出可能効果を入力すると、テスト開始前に各グループに必要な訪問者数を算出できます。
A/Bテストにおけるp値とは何ですか?
p値とは、実際にグループ間に差がない場合に、観測された差またはそれ以上の差が発生する確率のことです。p値が0.03である場合、結果が偶然の変動によるものである確率はわずか3%であることを意味します。多くのチームは勝者を判定する前に、pが0.05未満(95%信頼水準)を閾値として使用しますが、重要な意思決定ではpが0.01未満(99%信頼水準)が求められる場合があります。
統計的有意性とサンプルサイズは同じものですか?
いいえ、異なります。統計的有意性は、実際に収集したデータに基づく結果(p値)です。一方、サンプルサイズは、どの程度のリフトを検出できるかに関わる計画上の値です。サンプルサイズを事前に決めず、有意差が出るまでテスト結果を確認し続けると、偶然有意に見えた時点で早期終了する「途中確認によるバイアス」が生じ、偽陽性率が上がる可能性があります。
複数のバリエーションを一度にコントロールと比較できますか?
はい。最大4つのバリエーションを追加でき、それぞれが独自のz検定、信頼区間、p値でコントロールと比較されるため、すべての結果を並べて確認できます。複数のバリエーションを同時にテストすると、単なる偶然で有意差があるように見える可能性が高まるため、多数のバリエーションの中で境界線上の結果が出た場合は特に注意し、単独での再テストを検討してください。