標準的な検定
プールした2標本割合のz検定で、ほとんどのA/Bテストツールが内部で報告しているものです。
ツール / 統計的有意性計算機
両方のパターンの訪問者数とコンバージョン数を入力してください。p値、相対リフト、そして差が有意かどうかの率直な答えが得られます。
z = (p̂B − p̂A) ÷ √( p̄(1 − p̄)(1/nA + 1/nB) )
値を入力すると結果が見えます
コントロールを見た訪問者数と、そのうちコンバージョンした数です。
挑戦側についても同じ2つの数値です。コンバージョンは訪問者数を超えられません。
両方のコンバージョン率、相対リフト、z統計量、p値、そして0.05を満たすかどうかが得られます。
パターンBが先行していることと、パターンBが優れていることは同じではありません。これは本当の差と単なるノイズを切り分けます。
プールした2標本割合のz検定で、ほとんどのA/Bテストツールが内部で報告しているものです。
有意な0.2%のリフトと、有意でない40%のリフトは、まったく違う判断を求めます。両方の数字を表示します。
判定は慣例的な0.05の基準を使い、それを明示します。p値をバッジの裏に隠したりしません。
2つのページ版で登録率や購入率を比べられます。
開封率やクリック率の差がノイズを超えているかを確認できます。
同じ質問の2つの言い方で「はい」の割合を比べられます。
z = (p̂_B − p̂_A) ÷ √( p̄(1 − p̄) × (1/n_A + 1/n_B) ) ここで p̄ = (x_A + x_B) ÷ (n_A + n_B)
p̄は両方のパターンをまとめたコンバージョン率で、帰無仮説が「2つの率は等しい」であるために使います。p値はそのzに対する両側の正規確率です。
2標本割合のz検定を使います。両方のパターンでコンバージョン率をプールし、差の標準誤差を求め、観測された差をそれで割り、そのzを両側のp値に変換します。
pが0.05を下回れば、その差は慣例的に統計的に有意と呼ばれます。
2つのパターンの性能が本当に同じなら、これほど大きな差はまず出ないということです。差が大きいという意味でも、ビジネス上重要という意味でもありません。
導入を決める前に、p値の横のリフトを必ず読んでください。
基準となる率と、検出したい最小のリフトによります。低いベース率で小さな相対リフトを検出するには、パターンごとに数万人の訪問者が必要になることもあります。
サンプルサイズ計算機は、目標の誤差幅に対する出発点の数字を出します。
いいえ。繰り返し覗き見て最初に緑になった時点で止めると、偽陽性率は5%をかなり超えて上がります。
サンプルサイズを事前に決め、そこまで実施し、結果は一度だけ読んでください。
判定は標準の95%水準、つまりp < 0.05を使います。正確なp値は常に表示されるので、文脈に応じてより厳しい基準を当てはめられます。
パターンが異なるという十分な証拠がないということです。同じである証明ではありません。より大きなサンプルまで続けるか、実際の差があってもおそらく追う価値がないほど小さいと受け入れましょう。
そのままでは使えません。複数のパターンを同時に比べると偽陽性の確率が上がるため、補正か包括的な検定が必要です。カイ二乗計算機なら多パターンのコンバージョン表を扱えます。
いいえ。すべてブラウザ内で動きます。
新しいアンケート回答を集めますか?試す:Formms で、短いリンクとQR付きのフォームを。