حاسبة اختبار A/B
تحقّق مما إذا كان اختبارك قد فاز، وخطّط لحجم العينة وعدد الأسابيع اللازمة، واعرف قيمة النسخة الفائزة من حيث الإيرادات. الدلالة الإحصائية، واحتمال الفوز البايزي، وفحص نسبة العينة، واختبارات الإيرادات في مكان واحد. مجانية وبلا تسجيل.
فكرة اختبارك التالي
اختبر وكيل ذكاء اصطناعي يجيب عن أسئلة الزوار في صفحة الأسعار كنسختك البديلة التالية.
يجيب CRMsoftware.pro عن الأسئلة على موقعك الإلكتروني وWhatsApp وTelegram والبريد الإلكتروني خلال ثوانٍ، ليلاً ونهاراً، ويحوّل كل محادثة إلى جهة اتصال وصفقة يمكنك قياسها.
- وكيل ذكاء اصطناعي مدرَّب على موقعك ومستنداتك وسياساتك
- يحوّل المحادثة إلى أحد أعضاء الفريق مع السياق الكامل
- كل محادثة تصبح جهة اتصال وصفقة في مسار مبيعاتك
خطة مجانية بلا بطاقة ائتمان. الخطط المدفوعة من $19 شهرياً، تُدفع سنوياً.
المنهجية
كيف تعمل الدلالة الإحصائية في اختبار A/B
تُجري الحاسبة اختبار z لنسبتين: هل الفرق بين A وB أكبر مما تُنتجه الضوضاء العشوائية عادةً؟
يُحسب الخطأ المعياري من معدل التحويل المجمَّع للمجموعتين. وتتحول الدرجة المعيارية (z) إلى قيمة احتمالية (p-value): أي احتمال ظهور فرق بهذا الحجم لو كانت A وB متماثلتين فعلاً. والقيمة الاحتمالية الأقل من 0.05 دالّة إحصائياً عند مستوى ثقة 95%. أما فترة الثقة للفرق فتستخدم الخطأ المعياري غير المجمَّع.
5.0% مقابل 5.8%
z = 2.50, p = 0.012
10,000 زائر لكل نسخة، 500 مقابل 580 تحويلاً. ارتفعت B بنسبة 16%، وهي نتيجة دالّة عند 95%. ويُرجَّح أن يتراوح التحسّن بين 3.5% و28.5%.
اكتشاف تحسّن بنسبة 10%
31,234 زائراً لكل نسخة
عند معدل تحويل 5% ومستوى ثقة 95% وقوة إحصائية 80%. ومع 20,000 زائر أسبوعياً، شغّل الاختبار 4 أسابيع كاملة.
اعتماد نسخة فائزة بتحسّن 10%
+100 تحويل = $8,000 شهرياً
50,000 زائر شهرياً بمعدل 2% و$80 لكل تحويل. أي $96,000 سنوياً.
قبل الإطلاق
حجم العينة والحد الأدنى للأثر القابل للاكتشاف
كلما صغُر التحسّن الذي تريد اكتشافه، زاد عدد الزوار الذين تحتاجهم. وخفض التحسّن إلى النصف يضاعف حجم العينة أربع مرات تقريباً.
الحد الأدنى للأثر القابل للاكتشاف (MDE) هو أصغر تحسّن يستطيع اختبارك رصده بشكل موثوق. ويعرض «خطّط لاختباري» عدد الزوار الذين تحتاجهم للحد الأدنى للأثر الذي حددته، كما يعرض في الجدول أصغر تحسّن يمكنك اكتشافه إذا شغّلت الاختبار من أسبوع إلى 8 أسابيع. وإذا كان التحسّن الذي تأمله أصغر مما تستطيع زياراتك اكتشافه، فاختبر تغييراً أجرأ أو صفحة ذات زيارات أكثر.
اختبار أكثر من نسختين يقسّم الزيارات ويتطلب عتبة أكثر صرامة. وتطبّق الحاسبة تصحيح Bonferroni على مستوى الثقة، لتبقى كل مقارنة مع النسخة الأصلية دقيقة.
التوقيت
كم يجب أن يستمر اختبار A/B؟
حتى يبلغ حجم العينة المخطط، ولأسابيع كاملة.
غطِّ كل أيام الأسبوع
يختلف سلوك المشترين يوم الاثنين عنه يوم السبت. قرّب المدة إلى أسابيع كاملة لتحصل كل نسخة على المزيج نفسه.
حدّد العينة أولاً
التحقق من النتائج يومياً والتوقف عند أول لحظة تظهر فيها دلالة إحصائية يضخّم الانتصارات الزائفة. حدّد حجم العينة مسبقاً واقرأ النتيجة مرة واحدة.
احذر من تلوّث البيانات
الاختبارات الطويلة جداً تتأثر بفقدان ملفات تعريف الارتباط والموسمية والحملات الأخرى. وإذا احتجت إلى أشهر، فاختبر تغييراً أكبر بدلاً من ذلك.
منظور آخر
احتمال الفوز البايزي
إلى جانب القيمة الاحتمالية، تعرض النتيجة احتمال أن تكون B أفضل من A، ومقدار ما قد تخسره إذا اعتمدت B وتبيّن أنها أسوأ فعلاً.
تستخدم الحاسبة توزيعاً مسبقاً Beta(1, 1) لكل نسخة، وتحسب الاحتمال الدقيق لأن يكون المعدل الحقيقي لـ B أعلى من معدل A. وفي المثال، تبلغ احتمالية أن تكون B أفضل 99.4%. وتجد فرق كثيرة هذا أسهل في الشرح من القيمة الاحتمالية، لكنه يجيب عن سؤال مختلف، لذا استخدم العتبة نفسها في كل مرة.
جودة البيانات
عدم تطابق نسبة العينة
إذا قسّمت الزيارات بنسبة 50/50 لكن إحدى النسختين حصلت على زوار أكثر بشكل ملحوظ، فهناك خلل في الإعداد ولا يمكن الوثوق بالنتيجة.
تُجري الحاسبة اختبار مربع كاي على أعداد الزوار مقارنةً بالتقسيم المخطط. والقيمة الاحتمالية الأقل من 0.01 تشير إلى عدم تطابق. ومن الأسباب الشائعة: عمليات إعادة التوجيه التي تُفقد زواراً، والروبوتات، والتتبع الذي يعمل على نسخة واحدة فقط، والتخزين المؤقت. أصلح السبب وأعد تشغيل الاختبار بدلاً من الوثوق بالأرقام.
لماذا يهم ذلك
ما قيمة الاختبار الفائز
لا يتحول التحسّن في معدل التحويل إلى مال إلا من خلال زياراتك وقيمة الطلب.
يعرض «الأثر على الإيرادات» أيضاً تكلفة كل أسبوع تأخير بعد أن تحصل على نسخة فائزة، والأثر عند الحد الأدنى من النطاق إذا أدخلت تحسّناً متحفظاً. أما للإيراد لكل زائر أو متوسط قيمة الطلب، فاستخدم «متوسط القيمة»: فهو يُجري اختبار t لـ Welch، الذي لا يفترض تساوي التشتت في النسختين.
جداول البيانات
صيغ اختبار A/B لـ Excel وGoogle Sheets
A1 = زوار A، B1 = تحويلات A، C1 = زوار B، D1 = تحويلات B.
تحسّن B مقارنةً بـ A
الدرجة المعيارية (z)
القيمة الاحتمالية ثنائية الاتجاه (E1 = الدرجة المعيارية z)
الزوار لكل نسخة (F1 = المعدل الأساسي، G1 = المعدل الذي تأمله)
الأسئلة الشائعة
أسئلة حول اختبارات A/B
كيف أعرف ما إذا كان اختبار A/B دالاً إحصائياً؟
أدخل الزوار والتحويلات للنسختين. إذا كانت القيمة الاحتمالية أقل من 1 ناقص مستوى الثقة، مثلاً أقل من 0.05 عند 95%، فالفرق دالّ إحصائياً. مع 500 من 10,000 مقابل 580 من 10,000، تكون p = 0.012، فتفوز B عند مستوى ثقة 95%.
كم زائراً أحتاج لاختبار A/B؟
يعتمد ذلك على معدل التحويل لديك وأصغر تحسّن يهمك. عند معدل تحويل 5%، يتطلب اكتشاف تحسّن نسبي بنسبة 10% بمستوى ثقة 95% وقوة إحصائية 80% نحو 31,234 زائراً لكل نسخة.
كم يجب أن أشغّل اختبار A/B؟
حتى تبلغ كل نسخة حجم العينة المخطط، مع التقريب إلى أسابيع كاملة. اقسم إجمالي الزوار المطلوب على زياراتك الأسبوعية، ولا تتوقف مبكراً لأن النتيجة تبدو جيدة.
ما مستوى الثقة الجيد؟
95% هو الخيار الافتراضي الشائع. استخدم 99% للتغييرات المكلفة التراجع عنها، و90% للاختبارات السريعة منخفضة المخاطر. قرّر قبل أن تبدأ.
ما هي القوة الإحصائية؟
القوة الإحصائية هي احتمال أن يكتشف اختبارك تحسّناً لا يقل عن الحد الأدنى للأثر الذي حددته عندما يكون موجوداً فعلاً. و80% هي القيمة المعيارية؛ أما 90% فتتطلب زواراً أكثر بنحو الثلث.
النهج البايزي أم التكراري: أيهما أستخدم؟
كلاهما يستخدم البيانات نفسها. القيمة الاحتمالية تضبط عدد المرات التي تعلن فيها فائزاً زائفاً؛ أما احتمال الفوز البايزي فيخبرك بمدى ترجيح أن تكون B أفضل. اختر قاعدة واحدة لاتخاذ القرارات وطبّقها باستمرار.
ما هو عدم تطابق نسبة العينة؟
تقسيم للزوار يختلف عن الخطة بأكثر مما تسمح به الصدفة، مثلاً 52/48 على زيارات كبيرة مع إعداد 50/50. وهو يعني عادةً خللاً في التتبع أو إعادة التوجيه، ويجب إصلاح الاختبار وإعادة تشغيله.
هل يمكنني اختبار الإيرادات بدلاً من معدل التحويل؟
نعم. استخدم «متوسط القيمة» مع المتوسط والانحراف المعياري للإيراد لكل زائر في كل نسخة. فهو يُجري اختبار t لـ Welch ويعطي الفرق مع فترة ثقة.
المراجع
المصادر
- حجم العينة لاختبارات التحويل: Evan Miller
- تشخيص عدم تطابق نسبة العينة في التجارب عبر الإنترنت، KDD 2019: Fabijan et al., ACM
- اختبار t لـ Welch: Wikipedia
المزيد من أدوات المبيعات المجانية
حوّل مزيداً من الزوار إلى محادثات، والمحادثات إلى صفقات.
يجيب CRMsoftware.pro زوارك بالذكاء الاصطناعي، ويلتقط كل عميل محتمل، ويُظهر المحادثات التي تنتهي بصفقة. خطة مجانية بلا بطاقة.