Smart Host

A/B Testinde Örneklem Büyüklüğü: Sonuç Gerçek mi Rastlantı mı?

E-posta testlerinde örneklem büyüklüğü, yaygın ölçüm hataları, test edilecek değişkenler ve küçük liste stratejileri. A/B Testinde Örneklem Büyüklüğü: Sonuç…

A/B Testinde Örneklem Büyüklüğü: Sonuç Gerçek mi Rastlantı mı?
İçindekiler
  1. Küçük Örneklem Sorunu
  2. Gereken Örneklemi Ne Belirler?
  3. Pratik Kurallar
  4. Yaygın Ölçüm Hataları
  5. Neyi Test Etmeli?
  6. Asıl Metriği Unutmayın
  7. Küçük Listelerde Ne Yapmalı?
  8. Sonuç
  9. Sıkça Sorulan Sorular (SSS)
  10. Kaç kişiye test göndermeliyim?
  11. Testi ne kadar sürdürmeliyim?
  12. Neyi test etmeliyim?
  13. Listem küçük, test yapamaz mıyım?

A/B Testinde Örneklem Büyüklüğü: Sonuç Gerçek mi Rastlantı mı?

İki konu satırı denediniz. Birincisi yüzde yirmi iki, ikincisi yüzde yirmi altı açılma aldı. "İkincisi kazandı" diyerek tüm listeye onu gönderdiniz — ve fark aslında rastlantıydı.

Bu yazı, e-posta testlerinde sonuçların güvenilirliğini ele alıyor.

Küçük Örneklem Sorunu

Az sayıda alıcıda ölçülen fark yanıltıcıdır:

  • Rastlantısal dalgalanma büyüktür.
  • Birkaç kişi sonucu değiştirir.
  • Fark gerçek gibi görünür.

Somut bir örnekle bakalım: yüz kişilik bir grupta yirmi iki ile yirmi altı açılma arasında yalnızca dört kişi fark vardır — ve bu dört kişi tamamen rastlantısal olabilir.

Aynı testi tekrarlasanız sonuç tersine dönebilir.

Bu nedenle karar vermeden önce farkın büyüklüğü kadar örneklem büyüklüğüne de bakmak gerekir.

Gereken Örneklemi Ne Belirler?

Faktör Etkisi
Mevcut oran Düşük oran daha çok örnek ister
Yakalamak istediğiniz fark Küçük fark çok örnek ister
İstenen güven seviyesi Yüksek güven çok örnek ister

İkinci satır en belirleyici olanıdır ve pratik bir sonuç doğurur: yüzde yirmi gibi büyük bir farkı yakalamak için birkaç yüz kişi yeterken, yüzde iki gibi küçük bir farkı güvenilir biçimde ölçmek on binlerce kişi gerektirir.

Bu, küçük listelerde küçük farkları test etmenin neden anlamsız olduğunu açıklar.

Birinci satır ise tıklama testlerini zorlaştırır. Açılma oranları yüzde yirmilerde iken tıklama oranları yüzde ikilerdedir ve tıklama testleri çok daha büyük örneklem ister.

Pratik Kurallar

Karmaşık hesap yapmadan uygulanabilecek ilkeler:

  1. Küçük listelerde küçük farkları test etmeyin.
  2. Büyük değişiklikler test edin.
  3. Test grubunu yeterince büyük tutun.
  4. Sonucu bir kez daha doğrulayın.

İkinci madde en verimli yaklaşımdır: konu satırında tek bir kelimeyi değiştirmek yerine tamamen farklı bir yaklaşım denemek, hem daha büyük fark üretir hem daha az örneklemle ölçülebilir.

Soru sormak ile bilgi vermek, kısa ile uzun, kişisel ile kurumsal gibi karşıtlıklar test edilmeye değerdir.

Dördüncü madde ise en güvenilir doğrulamadır. Bir sonuç iki ayrı testte de aynı yönde çıkıyorsa, rastlantı olma ihtimali belirgin biçimde düşer.

Yaygın Ölçüm Hataları

  • Testi erken bitirmek.
  • Birden fazla değişkeni aynı anda test etmek.
  • Grupları rastgele ayırmamak.
  • Farklı zamanlarda göndermek.

Birinci madde en sık yapılan hatadır ve sonucu tamamen bozar: açılmalar ilk saatlerde yoğunlaşır ama gün boyunca devam eder — iki saat sonra bakıp karar vermek, farklı zaman dilimlerindeki alıcıları hiç saymamak demektir.

Açılma testleri için en az yirmi dört saat beklemek gerekir.

Üçüncü madde ise gizli bir yanlılık üretir. Listenin ilk yarısı ile ikinci yarısını karşılaştırmak, kayıt tarihine göre farklı davranan iki grubu karşılaştırmak anlamına gelebilir.

Dördüncü madde ise değişkeni kirletir. İki sürümü farklı saatlerde göndermek, konu satırını değil gönderim saatini test etmek olur.

Neyi Test Etmeli?

Değişken Ölçülen metrik
Konu satırı Açılma oranı
Gönderen adı Açılma oranı
Çağrı düğmesi Tıklama oranı
İçerik düzeni Tıklama oranı
Gönderim zamanı Açılma oranı

İkinci satır sıklıkla ihmal edilir ama etkisi büyüktür: gönderen adı, konu satırından daha güçlü bir açılma faktörü olabilir çünkü kullanıcı önce kimden geldiğine bakar.

Kişi adı ile şirket adı arasındaki fark, çoğu konu satırı testinden daha büyük sonuç verir.

Üçüncü ve dördüncü satırlar ise daha büyük örneklem gerektirir çünkü tıklama oranları düşüktür.

Asıl Metriği Unutmayın

Açılma ve tıklama ara metriklerdir:

  1. Açılma: İlgi çekti mi?
  2. Tıklama: Harekete geçirdi mi?
  3. Dönüşüm: Sonuç üretti mi?

Üçüncü madde asıl hedeftir ve bazen ara metriklerle ters düşer: merak uyandıran bir konu satırı açılmayı artırabilir ama içerik beklentiyi karşılamadığında dönüşüm düşer — kazanan sürüm aslında kaybettirmiş olur.

Bu nedenle test sonuçları mümkün olduğunca dönüşüme kadar takip edilmelidir.

Dönüşüm verisi az olduğu için istatistiksel güven daha zordur; bu durumda birden fazla kampanyanın verisi birleştirilebilir.

Küçük Listelerde Ne Yapmalı?

  • Tek kampanyada karar vermeyin.
  • Aynı testi birkaç kez tekrarlayın.
  • Sonuçları birleştirin.
  • Büyük farklara odaklanın.

İkinci ve üçüncü madde küçük listeler için pratik bir çözümdür: aynı testi beş kampanyada tekrarlayıp sonuçları toplamak, tek seferde büyük bir listeye göndermekle benzer bir güvenilirlik sağlar.

Bu yaklaşım zaman alır ama küçük listelerde tek gerçekçi yöntemdir.

Birinci madde ise disiplin gerektirir. Tek bir kampanyanın sonucuna dayanarak kalıcı bir kural çıkarmak, yanlış bir kuralı yıllarca uygulamaya yol açar.

Test sonuçlarını doğru ölçebilmek için segment ve raporlama desteği gerekir; e-posta gönderim altyapı çözümleri kapsamında grup bazlı gönderim ve karşılaştırmalı raporlama sunulur.

Sonuç

A/B testlerinde en büyük hata, küçük farkları küçük gruplarda ölçüp gerçek sanmaktır: yüz kişilik bir grupta yüzde 22 ile 26 arasında yalnızca dört kişi vardır ve bu dört kişi tamamen rastlantısal olabilir. Çözüm daha büyük değişiklikler test etmektir — tek kelime yerine tamamen farklı bir yaklaşım hem daha büyük fark üretir hem daha az örneklemle ölçülebilir. Testi erken bitirmeyin: iki saat sonra karar vermek, farklı zaman dilimlerindeki alıcıları hiç saymamaktır.

Sıkça Sorulan Sorular (SSS)

Kaç kişiye test göndermeliyim?

Yakalamak istediğiniz farkın büyüklüğüne bağlı. Yüzde yirmi gibi büyük bir farkı yakalamak için birkaç yüz kişi yeterken, yüzde iki gibi küçük bir farkı güvenilir ölçmek on binlerce kişi gerektirir. Tıklama testleri açılma testlerinden çok daha büyük örneklem ister çünkü oranlar düşüktür.

Testi ne kadar sürdürmeliyim?

Açılma testleri için en az yirmi dört saat. Açılmalar ilk saatlerde yoğunlaşır ama gün boyunca devam eder; iki saat sonra bakıp karar vermek, farklı zaman dilimlerindeki alıcıları hiç saymamak demektir.

Neyi test etmeliyim?

Büyük farklar üretecek şeyleri. Konu satırında tek kelime değiştirmek yerine tamamen farklı bir yaklaşım deneyin — soru sormak ile bilgi vermek, kısa ile uzun gibi. Ayrıca gönderen adını ihmal etmeyin; kullanıcı önce kimden geldiğine baktığı için çoğu konu satırı testinden daha büyük sonuç verir.

Listem küçük, test yapamaz mıyım?

Yapabilirsiniz ama tek kampanyada karar vermeyin. Aynı testi beş kampanyada tekrarlayıp sonuçları toplamak, tek seferde büyük bir listeye göndermekle benzer güvenilirlik sağlar. Zaman alır ama küçük listelerde tek gerçekçi yöntemdir.