Takésplit test, split testing, bucket testingPokročilý

Definice

A/B testování je řízený experiment, který porovnává dvě varianty stránky, funkce, ceny nebo sdělení na podobných skupinách uživatelů. Měří předem zvolenou metriku, například konverzi nebo retenci, a pomáhá rozhodnout, zda změna skutečně zlepšuje výsledek, nebo zda pozorovaný rozdíl mohl vzniknout náhodou.

Kategorie: Datová analytikaAktualizováno

Proč A/B testování řeší víc než názor

A/B testování nahrazuje spor o „lepší“ návrh experimentem na reálném provozu. Jedna skupina uživatelů vidí variantu A, druhá variantu B a obě skupiny se hodnotí podle stejného cíle. Cílem může být nákup, registrace, kliknutí, dokončení onboardingu, vrácení uživatele po týdnu nebo snížení počtu chyb.

A/B testování má smysl hlavně tam, kde samotný vkus nestačí. Barva tlačítka, text titulku nebo pořadí kroků v košíku může působit jasně jen v týmu, ale skutečné chování návštěvníků bývá jiné. Experiment také chrání před změnami, které vypadají hezky v návrhu, ale poškodí obchodní nebo produktovou metriku.

Rozdělení návštěvníků a měřený cíl

A/B testování potřebuje stabilní přiřazení uživatele do varianty. Stejný člověk by neměl při každé návštěvě přeskakovat mezi verzemi, protože by se míchal efekt změny s chaosem v rozhraní. Přiřazení se často ukládá do cookie, uživatelského profilu nebo experimentální služby napojené přes API.

Metrika se volí před spuštěním. Hlavní metrika říká, podle čeho se rozhodne vítěz. Ochranné metriky hlídají, zda zlepšení nevzniklo na úkor něčeho důležitého, například vyšší konverze za cenu většího počtu refundací. U webu může výsledky zkreslit cache, reklamní kampaně, sezónnost nebo souběžně nasazená úprava.

Statistická jistota a délka experimentu

A/B testování neznamená, že vyšší číslo po prvním dni automaticky vyhrává. Malý vzorek může vytvořit rozdíl čistě náhodou. Proto se předem odhaduje potřebný počet uživatelů, minimální efekt, který stojí za rozhodnutí, a pravidlo pro ukončení testu. Průběžné nahlížení na výsledek bez disciplíny zvyšuje riziko falešného vítěze.

Statistická významnost pomáhá odhadnout, jestli rozdíl pravděpodobně není jen šum. Praktická významnost je stejně důležitá: změna může být statisticky přesvědčivá, ale obchodně bezcenná. Dobrý závěr proto obsahuje naměřený efekt, interval nejistoty, dopad na vedlejší metriky a rozhodnutí, zda variantu nasadit, zahodit nebo dále rozdělit.

Kde se A/B testování láme v praxi

A/B testování selhává, když experiment nemá jasnou hypotézu. Test typu „zkusíme něco jiného“ sice může vyprodukovat tabulku výsledků, ale špatně se z něj učí. Lepší hypotéza říká, proč má změna pomoci, komu má pomoci a jaký mechanismus očekáváme.

A/B testování je citlivé také na etiku a soukromí. Experiment nesmí uživatele klamat způsobem, který porušuje důvěru, smluvní podmínky nebo pravidla ochrany osobních údajů. U cen, zdravotních rozhodnutí, finančních produktů nebo personalizace je potřeba přemýšlet nejen o konverzi, ale také o spravedlnosti a právním základu zpracování dat.

Příklady z praxe

  1. Text tlačítka v košíku

    E-shop chce zjistit, zda text tlačítka „Pokračovat k platbě“ funguje lépe než „Objednat a zaplatit“. Návštěvník dostane při první návštěvě jednu variantu a stejná varianta se mu ukazuje po celou dobu testu. Po nasbírání dostatečného vzorku tým vyhodnotí dokončené objednávky i storna.

    const key = "checkout_variant";
    let variant = localStorage.getItem(key);
    
    if (!variant) {
      variant = Math.random() < 0.5 ? "A" : "B";
      localStorage.setItem(key, variant);
    }
    
    document.body.dataset.checkoutVariant = variant;
    analytics.track("experiment_exposure", {
      experiment: "checkout_copy",
      variant
    });
  2. Onboarding v SaaS produktu

    SaaS aplikace zkouší nový onboarding pro čerstvě registrované účty. Varianta A ukazuje dlouhý průvodce, varianta B nechá uživatele nejdřív vytvořit první projekt a nápovědu přidává postupně. Vítězem není verze s více kliknutími, ale verze s vyšším počtem aktivních účtů po sedmi dnech.

Časté omyly

MýtusStačí pustit test na pár hodin a vzít variantu s vyšší konverzí.
Ve skutečnostiKrátký test často měří náhodný výkyv, denní rytmus nebo jeden zdroj návštěvnosti. Rozumný experiment má předem dané pravidlo ukončení a dostatečný vzorek.
MýtusKdyž vyhraje varianta B, můžeme stejnou změnu nasadit všude.
Ve skutečnostiVýsledek platí hlavně pro testované publikum, kontext a metriku. Změna úspěšná v mobilním košíku nemusí fungovat v desktopové aplikaci nebo u jiné země.
MýtusA/B testování je totéž co anketa mezi uživateli.
Ve skutečnostiAnketa zachycuje deklarovaný názor, zatímco A/B testování měří skutečné chování. Oba přístupy se mohou doplňovat, ale odpovídají na jiné otázky.

Časté dotazy

Kolik návštěvníků je potřeba pro A/B testování?
A/B testování potřebuje tolik návštěv nebo událostí, aby šlo rozlišit skutečný efekt od náhody. Potřebný vzorek závisí na běžné konverzi, očekávaném zlepšení, požadované jistotě a poměru rozdělení návštěvníků. Malý blog může čekat týdny, zatímco velký e-shop získá data rychleji. Předčasné ukončení testu často vytvoří vítěze, který při opakování zmizí.
Může A/B testování u webu poškodit SEO?
A/B testování může poškodit SEO, když vyhledávač dlouhodobě vidí jiný obsah než uživatelé, když se experiment používá jako maskování, nebo když varianty vytvářejí duplicitní URL bez kontroly indexace. Krátkodobý test rozhraní obvykle problém není. U titulkových, obsahových a URL změn je vhodné hlídat kanonické adresy, konzistentní renderování a dopad na organickou návštěvnost.
Kdy se A/B testování nevyplatí spouštět?
A/B testování se vyplatí, když existuje konkrétní rozhodnutí s měřitelným dopadem a dostatečný provoz. Malé změny na málo navštěvované stránce často neposkytnou průkazný výsledek v rozumném čase. V takové situaci bývá lepší kvalitativní výzkum, uživatelské testování, analýza funnelu nebo větší změna s jasnější hypotézou.
Kdy zvolit A/B testování místo multivariačního testu?
A/B testování porovnává dvě varianty jedné změny, zatímco multivariační test zkoumá více prvků a jejich kombinace najednou. Multivariační test potřebuje výrazně větší návštěvnost, protože se provoz dělí mezi více kombinací. Pro většinu týmů je praktičtější začít jednoduchým A/B testem a složitější návrh použít až u stránek s velkým objemem provozu.

Zdroje

  1. A/B testing(otevře se v novém okně)Wikipedia
  2. Application deployment and testing strategies(otevře se v novém okně)Google Cloud
  3. Online Controlled Experiments and A/B Testing(otevře se v novém okně)arXiv, 2017
  4. Controlled experiments on the web: survey and practical guide(otevře se v novém okně)Springer, 2009

Související pojmy

Potřebujete to vyřešit v praxi?

Poradíme, jak na to ve vašem projektu

Vysvětlit pojem je jedna věc, navrhnout kolem něj funkční řešení druhá. Ozvěte se a probereme, co dává smysl u vás.