Takékvalita datZákladní

Definice

Datová kvalita je míra, do jaké data odpovídají potřebám konkrétního použití, například rozhodování, reportingu, automatizace nebo trénování modelů. Posuzuje se podle vlastností jako přesnost, úplnost, konzistence, aktuálnost, jedinečnost a dohledatelnost původu, nikoli jen podle toho, zda jsou data technicky validní.

Kategorie: Datová analytikaAktualizováno

Co rozhoduje o kvalitě dat

Datová kvalita se vždy hodnotí vůči účelu. Stejná tabulka může stačit pro orientační dashboard, ale selhat při fakturaci, právním reportingu nebo trénování modelu. Kvalitní dataset má jasně popsaný význam sloupců, známý původ a pravidla, podle kterých se pozná chyba.

Praktický problém bývá méně viditelný než pád aplikace. Špatně zapsané datum, chybějící měna nebo zákazník uložený dvakrát mohou projít importem, ale později zkreslí KPI, segmentaci i automatické rozhodování. Datová kvalita se proto řeší jako součást toku dat, ne až jako kosmetická úprava hotového reportu.

Rozměry, které se u dat sledují

Hodnocení datové kvality obvykle kombinuje několik pohledů. Přesnost říká, zda hodnota odpovídá realitě. Úplnost sleduje, zda nechybí povinné údaje. Konzistence porovnává shodu mezi systémy, například mezi CRM a fakturační databází. Aktuálnost řeší stáří záznamu a jedinečnost odhaluje duplicity.

  • Přesnost: adresa zákazníka skutečně existuje a patří správné osobě.
  • Úplnost: objednávka má měnu, cenu, čas vytvoření i identifikátor zákazníka.
  • Konzistence: stav platby má stejný význam v aplikaci, účetnictví i datovém skladu.
  • Původ: dataset má dohledatelný zdroj, transformace a vlastníka pravidel.

Kontroly v pipeline a uložištích

Datová kvalita se chrání už při zápisu pomocí povinných polí, unikátních klíčů, referenční integrity a kontrolních omezení. V analytice se přidávají testy po načtení dat, porovnání s historickým rozsahem a varování při náhlém poklesu počtu řádků. V datovém jezeře bývá důležitá také katalogizace, protože bez metadat se obtížně pozná, která verze datasetu je důvěryhodná.

Dva příklady z praxe

Duplicitní zákazníci v CRM

E-shop importuje kontakty z registračního formuláře, newsletteru a zákaznické podpory. Jeden člověk se objeví třikrát s drobně odlišným zápisem e-mailu, takže marketingový nástroj započítá tři zákazníky a pošle více sdělení stejné osobě. Jednoduchá kontrola pomůže najít kandidáty na sloučení, ale finální pravidlo musí počítat i s oprávněnými sdílenými adresami.

SELECT lower(email) AS email, COUNT(*) AS pocet
FROM customers
WHERE email IS NOT NULL
GROUP BY lower(email)
HAVING COUNT(*) > 1;

Chybné štítky v trénovacích datech

Tým trénuje klasifikátor reklamací a část historických záznamů má zaměněné štítky „vráceno“ a „zamítnuto“. Model se učí z nesprávného signálu, takže ve výrobě upřednostňuje špatné případy a zhoršuje podporu. Kontrola trénovacích dat musí spojit automatické testy rozsahů s ručním vzorkováním a zpětnou vazbou od doménových expertů.

df = df.dropna(subset=["claim_id", "label"])
df = df[df["label"].isin(["vraceno", "zamitnuto", "v_reseni"])]

Proč vysoká datová kvalita není stav navždy

Datová kvalita se mění s produktem, obchodními pravidly i zdrojovými systémy. Nový formulář může začít posílat jiný formát telefonu, externí dodavatel může změnit číselník a migrace může rozbít vazby mezi entitami. Udržitelné řešení proto kombinuje vlastníka dat, dokumentovaná pravidla, automatické testy, monitoring a proces, který určuje, kdo chybu opraví a jak se zabrání jejímu opakování.

Příklady z praxe

  1. Duplicitní zákazníci v CRM

    E-shop importuje kontakty z registrace, newsletteru a zákaznické podpory. Jeden člověk se kvůli odlišné velikosti písmen nebo starému účtu objeví vícekrát, takže segmentace nadhodnotí počet zákazníků a kampaň pošle duplicitní sdělení. Kontrola najde podezřelé e-maily a tým následně rozhodne, které záznamy lze bezpečně sloučit.

    SELECT lower(email) AS email, COUNT(*) AS pocet
    FROM customers
    WHERE email IS NOT NULL
    GROUP BY lower(email)
    HAVING COUNT(*) > 1;
  2. Neplatné štítky v trénovacích datech

    Tým trénuje klasifikátor reklamací a část historických záznamů má chybějící nebo neplatné štítky. Model se pak učí z nejasného signálu a ve výrobě přesměrovává případy na špatnou frontu podpory. Validace odstraní očividně nepoužitelné řádky, ale kvalitu štítků musí ověřit i člověk se znalostí procesu.

    df = df.dropna(subset=["claim_id", "label"])
    df = df[df["label"].isin(["vraceno", "zamitnuto", "v_reseni"])]

Časté omyly

MýtusKdyž data projdou validací typu, jsou kvalitní.
Ve skutečnostiValidace typu potvrzuje jen to, že hodnota odpovídá očekávanému formátu. Datová kvalita musí řešit také věcnou správnost, úplnost, duplicity, návaznost na jiné systémy a použitelnost pro konkrétní rozhodnutí.
MýtusDatovou kvalitu vyřešíme jednorázovým čištěním databáze.
Ve skutečnostiJednorázové čištění odstraní část historických problémů, ale neřeší příčinu nových chyb. Datová kvalita potřebuje pravidla při vzniku dat, monitoring, odpovědné vlastníky a proces nápravy.

Časté dotazy

Proč se datová kvalita neměří jedním skóre?
Datová kvalita se nedá spolehlivě shrnout jedním číslem, protože různé účely vyžadují jiné kompromisy. Report tržeb potřebuje správné částky a měny, zatímco doporučovací model může více trpět duplicitními uživateli nebo opožděnými událostmi. Jedno skóre může být užitečné pro přehled, ale musí být rozložitelné na konkrétní pravidla, zdroje a dopady.
Kdo má ve firmě za datovou kvalitu odpovídat?
Odpovědnost za datovou kvalitu má být rozdělena mezi doménového vlastníka dat, datový tým a provozovatele zdrojové aplikace. Doménový vlastník určuje význam polí a obchodní pravidla, datový tým nastavuje kontroly a monitoring, aplikační tým opravuje chyby u zdroje. Bez jasného vlastnictví se z datové kvality stává trvalý seznam nálezů bez rozhodovací pravomoci.
Stačí pro datovou kvalitu validace schématu?
Validace schématu pro datovou kvalitu nestačí, protože schéma obvykle ověřuje jen typ, povinnost pole nebo formát. Hodnota může být technicky platná a přesto věcně špatná, například datum narození v budoucnosti nebo objednávka s nulovou cenou po chybné slevě. Dobrá kontrola kombinuje schéma, obchodní pravidla, vazby mezi systémy a sledování neobvyklých změn v čase.
Jak často se mají pravidla datové kvality spouštět?
Pravidla datové kvality se mají spouštět tak často, aby chyba nepoškodila rozhodnutí nebo zákaznický proces dřív, než se odhalí. Kritické transakční údaje se kontrolují při zápisu nebo v krátkých intervalech, analytické dávky často po každém načtení. Důležité je také rozlišit varování od blokující chyby, aby kontrola nezastavila systém kvůli málo významné odchylce.
Proč datová kvalita ovlivňuje AI modely víc než běžné reporty?
Datová kvalita ovlivňuje AI modely silně, protože model přebírá vzory obsažené v datech a špatné vzory může automatizovat ve velkém měřítku. Chybné štítky, zkreslený výběr příkladů nebo nekonzistentní formát vstupů se projeví v predikcích, které vypadají technicky správně, ale rozhodují špatně. U modelů je proto důležitá kvalita vstupů, anotací i průběžných produkčních dat.

Zdroje

  1. Data on the Web Best Practices: Data Quality Vocabulary(otevře se v novém okně)W3C, 2016
  2. Data quality(otevře se v novém okně)Wikipedia
  3. TensorFlow Data Validation(otevře se v novém okně)TensorFlow
  4. 5.5. Constraints(otevře se v novém okně)PostgreSQL Global Development Group
  5. ISO 8000-1:2022(otevře se v novém okně)ISO, 2022

Související pojmy

Potřebujete to vyřešit v praxi?

Poradíme, jak na to ve vašem projektu

Vysvětlit pojem je jedna věc, navrhnout kolem něj funkční řešení druhá. Ozvěte se a probereme, co dává smysl u vás.