TakéData set, datový souborZákladní

Definice

Datová sada je uspořádaný soubor datových záznamů, který má společný účel, strukturu a kontext použití. Může jít o tabulku objednávek, kolekci obrázků, logy aplikace nebo trénovací příklady pro model. Důležitá není jen data samotná, ale také popis sloupců, původ, kvalita a pravidla aktualizace.

Kategorie: Datová analytikaAktualizováno

Co tvoří datovou sadu

Záznamy, atributy a metadata

Datová sada se obvykle skládá ze záznamů a atributů. V tabulce je záznam jeden řádek a atribut jeden sloupec, například objednávka, zákazník, čas vytvoření a částka. U obrázků může být záznam jeden soubor a atributy tvoří štítek, rozlišení, autor nebo licenční podmínky. Metadata vysvětlují, odkud data pocházejí, jak byla získána, jaké jednotky používají a kdo za ně odpovídá.

Granularita rozhoduje o použití

Granularita určuje, co přesně jeden záznam znamená. Datová sada objednávek může mít jeden řádek na objednávku, položku košíku, platbu nebo změnu stavu. Stejné podnikové dění tak může vytvořit několik datových sad s různou přesností. Špatně zvolená granularita vede k chybným součtům, duplicitám nebo k závěrům, které vypadají přesně, ale odpovídají jiné otázce.

Kvalita datové sady v praxi

Schéma není jen dokumentace

Schéma popisuje názvy polí, datové typy, povinné hodnoty a vztahy mezi záznamy. Datová sada bez jasného schématu se špatně kontroluje a ještě hůř sdílí mezi týmy. V databázích pomáhá schéma vynucovat pravidla už při zápisu. V analytických souborech nahrazuje část této jistoty datový katalog, validační skripty nebo kontrakt mezi producentem a spotřebitelem dat.

Chybějící hodnoty a reprezentativnost

Chybějící hodnota nemusí znamenat chybu. Prázdné datum doručení může být v pořádku u neodeslané objednávky, ale podezřelé u uzavřené reklamace. Kvalitní datová sada proto popisuje, kdy je prázdná hodnota přípustná. Reprezentativnost je podobně důležitá: sada návštěv z jednoho marketingového kanálu nestačí pro závěr o celém webu.

Datová sada v analytice a strojovém učení

Od surových dat k tabulce pro práci

Surová data často leží v logu, frontě událostí, exportu z CRM nebo v datovém jezeře. Analytik z nich vytváří datovou sadu vhodnou pro konkrétní otázku: odstraní technické duplicity, sjednotí časové zóny, doplní číselníky a rozhodne, co patří mimo rozsah analýzy. Stabilní sady pro reporting často končí v datovém skladu.

Rozdělení pro modely

Ve strojovém učení se datová sada často dělí na trénovací, validační a testovací část. Trénovací data slouží k učení parametrů, validační část pomáhá ladit postup a testovací část má odhadnout chování na nových případech. Důležité je zabránit úniku informací, například aby stejný zákazník nebyl současně v trénovací i testovací části.

Příklady z praxe

  1. Objednávky e-shopu pro reporting

    E-shop vyexportuje soubor orders.csv s objednávkami za poslední rok. Každý řádek obsahuje ID objednávky, měsíc, cenu a stav platby. Analytik ze sady spočítá měsíční tržby a odhalí, že část stornovaných objednávek se dříve započítávala do obratu.

    import pandas as pd
    
    orders = pd.read_csv("orders.csv")
    monthly = orders.groupby("month")["revenue"].sum()
    print(monthly)
  2. Fotografie pro kontrolu kvality

    Tým trénuje model, který rozpoznává vadné výrobky z fotografií. Datová sada obsahuje snímky, štítky vady a informaci o výrobní lince. Po rozdělení podle výrobních sérií se ukáže, že model je spolehlivý na nových sériích méně, než naznačovalo náhodné rozdělení obrázků.

Časté omyly

MýtusDatová sada je prostě jeden soubor s daty.
Ve skutečnostiDatová sada může být jeden CSV soubor, ale také kolekce tabulek, obrázků, dokumentů nebo záznamů v objektovém úložišti. Hranici sady určuje společný účel, struktura a popis, ne počet souborů.
MýtusČím větší datová sada, tím lepší výsledek.
Ve skutečnostiVelikost pomáhá jen tehdy, když data odpovídají řešené otázce a mají přijatelnou kvalitu. Duplicitní, nevyvážená nebo špatně označená sada může zhoršit analýzu i model.

Časté dotazy

Co má obsahovat dobrý popis datové sady?
Dobrý popis datové sady má uvést účel, původ dat, význam polí, datové typy, jednotky, časové pokrytí, licenci a známá omezení. Datová sada bez těchto informací může být technicky čitelná, ale analyticky nebezpečná. Čtenář potřebuje vědět, zda hodnota nula znamená skutečnou nulu, chybějící měření nebo výsledek předchozí transformace.
Kdy je datová sada vhodná pro trénování modelu?
Datová sada je vhodná pro trénování modelu tehdy, když odpovídá problému, obsahuje správné cílové hodnoty a pokrývá případy, které model potká v produkci. Kvalita bývá důležitější než samotná velikost. Malá, přesně popsaná a reprezentativní sada může vést k lepšímu modelu než velký soubor s duplicitami, chybami ve štítcích a skrytým únikem informací.
Může být datová sada uložená ve více souborech?
Datová sada může být uložená ve více souborech, tabulkách nebo objektech v cloudovém úložišti. Podstatné je, aby zůstalo jasné, které části k sobě patří a jak se mají spojit. Velké sady se běžně dělí podle data, regionu nebo typu záznamu, protože se tak lépe přenášejí, verzují a zpracovávají paralelně.
Kdy datovou sadu anonymizovat?
Datovou sadu je vhodné anonymizovat nebo pseudonymizovat vždy, když obsahuje osobní údaje a původní identita není pro účel zpracování nutná. Nestačí odstranit jméno, protože člověka může prozradit kombinace údajů, například čas, poloha a vzácné chování. Právní a bezpečnostní posouzení patří před sdílení sady mimo původní tým.

Zdroje

  1. Dataset(otevře se v novém okně)Schema.org
  2. Data Catalog Vocabulary (DCAT) - Version 3(otevře se v novém okně)W3C, 2024
  3. Datasets(otevře se v novém okně)Hugging Face
  4. TensorFlow Datasets(otevře se v novém okně)TensorFlow

Související pojmy

Potřebujete to vyřešit v praxi?

Poradíme, jak na to ve vašem projektu

Vysvětlit pojem je jedna věc, navrhnout kolem něj funkční řešení druhá. Ozvěte se a probereme, co dává smysl u vás.