TakéData set, datový souborZákladní
Definice
Datová sada je uspořádaný soubor datových záznamů, který má společný účel, strukturu a kontext použití. Může jít o tabulku objednávek, kolekci obrázků, logy aplikace nebo trénovací příklady pro model. Důležitá není jen data samotná, ale také popis sloupců, původ, kvalita a pravidla aktualizace.
Co tvoří datovou sadu
Záznamy, atributy a metadata
Datová sada se obvykle skládá ze záznamů a atributů. V tabulce je záznam jeden řádek a atribut jeden sloupec, například objednávka, zákazník, čas vytvoření a částka. U obrázků může být záznam jeden soubor a atributy tvoří štítek, rozlišení, autor nebo licenční podmínky. Metadata vysvětlují, odkud data pocházejí, jak byla získána, jaké jednotky používají a kdo za ně odpovídá.
Granularita rozhoduje o použití
Granularita určuje, co přesně jeden záznam znamená. Datová sada objednávek může mít jeden řádek na objednávku, položku košíku, platbu nebo změnu stavu. Stejné podnikové dění tak může vytvořit několik datových sad s různou přesností. Špatně zvolená granularita vede k chybným součtům, duplicitám nebo k závěrům, které vypadají přesně, ale odpovídají jiné otázce.
Kvalita datové sady v praxi
Schéma není jen dokumentace
Schéma popisuje názvy polí, datové typy, povinné hodnoty a vztahy mezi záznamy. Datová sada bez jasného schématu se špatně kontroluje a ještě hůř sdílí mezi týmy. V databázích pomáhá schéma vynucovat pravidla už při zápisu. V analytických souborech nahrazuje část této jistoty datový katalog, validační skripty nebo kontrakt mezi producentem a spotřebitelem dat.
Chybějící hodnoty a reprezentativnost
Chybějící hodnota nemusí znamenat chybu. Prázdné datum doručení může být v pořádku u neodeslané objednávky, ale podezřelé u uzavřené reklamace. Kvalitní datová sada proto popisuje, kdy je prázdná hodnota přípustná. Reprezentativnost je podobně důležitá: sada návštěv z jednoho marketingového kanálu nestačí pro závěr o celém webu.
Datová sada v analytice a strojovém učení
Od surových dat k tabulce pro práci
Surová data často leží v logu, frontě událostí, exportu z CRM nebo v datovém jezeře. Analytik z nich vytváří datovou sadu vhodnou pro konkrétní otázku: odstraní technické duplicity, sjednotí časové zóny, doplní číselníky a rozhodne, co patří mimo rozsah analýzy. Stabilní sady pro reporting často končí v datovém skladu.
Rozdělení pro modely
Ve strojovém učení se datová sada často dělí na trénovací, validační a testovací část. Trénovací data slouží k učení parametrů, validační část pomáhá ladit postup a testovací část má odhadnout chování na nových případech. Důležité je zabránit úniku informací, například aby stejný zákazník nebyl současně v trénovací i testovací části.
Příklady z praxe
Objednávky e-shopu pro reporting
E-shop vyexportuje soubor orders.csv s objednávkami za poslední rok. Každý řádek obsahuje ID objednávky, měsíc, cenu a stav platby. Analytik ze sady spočítá měsíční tržby a odhalí, že část stornovaných objednávek se dříve započítávala do obratu.
import pandas as pd orders = pd.read_csv("orders.csv") monthly = orders.groupby("month")["revenue"].sum() print(monthly)Fotografie pro kontrolu kvality
Tým trénuje model, který rozpoznává vadné výrobky z fotografií. Datová sada obsahuje snímky, štítky vady a informaci o výrobní lince. Po rozdělení podle výrobních sérií se ukáže, že model je spolehlivý na nových sériích méně, než naznačovalo náhodné rozdělení obrázků.
Časté omyly
- MýtusDatová sada je prostě jeden soubor s daty.
- Ve skutečnostiDatová sada může být jeden CSV soubor, ale také kolekce tabulek, obrázků, dokumentů nebo záznamů v objektovém úložišti. Hranici sady určuje společný účel, struktura a popis, ne počet souborů.
- MýtusČím větší datová sada, tím lepší výsledek.
- Ve skutečnostiVelikost pomáhá jen tehdy, když data odpovídají řešené otázce a mají přijatelnou kvalitu. Duplicitní, nevyvážená nebo špatně označená sada může zhoršit analýzu i model.
Časté dotazy
- Co má obsahovat dobrý popis datové sady?
- Dobrý popis datové sady má uvést účel, původ dat, význam polí, datové typy, jednotky, časové pokrytí, licenci a známá omezení. Datová sada bez těchto informací může být technicky čitelná, ale analyticky nebezpečná. Čtenář potřebuje vědět, zda hodnota nula znamená skutečnou nulu, chybějící měření nebo výsledek předchozí transformace.
- Kdy je datová sada vhodná pro trénování modelu?
- Datová sada je vhodná pro trénování modelu tehdy, když odpovídá problému, obsahuje správné cílové hodnoty a pokrývá případy, které model potká v produkci. Kvalita bývá důležitější než samotná velikost. Malá, přesně popsaná a reprezentativní sada může vést k lepšímu modelu než velký soubor s duplicitami, chybami ve štítcích a skrytým únikem informací.
- Může být datová sada uložená ve více souborech?
- Datová sada může být uložená ve více souborech, tabulkách nebo objektech v cloudovém úložišti. Podstatné je, aby zůstalo jasné, které části k sobě patří a jak se mají spojit. Velké sady se běžně dělí podle data, regionu nebo typu záznamu, protože se tak lépe přenášejí, verzují a zpracovávají paralelně.
- Kdy datovou sadu anonymizovat?
- Datovou sadu je vhodné anonymizovat nebo pseudonymizovat vždy, když obsahuje osobní údaje a původní identita není pro účel zpracování nutná. Nestačí odstranit jméno, protože člověka může prozradit kombinace údajů, například čas, poloha a vzácné chování. Právní a bezpečnostní posouzení patří před sdílení sady mimo původní tým.
Zdroje
- Dataset(otevře se v novém okně)
- Data Catalog Vocabulary (DCAT) - Version 3(otevře se v novém okně)
- Datasets(otevře se v novém okně)
- TensorFlow Datasets(otevře se v novém okně)