Dashboard je vizuální panel, který soustředí klíčové metriky, grafy, upozornění a odkazy na jednu přehlednou obrazovku. Pomáhá rychle sledovat stav produktu, firmy nebo systému, odhalit odchylky a rozhodovat podle aktuálních dat místo procházení mnoha samostatných reportů v různých nástrojích a týmech.
Data pipeline je řízený sled kroků, který přesouvá data ze zdrojů do cílového úložiště nebo aplikace a během cesty je čistí, převádí, obohacuje či kontroluje. Používá se v analytice, strojovém učení i provozních systémech, aby data dorazila včas, ve správném formátu a dohledatelně.
Databázový pohled je pojmenovaný uložený SELECT dotaz, na který se v databázi odkazuje jako na tabulku. Pohled sám o sobě data neukládá: při každém použití se jeho definice vyhodnotí nad zdrojovými tabulkami. Slouží k zjednodušení složitých dotazů, k omezení přístupu na vybrané sloupce a řádky a ke stabilnímu rozhraní nad měnícím se datovým modelem.
Datová kvalita je míra, do jaké data odpovídají potřebám konkrétního použití, například rozhodování, reportingu, automatizace nebo trénování modelů. Posuzuje se podle vlastností jako přesnost, úplnost, konzistence, aktuálnost, jedinečnost a dohledatelnost původu, nikoli jen podle toho, zda jsou data technicky validní.
Datová sada je uspořádaný soubor datových záznamů, který má společný účel, strukturu a kontext použití. Může jít o tabulku objednávek, kolekci obrázků, logy aplikace nebo trénovací příklady pro model. Důležitá není jen data samotná, ale také popis sloupců, původ, kvalita a pravidla aktualizace.
Datové jezero je centrální úložiště, které uchovává velké objemy strukturovaných, polostrukturovaných i nestrukturovaných dat v původní nebo málo upravené podobě. Slouží jako základ pro analytiku, strojové učení, reporting a pozdější zpracování, kdy se datům dává struktura až při čtení nebo transformaci.
Datový sklad je centrální databázové prostředí určené pro dlouhodobé ukládání, sjednocení a analytické dotazování dat z více provozních systémů. Na rozdíl od transakční databáze optimalizuje čtení, agregace a historické pohledy, takže podporuje reporting, business intelligence, plánování i datové modely nad konzistentními metrikami.
Denormalizace je záměrné zavedení redundance do datového modelu, typicky zkopírováním nebo předpočítáním hodnot z jiných tabulek, aby čtení nemuselo spojovat mnoho tabulek a agregovat je za běhu. Denormalizace zrychluje dotazy výměnou za větší objem dat, složitější zápisy a riziko, že se kopie hodnoty rozejdou s originálem.
Detekce anomálií je hledání datových bodů, událostí nebo průběhů, které se výrazně odlišují od naučeného obrazu běžného chování. Používá se při odhalování podvodných plateb, průniků do sítě, výpadků infrastruktury nebo vadných kusů ve výrobě. Typicky pracuje s velmi nevyváženými daty, kde anomálie tvoří zlomek procenta všech pozorování.
Doporučovací systém je software, který každému uživateli vybírá z rozsáhlého katalogu malou množinu položek, jež ho pravděpodobně zaujmou. Odhad staví na historii chování (kliknutí, nákupy, hodnocení), na vlastnostech položek nebo na kombinaci obojího. Nasazuje se v e-shopech, streamovacích službách i zpravodajských aplikacích všude tam, kde je nabídka větší, než dokáže člověk projít.
Dotazovací plán je postup kroků, kterým databáze skutečně vykoná zadaný SQL dotaz: v jakém pořadí čte tabulky, zda použije index nebo sekvenční průchod a jakou metodou spojí data. Plán sestavuje plánovač na základě statistik o datech a vybírá z více možností tu s nejnižší odhadovanou cenou.