Definice
Datové jezero je centrální úložiště, které uchovává velké objemy strukturovaných, polostrukturovaných i nestrukturovaných dat v původní nebo málo upravené podobě. Slouží jako základ pro analytiku, strojové učení, reporting a pozdější zpracování, kdy se datům dává struktura až při čtení nebo transformaci.
Proč datové jezero vzniklo
Datové jezero řeší situaci, kdy organizace sbírá více dat, než dokáže hned převést do pevných tabulek. Do jednoho úložiště mohou proudit logy z aplikací, exporty z ERP, dokumenty, obrázky, telemetrie zařízení i historické zálohy. Hlavní hodnota není v okamžité čistotě dat, ale v možnosti data neztratit a později je použít pro nové otázky.
Datové jezero se často staví nad objektovým úložištěm v cloudu, například Amazon S3, Google Cloud Storage nebo Azure Data Lake Storage. Nad soubory potom pracují výpočetní nástroje, typicky Apache Spark, SQL enginy, notebooky nebo služby pro strojové učení. Úložiště a výpočet jsou oddělené, takže firma může levně držet velké objemy dat a výkon přidat až při zpracování.
Vrstvy v jezeře: od surových dat k použitelným sadám
Dobře navržené datové jezero nebývá jedna chaotická složka. Často má zóny podle zralosti dat. Surová vrstva uchovává původní podobu záznamů, aby bylo možné dohledat chybu v transformaci nebo znovu spustit novou logiku. Čistěná vrstva sjednocuje formáty, typy a časová razítka. Prezentační vrstva nabízí datové sady připravené pro dashboardy, modely nebo ad hoc analýzu.
Formáty jako Parquet nebo ORC pomáhají číst jen potřebné sloupce a ukládat metadata efektivněji než prosté CSV. Tabulkové vrstvy jako Delta Lake, Apache Iceberg nebo Apache Hudi přidávají transakce, verzování a práci se změnami, takže datové jezero se chová blíže databázové platformě.
Schéma až při čtení
Datové jezero obvykle používá přístup schema-on-read. Data se při zápisu nemusí hned vejít do pevného relačního modelu. Struktura se uplatní až ve chvíli, kdy analytik, datový inženýr nebo aplikace data čte. Tento přístup dává svobodu, ale přesouvá část odpovědnosti na katalogizaci, dokumentaci a kvalitu dotazů.
Datový sklad naproti tomu častěji používá schema-on-write. Data se před uložením čistí a modelují podle předem daných tabulek. Sklad je proto vhodný pro stabilní reporting a kontrolované metriky, zatímco datové jezero lépe podporuje průzkumnou analytiku, pokusy s novými zdroji a trénování modelů.
Správa, která brání datové bažině
Datové jezero bez pravidel se snadno změní v datovou bažinu. Tým postupně přestane vědět, kdo datovou sadu vytvořil, zda je aktuální, jaké obsahuje osobní údaje a která verze je důvěryhodná. Technická škálovatelnost sama o sobě nestačí.
Správa dat zahrnuje katalog metadat, vlastnictví datasetů, řízení přístupů, retenční pravidla, šifrování a auditní stopu. Důležité jsou také konvence názvů, partitioning podle času nebo domény a automatické kontroly kvality. Governance u datového jezera není byrokratický doplněk, ale podmínka, aby uložená data šla bezpečně a opakovaně použít.
Datové jezero, sklad a lakehouse
Datové jezero a datový sklad nejsou přímí nepřátelé. Mnoho architektur používá obojí: jezero drží široké spektrum surových a polozpracovaných dat, sklad poskytuje kurátorované tabulky pro management reporting a finanční metriky. Lakehouse se snaží spojit nízké náklady a flexibilitu jezera s transakčními vlastnostmi a správou známou ze skladů.
Příklady z praxe
Události z mobilní aplikace
Mobilní aplikace posílá každou interakci uživatele jako událost do surové vrstvy datového jezera. Produktový analytik později zjistí, že potřebuje nový pohled na chování v onboardingovém průvodci, který při návrhu datového skladu nikdo neplánoval. Protože původní události zůstaly uložené, tým dokáže dotaz doplnit bez změny produkční aplikace.
SELECT event_name, count(*) AS pocet FROM read_parquet('s3://firma-lake/raw/app_events/date=2026-07-28/*.parquet') WHERE platform = 'android' GROUP BY event_name;Trénovací sada pro model
E-commerce tým ukládá objednávky, reklamace a texty zákaznické podpory do datového jezera v oddělených zónách. Datový vědec spojí kurátorované objednávky s vyčištěnými tickety a vytvoří trénovací sadu pro predikci rizika vrácení zboží. Datové jezero umožní pracovat i s textovými poli, která by se do původního reportingového modelu nevešla.
from pyspark.sql import SparkSession spark = SparkSession.builder.getOrCreate() orders = spark.read.parquet("gs://firma-lake/curated/orders/") tickets = spark.read.parquet("gs://firma-lake/clean/support_tickets/") training = orders.join(tickets, "customer_id", "left")
Časté omyly
- MýtusDatové jezero je jen levnější databáze.
- Ve skutečnostiDatové jezero není náhrada transakční databáze pro běh aplikace. Datové jezero slouží hlavně k ukládání a analytickému zpracování velkých a různorodých datových sad.
- MýtusDo datového jezera se má nahrát všechno a řešit se to bude později.
- Ve skutečnostiNekontrolované ukládání všeho obvykle vytvoří datovou bažinu. Datové jezero potřebuje katalog, pravidla přístupů, kvalitu dat a odpovědnost za konkrétní datasety.
Časté dotazy
- Kdy má datové jezero smysl místo klasického datového skladu?
- Datové jezero má smysl místo klasického datového skladu ve chvíli, kdy data přicházejí v různých formátech, mění se jejich struktura nebo zatím není jasné, k čemu přesně budou sloužit. Datový sklad bývá lepší pro stabilní metriky, účetní reporting a dobře řízené relační modely. V praxi se často používá kombinace: datové jezero uchovává široký základ dat a sklad poskytuje prověřené výstupy pro byznys.
- Je datové jezero bezpečné pro citlivá data?
- Datové jezero může obsahovat osobní údaje, obchodní tajemství nebo provozní logy s citlivými informacemi, takže bezpečnost musí být součástí návrhu. Důležité je šifrování, oddělení rolí, audit přístupů, klasifikace dat a pravidla pro mazání nebo anonymizaci. Samotné uložení do cloudového bucketu bezpečnost neřeší, protože rozhodující jsou oprávnění, procesy a kontrola toho, kdo data používá.
- Jak zabránit tomu, aby se datové jezero změnilo v datovou bažinu?
- Datové jezero se nestane datovou bažinou, pokud má jasné vlastnictví datasetů, katalog metadat, pravidla pro názvy, kvalitu a životní cyklus dat. Každá důležitá datová sada by měla mít popis původu, význam polí, odpovědnou osobu a informaci o aktuálnosti. Bez těchto pravidel roste objem souborů rychleji než schopnost organizace data najít, pochopit a důvěryhodně použít.
- Umí datové jezero pracovat s daty v reálném čase?
- Datové jezero může podporovat real-time scénáře, ale samotný pojem neznamená okamžité zpracování. Některá jezera přijímají data dávkově jednou denně, jiná kombinují dávky se streamem z nástrojů jako Kafka nebo cloudové event služby. Rychlost závisí na ingestní vrstvě, formátu tabulek, výpočetním enginu a požadavcích na latenci, nikoli jen na názvu architektury.
Zdroje
- What is a Data Lake?(otevře se v novém okně)
- What is a data lake?(otevře se v novém okně)
- What Is a Data Lake?(otevře se v novém okně)
- Introduction to Azure Data Lake Storage Gen2(otevře se v novém okně)