Scrapery a datové pipeline

Data z webu, automaticky a čistě.

Sbíráme veřejná data z webů, čistíme je a ukládáme do databáze nebo tabulky. Pravidelně a s hlídáním výpadků. Stejné scrapery provozujeme u vlastního produktu Realitify, takže víme, co všechno se může pokazit.

Pro koho to je

Když data existují,
ale nejsou u vás.

Spousta užitečných informací leží veřejně na webech: ceny, nabídky, firmy, inzeráty. Scraper je každý den sesbírá za vás a dodá ve formě, se kterou se dá pracovat. Nejde o jednorázový skript, ale o spolehlivou službu, která běží a hlídá sama sebe.

Ručně sledujete ceny konkurence nebo nabídky.

Někdo z týmu každý týden obchází weby, kopíruje čísla do tabulky a občas na něco zapomene. Scraper to udělá každou noc, uloží historii cen a upozorní vás, když se něco změní. Čas lidí jde na rozhodování, ne na opisování.

Potřebujete databázi firem, produktů nebo inzerátů.

Seznam potenciálních zákazníků, katalog produktů dodavatelů nebo přehled nabídek na trhu. Sesbíráme data z více zdrojů, sjednotíme je do jednotné struktury a doplníme, co chybí, takže máte použitelnou databázi, ne hromadu odkazů.

Data chodí z mnoha zdrojů v různých formátech.

Weby, PDF, e-maily a tabulky s různými názvy sloupců. Pipeline je načte, převede na jednotný formát, odstraní duplicity a uloží na jedno místo. Následné reporty a aplikace pak pracují s čistými daty.

Co dostanete

Šest výstupů, které si odnesete

01Scrapery na míruProgram pro každý zdroj, napsaný přesně na jeho strukturu. Zvládá stránkování, přihlášení, dynamicky načítaný obsah i omezení rychlosti, aby zdroj nezatěžoval.
02AI extrakce z nestrukturovaných stránekTam, kde stránky nemají pevnou strukturu, využijeme jazykové modely. Z volného textu vytáhnou cenu, parametry nebo kontakt a výsledek ověříme pravidly.
03Čištění a deduplikaceSjednocení jednotek, měn a názvů, odstranění duplicit a kontrola chybějících údajů. Stejná nabídka na více portálech se spojí do jednoho záznamu.
04Pravidelné spouštěníPlánované běhy podle potřeby: každou hodinu, denně nebo týdně. Spolehlivé fronty, opakování po chybě a respektování limitů zdroje.
05Export: API, CSV, Google SheetsData dostanete tam, kde s nimi pracujete. Přes API do aplikace, jako CSV nebo přímo do Google Sheets, který se sám aktualizuje.
06Monitoring a upozorněníHlídáme, jestli scraper běží, kolik záznamů přinesl a zda se výsledky nezměnily. Při výpadku nebo změně webu dostanete upozornění dřív, než si všimnete chybějících dat.

Náš přístup

Od výběru zdrojů po stabilní provoz.

Nejdřív ověříme, že data jde sbírat legálně a spolehlivě. Teprve potom stavíme automatizaci.

01

Výběr zdrojů a právní kontrola

Projdeme zdroje, podmínky použití, robots.txt a typ dat, včetně osobních údajů. Výstupem je seznam zdrojů s hodnocením rizika a doporučením, co sbírat a co ne.

Seznam zdrojů

02

Prototyp na vzorku

Sesbíráme data z malého vzorku a ukážeme vám výsledek. Ověříte, že pole, kvalita i formát odpovídají tomu, co potřebujete.

Vzorek dat

03

Automatizace

Přidáme plánování, čištění, ukládání a výstupy. Nastavíme monitoring a upozornění, takže si nemusíte hlídat, jestli běží.

Plánované běhy

04

Provoz a údržba

Weby se mění, a scrapery s nimi. Sledujeme výpadky, opravujeme je a upravujeme sběr podle nových potřeb.

Opravy a rozvoj
01

Sběr

Stahování stránek včetně těch, které se načítají skriptem. Hlídáme rychlost dotazů, aby zdroj nebyl zatěžován.

Technologie a jejich role

PythonHlavní jazyk pro sběr a zpracování
PlaywrightOvládání prohlížeče pro dynamické weby
ScrapeGraphAIExtrakce řízená jazykovým modelem

Kdy dává smysl

Stránky se načítají skriptem nebo mění strukturu.

Co to přinese

Spolehlivé získání dat i z náročných zdrojů.

02

Zpracování

Surová data jsou plná chyb. Čistíme je pravidly a tam, kde to dává smysl, i jazykovým modelem.

Technologie a jejich role

PythonPravidla, normalizace a validace
LLM extrakceÚdaje z volného textu
DeduplikaceSpojení stejných záznamů

Kdy dává smysl

Zdroje mají nejednotný formát nebo volný text.

Co to přinese

Použitelná data místo hromady surových záznamů.

03

Data

Databáze s historií změn. Díky ní víte nejen aktuální stav, ale i vývoj cen nebo nabídek v čase.

Technologie a jejich role

PostgreSQLSpolehlivé úložiště s historií
Schéma datJednotná struktura záznamů
ZálohyObnova při chybě

Kdy dává smysl

Chcete sledovat vývoj, ne jen aktuální stav.

Co to přinese

Historie a analýza trendů bez dalšího sbírání.

04

Spouštění

Plánování běhů a návazných kroků. Při chybě se úloha zopakuje a o problému se dozvíte.

Technologie a jejich role

PlánovačPravidelné spouštění úloh
n8nNávazné kroky a upozornění
FrontyOpakování po chybě

Kdy dává smysl

Data se mají aktualizovat bez dozoru.

Co to přinese

Automatický provoz s upozorněním při problému.

05

Výstup

Doručení dat k lidem a systémům. Přehledný dashboard pro tým, API pro aplikace a export pro analytiky.

Technologie a jejich role

APINapojení dalších aplikací
DashboardPřehled pro tým
CSV / Google SheetsExport pro analýzu

Kdy dává smysl

Data mají používat lidé i jiné systémy.

Co to přinese

Data tam, kde s nimi pracujete.

Odkud chcete data získávat?

APIWeby

Veřejné weby, přihlášené účty nebo API? Pokud zdroj nabízí API nebo export, použijeme ho: je to stabilnější než scraping.

Jak často potřebujete aktuální data?

FrekvenceProvoz

Jednou týdně, denně, nebo každou hodinu? Čím častější aktualizace, tím větší nároky na provoz a ohleduplnost ke zdroji.

Co budete s daty dělat?

DashboardAPI

Report, aplikace, nebo analýza? Podle toho zvolíme strukturu databáze a výstup.

Jsou v datech osobní údaje?

GDPRPrávní kontrola

Firemní kontakty a jména fyzických osob mají jiná pravidla. Řešíme je před začátkem, ne až na konci.

Typické projekty

Tři situace, které řešíme nejčastěji.

Reference

Datové nástroje, které už běží.

Všechny projekty v Naší práci →

Časté otázky

Než se ozvete.

Sbírání veřejně dostupných dat je obecně v pořádku, ale záleží na zdroji, podmínkách použití a typu dat. Zvlášť opatrní jsme u osobních údajů, chráněných databází a obsahu za přihlášením. Před zahájením proto děláme právní kontrolu a zdroje, které nedoporučíme, vám řekneme. Nejsme advokátní kancelář, u citlivějších případů doporučíme konzultaci s právníkem.

Stane se to a počítáme s tím. Scraper hlídá, kolik záznamů přinesl, a při výrazném poklesu pošle upozornění. Opravu zahrnuje provozní péče, typicky do jednoho pracovního dne. Při AI extrakci jsou změny struktury méně citlivé.

Podle potřeby: od hodinových běhů po týdenní. Častější aktualizaci zvažujeme s ohledem na zdroj, abychom ho nezatěžovali. U většiny zakázek stačí denní běh.

Jeden jednodušší zdroj začíná kolem 25 000 Kč, pipeline s více zdroji, čištěním a dashboardem od 120 000 Kč. K tomu měsíční provozní péče podle počtu zdrojů.

Do databáze, kterou vlastníte, nebo kterou provozujeme na vašem účtu. Kdykoli je lze exportovat a převést jinam. Cloud a provoz →

Ano. Pipeline může krmit webovou nebo mobilní aplikaci, CRM nebo dashboard. Pokud je pro vás sběr jen začátek, navážeme aplikací. Webové aplikace a SaaS →

Další krok

Probereme, jaká data potřebujete.

Probrat data

KONTAKT

Pojďme se potkat

Máte nápad? Vyberte si termín pro společný rozhovor, nebo nám napište. Společně najdeme cestu k vašemu digitálnímu projektu.

Odesláním berete na vědomí zpracování osobních údajů.

Zásady zpracování osobních údajů