# Scrapery a datové pipeline

URL: https://www.virtuex.cz/co-tvorime/aplikace/scrapery
Slib: Data z webu, automaticky a čistě.
Orientační cena: od 25 000 Kč (nejsme plátci DPH)

**Data z webu, automaticky a čistě.**

Sbíráme veřejná data z webů, čistíme je a ukládáme do databáze nebo tabulky. Pravidelně a s hlídáním výpadků. Stejné scrapery provozujeme u vlastního produktu Realitify, takže víme, co všechno se může pokazit.

## Pro koho

- **Ručně sledujete ceny konkurence nebo nabídky.** Někdo z týmu každý týden obchází weby, kopíruje čísla do tabulky a občas na něco zapomene. Scraper to udělá každou noc, uloží historii cen a upozorní vás, když se něco změní. Čas lidí jde na rozhodování, ne na opisování.
- **Potřebujete databázi firem, produktů nebo inzerátů.** Seznam potenciálních zákazníků, katalog produktů dodavatelů nebo přehled nabídek na trhu. Sesbíráme data z více zdrojů, sjednotíme je do jednotné struktury a doplníme, co chybí, takže máte použitelnou databázi, ne hromadu odkazů.
- **Data chodí z mnoha zdrojů v různých formátech.** Weby, PDF, e-maily a tabulky s různými názvy sloupců. Pipeline je načte, převede na jednotný formát, odstraní duplicity a uloží na jedno místo. Následné reporty a aplikace pak pracují s čistými daty.

## Co dodáváme

- **Scrapery na míru:** Program pro každý zdroj, napsaný přesně na jeho strukturu. Zvládá stránkování, přihlášení, dynamicky načítaný obsah i omezení rychlosti, aby zdroj nezatěžoval.
- **AI extrakce z nestrukturovaných stránek:** Tam, kde stránky nemají pevnou strukturu, využijeme jazykové modely. Z volného textu vytáhnou cenu, parametry nebo kontakt a výsledek ověříme pravidly.
- **Čištění a deduplikace:** Sjednocení jednotek, měn a názvů, odstranění duplicit a kontrola chybějících údajů. Stejná nabídka na více portálech se spojí do jednoho záznamu.
- **Pravidelné spouštění:** Plánované běhy podle potřeby: každou hodinu, denně nebo týdně. Spolehlivé fronty, opakování po chybě a respektování limitů zdroje.
- **Export: API, CSV, Google Sheets:** Data dostanete tam, kde s nimi pracujete. Přes API do aplikace, jako CSV nebo přímo do Google Sheets, který se sám aktualizuje.
- **Monitoring a upozornění:** Hlídáme, jestli scraper běží, kolik záznamů přinesl a zda se výsledky nezměnily. Při výpadku nebo změně webu dostanete upozornění dřív, než si všimnete chybějících dat.

## Postup

1. **Výběr zdrojů a právní kontrola** Projdeme zdroje, podmínky použití, robots.txt a typ dat, včetně osobních údajů. Výstupem je seznam zdrojů s hodnocením rizika a doporučením, co sbírat a co ne.
2. **Prototyp na vzorku** Sesbíráme data z malého vzorku a ukážeme vám výsledek. Ověříte, že pole, kvalita i formát odpovídají tomu, co potřebujete.
3. **Automatizace** Přidáme plánování, čištění, ukládání a výstupy. Nastavíme monitoring a upozornění, takže si nemusíte hlídat, jestli běží.
4. **Provoz a údržba** Weby se mění, a scrapery s nimi. Sledujeme výpadky, opravujeme je a upravujeme sběr podle nových potřeb.

## Varianty a nástroje

- **Sběr:** Stahování stránek včetně těch, které se načítají skriptem. Hlídáme rychlost dotazů, aby zdroj nebyl zatěžován. (Python, Playwright, ScrapeGraphAI)
- **Zpracování:** Surová data jsou plná chyb. Čistíme je pravidly a tam, kde to dává smysl, i jazykovým modelem. (Python, LLM extrakce, Deduplikace)
- **Data:** Databáze s historií změn. Díky ní víte nejen aktuální stav, ale i vývoj cen nebo nabídek v čase. (PostgreSQL, Schéma dat, Zálohy)
- **Spouštění:** Plánování běhů a návazných kroků. Při chybě se úloha zopakuje a o problému se dozvíte. (Plánovač, n8n, Fronty)
- **Výstup:** Doručení dat k lidem a systémům. Přehledný dashboard pro tým, API pro aplikace a export pro analytiky. (API, Dashboard, CSV / Google Sheets)

## Časté otázky

**Je scrapování legální?**

Sbírání veřejně dostupných dat je obecně v pořádku, ale záleží na zdroji, podmínkách použití a typu dat. Zvlášť opatrní jsme u osobních údajů, chráněných databází a obsahu za přihlášením. Před zahájením proto děláme právní kontrolu a zdroje, které nedoporučíme, vám řekneme. Nejsme advokátní kancelář, u citlivějších případů doporučíme konzultaci s právníkem.

**Co když web změní strukturu?**

Stane se to a počítáme s tím. Scraper hlídá, kolik záznamů přinesl, a při výrazném poklesu pošle upozornění. Opravu zahrnuje provozní péče, typicky do jednoho pracovního dne. Při AI extrakci jsou změny struktury méně citlivé.

**Jak často se data aktualizují?**

Podle potřeby: od hodinových běhů po týdenní. Častější aktualizaci zvažujeme s ohledem na zdroj, abychom ho nezatěžovali. U většiny zakázek stačí denní běh.

**Kolik scraper stojí?**

Jeden jednodušší zdroj začíná kolem 25 000 Kč, pipeline s více zdroji, čištěním a dashboardem od 120 000 Kč. K tomu měsíční provozní péče podle počtu zdrojů.

**Kam se data ukládají?**

Do databáze, kterou vlastníte, nebo kterou provozujeme na vašem účtu. Kdykoli je lze exportovat a převést jinam.

**Umíte data využít v aplikaci?**

Ano. Pipeline může krmit webovou nebo mobilní aplikaci, CRM nebo dashboard. Pokud je pro vás sběr jen začátek, navážeme aplikací.

---
Zdroj: https://www.virtuex.cz/co-tvorime/aplikace/scrapery
Kontakt: info@virtuex.cz, +420 774 865 508
Další služby: https://www.virtuex.cz/llms.txt
