Verejne dostupné neznamená voľné na akékoľvek použitie. Prístup k stránke, kopírovanie obsahu, opakované použitie databázy a spracúvanie osobných údajov sú samostatné právne otázky.
Je web scraping legálny, ak sú údaje verejné?
Verejnosť údajov sama neurčuje legálnosť web scrapingu. Bežné sťahovanie dát z webu môže byť nízkorizikové, ak zbieraš fakty bez osobných údajov, nekopíruješ chránené texty či fotografie, rešpektuješ podmienky stránky, nezaťažuješ server a neobchádzaš žiadnu ochranu. Príkladom môže byť občasné získanie cien niekoľkých produktov pre internú analýzu.
Riziko rastie s rozsahom, frekvenciou a účelom. Iné je stiahnuť desať cien a iné každú minútu kopírovať celý katalóg konkurenta, fotografie, popisy, recenzie a kontakty zákazníkov. Legálnosť web scrapingu preto neurčuje názov použitého nástroja, ale spôsob prístupu, povaha dát a to, čo s nimi následne urobíš.
Čo rozhoduje o tom, či je web scraping legálny?
Pri jednom projekte sa môže naraz uplatniť niekoľko pravidiel:
- Prístup do systému: bolo potrebné prekonať prihlásenie, CAPTCHA, token, blokáciu alebo inú technickú ochranu?
- Zmluvné podmienky: zakazujú pravidlá webu robotický prístup, komerčné použitie alebo ďalšie zverejnenie?
- Autorské právo: sťahuješ iba fakty, alebo aj pôvodné texty, fotografie, grafiku a tvorivý výber obsahu?
- Databázové právo: vyberáš podstatnú časť databázy alebo opakovane malé časti, ktoré spolu nahrádzajú pôvodnú službu?
- Ochrana osobných údajov: obsahuje scraping dát mená, profily, e-maily, fotografie, identifikátory či názory konkrétnych ľudí?
- Prevádzka webu: spôsobuje bot nadmernú záťaž, výpadky, škodu alebo narúša podnikanie prevádzkovateľa?
Na podrobnejší kontext k obsahu si pozri aj článok o kopírovaní textov a obrázkov z webu. Širšie súvislosti nájdeš v sprievodcovi digitálnym právom.
Slovensko a EÚ verzus USA: Kedy sa zo scrapingu stáva problém?
CFAA je americký federálny zákon, nie svetový internetový trestný poriadok. Pri väzbe na USA môže byť relevantný, no slovenský projekt treba primárne posudzovať podľa slovenského a európskeho práva.
Kedy môže scraping dát porušiť slovenský Trestný zákon?
Podľa § 247 Trestného zákona je podstatné prekonanie bezpečnostného opatrenia a následné získanie neoprávneného prístupu do počítačového systému alebo jeho časti. Ak bot číta rovnakú verejnú stránku ako neprihlásený návštevník a nič neobchádza, automaticky to neznamená naplnenie tejto skutkovej podstaty.
Situácia sa mení, keď scraper obchádza autentifikáciu, používa cudzie prístupové údaje, prelamuje CAPTCHA, maskuje sa s cieľom obísť technickú blokáciu alebo vstupuje do neverejného API. Ak zároveň zasahuje do prevádzky, mení údaje alebo spôsobí škodu, môžu prichádzať do úvahy aj ďalšie ustanovenia. Nie každé porušenie podmienok je trestný čin, ale „veď to išlo cez HTTP“ nie je právna imunita.
Je web scraping legálny, ak ho robots.txt zakazuje?
Nie automaticky. Štandard RFC 9309 výslovne uvádza, že pravidlá robots.txt nie sú formou autorizácie prístupu. Ide o pokyny, ktoré majú crawlery rešpektovať. Ich ignorovanie však môže zhoršiť tvoju pozíciu: ukazuje, že vlastník automatizovaný prístup nechcel, a môže súvisieť so zmluvnými podmienkami, ochranou databázy, GDPR alebo dokazovaním úmyslu.
Rozumnejší scraper rešpektuje robots.txt, limity požiadaviek a stavové kódy. Ak existuje API alebo licencia, použije ich. Obchádzanie blokácie nie je plášť neviditeľnosti; skôr svietiaca tabuľa „vedel som, že ma nechcete pustiť“.
Chráni web autorské právo alebo právo k databáze?
Samotné fakty, napríklad cena alebo otváracia hodina, spravidla nie sú autorským dielom. Chránené však môžu byť originálne popisy, články, fotografie, grafika či tvorivá štruktúra. Preto je rozdiel medzi získaním hodnoty „49,90 €“ a skopírovaním celého produktového detailu vrátane fotografie a marketingového textu.
EÚ navyše chráni databázy, do ktorých získania, overenia alebo prezentácie obsahu smeroval podstatný vklad. Zakázaná môže byť extrakcia alebo ďalšie sprístupnenie celej databázy či jej podstatnej časti. Problémom môže byť aj opakované systematické vyberanie malých častí, ak obchádza normálne využívanie databázy a neprimerane poškodzuje záujmy jej zhotoviteľa.
Vo veci CV-Online Latvia proti Melons Súdny dvor EÚ pri agregátore pracovných ponúk zdôraznil ochranu podstatného vkladu a riziko pre jeho návratnosť. Prípad Ryanair proti PR Aviation ukázal, že nechránená databáza môže byť podľa vnútroštátneho práva stále obmedzená zmluvne.
Web scraping a GDPR: Sú verejné profily voľné dáta?
Web scraping a GDPR sa stretnú vždy, keď zbieraš informácie o identifikovanej alebo identifikovateľnej osobe. Verejný e-mail, fotografia, pracovná pozícia alebo príspevok na sociálnej sieti zostávajú osobnými údajmi. Zverejnenie nie je všeobecný súhlas s vytvorením obchodnej databázy, tréningom modelu ani automatizovaným profilovaním.
Web scraping a GDPR vyžaduje právny základ. Pri oprávnenom záujme musíš pomenovať legitímny cieľ, preukázať nevyhnutnosť a vyvážiť ho s právami ľudí. Ďalej platí minimalizácia, obmedzenie účelu, doby uchovávania a informačná povinnosť podľa článku 14, keď údaje nezískavaš priamo od dotknutej osoby. Citlivé údaje podľa článku 9 majú ešte prísnejší režim.
Usmernenie EDPB z júla 2026 pre generatívnu AI odporúča presné kritériá zberu, filtrovanie nepotrebných osobných údajov, vynechanie zdrojov technicky odmietajúcich scraping a transparentné informovanie. Ak individuálne informovanie vyžaduje neprimerané úsilie, článok 14 stále vyžaduje verejne dostupné informácie a ďalšie ochranné opatrenia.
Zoznam cien notebookov je právne iný materiál než zoznam ľudí, ich zamestnávateľov, názorov a kontaktov. Oba môžu byť verejné, ale iba jeden z nich ti môže priniesť veľmi osobný vzťah s dozorným orgánom.
Čo naozaj rozhodol spor hiQ Labs proti LinkedIn?
Americký prípad hiQ sa často skracuje na vetu „scraping verejných dát je legálny“. To je nebezpečne pohodlné. Odvolací súd v roku 2022 potvrdil predbežné opatrenie a uviedol, že pri sieti všeobecne otvorenej verejnosti pravdepodobne nejde o prístup bez autorizácie podľa CFAA. Zároveň výslovne nevyriešil celý spor ani všetky ostatné nároky.
Rozhodnutie nadviazalo na prípad Van Buren proti Spojeným štátom. Najvyšší súd USA odmietol široký výklad, podľa ktorého by človek porušil CFAA už tým, že použije oprávnene dostupné údaje na zakázaný účel. Dôležité je, či vstúpil do súborov, priečinkov alebo databáz, ktoré preňho boli technicky mimo povoleného priestoru.
Pre prax z toho plynie jednoduché varovanie: úspech proti jednému nároku podľa CFAA nevymaže zmluvu, copyright, súkromie ani databázové práva. Legálnosť web scrapingu sa nedá dokázať jedným screenshotom titulku z amerického technologického magazínu.
Kedy ti za sťahovanie dát z webu reálne hrozí žaloba?
Ak skúmaš, či je web scraping legálny, najvyššie riziko vzniká pri kopírovaní jadra cudzieho biznisu, obchádzaní ochrany alebo zarábaní na osobných údajoch. Prevádzkovateľ môže žiadať zákaz činnosti, odstránenie dát, náhradu škody, vydanie bezdôvodného obohatenia alebo ochranu svojich práv. Pri GDPR môže zasiahnuť aj dozorný orgán.
Pred väčším projektom zdokumentuj zdroje, účel, kategórie údajov, právny základ, podmienky webu a limity. Zbieraj iba potrebné polia, identifikuj crawler a zabezpeč vymazanie. Ak dáta zahŕňajú ľudí alebo na nich stojí celý produkt, právna konzultácia býva lacnejšia než zoznamovanie s právnym oddelením platformy.
FAQ: Je web scraping legálny v bežných situáciách?
Je web scraping legálny pri cenách z e-shopu?
Môže ísť o relatívne nízke riziko, ak zbieraš iba fakty, nepreberáš fotografie a popisy, nezaťažuješ web a neobchádzaš ochrany. Stále skontroluj podmienky a databázové práva.
Je scraping dát zo sociálnych sietí dovolený?
Je podstatne rizikovejší. Profily obsahujú osobné údaje, platformy majú zmluvné obmedzenia a používatelia nemusia rozumne očakávať ďalšie komerčné použitie svojich príspevkov.
Stačí rešpektovať robots.txt?
Nie. Je to dôležitý technický pokyn, nie kompletné právne povolenie. Ani povolený crawler automaticky nezískava licenciu na obsah alebo právny základ podľa GDPR.
Pomôže mi, keď údaje po stiahnutí anonymizujem?
Pomôže znížiť ďalšie riziká, ale pôvodný zber už mohol byť spracúvaním osobných údajov. Skutočná anonymizácia navyše musí prakticky znemožniť spätnú identifikáciu.
Kedy si mám vypýtať povolenie?
Najmä pri systematickom komerčnom zbere, kopírovaní veľkej databázy, osobných údajoch, ďalšom predaji alebo neistých podmienkach. API, licencia či písomná dohoda dokážu z právnej hmly spraviť podnikateľský plán.
Záver: Verejný web nie je dátový bufet zadarmo
Takže, je web scraping legálny? Áno, môže byť. Bezpečnejší je pri verejných neosobných faktoch, malom rozsahu, šetrnom prístupe a jasnom účele. Rizikový je pri obchádzaní ochrany, preberaní chráneného obsahu, systematickom vysávaní databázy, profilovaní ľudí alebo poškodzovaní prevádzky.
Neexistuje jedno tlačidlo „legálny scraper“. Každý projekt treba posúdiť podľa prístupu, dát, účelu, rozsahu a jurisdikcie. Robot môže byť rýchlejší než človek, ale predvolanie na súd vie stále prečítať iba jeho majiteľ.
Článok poskytuje všeobecné informácie a nie je právnym stanoviskom pre konkrétny projekt. Pri veľkom, komerčnom alebo osobnom datasete si nechaj posúdiť konkrétny zdroj, účel a spôsob zberu.
Zdroje




