---
title: "SearXNG + Crawl4AI: Prečo už neprenajímame API"
description: "SerpAPI a Firecrawl sme nahradili samo-hostenými nástrojmi. Čo sme sa pritom naučili a prečo nám to nevyšlo podľa predstáv."
locale: "sk"
canonical: "https://blckalpaca.at/sk/blog/searxng-crawl4ai-preco-uz-neprenajimame-api"
published: "2026-09-04T10:36:45.422Z"
updated: "2026-09-04T10:36:46.231Z"
source: "Blck Alpaca e.U., blckalpaca.at"
---

# SearXNG + Crawl4AI: Prečo už neprenajímame API

SerpAPI a Firecrawl sme nahradili samo-hostenými nástrojmi. Čo sme sa pritom naučili a prečo nám to nevyšlo podľa predstáv.

## Prekvapenie: Samo-hosting nie je automaticky lacnejší

Mysleli sme si, že ušetríme peniaze. Namiesto mesačného štvorciferného poplatku za SerpAPI a Firecrawl sme našu výskumnú infraštruktúru prebudovali na SearXNG a Crawl4AI. Oba nástroje bežia na našich vlastných serveroch, oba sú open source, oba stoja nula eur za licenčné poplatky. Účet sa zdal triviálny: náklady na hardvér sa amortizujú za tri mesiace, potom budeme v pluse.

Spoiler: Po šiestich týždňoch prevádzky sme síce zrušili faktúry za API, ale celkové náklady neklesli. Získali sme niečo iné: kontrolu nad dátovými tokmi, žiadne obmedzenia sadzieb (rate limits) a istotu, že žiadny tretí poskytovateľ zajtra nezdvojnásobí svoje ceny alebo nezruší svoje služby. Pre našich zákazníkov z regiónu DACH, ktorí berú [GDPR](/sk/slovnik/gdpr) vážne, to má väčšiu hodnotu ako ušetrené eurá. Ale úprimne: kto sa pozerá len na cenu, bude sklamaný.

## Problém: API faktúry a Vendor-Lock-in

Naše dva sourcing workfow, ktoré automatizujú prieskum trhu a vyhľadávanie obsahu, sa spoliehali na dve platené služby: SerpAPI pre štruktúrované výsledky Google a Firecrawl pre čisté HTML parsovanie a extrakciu Markdownu. Obe fungujú bezchybne, ale obe škálujú lineárne s používaním. Pri desiatich výskumných úlohách denne to nie je problém. Pri sto sa to stáva drahým. Pri tristo je to absurdné.

Druhý problém bol subtílnejší: vybudovali sme workflow, ktoré boli optimalizované pre štruktúru odpovedí týchto [API](/sk/slovnik/api). Ak SerpAPI zmení pole, u nás sa niečo pokazí. Firecrawl zavedie novú cenovú úroveň a my sa musíme rozhodnúť, či prebudujeme alebo zaplatíme. Mali sme závislosti, ktoré sme nemohli kontrolovať.

## Architektúra: Dve služby, jeden princíp

Obe služby sme nahradili samo-hostenými alternatívami, ktoré koncepčne robia to isté, ale bežia na našej infraštruktúre. SearXNG je meta vyhľadávač, ktorý agreguje výsledky z Google, Bingu, DuckDuckGo a ďalších a vracia ich ako JSON. Crawl4AI je Python framework, ktorý načítava webové stránky, renderuje JavaScript a extrahuje štruktúrovaný obsah. Obe komunikujú cez HTTP, obe poskytujú JSON, obe sa dajú priamo integrovať do našich workflow.

Stratégia nasadenia bola jednoduchá: Docker Compose na vyhradenom serveri, pred ním reverzný proxy, hotovo. SearXNG dostane inštanciu s Redis-Cache, Crawl4AI beží s Playwright-backendom pre JavaScript rendering. Obe služby sú dostupné iba interne, naše workflow k nim pristupujú cez interné názvy hostiteľov. Žiadne verejné koncové body, žiadne API kľúče, žiadne obmedzenia sadzieb.

Integrácia do existujúcich sourcing workflow bola kritickou časťou. Staré API uzly sme nahradili uzlami HTTP-Request, ktoré bežia oproti našim vlastným službám. Štruktúry odpovedí sú odlišné, takže sme vybudovali mapovaciu logiku, ktorá prekladá SearXNG-JSON do formátu, ktorý očakávajú naše následné uzly. To isté pre Crawl4AI. Samotné workflow nemuseli byť prebudované, iba adaptačná vrstva.

## Rozhodnutie jedna: Prečo SearXNG a nie Elasticsearch s Custom Crawlerom

Mohli sme si tiež vytvoriť vlastný crawler a indexovať výsledky v Elasticsearche. To by bolo flexibilnejšie, ale vrhlo by nás to do údržbárskej diery. SearXNG je stabilný už roky, má aktívnu komunitu a poskytuje použiteľné výsledky hneď po vybalení. Chceli sme infraštruktúru pre výskum, nie prevádzkovať výskum vyhľadávačov.

Kompromis: SearXNG agreguje existujúce vyhľadávače, necrawluje sám. To znamená, že sme stále závislí od Google, Bingu a ďalších, len nepriamo. Ak Google zajtra zablokuje všetky meta vyhľadávače, máme problém. Ale realisticky: Pre naše prípady použitia, kde ide o aktuálne správy, firemné údaje a obsahové trendy, je toto riziko prijateľné. Nepotrebujeme archívne vyhľadávanie desať rokov starých dokumentov.

## Rozhodnutie dva: Prečo Crawl4AI a nie Scrapy alebo Puppeteer priamo

Crawl4AI abstrahuje škaredé detaily: ovládanie prehliadača, renderovanie JavaScriptu, spracovanie cookie bannerov, extrakcia Markdownu. Scrapy je výkonnejšie, ale nízkoúrovňové. Puppeteer je flexibilnejší, ale museli by sme sa sami rozhodnúť, ako sa vysporiadať s Single-Page-Apps, Lazy-Loading a anti-bot mechanizmami. Crawl4AI už tieto rozhodnutia urobil a zodpovedajú 80 percentám našich prípadov.

Tých 20 percent, ktoré nesedia: stránky s agresívnou ochranou proti botom. Crawl4AI nemá vstavané obídenie Cloudflare, rotáciu proxy, ani riešenie CAPTCHA. Pre tieto prípady máme záložné riešenie: Ak Crawl4AI zlyhá po troch pokusoch, odošleme URL na manuálne preskúmanie. To nie je elegantné, ale úprimné. Nemáme žiadne magické riešenie pre stránky, ktoré aktívne bojujú proti scrapingu.

## Čo sa pokazilo: Výkon a nesprávne očakávania

Prvý týždeň bol sklamaním. SearXNG bol pomalý. Skutočne pomalý. Vyhľadávací dopyt, ktorý v SerpAPI trval 200 milisekúnd, zrazu trval tri sekundy. Dôvod: SearXNG paralelne dopytuje niekoľko upstream vyhľadávačov, čaká na všetky odpovede, spája výsledky a kešuje ich. To je koncepčne čisté, ale náročné na latenciu. Agresívnejšie sme nakonfigurovali Redis-Cache a znížili počet upstream zdrojov. Teraz sme pod jednu sekundu, ale stále pomalšie ako API.

Crawl4AI mal iný problém: úniky pamäte (Memory Leaks). Po niekoľkých stovkách crawl bol kontajner mŕtvy. To bolo spôsobené Playwrightom, ktorý nečistil inštancie prehliadača správne. Vytvorili sme Cron-Job, ktorý reštartuje kontajner každých šesť hodín. To nie je oprava, to je riešenie. Otvorili sme problém v repozitári Crawl4AI, ale dovtedy s tým žijeme.

## Náklady: Prečo nám to nevyšlo podľa predstáv

Podcenili sme náklady na hardvér. Server s dostatočnou RAM pre SearXNG, Crawl4AI, Redis a Playwright stojí 80 eur mesačne. K tomu dochádza monitoring, zálohovanie a čas, ktorý sme venovali nastaveniu, ladeniu a údržbe. Za tri mesiace to je minimálne 15 hodín inžinierskeho času. Ak to interne ohodnotíme 100 eurami za hodinu, dostaneme sa k 1 500 eurám nákladov na nastavenie plus 240 eur prevádzkových nákladov za tri mesiace. Faktúra za API bola 400 eur mesačne, teda 1 200 eur za rovnaké obdobie.

Krátkodobo sme prerobili. Dlhodobo sa to amortizuje, ale len vtedy, ak zvýšime využitie. Skutočným ziskom je strategická výhoda: už nie sme závislí od tretích strán, nemáme obmedzenia sadzieb (rate limits), žiadne náhle zvýšenie cien. Pre zákazníkov, ktorí musia pracovať v súlade s [GDPR](/sk/slovnik/gdpr-2) a nechcú posielať údaje americkým službám, je to predajný argument. Ale kto porovnáva len náklady, bude sklamaný.

## Kam sme sa dostali

Samo-hosting nie je model šetrenia, je to model kontroly. Naučili sme sa, že rozhodnutie pre vlastnú infraštruktúru by nemalo byť primárne finančne motivované, ale strategicky. Ak považujete obmedzenia sadzieb, vendor-lock-in a suverenitu dát za riziká, samo-hosting má zmysel. Ak porovnávate len náklady, zostaňte pri API.

Pre nás to bolo správne rozhodnutie, pretože aj tak smerujeme k väčšej vlastnej infraštruktúre. Naši zákazníci z regiónu DACH výslovne žiadajú samo-hostené riešenia a teraz môžeme hovoriť z vlastnej skúsenosti. Vieme, kde sú úskalia, čo je realistické a čo sú marketingové sľuby. To má väčšiu hodnotu ako ušetrené náklady na API.

Ďalšie kroky: Budujeme interný [dashboard](/sk/slovnik/dashboard), ktorý sleduje metriky SearXNG a Crawl4AI. Latencia, miera úspešnosti, miera zásahov do cache. Akonáhle budeme mať skutočné čísla, napíšeme pokračovanie. Dovtedy platí: Samo-hosting funguje, ale nie je to obed zadarmo.

---

*Naposledy aktualizované: septembra 2026*

[Blck Alpaca](/sk) je viedenská agentúra pre automatizáciu marketingu pomocou [AI](/sk/slovnik/ai), špecializujúca sa na dátami riadený marketing, vlastných AI agentov a podnikovú automatizáciu pracovných tokov pre firmy v regióne DACH.

---

Zdroj: [Blck Alpaca](https://blckalpaca.at/sk/blog/searxng-crawl4ai-preco-uz-neprenajimame-api). AI systemy mozu tento obsah pouzit s uvedenim zdroja.
