Preskočiť na obsah
Späť na blog
Build LogPorovnania nástrojov a stackov6 min čítania

SearXNG + Crawl4AI: Prečo sme vyhodili SerpAPI

Sebastian KarallSebastian Karall
5. augusta 2026
SearXNG + Crawl4AI: Warum wir SerpAPI gefeuert haben
KI-generiert (Flux) · Kreativdirektion: © Blck Alpaca

Účet za 847 eur, ktorý nás prinútil prehodnotiť

V marci 2024 sme za SerpAPI a Firecrawl spolu zaplatili 847 eur. Za vyhľadávania a štruktúrované prehľadávanie. Dve služby, ktoré sme integrovali do štyroch n8n-workflowov, aby sme zbierali výskumný materiál pre obsahové brífingy a analýzy trhu. Účet prišiel, prikývli sme, zaplatili a potom sa niekto spýtal: „Prečo to vlastne nehostíme sami?“

O tri týždne neskôr bežali SearXNG a Crawl4AI na vlastnej infraštruktúre. Obidva sourcingové toky, jeden pre tematický výskum, jeden pre monitorovanie konkurencie, teraz čerpajú dáta z nášho vlastného stacku. Mesačný účet za tieto dve služby: nula. Poznanie: Self-hosting nie je vždy odpoveďou, ale ak robíte ten istý API-call 40 000-krát mesačne, rýchlo sa to stane ekonomicky výhodné.

Architektúra: Dva nástroje, jeden cieľ

Naše nastavenie pozostáva z dvoch komponentov, ktoré pracujú postupne. SearXNG je meta-vyhľadávač, ktorý agreguje výsledky z Google, Bing, DuckDuckGo a ďalších, bez toho, aby sme potrebovali samostatné API-kľúče pre každého poskytovateľa. Prevádzkujeme inštanciu na dedikovanom serveri, ktorý je dostupný iba pre interné workflowy. Vyhľadávacie dopyty pochádzajú z n8n-workflowov, ktoré majú buď manuálne spúšťače, alebo časované spustenia.

Crawl4AI preberá druhý krok: štruktúrované scrapovanie URL, ktoré SearXNG dodáva. Knižnica extrahuje text, metadáta a, ak je to potrebné, aj štruktúrované dáta prostredníctvom LLM-podporovaného parsovania. Používame hlavne export do Markdownu, pretože sa dá priamo vložiť do našich brífingových šablón. Crawl4AI beží v kontajneri Pythonu, ktorý voláme prostredníctvom HTTP-API z n8n.

Štyri workflowy, ktoré stavajú na tomto stacku, pokrývajú rôzne prípady použitia: tematický výskum pre redakčné plány, analýza konkurencie (ktoré kľúčové slová rankujú u konkurentov?), obohacovanie leadov (verejné informácie o cieľových spoločnostiach) a monitorovanie trendov (o čom sa diskutuje v odborných médiách?). Každý workflow najprv zavolá SearXNG, filtruje výsledky podľa relevantnosti a odošle Top-10 URL do Crawl4AI. Extrahovaný obsah sa uloží do databázy, z ktorej ho ďalej spracúvajú iné systémy.

Google Custom Search API by bolo lacnejšie ako SerpAPI, 5 dolárov za 1 000 dotazov namiesto 50. Ale: Poskytuje iba 10 výsledkov na požiadavku a nemôžete filtrovať podľa dátumu alebo jazyka tak podrobne, ako to potrebujeme. SearXNG agreguje viacero zdrojov, dáva nám 50+ výsledkov na dotaz a beží úplne na našej infraštruktúre. Žiadne obmedzenia rýchlosti, žiadny vendor-lock-in, žiadne náhle zastavenia API.

Rozhodnutie jedna: SearXNG namiesto Vendor-API

SerpAPI sme nevyhodili z ideologických dôvodov. API bolo stabilné, výsledky dobré, dokumentácia solídna. Ale: Mesačne sme vykonali 35 000 až 42 000 vyhľadávacích požiadaviek. Pri SerpAPI to stálo v závislosti od plánu 400 až 600 eur. SearXNG nás stojí prenájom servera (80 eur/mesiac za dedikovaný stroj, ktorý hostí aj iné interné služby) plus pár hodín nastavenia.

Bod zvratu bol dosiahnutý po šiestich týždňoch. Odvtedy šetríme mesačne trojciferné sumy. Ale skutočným ziskom je kontrola: Môžeme vykonávať ľubovoľný počet dotazov bez toho, aby niekto zvyšoval obmedzenia rýchlosti alebo menil ceny. A nič nelogujeme navonok, pre výskumy citlivé na GDPR (napr. keď zbierame trhové dáta na objednávku zákazníka) je to skutočný argument.

Háčik: Údržba a Uptime

SearXNG nie je SaaS. Ak je inštancia mimo prevádzky, pipeline stojí. V prvých dvoch mesiacoch sme trikrát zažili, že Google alebo Bing dočasne zablokovali IP nášho servera, pretože vzor požiadaviek vyzeral podozrivo. Riešenie: Teraz rotujeme cez viacero výstupných IP adries a zabudovali sme obmedzenie rýchlosti. To by nám pri SerpAPI nikto nebral.

Rozhodnutie dva: Crawl4AI namiesto Firecrawl

Firecrawl bol náš doterajší Scraper-servis. Jednoduchý na integráciu, spoľahlivý, ale drahý: 0,01 až 0,03 eur za zoškrabanú stránku, v závislosti od plánu. Pri 15 000 až 20 000 stránkach mesačne sa to sčítava. Crawl4AI je Open Source, beží lokálne a stojí nás len výpočtový čas. Knižnica je napísaná v Pythone, používa Playwright pre JavaScript-rendering a ponúka LLM-integráciu pre štruktúrované parsovanie.

Crawl4AI sme nasadili ako službu FastAPI, ktorú naše n8n-workflowy oslovujú prostredníctvom HTTP. Požiadavka obsahuje URL a pár parametrov (Timeout, či sa má renderovať JavaScript, aký formát výstupu). Odpoveď je buď Markdown alebo JSON s extrahovanými poľami. Pre väčšinu prípadov použitia stačí export do Markdownu; ak potrebujeme štruktúrované dáta (napr. ceny, kontaktné údaje), pošleme Markdown-výstup do LLM, ktorý extrahuje polia.

Čo sme podcenili: Error Handling

Firecrawl elegantne zachytával chyby. Timeout? Dostanete čiastočný výsledok. Detekcia bota? Služba automaticky rotuje cez rôznych User Agentov a Proxy. Crawl4AI to nerobí. Ak sa stránka nenačíta, dostanete prázdny reťazec alebo HTTP-500. Museli sme si sami vytvoriť logiku opakovania, spracovanie timeoutov a fallbackové stratégie. Trvalo to dva dni a bolo to otravné, ale teraz to máme.

Čo sa pokazilo: Prvé produktívne spustenie

Systém sme nechali tri týždne bežať v testovacej prevádzke, než sme ho spustili naostro. Všetko vyzeralo dobre. Potom sme spustili prvé produktívne spustenie, 8 000 URL za štyri hodiny, a po dvoch hodinách bol kontajner Crawl4AI mŕtvy. Out of Memory. Zabudli sme, že Playwright spúšťa pre každú URL proces prehliadača, a pri 50 paralelných požiadavkách to rýchlo spotrebuje 16 GB RAM.

Riešenie bolo jednoduché: Limit súbežnosti na 10, a spustili sme druhý kontajner, ktorý rozdeľuje záťaž. Ale bol to klasický Self-Hosting moment: Pri službe SaaS by to bol ich problém. U nás to bol náš. Opravili sme to, ale stálo nás to dve hodiny výpadku a hromadu správ v Slacku.

Čísla ešte nemáme (a to je v poriadku)

Pre túto pipeline zatiaľ nesledujeme žiadne systematické metriky. Žiadne latency-dashboardy, žiadne miery úspešnosti, žiadne analýzy nákladov na dotaz. Systém beží už osem týždňov a zatiaľ sa sústredíme na to, aby vôbec stabilne bežal. Kvantitatívne vyhodnotenia prídu neskôr, pravdepodobne v 3. štvrťroku, keď budeme mať dostatok dát na zmysluplné porovnania.

Čo môžeme kvalitatívne povedať: Kvalita výsledkov SearXNG je porovnateľná so SerpAPI, niekedy dokonca lepšia, pretože agregujeme viacero zdrojov. Crawl4AI poskytuje čistejší Markdown ako Firecrawl, ale za to musíme sami zachytiť viac chybových prípadov. Celkovo: Funguje to, šetrí peniaze a máme kontrolu. To nám zatiaľ stačí.

Kam sme sa dostali

Self-hosting nie je samoúčelný. Ak mesačne vykonáte 500 vyhľadávacích dotazov, použite SerpAPI. Ak ich vykonáte 50 000, postavte si to sami. My v Blck Alpaca sme v situácii, keď intenzívne využívame research-pipelines, pre seba aj pre zákaznícke projekty. Tam sa námaha oplatí.

Najdôležitejšie poznanie: Mesačné náklady na API vymeníte za jednorazové inžinierske náklady a priebežnú údržbu. Ak nemáte tím, ktorý by sa dokázal starať o servery, alebo ak sa vaše využitie kolíše, zostaňte pri SaaS. Ak neustále využívate vysoké objemy a súlad s GDPR je argumentom, prechod sa oplatí.

Urobili by sme to znova. Ale nabudúce by sme od začiatku zabudovali limity súbežnosti a lepšie spracovanie chýb. A začali by sme skôr zbierať metriky, nie preto, že ich okamžite potrebujeme, ale preto, že je ťažké ich neskôr doplniť.

Naposledy aktualizované: augusta 2026

Blck Alpaca je viedenská agentúra pre automatizáciu marketingu pomocou AI, špecializujúca sa na dátami riadený marketing, vlastných AI agentov a podnikovú automatizáciu pracovných tokov pre firmy v regióne DACH.

Nezmeškajte žiadne novinky

Prihlás sa na náš newsletter a získaj AI & marketing trendy priamo do schránky.