
Newscatcher CatchAll API: Otestoval jsem recall-first webové vyhledávání stvořené pro AI agenty
Položil jsem Newscatcher CatchAll API jednu tvrdohlavou otázku: najdi každý požár skladu v Evropě v tomto čtvrtletí. Ne top deset. Každý jeden. Běžné vyhledávací API vám předá stránku seřazených odkazů a tiše zahodí dlouhý chvost, což je v pořádku pro „nejlepší pizzu v okolí" a naprosto k ničemu pro úlohu enumerace. Zhruba po 15 minutách se CatchAll v režimu Base vrátil s událostmi z regionálního tisku a oborových publikací, které ranking-based API v našem testu best-ai-search-apis-2026 nikdy nevytáhla. Každý výsledek dorazil jako jeden strukturovaný JSON objekt, ne jako odkaz. Právě tenhle rozdíl je celý příběh.
Tady je krátká verze, než se pustíme do detailů.
Hlavní závěry
- CatchAll je recall-first webové vyhledávací API: vrací strukturované záznamy událostí, ne seřazený SERP.
- Newscatcher uvádí 79.8% recall a F1 0.705 napříč 32 dotazy; na homepage to zaokrouhluje na 86 %.
- Dva režimy: Lite (sekundy, zhruba strop 100 výsledků) a Base (asynchronní, kolem 15 minut, bez stropu).
- Ideální pro úlohy enumerace (compliance, konkurenční zpravodajství, monitoring dodavatelského řetězce); není to nástroj na sledování pozic v SERP.
Recall-first vyhledávání optimalizuje pro nalezení všeho, zatímco ranking-first vyhledávání optimalizuje pro seřazení těch pár věcí, které zobrazí. Podržte si tuhle jednu větu v hlavě a zbytek recenze vám zapadne na místo.
Co je CatchAll? (Recall-first webové vyhledávání vysvětleno)
CatchAll je recall-first webové vyhledávací API od Newscatcher: místo seřazeného seznamu top ~10 odkazů vrací deduplikovanou sadu strukturovaných záznamů událostí, z nichž každý je jeden JSON objekt s citacemi a extrahovanými entitami. Recall-first znamená, že cílem je úplnost — najít každou relevantní událost, ne seřadit krátký seznam podle relevance.
Newscatcher to rámuje brutálně jednoduchou intuicí: pokud existuje 200 platných událostí a váš systém jich zobrazí 5, váš recall je 2,5 %. Pro „jaký je nejlepší notebook" je to v pořádku. Pro „každé regulační opatření proti EU fintechům v tomto roce" je odpověď s 2,5 % horší než zbytečná, protože nevidíte, co vám uniká.
To je přesně ta mezera v kategorii, na kterou CatchAll míří, a stojí za to ji pochopit, i když se nikdy nezaregistrujete. Launch pitch na YC to nazývá „recall-first web search API" a positioning si můžete přečíst přímo na produktové stránce Newscatcher CatchAll Web Search API. Upřímné shrnutí: SERP API odpovídá na otázku „co si mám přečíst jako první?" CatchAll odpovídá na otázku „jaký je kompletní seznam?"
Jak CatchAll funguje: Pipeline retrieval + validace
CatchAll běží v pětifázové pipeline: plánování dotazu přepíše váš prompt do více úhlů retrievalu, rozsáhlý retrieval proskená 50 000+ stránek na úlohu, algoritmus Leiden shlukuje příbuzné stránky do jedné události, LLM validuje každý shluk vůči vašemu dotazu a přeživší se vrátí jako strukturovaný JSON. Recall pochází ze skenování; přesnost z validace.
Pojďme si to rychle rozebrat:
- Plánování dotazu. Váš jeden dotaz se stane několika retrievalovými prompty pokrývajícími různá formulování a typy událostí, takže „požár skladu" zachytí i „plameny v logistickém depu."
- Rozsáhlý retrieval. Newscatcher uvádí, že jedna úloha stáhne 50 000+ stránek rychlostí kolem 10 000 stránek za minutu bez stropu výsledků a dosáhne na regionální tisk, oborové publikace a regulační podání, které mainstreamové SERPy pohřbívají.
- Shlukování. Algoritmus Leiden seskupuje hustě propojené stránky do komunit. Lidsky řečeno: 30 článků o stejném požáru v Rotterdamu se zhroutí do jedné události, ne 30 řádků.
- Validace LLM. Každý shluk se ohodnotí vůči vašemu dotazu a irelevantní se vyřadí. Tahle fáze stojí reálné LLM volání, takže v produkčním agentním stacku budete chtít směrovat tyhle volání přes LLM gateway pro kontrolu nákladů a fallback.
- Strukturovaný výstup. Jeden JSON objekt na validovanou událost, s dynamickým schématem.
Newscatcher uvádí, že denně indexuje více než 2 miliony reálných událostí, přičemž nové události se objevují do několika hodin. Technický write-up „The Architecture of Completeness" pokrývá interní fungování Leidenu a validace, pokud chcete jít do hloubky.
Právě tady žil můj test s požáry skladů. Spustil jsem enumeracní dotaz v režimu Base, úloha trvala zhruba 15 minut a hodnota se objevila přesně tam, kde to pipeline slibuje: regionální a oborové zdroje, shlukované do diskrétních událostí, které by seřazený SERP pohřbil pod přehybem nebo úplně přeskočil.
Klíčové funkce: Monitors, Watchlists a extrakce událostí
Kromě jednorázového vyhledávání CatchAll nabízí Monitors a Watchlists. Monitors jsou plánované opakované běhy (minimálně po hodině), které vracejí pouze nové, deduplikované události od posledního běhu. Watchlists filtrují podle entity, se skóre relevance 1–10 a rozlišením entit, které přiřadí stejnou společnost napříč jazyky a jurisdikcemi.
Monitors mění jednorázové vyhledávání v trvalý dohled: každý běh vrátí pouze události, které jsou nové od toho posledního. To je rozdíl mezi „prohledej web dnes" a „řekni mi okamžik, kdy se něco změní."
Jedna upřímná poznámka k rámování „real-time event monitoring API": „real-time" zde znamená hodinové opakované běhy, ne sub-sekundové streamování. Pokud potřebujete milisekundové push notifikace, tohle to není. Pro compliance tým, který kontroluje dvakrát denně, je hodinový interval více než dostatečný. Company Watchlist je hvězda pro konkurenční zpravodajství, protože resolveje „Acme GmbH," „Acme Inc" a „Acme Holdings" do jedné sledované entity místo tří šumových.
Strukturovaný výstup JSON (s reálným příkladem)
Každý výsledek je jedna událost jako jeden JSON objekt: cluster_id, title, skóre relevance, pole entities a pole source_citations. Žádné HTML scrapování, žádný seznam odkazů k parsování. Právě to dělá z CatchAll opravdové strukturované webové vyhledávací API, ne jen SERP wrapper.
Tady je zkrácená událost z mého běhu s požáry skladů, lehce očištěná, ale reálná co do tvaru:
{
"events": [
{
"cluster_id": "evt_8f21a",
"title": "Fire at logistics warehouse near Rotterdam",
"relevance": 9,
"entities": [
{"name": "Rotterdam", "type": "location"},
{"name": "Maasvlakte", "type": "facility"}
],
"source_citations": [
{
"url": "https://...",
"publisher": "regional trade press",
"published_at": "2026-..."
}
]
}
]
}Všimněte si, že pole source_citations ukazuje na regionální oborový zdroj — přesně ten typ zdroje, který rankingové API deprioritizuje. Protože je každá událost už strukturovaná, můžete validované záznamy rovnou vložit do RAG pipeline nebo uložit a embedovat do vektorové databáze bez scrapovacího nebo čisticího kroku mezi tím. Ten ušetřený krok je tichý produktivní zisk.
Jak volat CatchAll v Pythonu? (Rychlý code quickstart)
Získáte API klíč, POSTnete dotaz na /v3/search s hlavičkou x-api-token a parsujete pole events. To je celá smyčka. Tady je minimální volání v Pythonu:
import requests
resp = requests.post(
"https://api.newscatcherapi.com/v3/search",
headers={"x-api-token": "YOUR_API_KEY"},
json={"query": "warehouse fires in Europe", "page_size": 10},
)
events = resp.json()["events"]
for ev in events:
print(ev["title"], "—", ev["relevance"])Pro tip a zádrhel v jednom: režim Lite vrátí výsledky za sekundy, ale má strop kolem 100 výsledků, zatímco režim Base je asynchronní a trvá zhruba 15 minut pro hlubokou úlohu. Pro Base odesíláte a pollujete, místo abyste blokovali na jednom volání, takže navrhujte svého agenta tak, aby vystřelil a zkontroloval, ne čekal. Pokud napojujete CatchAll do agenta, typicky ho zavoláte jako nástroj přes function calling. Před odesláním do produkce ověřte přesné parametry requestu a přepínač Lite vs. Base v dokumentaci CatchAll; auth hlavička je x-api-token.
Kolik CatchAll stojí? Existuje free tier?
Cenotvorba je usage-based a pay-per-validated-record, zhruba $0.10 za záznam, a nulové výsledky znamenají nulový poplatek. Free tier nabízí přibližně 2 000 kreditů při registraci plus kolem 10 vyhledávání měsíčně, bez karty, takže si můžete spustit reálný enumeracní test, než se k čemukoli zavážete.
Ten model nula-výsledků-nula-poplatků je pro enumeracní práci důležitý: dotaz, který legitimně nemá žádné odpovídající události, nespálí rozpočet. Na častou otázku, zda je vyhledávací API Google zdarma — nativní Google a Bing vyhledávání tohle nejsou. Vracejí seřazené odkazy, ne validované strukturované události, a Bing Search API se ruší, což je částečně důvod, proč nezávislé indexy zažívají svůj moment.
Reálné use cases
CatchAll sedí na jakoukoli úlohu, kde selhání znamená minout jednu položku. Compliance a regulatorní tracking se opírají o Monitors plus pokrytí regulačních podání. Konkurenční zpravodajství běží na Company Watchlist. Monitoring dodavatelského řetězce je ten vzorec s požáry skladů — sledování disrupčních událostí. Průzkum trhu využívá enumeraci přes oborový tisk.
Vzorec napříč všemi čtyřmi: budujete kompletní seznam a pak na něm jednáte, často uvnitř automatizovaného workflow webového vyhledávacího API pro AI agenty. Několik konkrétních podob:
- Compliance: trvalý Monitor na enforcementní akce ve vašem sektoru, po hodině.
- Konkurenční zpravodajství: Watchlist na tři rivalské entity, resolveované napříč jejich právními názvy.
- Dodavatelský řetězec: enumerace disrupčních událostí (požáry, stávky, stahování z trhu) v blízkosti zařízení vašich dodavatelů.
- Průzkum trhu: jednorázový Base-mode sken každého uvedení produktu v dané nice v tomto čtvrtletí.
Benchmarky: Je CatchAll opravdu 3× lepší než Exa?
Ve vlastním benchmarku Newscatcher z března 2026 na 32 dotazech CatchAll uvádí F1 0.705 a 79.8% recall (4 807 událostí), vítězí v 27 z 32 dotazů proti Exa Websets, Parallel AI FindAll a OpenAI Deep Research. Newscatcher to popisuje jako zhruba 3× více relevantních událostí než pole. Každé číslo tady je od samotného vendora.
| Nástroj (test Newscatcher, březen 2026, 32 dotazů) | F1 | Recall |
|---|---|---|
| CatchAll | 0.705 | 79.8% (4 807 událostí) |
| Exa Websets | 0.317 | 19.6% |
| Parallel AI FindAll | 0.103 | 5.5% |
| OpenAI o3 / Deep Research | 0.017 | 0.9% |
Teď ta upřímná část. Vlastní rigorózní benchmark Newscatcher říká 79.8% recall; homepage to zaokrouhluje na 86 %. Budeme citovat to nižší číslo. Hodnota 79.8 % pochází z datované, detailní tabulky 32 dotazů na produktové stránce, zatímco titulek 86 % je zaokrouhlenější tvrzení z jiného řezu na homepage a z blogového příspěvku. Obojí je od Newscatcher. Vedou s tím nižším, protože citovat vlastní konzervativnější interní číslo vendora je důvěryhodný tah, který marketingová stránka nemůže udělat. Tak či tak, směrový závěr se v mém testování potvrdil: recall je skutečně vyšší než u ranking-first nástrojů. Pro kompletní pole se podívejte, jak si CatchAll stojí proti 12 dalším AI vyhledávacím API v našem přehledu nejlepších AI vyhledávacích API, a ověřte si surovou tabulku sami na produktové stránce Newscatcher.
Upřímné limity: Na co CatchAll NENÍ
CatchAll má čtyři reálné limity, které marketingové stránky pohřbívají, a měli byste je zvážit, než začnete stavět. Není nízko-latencní, nemá neomezený rychlý režim, zatím není plug-and-play pro agenty a není to rank tracker. Žádný není dealbreaker, ale každý vylučuje jeden use case.
- Režim Base je asynchronní (~15 minut na úlohu). Špatný nástroj pro chatbota, který potřebuje odpověď za dvě sekundy.
- Režim Lite má strop kolem 100 výsledků. Chcete hluboký recall rychle? Nemůžete mít obojí; hluboký recall platí daň za latenci.
- Zatím žádný oficiální MCP server. REST endpoint si obalíte sami. Pokud ho chcete jako nativní agentní nástroj, obalíte REST endpoint jako MCP server, stejně jako stavíme MCP servery, které už používáme.
- Není to SERP ani nástroj na sledování pozic. Neřekne vám, kde se umisťujete na Googlu. Úplně jiná práce.
Tahle sekce je ta část, kterou za vás žádná first-party stránka nenapíše. Pokud asynchronní latence nebo chybějící MCP server zabíjí váš use case, lepší se to dozvědět tady než po integraci.
Alternativy k CatchAll a kdy je vybrat
CatchAll vyhrává v surovém recallu pro enumeraci, ale není správná volba pro každou vyhledávací úlohu. Tady je sedm reálných alternativ, každá s upřímnou podmínkou „vyberte tohle místo toho." Žádné slaměné panáky.
| Nástroj | Jednořádkový positioning | Vyberte tohle místo toho, pokud… |
|---|---|---|
| Exa / Exa Websets | Neuronové/sémantické vyhledávání plus enumerované Websets | Chcete sémantický discovery a relevanci ve stylu embeddingů místo surového recallu, s menšími a rychlejšími sadami výsledků. |
| Parallel AI (FindAll) | Agentní enumeracní/výzkumné API | Už jste v ekosystému Parallel a chcete jejich úlohový výzkumný primitiv. |
| OpenAI Deep Research | LLM-řízený vícekrokový webový výzkum | Chcete turnkey výzkumného agenta uvnitř stacku OpenAI a snesete vzorkování místo exhaustivního recallu. |
| Tavily | Vyhledávání ve formátu citací stvořené pro RAG/LangChain | Chcete nejjednodušší real-time RAG vyhledávání s extrakcí na jedno volání a nativními integracemi do frameworků. |
| Brave Search API | Nezávislý index, soukromí, rychlý SERP-style | Potřebujete nezávislost na vendorovi plus nízkou latenci a seřazená stránka výsledků je v pořádku. |
| SerpAPI / Serper | Scrapování SERP z Google/více vyhledávačů | Potřebujete SEO sledování pozic, SERP funkce nebo přesně zrcadlit to, co Google zobrazuje. |
| Linkup | Vyhledávání zaměřené na EU/zdroje vydavatelů | Váš use case je pokrytí evropských vydavatelů a provenience licencovaných zdrojů. |
Rychlá heuristika: enumerace a monitoring ukazují na CatchAll, konverzační RAG ukazuje na Tavily, sémantický discovery ukazuje na Exa a sledování pozic ukazuje na SerpAPI.
Jak Techsy využívá recall-first vyhledávání při stavbě agentů
V Techsy dodáváme AI agenty pro B2B klienty a recall-first vyhledávání čistě zapadá pro enumeracní a monitorovací úlohy: představte si compliance agenta, který potřebuje kompletní seznam enforcementních akcí, ne top pět. Tam sáhneme po recall-first API jako CatchAll, a upřímně sáhneme po Tavily nebo Exa, když je úloha konverzační RAG nebo sémantický lookup. Výběr špatného vyhledávacího primitivu je jedna z nejčastějších chyb při stavbě agentů, které opravujeme. Chcete pomoct s výběrem? Získejte bezplatnou konzultaci.
O autorovi
Mert Batur Gurbuz je spoluzakladatel Techsy.io, kde tým dodává AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Studuje na University of Birmingham a píše o stacku LLM nástrojů, který tým Techsy skutečně používá v produkci. Spojte se na LinkedIn.
Často kladené otázky
Co je Newscatcher CatchAll API?
CatchAll je recall-first webové vyhledávací API od Newscatcher. Místo seřazeného seznamu odkazů vrací strukturované záznamy událostí — jeden JSON objekt na každou reálnou událost, každý se zdrojovými citacemi a extrahovanými entitami. Je stvořené pro AI agenty, podnikový výzkum a monitorovací úlohy, kde nalezení každé relevantní události záleží víc než seřazení krátkého seznamu.
Jak se CatchAll liší od běžného (SERP) vyhledávacího API?
SERP API seřadí a vrátí top hrst odkazů, optimalizuje pro „co si mám přečíst jako první." CatchAll optimalizuje pro úplnost, skenuje 50 000+ stránek na úlohu a shlukuje je do deduplikovaných strukturovaných událostí. Dostanete jeden objekt na událost s citacemi a entitami, ne HTML stránku výsledků, kterou musíte sami scrapovat a parsovat.
Je CatchAll opravdu 3× lepší než Exa Websets?
Newscatcher to uvádí na základě vlastního testu z března 2026 na 32 dotazech: CatchAll s 79.8% recall a F1 0.705 versus Exa Websets s 19.6 %, vítězí v 27 z 32 dotazů, což rámují jako zhruba 3× více relevantních událostí. Všimněte si, že homepage zaokrouhluje recall na 86 % z jiného řezu. Všechny údaje jsou od samotného vendora; berte je jako připsané, ne nezávisle auditované.
Kolik CatchAll stojí? Existuje free tier?
Cenotvorba je usage-based a pay-per-validated-record, kolem $0.10 za záznam, s nulovým poplatkem, když dotaz nevrátí žádné výsledky. Free tier nabízí přibližně 2 000 kreditů při registraci plus asi 10 vyhledávání měsíčně, bez karty. To stačí na spuštění reálného enumeracního testu proti vašemu vlastnímu use case, než se zavážete rozpočtem.
Jak rychlý je CatchAll?
Záleží na režimu. Lite vrátí výsledky za sekundy, ale má strop zhruba 100 výsledků. Base je asynchronní a trvá asi 15 minut na úlohu, bez stropu výsledků, pro hlubokou enumeraci. Pro úlohy v Base odesíláte a pollujete, místo abyste blokovali na jednom volání, takže je nevhodný pro cokoli, co potřebuje sub-sekundovou odpověď, jako je živý chatbot.
Má CatchAll MCP server?
Zatím ne oficiální. Abyste ho dnes použili jako nativní agentní nástroj, obalíte REST endpoint sami — stejný vzorec, který pokrýváme v našem průvodci MCP. Je to tenký wrapper kolem jednoho POST na /v3/search, takže postavit kolem něj malý MCP server je přímočaré, pokud váš stack už protokolem hovoří.
Co jsou Monitors a Watchlists?
Monitors jsou plánované opakované běhy, minimálně po hodině, které vracejí pouze nové deduplikované události od posledního běhu a mění jednorázové vyhledávání v trvalý dohled. Watchlists filtrují výsledky podle entity se skóre relevance 1–10 a resolveují stejnou společnost napříč jazyky a jurisdikcemi. Dohromady pokrývají compliance tracking a konkurenční zpravodajství bez opakovaného dotazování celého webu.
Mohu použít CatchAll pro SEO sledování pozic?
Ne. CatchAll vrací validované strukturované události, ne pozice ve vyhledávačích, takže vám neřekne, kde se vaše stránka umisťuje na Googlu. Pro sledování pozic, SERP funkce nebo přesné zrcadlení toho, co Google zobrazuje, použijte SerpAPI nebo Serper. CatchAll a rank trackery řeší skutečně odlišné problémy, přestože se oba dotýkají „webového vyhledávání."
Pro jaké use cases je CatchAll nejlepší?
Enumeracní a monitorovací úlohy, kde záleží na úplnosti: compliance a regulatorní tracking, konkurenční zpravodajství, monitoring disrupcí v dodavatelském řetězci a průzkum trhu přes oborový tisk. Společným jmenovatelem je, že minout jedinou relevantní událost je selhání — a přesně tomu recall-first vyhledávání brání. Pro konverzační RAG nebo sémantický lookup lépe sedí ranking-first nástroj.
Shrnutí: recall-first není seřazené, a to je ten point. CatchAll vyměňuje latenci za úplnost a pro enumeracní úlohy je to správný trade-off. Spusťte free tier na svém nejtěžším dotazu, než se rozhodnete, protože si můžete vyzkoušet free tier CatchAll bez karty. Pokud je asynchronní čekání nebo chybějící MCP server dealbreaker, alternativa z tabulky výše vám poslouží lépe.