
Newscatcher CatchAll API: ik testte het recall-first zoeksysteem voor AI-agents
Ik stelde de Newscatcher CatchAll API een hardnekkige vraag: vind elke magazijnbrand in Europa dit kwartaal. Niet de top tien. Allemaal. Een gewone search API geeft je een gerankte lijst links en laat de lange staart stilletjes vallen. Prima voor "beste pizza bij mij in de buurt", nutteloos voor een opsommingstaak. Zo'n vijftien minuten later, in Base-modus, leverde CatchAll regionale pers- en vakblad-events op die de ranking-gebaseerde API's in onze best-ai-search-apis-2026-test nooit hadden gevonden. Elk resultaat: één gestructureerd JSON-object, geen link. Dat verschil is het hele verhaal.
Hier is de korte versie, voordat we ingaan op de technische details.
Belangrijkste punten
- CatchAll is een recall-first web search API: het geeft gestructureerde event-records terug, geen gerankte SERP.
- Newscatcher rapporteert 79,8% recall en F1 0,705 over 32 queries; de homepage rondt dit af naar 86%.
- Twee modi: Lite (seconden, cap van ongeveer 100 resultaten) en Base (asynchroon, circa 15 minuten, geen cap).
- Beste keuze voor opsommingstaken (compliance, concurrentie-intelligence, supply-chain monitoring); het is geen SERP-ranktracker.
Recall-first search optimaliseert voor alles vinden, terwijl ranking-first search optimaliseert voor de weinige dingen die het oppervlakt, ordenen. Houd die ene zin in je hoofd en de rest van deze recensie valt op zijn plek.
Wat is CatchAll? (Recall-First Web Search, uitgelegd)
CatchAll is een recall-first web search API van Newscatcher: in plaats van een gerankte lijst van de top ~10 links geeft het een gededupliceerde set gestructureerde event-records terug, elk één JSON-object met citaten en geëxtraheerde entiteiten. Recall-first betekent dat het doel volledigheid is, elk relevant event vinden, niet een korte lijst op relevantie sorteren.
Newscatcher framt dit met een heldere gedachte-oefening: als er 200 geldige events bestaan en jouw systeem er 5 oppervlakt, is je recall 2,5%. Voor "wat is de beste laptop?" is dat prima. Voor "elk handhavingsoptreden tegen EU-fintechs dit jaar?" is een antwoord van 2,5% erger dan nutteloos, omdat je niet kunt zien wat je mist.
Dat is de categoriale leemte die CatchAll invult, en het is het begrijpen waard zelfs als je je nooit aanmeldt. De YC-lanceerpitch noemt het een "recall-first web search API", en je kunt de positionering rechtstreeks lezen op de productpagina van Newscatcher's CatchAll Web Search API. De eerlijke omschrijving: een SERP API beantwoordt "wat moet ik het eerst lezen?" CatchAll beantwoordt "wat is de complete lijst?"
Hoe CatchAll werkt: de ophaal- en validatiepipeline
CatchAll draait een vijfstappenpipeline: query planning herschrijft je prompt in meerdere ophaalhoeken, grootschalige ophaling scant 50.000+ pagina's per taak, het Leiden-algoritme clustert verwante pagina's tot afzonderlijke events, een LLM valideert elk cluster tegen je query, en de overgebleven resultaten komen terug als gestructureerde JSON. Recall komt van de scan; precisie van de validatie.
Laten we die stappen snel doornemen:
- Query planning. Je ene query wordt meerdere ophaalprompts die verschillende formuleringen en event-typen bestrijken, zodat "magazijnbrand" ook "brand bij logistiek depot" vangt.
- Grootschalige ophaling. Newscatcher zegt dat één taak 50.000+ pagina's ophaalt met zo'n 10.000 pagina's per minuut en zonder resultaatcap, inclusief regionale pers, vakbladen en regelgevende archieven die mainstream SERPs begraven.
- Clustering. Het Leiden-algoritme groepeert dicht verbonden pagina's in communities. In gewone taal: 30 artikelen over dezelfde brand in Rotterdam worden één event, niet 30 rijen.
- LLM-validatie. Elk cluster krijgt een score ten opzichte van je query; irrelevante clusters worden verwijderd. Deze stap kost echte LLM-calls, dus bij een productie-agent-stack wil je ze via een LLM gateway routeren om kosten te beheersen en fallbacks in te bouwen.
- Gestructureerde output. Één JSON-object per gevalideerd event, met een dynamisch schema.
Newscatcher rapporteert dat het dagelijks meer dan 2 miljoen realtime-events indexeert, waarbij nieuwe events binnen uren beschikbaar zijn. De technische write-up "The Architecture of Completeness" gaat dieper in op het Leiden-algoritme en de validatie-internals als je de technische details wilt.
Dit is waar mijn magazijnbrand-test plaatsvond. Ik voerde de opsommingsquery uit in Base-modus, de taak duurde ongeveer 15 minuten, en de meerwaarde toonde zich precies waar de pipeline het belooft: regionale en vakblad-bronnen, geclusterd tot afzonderlijke events, die een gerankte SERP had begraven of overgeslagen.
Kernfuncties: Monitors, Watchlists en event-extractie
Naast eenmalige zoekopdrachten levert CatchAll Monitors en Watchlists. Monitors zijn geplande heruitvoeringen (minimaal elk uur) die alleen de nieuwe, gededupliceerde events teruggeven na de laatste run. Watchlists filteren op entiteit, met een relevantiescore van 1-10 en entiteitsresolutie die hetzelfde bedrijf over talen en jurisdicties heen herkent.
Monitors zetten een eenmalige zoekopdracht om in een permanente bewaking: elke run geeft alleen de events terug die nieuw zijn na de vorige. Dat is het verschil tussen "zoek vandaag op het web" en "vertel me zodra er iets verandert."
Één eerlijke kanttekening bij de formulering "realtime event monitoring API": "realtime" betekent hier elk uur herhalen, geen sub-seconde streaming. Als je milliseconde push-notificaties nodig hebt, is dit niet de juiste keuze. Voor een compliance-team dat twee keer per dag controleert, is elk uur meer dan genoeg. De Company Watchlist is de opvallendste functie voor concurrentie-intelligence: het herkent "Acme GmbH", "Acme Inc" en "Acme Holdings" als één te volgen entiteit, niet als drie aparte.
De gestructureerde JSON-output (met een echt voorbeeld)
Elk resultaat is één event als één JSON-object: een cluster_id, een title, een relevance-score, een entities-array en een source_citations-array. Geen HTML-scraping, geen te parsen linklijst. Dat maakt CatchAll een echte gestructureerde web search API in plaats van een SERP-wrapper.
Hier is een ingekort event uit mijn magazijnbrand-run, licht opgeschoond maar qua opbouw echt:
{
"events": [
{
"cluster_id": "evt_8f21a",
"title": "Fire at logistics warehouse near Rotterdam",
"relevance": 9,
"entities": [
{"name": "Rotterdam", "type": "location"},
{"name": "Maasvlakte", "type": "facility"}
],
"source_citations": [
{
"url": "https://...",
"publisher": "regional trade press",
"published_at": "2026-..."
}
]
}
]
}De source_citations-array verwijst naar een regionaal vakblad: precies het soort bron dat een ranking-API naar achteren schuift. Omdat elk event al gestructureerd is, kun je de gevalideerde records rechtstreeks in een RAG-pipeline droppen of ze opslaan en embedden in een vectordatabase zonder tussenliggende scraping- of opschoonstap. Die bespaarde stap is de stille productiviteitswinst.
CatchAll aanroepen in Python (code quickstart)
Je haalt een API-sleutel op, POST je query naar /v3/search met de x-api-token-header en parseert de events-array. Dat is de volledige loop. Hier is een minimale Python-aanroep:
import requests
resp = requests.post(
"https://api.newscatcherapi.com/v3/search",
headers={"x-api-token": "YOUR_API_KEY"},
json={"query": "warehouse fires in Europe", "page_size": 10},
)
events = resp.json()["events"]
for ev in events:
print(ev["title"], "—", ev["relevance"])Tip en valkuil in één: Lite-modus geeft binnen seconden resultaat maar heeft een cap van circa 100 resultaten, terwijl Base-modus asynchroon is en zo'n 15 minuten duurt per diepe taak. Voor Base geef je de opdracht en poll je daarna, in plaats van de aanroep te blokkeren. Ontwerp je agent dus met verstuur-en-check, niet wachten. Als je CatchAll in een agent integreert, roep je het doorgaans aan als tool via function calling. Controleer de exacte request-parameters en de Lite-versus-Base-vlag in de CatchAll-documentatie voordat je uitrolt; de auth-header is x-api-token.
Wat kost CatchAll? Is er een gratis laag?
De prijs is gebruiksgebaseerd en betaal-per-gevalideerd-record, circa $0.10 per record, en nul resultaten betekent nul kosten. Er is een gratis laag van ongeveer 2.000 credits bij aanmelding plus circa 10 zoekopdrachten per maand, zonder creditcard, zodat je een echte opsommingstest kunt uitvoeren voordat je budget vastlegt.
Dat model van nul-resultaten-nul-kosten telt voor opsommingswerk: een query die legitiem geen overeenkomende events heeft, verbrandt geen budget. Op de veelgestelde vraag of Google's search API gratis is: native Google en Bing search zijn dit niet. Ze geven gerankte links terug, geen gevalideerde gestructureerde events, en Bing's Search API wordt stopgezet, wat mede verklaart waarom onafhankelijke indexes nu hun moment hebben.
Praktijkvoorbeelden
CatchAll past bij elke taak waarbij het missen van één item de foutmodus is. Compliance en regelgevingstracking leunen op Monitors plus de dekking van regelgevende archieven. Concurrentie-intelligence draait op de Company Watchlist. Supply-chain monitoring is het magazijnbrand-patroon: waken voor verstoringsevents. Marktonderzoek gebruikt opsomming over vakbladen.
Het patroon door alle vier heen: je bouwt een complete lijst en handelt daarnaar, vaak binnen een geautomatiseerde web search API voor AI-agents workflow. Een paar concrete vormen:
- Compliance: een permanente Monitor op handhavingsacties in je sector, elk uur.
- Concurrentie-intelligence: Watchlist op drie concurrerende entiteiten, opgelost over hun juridische namen heen.
- Supply chain: opsomming van verstoringsevents (branden, stakingen, recalls) nabij je leveranciersfaciliteiten.
- Marktonderzoek: eenmalige Base-modus scan van elk product launch in een niche dit kwartaal.
De benchmarks: is CatchAll echt 3x beter dan Exa?
In Newscatcher's eigen benchmark van maart 2026 over 32 queries rapporteert CatchAll F1 0,705 en 79,8% recall (4.807 events), winnend in 27 van de 32 queries ten opzichte van Exa Websets, Parallel AI FindAll en OpenAI Deep Research. Newscatcher omschrijft dat als ruwweg 3x meer relevante events dan de concurrentie. Elk cijfer hier is van de leverancier zelf.
| Tool (Newscatcher's test maart 2026, 32 queries) | F1 | Recall |
|---|---|---|
| CatchAll | 0,705 | 79,8% (4.807 events) |
| Exa Websets | 0,317 | 19,6% |
| Parallel AI FindAll | 0,103 | 5,5% |
| OpenAI o3 / Deep Research | 0,017 | 0,9% |
Nu het eerlijke deel. Newscatcher's eigen gedetailleerde benchmark zegt 79,8% recall; de homepage rondt dit af naar 86%. We citeren het lagere getal. Het cijfer van 79,8% komt uit de gedateerde, gedetailleerde tabel van 32 queries op de productpagina, terwijl het headline-percentage van 86% een afgerondere claim is uit een andere berekening op de homepage en een blogpost. Beide zijn van Newscatcher. Ik gebruik het lagere getal omdat een leveranciers eigen meer-conservatieve interne cijfer citeren de vertrouwensopbouw is die een marketingpagina niet kan maken. Hoe dan ook, de richting bleef overeind in mijn tests: recall is daadwerkelijk hoger dan bij de ranking-first tools. Voor het volledige veld, bekijk hoe CatchAll scoort tegen 12 andere AI search API's in onze beste AI search API-roundup, en controleer de ruwe tabel zelf op Newscatcher's productpagina.
Eerlijke beperkingen: waarvoor CatchAll NIET geschikt is
CatchAll heeft vier echte beperkingen die de marketingpagina's begraven, en je moet ze afwegen voordat je gaat bouwen. Het is niet laaglatent, niet onbeperkt in de snelle modus, nog niet plug-and-play voor agents en geen ranktracker. Geen ervan is een dealbreaker, maar elk sluit een use case uit.
- Base-modus is asynchroon (~15 minuten per taak). Verkeerde keuze voor een chatbot die binnen twee seconden een antwoord nodig heeft.
- Lite-modus heeft een cap van circa 100 resultaten. Diepe recall én snelheid? Die combinatie bestaat niet; diepe recall betaalt de latentiebelasting.
- Nog geen officiële MCP-server. Je omhult het REST-endpoint zelf. Als je het als native agent-tool wilt, omhul je het REST-endpoint als MCP-server, op dezelfde manier als we de MCP-servers bouwen die we al gebruiken.
- Het is geen SERP- of ranktracking-tool. Het vertelt je niet waar je op Google staat. Een totaal andere taak.
Dit is het deel dat geen first-party pagina voor je zal schrijven. Als de async-latentie of de ontbrekende MCP-server je use case afschiet, kun je dat beter hier leren dan na integratie.
CatchAll-alternatieven: wanneer kies je voor iets anders?
CatchAll wint op ruwe recall voor opsomming, maar is niet de juiste keuze voor elke zoektaak. Hier zijn zeven echte alternatieven, elk met de eerlijke "kies dit liever" conditie. Geen stroppoppen.
| Tool | Positionering in één zin | Kies dit liever als... |
|---|---|---|
| Exa / Exa Websets | Neurale/semantische search plus geënumereerde Websets | Je semantische ontdekking en embeddings-stijl relevantie wilt boven ruwe recall, met kleinere, snellere resultaatsets. |
| Parallel AI (FindAll) | Agentische opsomming/onderzoek API | Je al in het Parallel-ecosysteem zit en hun taakgerichte onderzoeksprimitief wilt. |
| OpenAI Deep Research | LLM-gestuurde meerstaps webonderzoek | Je een turnkey onderzoeksagent in de OpenAI-stack wilt en sampling boven uitputtende recall tolereert. |
| Tavily | Citaatgerichte search gebouwd voor RAG/LangChain | Je de eenvoudigste realtime RAG-search wilt met extractie in één aanroep en native framework-integraties. |
| Brave Search API | Onafhankelijke index, privacy, snelle SERP-stijl | Je leveranciersonafhankelijkheid plus lage latentie nodig hebt en een gerankte resultatenpagina prima vindt. |
| SerpAPI / Serper | Google/multi-engine SERP-scraping | Je SEO-ranktracking, SERP-features of exact wilt wat Google toont. |
| Linkup | EU/publisher-brongerichte search | Je use case is Europese publisher-dekking en gelicenseerde bronherkomst. |
De snelle vuistregel: opsomming en monitoring wijzen naar CatchAll, conversationele RAG naar Tavily, semantische ontdekking naar Exa, en ranktracking naar SerpAPI.
Hoe Techsy recall-first zoeken inzet in agent-projecten
Bij Techsy bouwen we AI-agents voor B2B-klanten, en recall-first search past goed voor opsomming en monitoringstaken: denk aan een compliance-agent die de complete lijst van handhavingsacties nodig heeft, niet de top vijf. Daarvoor kiezen we een recall-first API zoals CatchAll, en eerlijk gezegd kiezen we voor Tavily of Exa wanneer de taak conversationele RAG of semantisch opzoeken is. De verkeerde search-primitieve kiezen is een van de meest voorkomende fouten die we oplossen in agent-projecten. Hulp nodig bij de keuze? Plan een gratis gesprek.
Over de Auteur
Mert Batur is Medeoprichter van Techsy.io, waar het team AI-agents, automatiseringssystemen en voice/SDR-pipelines bouwt voor B2B-klanten. Hij schrijft over de LLM-tooling stack die het Techsy-team daadwerkelijk in productie gebruikt. Verbind op LinkedIn.
Veelgestelde Vragen
Wat is de Newscatcher CatchAll API?
CatchAll is een recall-first web search API van Newscatcher. In plaats van een gerankte lijst links geeft het gestructureerde event-records terug: één JSON-object per realiteitsgebaseerd event, elk met broncitaten en geëxtraheerde entiteiten. Het is gebouwd voor AI-agents, enterprise-onderzoek en monitoringstaken waarbij het vinden van elk relevant event belangrijker is dan het ordenen van een korte lijst.
Hoe verschilt CatchAll van een gewone (SERP) search API?
Een SERP API rankt en geeft een handvol links terug, geoptimaliseerd voor "wat moet ik het eerst lezen?" CatchAll optimaliseert voor volledigheid: het scant 50.000+ pagina's per taak en clustert ze tot gededupliceerde gestructureerde events. Je krijgt één object per event met citaten en entiteiten, geen HTML-resultatenpagina die je zelf moet scrapen en parsen.
Is CatchAll echt 3x beter dan Exa Websets?
Newscatcher rapporteert dit op basis van hun eigen test van maart 2026 van 32 queries: CatchAll op 79,8% recall en F1 0,705 ten opzichte van Exa Websets op 19,6%, winnend in 27 van de 32 queries, wat ze omschrijven als ruwweg 3x meer relevante events. De homepage rondt recall af naar 86% op basis van een andere berekening. Alle cijfers zijn van de leverancier zelf; behandel ze als toegeschreven, niet onafhankelijk geauditeerd.
Wat kost CatchAll? Is er een gratis laag?
De prijs is gebruiksgebaseerd en betaal-per-gevalideerd-record, circa $0.10 per record, met nul kosten wanneer een query geen resultaten oplevert. De gratis laag geeft circa 2.000 credits bij aanmelding plus ongeveer 10 zoekopdrachten per maand, zonder creditcard. Dat is genoeg om een echte opsommingstest te draaien op je eigen use case voordat je budget vastlegt.
Hoe snel is CatchAll?
Dat hangt af van de modus. Lite geeft binnen seconden resultaat maar heeft een cap van circa 100 resultaten. Base is asynchroon en duurt ongeveer 15 minuten per taak, zonder resultaatcap, voor diepe opsomming. Voor Base-taken geef je de opdracht en poll je daarna, in plaats van één aanroep te blokkeren. Het is dus niet geschikt voor iets dat een sub-seconde antwoord nodig heeft, zoals een live chatbot.
Heeft CatchAll een MCP-server?
Nog niet officieel. Om het vandaag als native agent-tool te gebruiken, omhul je het REST-endpoint zelf, hetzelfde patroon als in onze MCP-gids. Het is een dunne wrapper rondom een enkele POST naar /v3/search, dus een kleine MCP-server eromheen bouwen is eenvoudig als je stack al het protocol spreekt.
Wat zijn Monitors en Watchlists?
Monitors zijn geplande heruitvoeringen, minimaal elk uur, die alleen de nieuwe gededupliceerde events teruggeven na de laatste run, waardoor een eenmalige zoekopdracht een permanente bewaking wordt. Watchlists filteren resultaten op entiteit met een relevantiescore van 1-10 en herkennen hetzelfde bedrijf over talen en jurisdicties heen. Samen dekken ze compliance-tracking en concurrentie-intelligence zonder elke keer het volledige web opnieuw te bevragen.
Kan ik CatchAll gebruiken voor SEO-ranktracking?
Nee. CatchAll geeft gevalideerde gestructureerde events terug, geen zoekmachinerangschikkingen, dus het vertelt je niet waar je pagina op Google staat. Voor ranktracking, SERP-features of het exact spiegelen van wat Google toont, gebruik SerpAPI of Serper. CatchAll en ranktrackers pakken daadwerkelijk andere problemen aan, ook al raken beide "web search."
Waarvoor is CatchAll het meest geschikt?
Opsomming en monitoringstaken waarbij volledigheid telt: compliance en regelgevingstracking, concurrentie-intelligence, supply-chain verstoringsmonitoring en marktonderzoek over vakbladen. De rode draad: het missen van één relevant event is de foutmodus, en dat is precies wat recall-first search is ontworpen te voorkomen. Voor conversationele RAG of semantisch opzoeken past een ranking-first tool beter.
Conclusie: recall-first is niet gerankt, en dat is het punt. CatchAll ruilt latentie voor volledigheid, en voor opsommingstaken is dat de juiste ruil. Voer de gratis laag uit op je hardste query voordat je beslist, want je kunt CatchAll's gratis laag proberen zonder creditcard. Als het async-wachten of de ontbrekende MCP-server een dealbreaker is, past een alternatief uit de tabel hierboven beter.