
Newscatcher CatchAll API: Jeg testede den recall-første websøgning bygget til AI-agenter
Jeg stillede Newscatcher CatchAll API ét stædigt spørgsmål: find hver eneste lagerbrand i Europa i dette kvartal. Ikke de ti bedste. Hver eneste en. En normal søge-API giver dig en rangeret side med links og dropper stille og roligt den lange hale, hvilket er fint til "bedste pizza i nærheden af mig" og ubrugeligt til en optællingsopgave. Cirka 15 minutter senere, i Base-tilstand, vendte CatchAll tilbage med regionalpresse- og fagbladsevents, som de rangeringsbaserede API'er i vores best-ai-search-apis-2026-test aldrig fandt frem til. Hvert resultat ankom som ét struktureret JSON-objekt, ikke et link. Det gab er hele historien.
Her er den korte version, før vi dykker ned i teknikken.
Nøglepointer
- CatchAll er en recall-første websøgnings-API: den returnerer strukturerede eventposter, ikke en rangeret SERP.
- Newscatcher rapporterer 79.8% recall og F1 0.705 på tværs af 32 forespørgsler; hjemmesiden runder dette op til 86%.
- To tilstande: Lite (sekunder, cirka 100-resultaters loft) og Base (asynkron, cirka 15 minutter, intet loft).
- Bedst til optællingsopgaver (compliance, konkurrentintel, forsyningskædeovervågning); det er ikke en SERP-rangeringstracker.
Recall-første søgning optimerer for at finde alt, hvor rangeringsførste søgning optimerer for at sortere de få ting, den finder frem til. Hold den ene sætning i hovedet, og resten af denne anmeldelse falder på plads.
Hvad er CatchAll? (Recall-første websøgning forklaret)
CatchAll er en recall-første websøgnings-API fra Newscatcher: i stedet for en rangeret liste over de bedste ~10 links returnerer den et deduplikeret sæt af strukturerede eventposter, hver især et enkelt JSON-objekt med kildehenvisninger og udtrukne entiteter. Recall-første betyder, at målet er fuldstændighed — at finde alle relevante events, ikke at sortere en kort liste efter relevans.
Newscatcher indrammer det med en kontant intuitionspumpe: hvis der findes 200 gyldige events, og dit system finder 5 frem, er din recall 2.5%. Til "hvad er den bedste laptop" er det fint. Til "hver eneste regulatorisk handling mod EU-fintechs i år" er et 2.5%-svar værre end ubrugeligt, fordi du ikke kan se, hvad du går glip af.
Det er det kategorigab, CatchAll sigter efter, og det er værd at forstå, selvom du aldrig tilmelder dig. YC-lanceringspitchet kalder det en "recall-first web search API", og du kan læse positioneringen direkte fra Newscatchers CatchAll Web Search API-produktside. Den ærlige indramning: en SERP-API svarer på "hvad skal jeg læse først?" CatchAll svarer på "hvad er den komplette liste?"
Sådan fungerer CatchAll: Retrieval- + valideringspipelinen
CatchAll kører en femtrins pipeline: forespørgselsplanlægning omskriver din prompt til flere retrieval-vinkler, storskala-retrieval scanner 50,000+ sider pr. job, Leiden-algoritmen klynger relaterede sider til enkelte events, en LLM validerer hver klynge mod din forespørgsel, og de overlevende kommer tilbage som struktureret JSON. Recall kommer fra scanningen; præcision kommer fra valideringen.
Lad os hurtigt gennemgå dem:
- Forespørgselsplanlægning. Din ene forespørgsel bliver til flere retrieval-prompts, der dækker forskellige formuleringer og eventtyper, så "lagerbrand" også fanger "brand på logistikdepot".
- Storskala-retrieval. Newscatcher siger, at et enkelt job henter 50,000+ sider med cirka 10,000 sider i minuttet uden resultatloft og når regionalpresse, fagblade og regulatoriske indberetninger, som mainstream-SERP'er begraver.
- Klyngedannelse. Leiden-algoritmen grupperer tæt forbundne sider i fællesskaber. I almindelige termer: 30 artikler om den samme brand i Rotterdam kollapser til én event, ikke 30 rækker.
- LLM-validering. Hver klynge scores mod din forespørgsel, og irrelevante klynger frasorteres. Dette trin koster reelle LLM-kald, så i en produktionsagentstack vil du gerne route dem gennem en LLM-gateway for at styre forbrug og fallback.
- Struktureret output. Ét JSON-objekt pr. valideret event med et dynamisk skema.
Newscatcher rapporterer at indeksere mere end 2 millioner virkelige events dagligt, med nye events, der lander på under timer. Den tekniske gennemgang, "The Architecture of Completeness", dækker Leiden- og valideringsdetaljerne, hvis du vil have den dybe version.
Det var her, min lagerbrandstest foregik. Jeg kørte optællingsforespørgslen i Base-tilstand, jobbet tog cirka 15 minutter, og værdien viste sig præcis der, hvor pipelinen lover det: regionale kilder og fagkilder, klynget til diskrete events, som en rangeret SERP ville have begravet under folden eller sprunget helt over.
Nøglefunktioner: Monitors, Watchlists og eventudtræk
Ud over engangssøgning leverer CatchAll Monitors og Watchlists. Monitors er planlagte genkørsler (minimum hver time), der kun returnerer de nye, deduplikerede events siden sidste kørsel. Watchlists filtrerer efter entitet med en 1-10-relevansscore og entitetsopløsning, der matcher den samme virksomhed på tværs af sprog og jurisdiktioner.
Monitors gør en engangssøgning til en stående overvågning: hver kørsel returnerer kun de events, der er nye siden den seneste. Det er forskellen mellem "søg på nettet i dag" og "fortæl mig det, i det øjeblik noget ændrer sig".
Ét ærligt forbehold om "real-time event monitoring API"-indramningen: "real-time" betyder her genkørsler hver time, ikke streaming på under et sekund. Hvis du har brug for push-notifikationer på millisekundniveau, er det ikke det her. For et complianceteam, der tjekker to gange om dagen, er hver time mere end nok. Company Watchlist skiller sig ud til konkurrentintel, da den opløser "Acme GmbH", "Acme Inc" og "Acme Holdings" til én sporet entitet i stedet for tre støjende.
Det strukturerede JSON-output (med et rigtigt eksempel)
Hvert resultat er én event som ét JSON-objekt: et cluster_id, en title, en relevance-score, et entities-array og et source_citations-array. Ingen HTML-scraping, ingen linkliste at parse. Det er det, der gør CatchAll til en ægte struktureret websøgnings-API i stedet for en SERP-wrapper.
Her er en forkortet event fra min lagerbrandskørsel, let renset, men reel i formen:
{
"events": [
{
"cluster_id": "evt_8f21a",
"title": "Fire at logistics warehouse near Rotterdam",
"relevance": 9,
"entities": [
{"name": "Rotterdam", "type": "location"},
{"name": "Maasvlakte", "type": "facility"}
],
"source_citations": [
{
"url": "https://...",
"publisher": "regional trade press",
"published_at": "2026-..."
}
]
}
]
}Bemærk, at source_citations-arrayet peger på en regional fagpublikation, præcis den type kilde, en rangerings-API nedprioriterer. Fordi hver event allerede er struktureret, kan du smide de validerede poster direkte ind i en RAG-pipeline eller gemme og embedde dem i en vektordatabase uden et scraping- eller oprydningstrin indimellem. Det sparede trin er den stille produktivitetsgevinst.
Hvordan kalder du CatchAll i Python? (Kode-quickstart)
Du får en API-nøgle, POSTer din forespørgsel til /v3/search med x-api-token-headeren og parser events-arrayet. Det er hele loopet. Her er et minimalt Python-kald:
import requests
resp = requests.post(
"https://api.newscatcherapi.com/v3/search",
headers={"x-api-token": "YOUR_API_KEY"},
json={"query": "warehouse fires in Europe", "page_size": 10},
)
events = resp.json()["events"]
for ev in events:
print(ev["title"], "—", ev["relevance"])Pro-tip og faldgrube i ét: Lite-tilstand returnerer på sekunder, men har et loft på cirka 100 resultater, mens Base-tilstand er asynkron og tager cirka 15 minutter for et dybt job. For Base indsender og poller du i stedet for at blokere på et enkelt kald, så design din agent til at affyre og tjekke, ikke vente. Hvis du integrerer CatchAll i en agent, vil du typisk kalde den som et værktøj via function calling. Bekræft de nøjagtige request-parametre og Lite-mod-Base-flaget mod CatchAll-dokumentationen, før du shipper; auth-headeren er x-api-token.
Hvad koster CatchAll? Er der en gratis tier?
Prissætningen er brugsbaseret og betal-pr-valideret-post, cirka $0.10 pr. post, og nul resultater betyder nul betaling. Der er en gratis tier med cirka 2,000 credits ved tilmelding plus cirka 10 søgninger om måneden, intet kort påkrævet, så du kan køre en reel optællingstest, før du forpligter dig.
Den nul-resultater-nul-betaling-model betyder noget for optællingsarbejde: en forespørgsel, der legitimt ikke har nogen matchende events, brænder ikke budget af. På det almindelige spørgsmål om, hvorvidt Googles søge-API er gratis: native Google- og Bing-søgning er ikke det her. De returnerer rangerede links, ikke validerede strukturerede events, og Bings Search API udfases, hvilket er en del af grunden til, at uafhængige indekser har deres øjeblik.
Virkelige use cases
CatchAll passer til ethvert job, hvor det at overse én post er fejltilstanden. Compliance og regulatorisk sporing læner sig op ad Monitors plus dens dækning af regulatoriske indberetninger. Konkurrentintel kører på Company Watchlist. Forsyningskædeovervågning er lagerbrandsmønsteret — at holde øje med disruptions-events. Markedsundersøgelser bruger optælling over fagpressen.
Mønsteret på tværs af alle fire: du bygger en komplet liste og handler derefter på den, ofte i en automatiseret websøgnings-API til AI-agenter-workflow. Et par konkrete former:
- Compliance: stående Monitor på håndhævelseshandlinger i din sektor, hver time.
- Konkurrentintel: Watchlist på tre rivaliserende entiteter, opløst på tværs af deres juridiske navne.
- Forsyningskæde: optælling af disruptions-events (brande, strejker, tilbagekaldelser) nær dine leverandørfaciliteter.
- Markedsundersøgelser: engangs Base-tilstandsscanning af hver eneste produktlancering i en niche i dette kvartal.
Benchmarks: Er CatchAll virkelig 3x bedre end Exa?
I Newscatchers egen benchmark fra marts 2026 med 32 forespørgsler rapporterer CatchAll F1 0.705 og 79.8% recall (4,807 events) og vinder 27 ud af 32 forespørgsler mod Exa Websets, Parallel AI FindAll og OpenAI Deep Research. Newscatcher beskriver det som cirka 3x flere relevante events end feltet. Hvert tal her er leverandørens eget.
| Værktøj (Newscatchers test fra marts 2026, 32 forespørgsler) | F1 | Recall |
|---|---|---|
| CatchAll | 0.705 | 79.8% (4,807 events) |
| Exa Websets | 0.317 | 19.6% |
| Parallel AI FindAll | 0.103 | 5.5% |
| OpenAI o3 / Deep Research | 0.017 | 0.9% |
Nu den ærlige del. Newscatchers egen grundige benchmark siger 79.8% recall; hjemmesiden runder det op til 86%. Vi citerer det lavere tal. 79.8%-tallet kommer fra den daterede, detaljerede 32-forespørgsels-produktsidetabel, mens 86%-overskriften er et rundere udsagn fra et andet snit på hjemmesiden og et blogindlæg. Begge er Newscatchers. Jeg fører med det lavere, fordi det at citere en leverandørs eget mere konservative interne tal er det tillidsskabende træk, en marketingside ikke kan lave. Uanset hvad holdt den retningsmæssige konklusion i min test: recall er reelt højere end rangeringsførste-værktøjerne. For det fulde felt, se hvordan CatchAll rangerer mod 12 andre AI-søge-API'er i vores bedste AI-søge-API'er-oversigt, og tjek den rå tabel selv på Newscatchers produktside.
Ærlige begrænsninger: Hvad CatchAll IKKE er til
CatchAll har fire reelle begrænsninger, som marketingsiderne begraver, og du bør veje dem, før du bygger. Den er ikke lav-latency, ikke uden loft i sin hurtige tilstand, endnu ikke plug-and-play for agenter og ikke en rangeringstracker. Ingen er dealbreakers, men hver især udelukker en use case.
- Base-tilstand er asynkron (~15 minutter pr. job). Forkert værktøj til en chatbot, der har brug for et svar på to sekunder.
- Lite-tilstand har et loft på cirka 100 resultater. Vil du have dyb recall hurtigt? Du kan ikke få begge dele; dyb recall betaler latency-skatten.
- Ingen officiel MCP-server endnu. Du wrapper REST-endepunktet selv. Hvis du vil have den som et native agentværktøj, ville du wrappe REST-endepunktet som en MCP-server, på samme måde som vi bygger de MCP-servere, vi allerede bruger.
- Det er ikke et SERP- eller rangeringssporingsværktøj. Det fortæller dig ikke, hvor du rangerer på Google. Helt andet job.
Dette afsnit er den del, ingen førstegangsside vil skrive for dig. Hvis den asynkrone latency eller den manglende MCP-server dræber din use case, er det bedre at lære det her end efter integration.
CatchAll-alternativer og hvornår du skal vælge dem
CatchAll vinder på rå recall til optælling, men det er ikke det rigtige valg til ethvert søgejob. Her er syv reelle alternativer, hver med den ærlige "vælg dette i stedet"-betingelse. Ingen stråmænd.
| Værktøj | Én-linjes positionering | Vælg dette i stedet, hvis… |
|---|---|---|
| Exa / Exa Websets | Neural/semantisk søgning plus optalte Websets | Du vil have semantisk opdagelse og embeddings-lignende relevans frem for rå recall med mindre, hurtigere resultatsæt. |
| Parallel AI (FindAll) | Agentisk optællings-/forsknings-API | Du allerede er i Parallel-økosystemet og vil have deres task-stil-forskningsprimitiv. |
| OpenAI Deep Research | LLM-drevet flertrins websøgning | Du vil have en nøglefærdig forskningsagent i OpenAI-stacken og kan tolerere stikprøver frem for udtømmende recall. |
| Tavily | Citationsformet søgning bygget til RAG/LangChain | Du vil have den enkleste realtids-RAG-søgning med ét-kalds-udtræk og native framework-integrationer. |
| Brave Search API | Uafhængigt indeks, privatliv, hurtig SERP-stil | Du har brug for leverandøruafhængighed plus lav latency, og en rangeret resultatside er fint. |
| SerpAPI / Serper | Google/flermotorers SERP-scraping | Du har brug for SEO-rangeringssporing, SERP-funktioner eller at spejle præcis det, Google viser. |
| Linkup | EU-/udgiverkildefokuseret søgning | Din use case er europæisk udgiverdækning og licenseret kildeproveniens. |
Den hurtige heuristik: optælling og overvågning peger på CatchAll, konversationel RAG peger på Tavily, semantisk opdagelse peger på Exa, og rangeringssporing peger på SerpAPI.
Hvordan Techsy bruger recall-første søgning i agentbygning
Hos Techsy leverer vi AI-agenter til B2B-kunder, og recall-første søgning passer rent ind til optællings- og overvågningsjob: tænk en compliance-agent, der har brug for den komplette liste over håndhævelseshandlinger, ikke de fem bedste. Vi rækker ud efter en recall-første API som CatchAll der, og rækker ærligt talt ud efter Tavily eller Exa, når opgaven i stedet er konversationel RAG eller semantisk opslag. At vælge den forkerte søgeprimitiv er en af de mest almindelige agentbygningsfejl, vi retter. Vil du have hjælp til at vælge? Få en gratis konsultation.
Om forfatteren
Mert Batur Gurbuz er medstifter af Techsy.io, hvor teamet leverer AI-agenter, automatiseringssystemer og voice/SDR-pipelines til B2B-kunder. Han studerer på University of Birmingham og skriver om den LLM-værktøjsstack, Techsy-teamet faktisk bruger i produktion. Forbind på LinkedIn.
Ofte stillede spørgsmål
Hvad er Newscatcher CatchAll API?
CatchAll er en recall-første websøgnings-API fra Newscatcher. I stedet for en rangeret liste over links returnerer den strukturerede eventposter, ét JSON-objekt pr. virkelig event, hver med kildehenvisninger og udtrukne entiteter. Den er bygget til AI-agenter, virksomhedsforskning og overvågningsopgaver, hvor det at finde alle relevante events betyder mere end at sortere en kort liste.
Hvordan adskiller CatchAll sig fra en normal (SERP) søge-API?
En SERP-API rangerer og returnerer de bedste håndfuld links og optimerer for "hvad skal jeg læse først". CatchAll optimerer for fuldstændighed, scanner 50,000+ sider pr. job og klynger dem til deduplikerede strukturerede events. Du får ét objekt pr. event med kildehenvisninger og entiteter, ikke en HTML-resultatside, du selv skal scrape og parse.
Er CatchAll virkelig 3x bedre end Exa Websets?
Newscatcher rapporterer det i deres egen test fra marts 2026 med 32 forespørgsler: CatchAll med 79.8% recall og F1 0.705 mod Exa Websets med 19.6%, og vinder 27 ud af 32 forespørgsler, hvilket de indrammer som cirka 3x flere relevante events. Bemærk, at hjemmesiden runder recall op til 86% fra et andet snit. Alle tal er leverandørens egne; behandl dem som tilskrevne, ikke uafhængigt reviderede.
Hvad koster CatchAll? Er der en gratis tier?
Prissætningen er brugsbaseret og betal-pr-valideret-post, cirka $0.10 pr. post, med nul betaling, når en forespørgsel ikke returnerer nogen resultater. Den gratis tier giver cirka 2,000 credits ved tilmelding plus cirka 10 søgninger om måneden, intet kort påkrævet. Det er nok til at køre en reel optællingstest mod din egen use case, før du forpligter budget.
Hvor hurtig er CatchAll?
Det afhænger af tilstanden. Lite returnerer på sekunder, men har et loft på cirka 100 resultater. Base er asynkron og tager cirka 15 minutter pr. job uden resultatloft til dyb optælling. For Base-job indsender og poller du i stedet for at blokere på ét kald, så det er forkert til alt, der har brug for et svar på under et sekund som en live chatbot.
Har CatchAll en MCP-server?
Ikke en officiel endnu. For at bruge den som et native agentværktøj i dag wrapper du REST-endepunktet selv, det samme mønster, der dækkes i vores MCP-guide. Det er en tynd wrapper omkring en enkelt POST til /v3/search, så det er ligetil at bygge en lille MCP-server omkring den, hvis din stack allerede taler protokollen.
Hvad er Monitors og Watchlists?
Monitors er planlagte genkørsler, minimum hver time, der kun returnerer de nye deduplikerede events siden sidste kørsel og gør en engangssøgning til en stående overvågning. Watchlists filtrerer resultater efter entitet med en 1-10-relevansscore og opløser den samme virksomhed på tværs af sprog og jurisdiktioner. Sammen dækker de compliancesporing og konkurrentintel uden at genforespørge hele nettet hver gang.
Kan jeg bruge CatchAll til SEO-rangeringssporing?
Nej. CatchAll returnerer validerede strukturerede events, ikke søgemaskinerangeringer, så den fortæller dig ikke, hvor din side ligger på Google. Til rangeringssporing, SERP-funktioner eller at spejle præcis det, Google viser, skal du bruge SerpAPI eller Serper i stedet. CatchAll og rangeringstrackere løser reelt forskellige problemer, selvom begge berører "websøgning".
Hvilke use cases er CatchAll bedst til?
Optællings- og overvågningsopgaver, hvor fuldstændighed betyder noget: compliance og regulatorisk sporing, konkurrentintel, forsyningskæde-disruptionsovervågning og markedsundersøgelser over fagpressen. Den fælles tråd er, at det at overse en enkelt relevant event er fejltilstanden, hvilket er præcis det, recall-første søgning er designet til at forhindre. Til konversationel RAG eller semantisk opslag passer et rangeringsførste-værktøj bedre.
Bundlinje: recall-første er ikke rangeret, og det er pointen. CatchAll bytter latency for fuldstændighed, og til optællingsjob er det den rigtige handel. Kør den gratis tier på din egen sværeste forespørgsel, før du beslutter dig, da du kan prøve CatchAlls gratis tier uden kort. Hvis den asynkrone ventetid eller den manglende MCP-server er en dealbreaker, vil et alternativ fra tabellen ovenfor tjene dig bedre.