ai-machine-learning

Newscatcher CatchAll API: Jeg testet fullstendighets-søket bygget for AI-agenter

Skrevet av Mert Batur
Jun 30, 2026
13 lesing
Newscatcher CatchAll API: Jeg testet fullstendighets-søket bygget for AI-agenter

Newscatcher CatchAll API: Jeg testet fullstendighets-søket bygget for AI-agenter

Jeg stilte Newscatcher CatchAll API ett hardbarka spørsmål: finn alle lagerbranner i Europa dette kvartalet. Ikke de ti øverste. Alle sammen. En vanlig søke-API gir deg en rangert side med lenker og dropper stille den lange halen — noe som er greit for "beste pizza i nærheten" og helt ubrukelig for en opptellingsoppgave. Etter omtrent 15 minutter, i Base-modus, kom CatchAll tilbake med hendelser fra regionalpresse og fagpublikasjoner som de rangerings-baserte API-ene i vår beste-ai-soke-apis-2026-test aldri avdekket. Hvert resultat kom som ett strukturert JSON-objekt, ikke en lenke. Det gapet er hele historien.

Her er kortversjonen før vi går inn på koblingene.

Viktigste punkter

  • CatchAll er en recall-first nettsøk-API: den returnerer strukturerte hendelsesregistre, ikke en rangert SERP.
  • Newscatcher rapporterer 79,8 % recall og F1 0,705 på tvers av 32 spørringer; hjemmesiden runder dette opp til 86 %.
  • To modi: Lite (sekunder, rundt 100 resultater) og Base (asynkron, ca. 15 minutter, ingen grense).
  • Best for opptellingsoppgaver (compliance, konkurranseintelligens, forsyningskjedeovervåking); det er ikke et SERP-rangsporer.

Recall-first søk optimaliserer for å finne alt, der rangerings-first søk optimaliserer for å sortere de få tingene det viser frem. Hold den ene setningen i hodet og resten av denne gjennomgangen faller på plass.

Hva er CatchAll? (Recall-first nettsøk, forklart)

CatchAll er en recall-first nettsøk-API fra Newscatcher: i stedet for en rangert liste med de øverste ~10 lenkene returnerer den et deduplisert sett med strukturerte hendelsesregistre, der hvert er ett JSON-objekt med kildesiteringer og uttrukne entiteter. Recall-first betyr at målet er fullstendighet — å finne alle relevante hendelser, ikke å sortere en kort liste etter relevans.

Newscatcher rammer dette inn med en konkret tankeøvelse: hvis 200 gyldige hendelser eksisterer og systemet ditt viser frem 5, er recall-verdien din 2,5 %. For "hva er den beste laptopen" er det greit. For "alle regulatoriske tiltak mot EU-fintech dette året" er et 2,5 %-svar verre enn ubrukelig — fordi du ikke kan se hva du mangler.

Det er dette kategorigapet CatchAll retter seg mot, og det er verdt å forstå selv om du aldri melder deg på. YC-lanseringsinnlegget kaller det en "recall-first web search API", og du kan lese posisjoneringen direkte fra produktsiden til Newscatchers CatchAll Web Search API. Den ærlige rammen: en SERP-API svarer på "hva bør jeg lese først?" CatchAll svarer på "hva er den fullstendige listen?"

Slik fungerer CatchAll: Hentings- og valideringspipeline

CatchAll kjører en femdelt pipeline: spørringsplanlegging omskriver spørringen din til flere hentingsvinkler, storstilt henting skanner 50 000+ sider per jobb, Leiden-algoritmen klynger relaterte sider til enkelthendelser, en LLM validerer hver klynge mot spørringen din, og de som overlever kommer tilbake som strukturert JSON. Recall kommer fra skanningen; presisjonen kommer fra valideringen.

La oss bryte disse ned kort:

  1. Spørringsplanlegging. Spørringen din blir til flere hentingsprompter som dekker ulike formuleringer og hendelsestyper — "lagerbrann" fanger også "brann i logistikkdepot."
  2. Storstilt henting. Newscatcher sier at én jobb henter 50 000+ sider med ca. 10 000 sider per minutt uten resultatgrense, og når regionalpresse, fagpublikasjoner og regulatoriske arkiver som mainstream SERP-er begravder.
  3. Klyngedannelse. Leiden-algoritmen grupperer tett tilkoblede sider i fellesskap. Enkelt forklart: 30 artikler om samme Rotterdam-brann kollapser til én hendelse, ikke 30 rader.
  4. LLM-validering. Hver klynge scores mot spørringen din, og irrelevante droppes. Dette steget krever ekte LLM-kall, så i en produksjons-agentstabel ville du typisk rute disse gjennom en LLM-gateway for å kontrollere forbruk og fallback.
  5. Strukturert utdata. Ett JSON-objekt per validert hendelse, med et dynamisk skjema.

Newscatcher rapporterer at de indekserer mer enn 2 millioner virkelige hendelser daglig, med nye hendelser som lander i løpet av timer. Den tekniske artikkelen "The Architecture of Completeness" dekker Leiden og valideringsinternalene hvis du vil ha dybdestoffet.

Det er her lagerbranntesten min lå. Jeg kjørte opptellingsspørringen i Base-modus, jobben tok ca. 15 minutter, og verdien viste seg nøyaktig der pipeline-en lover den: regionale og faglige kilder, klynget til diskrete hendelser, som en rangert SERP ville ha begravd under folden eller hoppet over helt.

Nøkkelfunksjoner: Monitorer, overvåkningslister og hendelsesuttrekking

Utover engangs-søk leverer CatchAll Monitorer og Overvåkningslister. Monitorer er planlagte re-kjøringer (minimum timesvis) som bare returnerer de nye, dedupliserte hendelsene siden siste kjøring. Overvåkningslister filtrerer etter entitet med en relevansscore fra 1 til 10 og entitetsoppløsning som matcher samme selskap på tvers av språk og jurisdiksjoner.

Monitorer forvandler et engangs-søk til en stående vakt: hver kjøring returnerer bare hendelsene som er nye siden sist. Det er forskjellen mellom "søk nettet i dag" og "fortell meg øyeblikket noe endrer seg."

En ærlig reservasjon om "sanntids hendelsesovervåking API"-rammen: "sanntid" her betyr timesvis re-kjøringer, ikke sub-sekund strømming. Trenger du millisekund push-varsler, er ikke dette det. For et compliance-team som sjekker to ganger om dagen er timesvis mer enn nok. Selskapsovervåkningslisten er høydepunktet for konkurranseintelligens, siden den løser "Acme GmbH," "Acme Inc" og "Acme Holdings" til én sporet entitet i stedet for tre støyende.

Den strukturerte JSON-utgangen (med et ekte eksempel)

Hvert resultat er én hendelse som ett JSON-objekt: en cluster_id, en title, en relevance-score, en entities-array og en source_citations-array. Ingen HTML-skraping, ingen lenkeliste å parsere. Dette er det som gjør CatchAll til en genuin strukturert nettsøk-API snarere enn en SERP-wrapper.

Her er en forkortet hendelse fra lagerbrannkjøringen min, lett renset men ekte i form:

json
{
  "events": [
    {
      "cluster_id": "evt_8f21a",
      "title": "Fire at logistics warehouse near Rotterdam",
      "relevance": 9,
      "entities": [
        {"name": "Rotterdam", "type": "location"},
        {"name": "Maasvlakte", "type": "facility"}
      ],
      "source_citations": [
        {
          "url": "https://...",
          "publisher": "regional trade press",
          "published_at": "2026-..."
        }
      ]
    }
  ]
}

Legg merke til at source_citations-arrayen peker på et regionalt fagblad — nøyaktig den typen kilde en rangerings-API nedprioriterer. Fordi hver hendelse allerede er strukturert, kan du slippe de validerte registrene rett inn i en RAG-pipeline eller lagre og embedde dem i en vektordatabase uten et skrapings- eller oppryddingstrinn i mellom. Det sparte steget er den stille produktivitetsgevinsten.

Hvordan kaller du CatchAll i Python? (Rask start med kode)

Du henter en API-nøkkel, POSTer spørringen til /v3/search med x-api-token-headeren og parserer events-arrayen. Det er hele løkken. Her er et minimalt Python-kall:

python
import requests

resp = requests.post(
    "https://api.newscatcherapi.com/v3/search",
    headers={"x-api-token": "YOUR_API_KEY"},
    json={"query": "warehouse fires in Europe", "page_size": 10},
)
events = resp.json()["events"]
for ev in events:
    print(ev["title"], "—", ev["relevance"])

Tips og fallgruve i ett: Lite-modus returnerer på sekunder men cap-er rundt 100 resultater, mens Base-modus er asynkron og tar ca. 15 minutter for en dybdejobb. For Base sender du og poller i stedet for å blokkere på ett kall, så design agenten din til å sende-og-sjekke, ikke vente. Hvis du kobler CatchAll inn i en agent, vil du typisk kalle det som et verktøy via function calling. Bekreft de eksakte forespørselsparametrene og Lite-versus-Base-flagget mot CatchAll-dokumentasjonen før du sender; auth-headeren er x-api-token.

Hva koster CatchAll? Finnes det et gratisnivå?

Prisingen er bruksbasert og betaling-per-validert-oppslag, ca. $0,10 per oppslag, og null resultater betyr null kostnad. Det finnes et gratisnivå med ca. 2 000 kreditter ved registrering pluss ca. 10 søk per måned, uten kortregistrering, slik at du kan kjøre en ekte opptellingstest før du forplikter deg.

Den null-resultater-null-kostnad-modellen betyr noe for opptellingsarbeid: en spørring som legitimt ikke har noen matchende hendelser, brenner ikke budsjettet. Til det vanlige spørsmålet om Googles søke-API er gratis: native Google og Bing-søk er ikke dette. De returnerer rangerte lenker, ikke validerte strukturerte hendelser, og Bings Search API fases ut — noe som er en del av grunnen til at uavhengige indekser opplever sin storhetstid.

Praktiske brukstilfeller

CatchAll passer enhver jobb der det å miste én vare er feilmodus. Compliance- og regulatorisk sporing lener seg på Monitorer pluss regulatorisk-arkivdekning. Konkurranseintelligens kjører på Selskapsovervåkningslisten. Forsyningskjedeovervåking er lagerbranns-mønsteret — å passe på for forstyrrelseshendelser. Markedsundersøkelser bruker opptelling over fagpresse.

Mønsteret på tvers av alle fire: du bygger en fullstendig liste og handler deretter, ofte inne i en automatisert nettsøk-API for AI-agenter-arbeidsflyt. Noen konkrete former:

  • Compliance: stående Monitor på håndhevingstiltak i din sektor, timesvis.
  • Konkurranseintelligens: overvåkningsliste på tre rivaliserende entiteter, løst på tvers av deres juridiske navn.
  • Forsyningskjede: opptelling av forstyrrelseshendelser (branner, streiker, tilbakekallinger) nær leverandøranleggene dine.
  • Markedsundersøkelser: ett Base-modus-søk av alle produktlanseringer i en nisje dette kvartalet.

Benchmarkene: Er CatchAll virkelig 3x bedre enn Exa?

I Newscatchers eget mars 2026-benchmark av 32 spørringer rapporterer CatchAll F1 0,705 og 79,8 % recall (4 807 hendelser), og vinner 27 av 32 spørringer mot Exa Websets, Parallel AI FindAll og OpenAI Deep Research. Newscatcher beskriver det som ca. 3x flere relevante hendelser enn feltet. Alle tall her er leverandørens egne.

Verktøy (Newscatchers mars 2026-test, 32 spørringer)F1Recall
CatchAll0,70579,8 % (4 807 hendelser)
Exa Websets0,31719,6 %
Parallel AI FindAll0,1035,5 %
OpenAI o3 / Deep Research0,0170,9 %

Nå den ærlige delen. Newscatchers eget grundige benchmark sier 79,8 % recall; hjemmesiden runder det til 86 %. Vi siterer det lavere tallet. 79,8 %-tallet kommer fra den daterte, detaljerte 32-spørringers produktsidetabellen, mens 86 %-overskriften er et runder tall fra et annet utvalg på hjemmesiden og et blogginnlegg. Begge er Newscatchers egne. Jeg fører med det lavere fordi å sitere en leverandørs eget mer konservative interne tall er tillitsbevegelsen en markedsside ikke kan gjøre. Uansett holdt den retningsbestemte konklusjonen i testingen min: recall er genuint høyere enn de rangerings-prioriterte verktøyene. Se hele feltet i vår oversikt over de beste AI-søke-API-ene, og sjekk råtabellen selv på Newscatchers produktside.

Ærlige begrensninger: Hva CatchAll IKKE er for

CatchAll har fire reelle begrensninger som markedssidet begravder, og du bør veie dem før du bygger. Det er ikke lav-latens, ikke ubegrenset i den raske modusen, ikke plug-and-play for agenter ennå, og ikke et rangsporer. Ingen er dealbreakers, men hver utelukker et brukstilfelle.

  • Base-modus er asynkron (~15 minutter per jobb). Feil verktøy for en chatbot som trenger svar på to sekunder.
  • Lite-modus cap-er rundt 100 resultater. Vil du ha dyp recall raskt? Du kan ikke ha begge; dyp recall betaler latenstollen.
  • Ingen offisiell MCP-server ennå. Du pakker REST-endepunktet selv. Vil du ha det som et native agentverktøy, kan du pakke REST-endepunktet som en MCP-server — det samme mønsteret vi bruker til å bygge de MCP-serverne vi allerede bruker.
  • Det er ikke et SERP- eller rangsporing-verktøy. Det vil ikke fortelle deg hvor du rangerer på Google. En helt annen jobb.

Denne seksjonen er den delen ingen førstepartside vil skrive for deg. Hvis den asynkrone latensen eller den manglende MCP-serveren ødelegger brukstilfellet ditt, er det bedre å lære det her enn etter integrasjon.

CatchAll-alternativer og når du bør velge dem

CatchAll vinner på rå recall for opptelling, men det er ikke det rette valget for enhver søkejobb. Her er syv reelle alternativer, hvert med den ærlige "velg dette i stedet"-betingelsen. Ingen stråmenn.

VerktøyKort posisjoneringVelg dette i stedet hvis…
Exa / Exa WebsetsNevral/semantisk søk pluss opplistede WebsetsDu vil ha semantisk oppdagelse og embedding-stilrelevans over rå recall, med mindre og raskere resultatsett.
Parallel AI (FindAll)Agentisk opptelling/research-APIDu er allerede i Parallel-økosystemet og vil ha deres oppgavestils-forskningsprimitiv.
OpenAI Deep ResearchLLM-drevet flerstegs nettforskningDu vil ha en ferdiglagd forskningsagent innenfor OpenAI-stakken og kan tolerere utvalg over uttømmende recall.
TavilySiteringsformet søk bygget for RAG/LangChainDu vil ha det enkleste sanntids-RAG-søket med enettsuttrekk og native framework-integrasjoner.
Brave Search APIUavhengig indeks, personvern, rask SERP-stilDu trenger leverandøruavhengighet pluss lav latens og en rangert resultatside er greit.
SerpAPI / SerperGoogle/fler-motor SERP-skrapingDu trenger SEO-rangsporing, SERP-funksjoner eller å speile nøyaktig hva Google viser.
LinkupEU/utgiver-kildefokusert søkBrukstilfellet ditt er europeisk utgiverdekning og lisensiert kildeopprinnelse.

Den raske tommelfingerregelen: opptelling og overvåking peker mot CatchAll, konversasjonelt RAG peker mot Tavily, semantisk oppdagelse peker mot Exa og rangsporing peker mot SerpAPI.

Slik bruker Techsy recall-first-søk i agentbygging

Hos Techsy leverer vi AI-agenter for B2B-kunder, og recall-first søk passer rent inn for opptelling og overvåkingsjobber: tenk en compliance-agent som trenger den fullstendige listen over håndhevingstiltak, ikke de fem øverste. Vi bruker en recall-first API som CatchAll der, og bruker ærlig talt Tavily eller Exa når oppgaven er konversasjonelt RAG eller semantisk oppslag i stedet. Å velge feil søkprimitiv er en av de vanligste agentbyggfeilene vi fikser. Vil du ha hjelp til å velge? Få en gratis konsultasjon.

Om forfatteren

Mert Batur er medgründer av Techsy.io, der teamet leverer AI-agenter, automatiseringssystemer og tale/SDR-pipelines for B2B-kunder. Han skriver om LLM-verktøystakken som Techsy-teamet faktisk bruker i produksjon. Koble til på LinkedIn.

Ofte stilte spørsmål

Hva er Newscatcher CatchAll API?

CatchAll er en recall-first nettsøk-API fra Newscatcher. I stedet for en rangert liste med lenker returnerer den strukturerte hendelsesregistre — ett JSON-objekt per virkelig hendelse, hver med kildesiteringer og uttrukne entiteter. Den er bygget for AI-agenter, enterprise-forskning og overvåkingsoppgaver der det å finne alle relevante hendelser er viktigere enn å sortere en kort liste.

Hvordan er CatchAll forskjellig fra en vanlig (SERP) søke-API?

En SERP-API rangerer og returnerer de øverste lenkene, og optimaliserer for "hva bør jeg lese først." CatchAll optimaliserer for fullstendighet, skanner 50 000+ sider per jobb og klynger dem til dedupliserte strukturerte hendelser. Du får ett objekt per hendelse med siteringer og entiteter, ikke en HTML-resultatside du må skrape og parsere selv.

Er CatchAll virkelig 3x bedre enn Exa Websets?

Newscatcher rapporterer det i sin egen mars 2026-test av 32 spørringer: CatchAll med 79,8 % recall og F1 0,705 versus Exa Websets på 19,6 %, og vinner 27 av 32 spørringer — noe de rammer inn som ca. 3x flere relevante hendelser. Merk at hjemmesiden runder recall opp til 86 % fra et annet utvalg. Alle tall er leverandørens egne; behandle dem som tilskrevet, ikke uavhengig revidert.

Hva koster CatchAll? Er det et gratisnivå?

Prisingen er bruksbasert og betaling-per-validert-oppslag, ca. $0,10 per oppslag, med null kostnad når en spørring returnerer ingen resultater. Gratisnivået gir ca. 2 000 kreditter ved registrering pluss ca. 10 søk per måned, uten kortregistrering. Det er nok til å kjøre en ekte opptellingstest mot ditt eget brukstilfelle før du forplikter budsjett.

Hvor rask er CatchAll?

Det avhenger av modusen. Lite returnerer på sekunder men cap-er på ca. 100 resultater. Base er asynkron og tar ca. 15 minutter per jobb, uten resultatgrense, for dyp opptelling. For Base-jobber sender du og poller i stedet for å blokkere på ett kall, så det er feil for alt som trenger et sub-sekund svar som en live chatbot.

Har CatchAll en MCP-server?

Ikke en offisiell ennå. For å bruke den som et native agentverktøy i dag pakker du REST-endepunktet selv — det samme mønsteret som dekkes i vår MCP-guide. Det er en tynn wrapper rundt en enkelt POST til /v3/search, så å bygge en liten MCP-server rundt den er rett frem hvis stakken din allerede snakker protokollen.

Hva er Monitorer og overvåkningslister?

Monitorer er planlagte re-kjøringer, minimum timesvis, som bare returnerer de nye dedupliserte hendelsene siden siste kjøring — de forvandler et engangs-søk til en stående vakt. Overvåkningslister filtrerer resultater etter entitet med en relevansscore fra 1 til 10 og løser samme selskap på tvers av språk og jurisdiksjoner. Sammen dekker de compliance-sporing og konkurranseintelligens uten å re-spørre hele nettet hver gang.

Kan jeg bruke CatchAll til SEO-rangssporing?

Nei. CatchAll returnerer validerte strukturerte hendelser, ikke søkemotorrangeringer, så den vil ikke fortelle deg hvor siden din ligger på Google. For rangsporing, SERP-funksjoner eller å speile nøyaktig hva Google viser, bruk SerpAPI eller Serper i stedet. CatchAll og rangsporing løser genuint forskjellige problemer til tross for at begge berører "nettsøk."

Hvilke brukstilfeller passer CatchAll best for?

Opptellings- og overvåkingsoppgaver der fullstendighet betyr noe: compliance- og regulatorisk sporing, konkurranseintelligens, forsyningskjede forstyrrelsesovervåking og markedsundersøkelser over fagpresse. Den røde tråden er at det å miste én enkelt relevant hendelse er feilmodus — noe som er nøyaktig det recall-first søk er designet for å forhindre. For konversasjonelt RAG eller semantisk oppslag passer et rangerings-prioritert verktøy bedre.

Bunnlinjen: recall-first er ikke rangert, og det er poenget. CatchAll handler latens mot fullstendighet, og for opptellingsjobber er det den rette handelen. Kjør gratisnivået på din egen hardeste spørring før du bestemmer — du kan prøve CatchAll gratis uten kort. Hvis den asynkrone ventetiden eller den manglende MCP-serveren er en dealbreaker, vil et alternativ fra tabellen ovenfor tjene deg bedre.

Emneord

newscatcher-catchall-apirecall-first-web-searchweb-search-api-for-ai-agentsstructured-web-search-apideep-research-api

Del denne artikkelen

Kom i gang

Klar til å bygge noe ekstraordinært?

La oss gjøre visjonen din til virkelighet. Teamet vårt er klart til å hjelpe deg med å lage programvare som utgjør en forskjell.