ai-machine-learning

Newscatcher CatchAll API: Ho Testato la Ricerca Web Recall-First per Agenti AI

Scritto da Mert Batur
Jun 30, 2026
15 lettura
Newscatcher CatchAll API: Ho Testato la Ricerca Web Recall-First per Agenti AI

Newscatcher CatchAll API: Ho Testato la Ricerca Web Recall-First per Agenti AI

Ho fatto alla Newscatcher CatchAll API una domanda ostinata: trova ogni incendio in un magazzino in Europa in questo trimestre. Non i primi dieci. Tutti quanti. Una normale API di ricerca ti restituisce una pagina di link classificati e taglia silenziosamente la coda lunga, il che va bene per "la migliore pizza qui vicino" ed è inutile per un compito di enumerazione. Circa 15 minuti dopo, in modalità Base, CatchAll ha restituito eventi provenienti dalla stampa regionale e da pubblicazioni specializzate che le API basate su ranking nel nostro test best-ai-search-apis-2026 non hanno mai portato in superficie. Ogni risultato è arrivato come un unico oggetto JSON strutturato, non come un link. Quella differenza è tutta la storia.

Ecco la versione breve prima di entrare nei dettagli tecnici.

Punti Chiave

  • CatchAll è un'API di ricerca web recall-first: restituisce record di eventi strutturati, non una SERP classificata.
  • Newscatcher riporta un recall del 79,8% e un F1 di 0,705 su 32 query; la homepage arrotonda questo a 86%.
  • Due modalità: Lite (secondi, circa 100 risultati massimi) e Base (asincrona, circa 15 minuti, senza limite).
  • Adatta per compiti di enumerazione (conformità, intelligence competitiva, monitoraggio della supply chain); non è uno strumento di rank tracking.

La ricerca recall-first ottimizza il trovare tutto, mentre la ricerca ranking-first ottimizza l'ordinamento delle poche cose che porta in superficie. Tieni questa frase in testa e il resto di questa recensione si fa chiaro da solo.

Che Cos'è CatchAll? (Ricerca Web Recall-First, Spiegata)

CatchAll è un'API di ricerca web recall-first di Newscatcher: invece di una lista classificata dei primi ~10 link, restituisce un insieme deduplicato di record di eventi strutturati, ognuno un singolo oggetto JSON con citazioni e entità estratte. Recall-first significa che l'obiettivo è la completezza — trovare ogni evento rilevante, non ordinare una lista breve per rilevanza.

Newscatcher lo spiega con un esempio diretto: se esistono 200 eventi validi e il tuo sistema ne porta in superficie 5, il tuo recall è del 2,5%. Per "qual è il laptop migliore" va bene. Per "ogni azione regolatoria contro le fintech UE quest'anno," una risposta al 2,5% è peggio che inutile perché non puoi vedere cosa ti stai perdendo.

Questo è il gap categoriale che CatchAll punta a colmare, e vale la pena capirlo anche se non ti registri mai. Il pitch di lancio su YC la chiama "API di ricerca web recall-first," e puoi leggerne il posizionamento direttamente sulla pagina prodotto della CatchAll Web Search API di Newscatcher. La distinzione onesta: un'API SERP risponde a "cosa dovrei leggere prima?" CatchAll, però, risponde a "qual è la lista completa?"

Come Funziona CatchAll: La Pipeline di Recupero + Validazione

CatchAll esegue una pipeline in cinque fasi: la pianificazione delle query riscrive il tuo prompt in diversi angoli di recupero, il recupero su larga scala scansiona 50.000+ pagine per job, l'algoritmo di Leiden raggruppa le pagine correlate in singoli eventi, un LLM valida ogni cluster rispetto alla tua query, e i risultati validi tornano come JSON strutturato. Il recall arriva dalla scansione; la precisione arriva dalla validazione.

Analizziamoli brevemente:

  1. Pianificazione delle query. La tua singola query diventa diversi prompt di recupero che coprono diverse formulazioni e tipi di eventi, così "incendio in magazzino" cattura anche "fiamme in deposito logistico."
  2. Recupero su larga scala. Newscatcher dice che un singolo job preleva 50.000+ pagine a circa 10.000 pagine al minuto senza limite di risultati, raggiungendo stampa regionale, pubblicazioni specializzate e documenti regolatori che le SERP mainstream seppelliscono.
  3. Clustering. L'algoritmo di Leiden raggruppa le pagine densamente connesse in community. In parole semplici: 30 articoli sullo stesso incendio a Rotterdam collassano in un unico evento, non 30 righe.
  4. Validazione LLM. Ogni cluster viene valutato rispetto alla tua query, e quelli irrilevanti vengono scartati. Questa fase richiede chiamate LLM reali, quindi in uno stack di agenti in produzione vorresti indirizzarle attraverso un LLM gateway per controllare la spesa e il fallback.
  5. Output strutturato. Un oggetto JSON per evento validato, con schema dinamico.

Newscatcher riporta di indicizzare più di 2 milioni di eventi reali al giorno, con nuovi eventi disponibili nel giro di ore. Il documento tecnico "The Architecture of Completeness" copre i dettagli interni di Leiden e della validazione se vuoi approfondire.

Qui si è svolto il mio test sugli incendi nei magazzini. Ho eseguito la query di enumerazione in modalità Base, il job ha richiesto circa 15 minuti, e il valore si è manifestato esattamente dove la pipeline lo promette: fonti regionali e specializzate, raggruppate in eventi discreti, che una SERP classificata avrebbe seppellito oltre la prima pagina o saltato del tutto.

Funzionalità Principali: Monitor, Watchlist ed Estrazione di Eventi

Oltre alla ricerca una-tantum, CatchAll include Monitor e Watchlist. I Monitor sono ri-esecuzioni pianificate (minimo orario) che restituiscono solo i nuovi eventi deduplicati dall'ultima esecuzione. Le Watchlist filtrano per entità, con un punteggio di rilevanza da 1 a 10 e una risoluzione delle entità che abbina la stessa azienda tra lingue e giurisdizioni.

I Monitor trasformano una ricerca una-tantum in una sorveglianza continuativa: ogni esecuzione restituisce solo gli eventi nuovi dall'ultima. Questa è la differenza tra "cerca sul web oggi" e "informami nel momento in cui qualcosa cambia."

Una nota onesta sul posizionamento "API di monitoraggio eventi in tempo reale": "in tempo reale" qui significa ri-esecuzioni orarie, non streaming sub-secondo. Se hai bisogno di notifiche push in millisecondi, questo non fa per te. Per un team di conformità che controlla due volte al giorno, ogni ora è più che sufficiente. La Company Watchlist è il punto di forza per l'intelligence competitiva, poiché risolve "Acme GmbH," "Acme Inc" e "Acme Holdings" in un'unica entità tracciata invece di tre entità rumorose separate.

L'Output JSON Strutturato (Con un Esempio Reale)

Ogni risultato è un evento come un oggetto JSON: un cluster_id, un title, un punteggio relevance, un array entities e un array source_citations. Nessuno scraping HTML, nessuna lista di link da analizzare. Questo è ciò che rende CatchAll una vera API di ricerca web strutturata e non un semplice wrapper SERP.

Ecco un evento troncato dal mio test sugli incendi nei magazzini, leggermente ripulito ma fedele nella struttura:

json
{
  "events": [
    {
      "cluster_id": "evt_8f21a",
      "title": "Fire at logistics warehouse near Rotterdam",
      "relevance": 9,
      "entities": [
        {"name": "Rotterdam", "type": "location"},
        {"name": "Maasvlakte", "type": "facility"}
      ],
      "source_citations": [
        {
          "url": "https://...",
          "publisher": "regional trade press",
          "published_at": "2026-..."
        }
      ]
    }
  ]
}

Nota come l'array source_citations punti a un'uscita della stampa specializzata regionale, esattamente il tipo di fonte che un'API di ranking non mette in priorità. Poiché ogni evento è già strutturato, puoi inserire i record validati direttamente in una pipeline RAG o archiviarli e incorporarli in un database vettoriale senza passaggi intermedi di scraping o pulizia. Quel risparmio di passaggi è la vera vittoria di produttività.

Come Si Chiama CatchAll in Python? (Avvio Rapido con il Codice)

Ottieni una chiave API, fai un POST della tua query a /v3/search con l'header x-api-token, e analizza l'array events. Questo è il loop completo. Ecco una chiamata Python minimale:

python
import requests

resp = requests.post(
    "https://api.newscatcherapi.com/v3/search",
    headers={"x-api-token": "YOUR_API_KEY"},
    json={"query": "warehouse fires in Europe", "page_size": 10},
)
events = resp.json()["events"]
for ev in events:
    print(ev["title"], "—", ev["relevance"])

Consiglio pratico e avvertenza in uno: la modalità Lite restituisce in secondi ma si ferma intorno ai 100 risultati, mentre la modalità Base è asincrona e richiede circa 15 minuti per un job approfondito. Per la modalità Base invii e poi fai polling invece di bloccarti su una singola chiamata, quindi progetta il tuo agente per inviare-e-verificare, non per aspettare. Se stai integrando CatchAll in un agente, tipicamente la chiameresti come strumento tramite function calling. Verifica i parametri esatti della richiesta e il flag Lite-contro-Base nella documentazione CatchAll prima del rilascio; l'header di autenticazione è x-api-token.

Quanto Costa CatchAll? Esiste un Piano Gratuito?

I prezzi sono basati sull'utilizzo e tariffati per record validato, circa $0,10 per record, e zero risultati significa zero addebiti. Esiste un piano gratuito di circa 2.000 crediti alla registrazione più circa 10 ricerche al mese, senza carta di credito richiesta, così puoi eseguire un vero test di enumerazione prima di impegnarti.

Quel modello di zero-risultati-zero-addebiti conta per il lavoro di enumerazione: una query che legittimamente non ha eventi corrispondenti non consuma budget. Sulla domanda comune se l'API di ricerca di Google sia gratuita: Google e Bing nativi non fanno questo. Restituiscono link classificati, non eventi strutturati validati, e l'API di ricerca di Bing viene ritirata, il che è in parte il motivo per cui gli indici indipendenti stanno vivendo un momento di interesse.

Casi d'Uso Reali

CatchAll si adatta a qualsiasi lavoro in cui perdere un solo elemento è la modalità di fallimento. La conformità e il monitoraggio regolatorio si appoggiano ai Monitor e alla copertura dei documenti regolatori. L'intelligence competitiva si basa sulla Company Watchlist. Il monitoraggio della supply chain è il pattern degli incendi nei magazzini, osservare gli eventi di interruzione. La ricerca di mercato usa l'enumerazione sulla stampa specializzata.

Il pattern comune a tutti e quattro: stai costruendo una lista completa, poi agendo su di essa, spesso all'interno di un flusso di lavoro automatizzato di API di ricerca web per agenti AI. Alcune forme concrete:

  • Conformità: Monitor continuativo sulle azioni esecutive nel tuo settore, ogni ora.
  • Intelligence competitiva: Watchlist su tre entità rivali, risolte tra i loro nomi legali.
  • Supply chain: enumerazione degli eventi di interruzione (incendi, scioperi, richiami) vicino agli impianti dei tuoi fornitori.
  • Ricerca di mercato: scansione una-tantum in modalità Base di ogni lancio di prodotto in una nicchia questo trimestre.

I Benchmark: CatchAll È Davvero 3x Migliore di Exa?

Nel benchmark interno di Newscatcher di marzo 2026 su 32 query, CatchAll riporta F1 0,705 e recall del 79,8% (4.807 eventi), vincendo 27 delle 32 query contro Exa Websets, Parallel AI FindAll e OpenAI Deep Research. Newscatcher descrive questo come circa 3 volte più eventi rilevanti rispetto al campo. Ogni numero qui è del fornitore stesso.

Strumento (test Newscatcher marzo 2026, 32 query)F1Recall
CatchAll0,70579,8% (4.807 eventi)
Exa Websets0,31719,6%
Parallel AI FindAll0,1035,5%
OpenAI o3 / Deep Research0,0170,9%

Ora la parte onesta. Il benchmark rigoroso interno di Newscatcher riporta un recall del 79,8%; la homepage arrotonda a 86%. Citerò il numero più basso. Il dato del 79,8% proviene dalla tabella dettagliata a 32 query sulla pagina prodotto, mentre l'86% è una dichiarazione più arrotondata da un taglio diverso nella homepage e in un post del blog. Entrambi sono di Newscatcher. Parto dal numero più basso perché citare il numero interno più conservativo del fornitore è la mossa di credibilità che una pagina marketing non può fare. In ogni caso, il risultato direzionale ha retto nel mio test: il recall è genuinamente più alto rispetto agli strumenti ranking-first. Per il quadro completo, vedi come CatchAll si posiziona rispetto ad altri 12 API di ricerca AI nel nostro confronto delle migliori API di ricerca AI, e controlla la tabella originale sulla pagina prodotto di Newscatcher.

Limiti Onesti: Per Cosa CatchAll NON È Adatta

CatchAll ha quattro limiti reali che le pagine marketing non menzionano, e dovresti valutarli prima di sviluppare. Non è a bassa latenza, non è illimitata nella sua modalità veloce, non è ancora plug-and-play per gli agenti, e non è uno strumento di rank tracking. Nessuno di questi è però un dealbreaker assoluto; ognuno esclude un caso d'uso specifico.

  • La modalità Base è asincrona (~15 minuti per job). Strumento sbagliato per un chatbot che ha bisogno di una risposta in due secondi.
  • La modalità Lite si ferma intorno ai 100 risultati. Vuoi recall approfondito e veloce? Non puoi averli entrambi; il recall approfondito paga il costo della latenza.
  • Nessun server MCP ufficiale ancora. Devi configurare l'endpoint REST tu stesso. Se lo vuoi come strumento nativo per agenti, dovresti configurare l'endpoint REST come server MCP, nello stesso modo in cui costruiamo i server MCP che usiamo già.
  • Non è uno strumento SERP o di rank tracking. Non ti dirà dove ti posizioni su Google. Un lavoro completamente diverso.

Questa sezione è la parte che nessuna pagina di primo livello scriverà per te. Se la latenza asincrona o il server MCP mancante blocca il tuo caso d'uso, meglio scoprirlo qui che dopo l'integrazione.

Alternative a CatchAll e Quando Sceglierle

CatchAll vince sul recall grezzo per l'enumerazione, ma non è la scelta giusta per ogni lavoro di ricerca. Ecco sette alternative reali, ognuna con la condizione onesta "scegli questo invece." Nessun confronto artificioso.

StrumentoPosizionamento in una rigaScegli questo invece se…
Exa / Exa WebsetsRicerca neurale/semantica più Webset enumeratiVuoi la scoperta semantica e la rilevanza in stile embeddings rispetto al recall grezzo, con result set più piccoli e veloci.
Parallel AI (FindAll)API di enumerazione/ricerca agenticaSei già nell'ecosistema Parallel e vuoi il loro primitivo di ricerca in stile task.
OpenAI Deep ResearchRicerca web multi-step guidata da LLMVuoi un agente di ricerca chiavi in mano nello stack OpenAI e puoi tollerare il campionamento rispetto al recall esaustivo.
TavilyRicerca in formato citazione costruita per RAG/LangChainVuoi la ricerca RAG in tempo reale più semplice con estrazione in una chiamata e integrazioni native con i framework.
Brave Search APIIndice indipendente, privacy, SERP veloceHai bisogno di indipendenza dal fornitore più bassa latenza e una pagina di risultati classificati va bene.
SerpAPI / SerperScraping SERP Google/multi-motoreHai bisogno di rank tracking SEO, funzionalità SERP, o di replicare esattamente ciò che mostra Google.
LinkupRicerca focalizzata su fonti EU/publisherIl tuo caso d'uso è la copertura di publisher europei e la provenienza da fonti licenziate.

L'euristica rapida: enumerazione e monitoraggio puntano a CatchAll, RAG conversazionale punta a Tavily, scoperta semantica punta a Exa, e il rank tracking punta a SerpAPI.

Come Techsy Usa la Ricerca Recall-First nei Progetti di Agenti

In Techsy sviluppiamo agenti AI per clienti B2B, e la ricerca recall-first si inserisce perfettamente per i compiti di enumerazione e monitoraggio: pensa a un agente di conformità che ha bisogno della lista completa delle azioni esecutive, non dei primi cinque. Per quello utilizzeremo un'API recall-first come CatchAll, e onestamente ci rivolgiamo a Tavily o Exa quando il compito è RAG conversazionale o ricerca semantica. Scegliere il primitivo di ricerca sbagliato è uno degli errori più comuni che correggiamo nello sviluppo di agenti. Vuoi un aiuto nella scelta? Richiedi una consulenza gratuita.

Sull'Autore

Mert Batur è Cofondatore di Techsy.io, dove il team sviluppa agenti AI, sistemi di automazione e pipeline vocali/SDR per clienti B2B. Scrive dello stack di strumenti LLM che il team di Techsy usa davvero in produzione. Connettiti su LinkedIn.

Domande Frequenti

Che cos'è la Newscatcher CatchAll API?

CatchAll è un'API di ricerca web recall-first di Newscatcher. Invece di una lista classificata di link, restituisce record di eventi strutturati, un oggetto JSON per evento reale, ognuno con citazioni delle fonti e entità estratte. È costruita per agenti AI, ricerca enterprise e compiti di monitoraggio in cui trovare ogni evento rilevante conta più dell'ordinamento di una lista breve.

In cosa si differenzia CatchAll da una normale API di ricerca (SERP)?

Un'API SERP classifica e restituisce il gruppetto di link in cima, ottimizzando per "cosa dovrei leggere prima." CatchAll ottimizza per la completezza, scansionando 50.000+ pagine per job e raggruppandole in eventi strutturati deduplicati. Ottieni un oggetto per evento con citazioni e entità, non una pagina HTML di risultati che devi fare scraping e analizzare tu stesso.

CatchAll è davvero 3x migliore di Exa Websets?

Newscatcher lo riporta nel proprio test interno di marzo 2026 su 32 query: CatchAll al 79,8% di recall e F1 0,705 contro Exa Websets al 19,6%, vincendo 27 delle 32 query, che descrivono come circa 3 volte più eventi rilevanti. Nota che la homepage arrotonda il recall a 86% da un taglio diverso. Tutti i numeri sono del fornitore; trattali come attribuiti, non verificati in modo indipendente.

Quanto costa CatchAll? Esiste un piano gratuito?

I prezzi sono basati sull'utilizzo e tariffati per record validato, circa $0,10 per record, con zero addebiti quando una query non restituisce risultati. Il piano gratuito offre circa 2.000 crediti alla registrazione più circa 10 ricerche al mese, senza carta di credito richiesta. È sufficiente per eseguire un vero test di enumerazione sul tuo caso d'uso prima di impegnare il budget.

Quanto è veloce CatchAll?

Dipende dalla modalità. Lite restituisce in secondi ma si ferma a circa 100 risultati. Base è asincrona e richiede circa 15 minuti per job, senza limite di risultati, per l'enumerazione approfondita. Per i job in modalità Base invii e poi fai polling invece di bloccarti su una chiamata, quindi non è adatta per niente che abbia bisogno di una risposta sub-secondo come un chatbot live.

CatchAll ha un server MCP?

Non ancora uno ufficiale. Per usarla oggi come strumento nativo per agenti, devi configurare tu stesso l'endpoint REST, lo stesso pattern trattato nella nostra guida MCP. È un sottile wrapper attorno a un singolo POST a /v3/search, quindi costruire un piccolo server MCP attorno ad essa è semplice se il tuo stack già parla il protocollo.

Cosa sono Monitor e Watchlist?

I Monitor sono ri-esecuzioni pianificate, minimo orarie, che restituiscono solo i nuovi eventi deduplicati dall'ultima esecuzione, trasformando una ricerca una-tantum in una sorveglianza continuativa. Le Watchlist filtrano i risultati per entità con un punteggio di rilevanza da 1 a 10 e risolvono la stessa azienda tra lingue e giurisdizioni. Insieme coprono il monitoraggio della conformità e l'intelligence competitiva senza ri-interrogare il web intero ogni volta.

Posso usare CatchAll per il tracking del ranking SEO?

No. CatchAll restituisce eventi strutturati validati, non classifiche dei motori di ricerca, quindi non ti dirà dove si trova la tua pagina su Google. Per il rank tracking, le funzionalità SERP o per replicare esattamente ciò che mostra Google, usa SerpAPI o Serper. CatchAll e gli strumenti di rank tracking risolvono problemi genuinamente diversi pur toccando entrambi la "ricerca web."

Per quali casi d'uso è più adatta CatchAll?

Compiti di enumerazione e monitoraggio in cui la completezza è fondamentale: conformità e monitoraggio regolatorio, intelligence competitiva, monitoraggio delle interruzioni della supply chain e ricerca di mercato sulla stampa specializzata. Il filo comune è che perdere un singolo evento rilevante è la modalità di fallimento, che è esattamente ciò che la ricerca recall-first è progettata per prevenire. Per RAG conversazionale o ricerca semantica, uno strumento ranking-first si adatta meglio.

In sintesi: recall-first non è classificata, e questo è il punto. CatchAll scambia la latenza con la completezza, e per i compiti di enumerazione è il giusto compromesso. Esegui il piano gratuito sulla tua query più difficile prima di decidere, poiché puoi provare il piano gratuito di CatchAll senza carta di credito. Se l'attesa asincrona o il server MCP mancante è un dealbreaker, un'alternativa dalla tabella sopra ti servirà meglio.

Tag

newscatcher-catchall-apirecall-first-web-searchweb-search-api-for-ai-agentsstructured-web-search-apideep-research-api

Condividi questo articolo

Il Tuo Prossimo Passo

Hai un progetto in mente? Parliamone.

Prenota una call di 30 minuti. Ti ascoltiamo, capiamo il problema e ti diciamo se possiamo aiutarti.