
API-ul Newscatcher CatchAll: Am testat căutarea web orientată pe recall, construită pentru agenți AI
Am pus API-ului Newscatcher CatchAll o întrebare încăpățânată: găsește fiecare incendiu de depozit din Europa în acest trimestru. Nu primele zece. Pe toate. Un API normal de căutare îți oferă o pagină clasată de linkuri și renunță tacit la coada lungă, ceea ce este acceptabil pentru „cea mai bună pizza lângă mine”, dar inutil pentru o sarcină de enumerare. Aproximativ 15 minute mai târziu, în modul Base, CatchAll s-a întors cu evenimente din presa regională și publicațiile de specialitate pe care API-urile bazate pe ranking din testul nostru best-ai-search-apis-2026 nu le-au afișat niciodată. Fiecare rezultat a sosit sub forma unui singur obiect JSON structurat, nu un link. Această diferență este întreaga poveste.
Iată versiunea scurtă înainte de a intra în detalii tehnice.
Principalele concluzii
- CatchAll este un API de căutare web orientat pe recall: returnează înregistrări structurate de evenimente, nu o pagină de rezultate (SERP) clasată.
- Newscatcher raportează un recall de 79,8% și un scor F1 de 0,705 pe 32 de interogări; pagina principală rotunjește această cifră la 86%.
- Două moduri: Lite (secunde, capacitate de aproximativ 100 de rezultate) și Base (asincron, aproximativ 15 minute, fără limită).
- Ideal pentru sarcini de enumerare (conformitate, informații competitive, monitorizarea lanțului de aprovizionare); nu este un instrument de urmărire a rank-ului SERP.
Căutarea orientată pe recall optimizează găsirea tuturor elementelor, în timp ce căutarea orientată pe ranking optimizează ordonarea celor câteva elemente pe care le afișează. Păstrează această propoziție în minte și restul acestui review va deveni clar.
Ce este CatchAll? (Căutare web orientată pe recall, explicată)
CatchAll este un API de căutare web orientat pe recall de la Newscatcher: în loc de o listă clasată cu primele ~10 linkuri, returnează un set deduplicat de înregistrări structurate de evenimente, fiecare fiind un singur obiect JSON cu citări și entități extrase. Orientarea pe recall înseamnă că scopul este completitudinea, găsirea fiecărui eveniment relevant, nu ordonarea unei liste scurte după relevanță.
Newscatcher prezintă acest concept printr-o intuiție directă: dacă există 200 de evenimente valide și sistemul tău afișează 5, recall-ul tău este de 2,5%. Pentru „care este cel mai bun laptop”, este acceptabil. Pentru „fiecare acțiune de reglementare împotriva fintech-urilor din UE anul acesta”, un răspuns de 2,5% este mai rău decât inutil, deoarece nu poți vedea ce îți lipsește.
Aceasta este lacuna de categorie pe care CatchAll o vizează, iar merită înțeleasă chiar dacă nu te înscrii niciodată. Pitch-ul de lansare YC îl numește un „API de căutare web orientat pe recall”, iar poziționarea poate fi citită direct de pe pagina de produs Newscatcher's CatchAll Web Search API. Formularea onestă: un API SERP răspunde la „ce ar trebui să citesc mai întâi?”, iar CatchAll răspunde la „care este lista completă?”.
Cum funcționează CatchAll: Pipeline-ul de Recuperare + Validare
CatchAll rulează un pipeline în cinci etape: planificarea interogării rescrie promptul tău în multiple unghiuri de recuperare, recuperarea la scară largă scanează peste 50.000 de pagini per job, algoritmul Leiden clusterizează paginile conexe în evenimente unice, un LLM validează fiecare cluster în raport cu interogarea ta, iar supraviețuitoarele revin ca JSON structurat. Recall-ul provine din scanare; precizia provine din validare.
Să le descompunem rapid:
- Planificarea interogării. O singură interogare devine mai multe prompturi de recuperare care acoperă diferite formulări și tipuri de evenimente, astfel încât „incendiu de depozit” să prindă și „incendiu la hubul logistic”.
- Recuperare la scară largă. Newscatcher afirmă că un singur job extrage peste 50.000 de pagini la aproximativ 10.000 de pagini pe minut, fără limită de rezultate, ajungând la presa regională, publicațiile de specialitate și dosarele de reglementare pe care SERP-urile mainstream le îngroapă.
- Clusterizare. Algoritmul Leiden grupează paginile dens conectate în comunități. În termeni simpli: 30 de articole despre același incendiu din Rotterdam se colapsează într-un singur eveniment, nu în 30 de rânduri.
- Validare LLM. Fiecare cluster este punctat în raport cu interogarea ta, iar cele irelevante sunt eliminate. Această etapă costă apeluri LLM reale, așa că într-un stack de agenți de producție ai dori să direcționezi aceste apeluri printr-un LLM gateway pentru a controla cheltuielile și fallback-ul.
- Output structurat. Un obiect JSON per eveniment validat, cu o schemă dinamică.
Newscatcher raportează indexarea a peste 2 milioane de evenimente din lumea reală zilnic, cu evenimente noi care apar în câteva ore. Documentația tehnică, „The Architecture of Completeness”, acoperă detaliile interne ale algoritmului Leiden și ale validării dacă dorești o analiză profundă.
Aici a avut loc testul meu cu incendiile de depozite. Am rulat interogarea de enumerare în modul Base, jobul a durat aproximativ 15 minute, iar valoarea a apărut exact acolo unde promite pipeline-ul: surse regionale și de specialitate, clusterizate în evenimente discrete, pe care un SERP clasat le-ar fi îngropat sub fold sau le-ar fi omis complet.
Caracteristici cheie: Monitoare, Liste de supraveghere și Extracție de evenimente
Dincolo de căutarea one-off, CatchAll include Monitoare și Liste de supraveghere (Watchlists). Monitoarele sunt re-rulări programate (minim orar) care returnează doar evenimentele noi, deduplicate, de la ultima rulare. Listele de supraveghere filtrează după entitate, cu un scor de relevanță de 1-10 și o rezoluție a entităților care potrivește aceeași companie across limbi și jurisdicții.
Monitoarele transformă o căutare unică într-o supraveghere continuă: fiecare rulare returnează doar evenimentele care sunt noi față de cea anterioară. Aceasta este diferența dintre „caută pe web astăzi” și „spune-mi în momentul în care ceva se schimbă”.
O notă onestă privind framing-ul „API de monitorizare a evenimentelor în timp real”: „timp real” aici înseamnă re-rulări orare, nu streaming în sub-secundă. Dacă ai nevoie de notificări push în milisecunde, acesta nu este instrumentul potrivit. Pentru o echipă de conformitate care verifică de două ori pe zi, intervalul orar este mai mult decât suficient. Company Watchlist este punctul forte pentru intelligence competitiv, deoarece rezolvă „Acme GmbH”, „Acme Inc” și „Acme Holdings” într-o singură entitate urmărită, în loc de trei zgomotoase.
Output-ul JSON Structurat (Cu un exemplu real)
Fiecare rezultat este un eveniment ca un singur obiect JSON: un cluster_id, un title, un scor de relevance, un array entities și un array source_citations. Fără scraping HTML, fără listă de linkuri de parsat. Acest lucru face din CatchAll un genuin API de căutare web structurată, nu un wrapper SERP.
Iată un eveniment trunchiat din rularea mea cu incendiile de depozite, ușor curățat, dar real ca structură:
{
"events": [
{
"cluster_id": "evt_8f21a",
"title": "Fire at logistics warehouse near Rotterdam",
"relevance": 9,
"entities": [
{"name": "Rotterdam", "type": "location"},
{"name": "Maasvlakte", "type": "facility"}
],
"source_citations": [
{
"url": "https://...",
"publisher": "regional trade press",
"published_at": "2026-..."
}
]
}
]
}Observă că array-ul source_citations indică spre o publicație regională de specialitate, exact genul de sursă pe care un API de ranking o deprioritizează. Deoarece fiecare eveniment este deja structurat, poți introduce înregistrările validate direct într-un pipeline RAG sau le poți stoca și embedding-ui într-o bază de date vectorială fără un pas intermediar de scraping sau curățare. Acest pas economisit este câștigul discret de productivitate.
Cum apelezi CatchAll în Python? (Ghid rapid de cod)
Obții o cheie API, faci POST interogării tale către /v3/search cu header-ul x-api-token și parsezi array-ul events. Acesta este întregul ciclu. Iată un apel Python minimal:
import requests
resp = requests.post(
"https://api.newscatcherapi.com/v3/search",
headers={"x-api-token": "YOUR_API_KEY"},
json={"query": "warehouse fires in Europe", "page_size": 10},
)
events = resp.json()["events"]
for ev in events:
print(ev["title"], "—", ev["relevance"])Sfat pro și capcană într-unul singur: modul Lite returnează în secunde, dar are o limită de aproximativ 100 de rezultate, în timp ce modul Base este asincron și durează aproximativ 15 minute pentru un job profund. Pentru Base, submiti și polling-ezi, în loc să blochezi un singur apel, așa că proiectează-ți agentul să fire-and-check, nu să aștepte. Dacă integrezi CatchAll într-un agent, de obicei îl apelezi ca tool prin function calling. Confirmă parametrii exacti ai cererii și flag-ul Lite-versus-Base în documentația CatchAll înainte de lansare; header-ul de auth este x-api-token.
Cât costă CatchAll? Există un nivel gratuit?
Prețurile sunt bazate pe utilizare și pay-per-validated-record, aproximativ 0,10 USD per înregistrare, iar zero rezultate înseamnă zero costuri. Există un nivel gratuit de aproximativ 2.000 de credite la înscriere plus aproximativ 10 căutări pe lună, fără card necesar, astfel încât poți rula un test real de enumerare înainte de a te angaja.
Modelul zero-rezultate-zero-cost contează pentru munca de enumerare: o interogare care legitim nu are evenimente potrivite nu consumă bugetul. La întrebarea comună dacă API-ul de căutare Google este gratuit, căutările native Google și Bing nu sunt așa. Ele returnează linkuri clasate, nu evenimente structurate validate, iar API-ul de căutare Bing este retras, ceea este parte din motivul pentru care indecșii independenți au un moment favorabil.
Cazuri de utilizare din lumea reală
CatchAll se potrivește oricărei sarcini în care omiterea unui singur element este modul de eșec. Urmărirea conformității și reglementărilor se bazează pe Monitoare plus acoperirea dosarelor de reglementare. Intelligence-ul competitiv rulează pe Company Watchlist. Monitorizarea lanțului de aprovizionare este modelul incendiilor de depozite, urmărind evenimente de disrupție. Cercetarea de piață folosește enumerarea peste presa de specialitate.
Modelul在所有 patru cazuri: construiești o listă completă, apoi acționezi pe baza ei, adesea într-un flux de lucru automatizat API de căutare web pentru agenți AI. Câteva forme concrete:
- Conformitate: Monitor permanent pe acțiuni de aplicare a legii în sectorul tău, orar.
- Inteligență competitivă: Watchlist pe trei entități rivale, rezolvate across numele lor legale.
- Lanț de aprovizionare: Enumerarea evenimentelor de disrupție (incendii, greve, retrageri de produse) lângă facilitățile furnizorilor tăi.
- Cercetare de piață: Scanare one-shot în modul Base a fiecărei lansări de produs într-o nișă în acest trimestru.
Benchmark-urile: Este CatchAll realmente de 3 ori mai bun decât Exa?
În propriul benchmark din martie 2026 al Newscatcher pe 32 de interogări, CatchAll raportează F1 0,705 și un recall de 79,8% (4.807 evenimente), câștigând 27 din 32 de interogări împotriva Exa Websets, Parallel AI FindAll și OpenAI Deep Research. Newscatcher descrie acest lucru ca fiind aproximativ de 3 ori mai multe evenimente relevante decât concurența. Fiecare număr de aici este al vendorului.
| Tool (Testul Newscatcher din martie 2026, 32 de interogări) | F1 | Recall |
|---|---|---|
| CatchAll | 0.705 | 79.8% (4.807 evenimente) |
| Exa Websets | 0.317 | 19.6% |
| Parallel AI FindAll | 0.103 | 5.5% |
| OpenAI o3 / Deep Research | 0.017 | 0.9% |
Acum partea onestă. Benchmark-ul riguros al Newscatcher spune 79,8% recall; pagina principală îl rotunjește la 86%. Vom cita numărul mai mic. Cifra de 79,8% provine din tabelul detaliat și datat de pe pagina de produs cu 32 de interogări, în timp ce titlul de 86% este o afirmație mai rotunjită dintr-o altă secțiune a paginii principale și un blog post. Ambele sunt ale Newscatcher. Merg pe cifra mai mică deoarece citarea numărului intern mai conservator al vendorului este mișcarea de încredere pe care o pagină de marketing nu o poate face. Indiferent, constatarea direcțională s-a menținut în testele mele: recall-ul este genuin mai mare decât al tool-urilor orientate pe ranking. Pentru câmpul complet, vezi cum se clasează CatchAll față de alte 12 API-uri de căutare AI în round-up-ul nostru best AI search APIs roundup și verifică tabelul brut tu însuți pe pagina de produs Newscatcher.
Limite oneste: Pentru ce NU este CatchAll
CatchAll are patru limite reale pe care paginile de marketing le îngroapă, și ar trebui să le cântărești înainte de a construi. Nu este low-latency, nu este nelimitat în modul său rapid, nu este încă plug-and-play pentru agenți și nu este un tracker de rank. Niciuna nu este un dealbreaker, dar fiecare exclude un caz de utilizare.
- Modul Base este asincron (~15 minute per job). Instrument greșit pentru un chatbot care are nevoie de un răspuns în două secunde.
- Modul Lite are o limită de aproximativ 100 de rezultate. Vrei recall profund rapid? Nu le poți avea pe ambele; recall-ul profund plătește taxa de latență.
- Niciun server MCP oficial încă. Înfășori endpoint-ul REST tu însuți. Dacă îl vrei ca tool nativ pentru agent, ai înfășura endpoint-ul REST ca server MCP, în același mod în care construim serverele MCP pe care le folosim deja.
- Nu este un instrument SERP sau de urmărire a rank-ului. Nu îți va spune unde te clasezi pe Google. Este o sarcină complet diferită.
Această secțiune este partea pe care nicio pagină first-party nu o va scrie pentru tine. Dacă latența asincronă sau lipsa serverului MCP îți omoară cazul de utilizare, mai bine afli aici decât după integrare.
Alternative CatchAll și când să le alegi
CatchAll câștigă la recall brut pentru enumerare, dar nu este alegerea corectă pentru fiecare sarcină de căutare. Iată șapte alternative reale, fiecare cu condiția onestă „alege asta în schimb”. Fără om de paie.
| Tool | Poziționare într-o linie | Alege asta în schimb dacă… |
|---|---|---|
| Exa / Exa Websets | Căutare neurală/semantică plus Websets enumerate | Vrei descoperire semantică și relevanță stil embeddings peste recall brut, cu seturi de rezultate mai mici și mai rapide. |
| Parallel AI (FindAll) | API agentic de enumerare/cercetare | Ești deja în ecosistemul Parallel și vrei primitiva lor de cercetare stil task. |
| OpenAI Deep Research | Cercetare web multi-step驱动 de LLM | Vrei un agent de research turnkey în stack-ul OpenAI și poți tolera sampling-ul peste recall-ul exhaustiv. |
| Tavily | Căutare shaped-citații construită pentru RAG/LangChain | Vrei cea mai simplă căutare RAG în timp real cu extracție one-call și integrări native de framework. |
| Brave Search API | Index independent, confidențialitate, SERP rapid | Ai nevoie de independență de vendor plus latență scăzută și o pagină de rezultate clasată este acceptabilă. |
| SerpAPI / Serper | Scraping SERP Google/multi-engine | Ai nevoie de urmărire rank SEO, feature-uri SERP sau să oglindești exact ce arată Google. |
| Linkup | Căutare focusată pe surse UE/editori | Cazul tău de utilizare este acoperirea editorilor europeni și proveniența surselor licențiate. |
Euristica rapidă: enumerarea și monitorizarea indică spre CatchAll, RAG conversațional indică spre Tavily, descoperirea semantică indică spre Exa, iar urmărirea rank-ului indică spre SerpAPI.
Cum folosește Techsy căutarea orientată pe recall în construcția de agenți
La Techsy, livrăm agenți AI pentru clienți B2B, iar căutarea orientată pe recall se integrează curat pentru sarcini de enumerare și monitorizare: gândeste-te la un agent de conformitate care are nevoie de lista completă a acțiunilor de aplicare a legii, nu de primele cinci. Vom apela la un API orientat pe recall precum CatchAll acolo și, onest, la Tavily sau Exa atunci când sarcina este RAG conversațional sau lookup semantic în schimb. Alegerea primitivii de căutare greșite este una dintre cele mai comune greșeli în construirea de agenți pe care le reparăm. Vrei ajutor la alegere? Obține o consultație gratuită.
Despre autor
Mert Batur Gurbuz este Co-Founder al Techsy.io, unde echipa livrează agenți AI, sisteme de automatizare și pipeline-uri voice/SDR pentru clienți B2B. Studiază la University of Birmingham și scrie despre stack-ul de tooling LLM pe care echipa Techsy îl folosește efectiv în producție. Conectează-te pe LinkedIn.
Întrebări frecvente
Ce este API-ul Newscatcher CatchAll?
CatchAll este un API de căutare web orientat pe recall de la Newscatcher. În loc de o listă clasată de linkuri, returnează înregistrări structurate de evenimente, un obiect JSON per eveniment din lumea reală, fiecare cu citări de sursă și entități extrase. Este construit pentru agenți AI, cercetare enterprise și sarcini de monitorizare unde găsirea fiecărui eveniment relevant contează mai mult decât ordonarea unei liste scurte.
Cum diferă CatchAll de un API normal de căutare (SERP)?
Un API SERP clasează și returnează primele câteva linkuri, optimizând pentru „ce ar trebui să citesc mai întâi”. CatchAll optimizează pentru completitudine, scanând peste 50.000 de pagini per job și clusterizându-le în evenimente structurate deduplicate. Primești un obiect per eveniment cu citări și entități, nu o pagină de rezultate HTML pe care trebuie să o scrape-uiești și parsezi tu însuți.
Este CatchAl really de 3 ori mai bun decât Exa Websets?
Newscatcher raportează acest lucru pe propriul test din martie 2026 pe 32 de interogări: CatchAll la 79,8% recall și F1 0,705 versus Exa Websets la 19,6%, câștigând 27 din 32 de interogări, ceea ce frame-uiesc ca fiind aproximativ de 3 ori mai multe evenimente relevante. Reține că pagina principală rotunjește recall-ul la 86% dintr-o altă secțiune. Toate cifrele sunt ale vendorului; tratează-le ca atribuite, nu auditate independent.
Cât costă CatchAll? Există un nivel gratuit?
Prețurile sunt bazate pe utilizare și pay-per-validated-record, aproximativ 0,10 USD per înregistrare, cu zero costuri când o interogare nu returnează rezultate. Nivelul gratuit oferă aproximativ 2.000 de credite la înscriere plus aproximativ 10 căutări pe lună, fără card necesar. Este suficient pentru a rula un test real de enumerare pe propriul caz de utilizare înainte de a angaja bugetul.
Cât de rapid este CatchAll?
Depinde de mod. Lite returnează în secunde, dar are o limită de aproximativ 100 de rezultate. Base este asincron și durează aproximativ 15 minute per job, fără limită de rezultate, pentru enumerare profundă. Pentru job-urile Base submiti și polling-ezi, în loc să blochezi un singur apel, deci este greșit pentru orice are nevoie de un răspuns sub-secundă, cum ar fi un chatbot live.
Are CatchAll un server MCP?
Nu unul oficial încă. Pentru a-l folosi ca tool nativ pentru agent astăzi, înfășori endpoint-ul REST tu însuți, același pattern acoperit în ghidul nostru MCP. Este un wrapper subțire în jurul unui singur POST către /v3/search, deci construirea unui mic server MCP în jurul lui este simplă dacă stack-ul tău vorbește deja protocolul.
Ce sunt Monitoarele și Listele de supraveghere?
Monitoarele sunt re-rulări programate, minim orar, care returnează doar evenimentele noi deduplicate de la ultima rulare, transformând o căutare one-off într-o supraveghere continuă. Listele de supraveghere filtrează rezultatele după entitate cu un scor de relevanță 1-10 și rezolvă aceeași companie across limbi și jurisdicții. Împreună acoperă urmărirea conformității și intelligence-ul competitiv fără a re-interoga întregul web de fiecare dată.
Pot folosi CatchAll pentru urmărirea rank-ului SEO?
Nu. CatchAll returnează evenimente structurate validate, nu rank-inguri de motoare de căutare, deci nu îți va spune unde se află pagina ta pe Google. Pentru urmărirea rank-ului, feature-urile SERP sau oglindirea exactă a ceea ce arată Google, folosește SerpAPI sau Serper în schimb. CatchAll și trackere-le de rank rezolvă probleme genuin diferite, deși ambele ating „căutarea web”.
Pentru ce cazuri de utilizare este CatchAll cel mai bun?
Sarcini de enumerare și monitorizare unde completitudinea contează: urmărirea conformității și reglementărilor, intelligence competitiv, monitorizarea disrupțiilor din lanțul de aprovizionare și cercetare de piață peste presa de specialitate. Firul comun este că omiterea unui singur eveniment relevant este modul de eșec, ceea este exact ceea ce căutarea orientată pe recall este concepută să prevină. Pentru RAG conversațional sau lookup semantic, un tool orientat pe ranking se potrivește mai bine.
Concluzia: orientarea pe recall nu este clasată, și acesta este punctul. CatchAll trade-uiește latența pentru completitudine, iar pentru sarcini de enumerare acesta este trade-ul corect. Rulează nivelul gratuit pe propria ta cea mai dificilă interogare înainte de a decide, deoarece poți încerca nivelul gratuit CatchAll fără card. Dacă așteptarea asincronă sau lipsa serverului MCP este un dealbreaker, o alternativă din tabelul de mai sus te va servi mai bine.