
API Newscatcher CatchAll: Testei a Pesquisa Web com Foco em Recall Criada para Agentes de IA
Fiz uma pergunta teimosa à API Newscatcher CatchAll: encontrar todos os incêndios em armazéns na Europa neste trimestre. Não os dez principais. Todos eles. Uma API de pesquisa normal entrega-lhe uma página classificada de links e descarta silenciosamente a "cauda longa", o que é aceitável para "melhor pizza perto de mim", mas inútil para uma tarefa de enumeração. Cerca de 15 minutos depois, no modo Base, o CatchAll devolveu eventos de imprensa regional e publicações setoriais que as APIs baseadas em ranking do nosso teste best-ai-search-apis-2026 nunca revelaram. Cada resultado chegou como um único objeto JSON estruturado, não como um link. Essa diferença é toda a história.
Aqui está a versão resumida antes de entrarmos nos detalhes técnicos.
Principais Conclusões
- O CatchAll é uma API de pesquisa web com foco em recall: devolve registos de eventos estruturados, não uma página de resultados de motor de busca (SERP) classificada.
- A Newscatcher reporta 79,8% de recall e F1 de 0,705 em 32 consultas; a página inicial arredonda este valor para 86%.
- Dois modos: Lite (segundos, limite aproximado de 100 resultados) e Base (assíncrono, cerca de 15 minutos, sem limite).
- Ideal para tarefas de enumeração (conformidade, inteligência competitiva, monitorização da cadeia de abastecimento); não é um rastreador de rankings de SERP.
A pesquisa com foco em recall otimiza para encontrar tudo, enquanto a pesquisa com foco em ranking otimiza para ordenar as poucas coisas que revela. Tenha esta frase em mente e o restante desta análise encaixará perfeitamente.
O Que É o CatchAll? (Pesquisa Web com Foco em Recall, Explicada)
O CatchAll é uma API de pesquisa web com foco em recall da Newscatcher: em vez de uma lista classificada dos ~10 principais links, devolve um conjunto desduplicado de registos de eventos estruturados, sendo cada um um único objeto JSON com citações e entidades extraídas. Foco em recall significa que o objetivo é a completude, encontrar todos os eventos relevantes, e não ordenar uma lista curta por relevância.
A Newscatcher apresenta isto com uma intuição direta: se existirem 200 eventos válidos e o seu sistema revelar apenas 5, o seu recall é de 2,5%. Para "qual é o melhor portátil", isso é aceitável. Para "todas as ações regulatórias contra fintechs da UE este ano", uma resposta de 2,5% é pior do que inútil, porque não consegue ver o que lhe está a escapar.
É essa lacuna de categoria que o CatchAl visa preencher, e vale a pena compreendê-la mesmo que nunca se inscreva. O pitch de lançamento da YC chama-lhe uma "API de pesquisa web com foco em recall", e pode ler o posicionamento diretamente na página do produto Newscatcher's CatchAll Web Search API. O enquadramento honesto: uma API de SERP responde a "o que devo ler primeiro?". O CatchAll responde a "qual é a lista completa?".
Como Funciona o CatchAll: O Pipeline de Recuperação + Validação
O CatchAll executa um pipeline de cinco etapas: o planeamento de consultas reescreve o seu prompt em múltiplos ângulos de recuperação, a recuperação em larga escala analisa mais de 50.000 páginas por trabalho, o algoritmo de Leiden agrupa páginas relacionadas em eventos únicos, um LLM valida cada cluster face à sua consulta e os sobreviventes regressam como JSON estruturado. O recall vem da varredura; a precisão vem da validação.
Vamos decompor isto rapidamente:
- Planeamento de consultas. A sua única consulta torna-se vários prompts de recuperação que cobrem diferentes formulações e tipos de eventos, por isso "incêndio em armazém" também captura "incêndio em depósito logístico".
- Recuperação em larga escala. A Newscatcher afirma que um único trabalho extrai mais de 50.000 páginas a cerca de 10.000 páginas por minuto, sem limite de resultados, alcançando imprensa regional, publicações setoriais e dossiers regulatórios que as SERP principais enterram.
- Agrupamento (Clustering). O algoritmo de Leiden agrupa páginas densamente conectadas em comunidades. Em termos simples: 30 artigos sobre o mesmo incêndio em Roterdão colapsam num único evento, não em 30 linhas.
- Validação por LLM. Cada cluster é pontuado face à sua consulta e os irrelevantes são descartados. Esta etapa consome chamadas reais de LLM, por isso, numa pilha de agentes de produção, gostaria de encaminhar essas chamadas através de um LLM gateway para controlar custos e fallbacks.
- Saída estruturada. Um objeto JSON por evento validado, com um esquema dinâmico.
A Newscatcher reporta indexar mais de 2 milhões de eventos do mundo real diariamente, com novos eventos a aparecerem em menos de horas. O artigo técnico, "The Architecture of Completeness", cobre os detalhes internos do Leiden e da validação se quiser aprofundar.
Foi aqui que o meu teste de incêndios em armazéns ocorreu. Executei a consulta de enumeração no modo Base, o trabalho demorou cerca de 15 minutos e o valor apareceu exatamente onde o pipeline promete: fontes regionais e setoriais, agrupadas em eventos discretos, que uma SERP classificada teria enterrado abaixo da dobra ou ignorado completamente.
Principais Funcionalidades: Monitores, Listas de Vigilância e Extração de Eventos
Para além da pesquisa pontual, o CatchAll inclui Monitores e Listas de Vigilância (Watchlists). Os Monitores são reexecuções agendadas (mínimo horário) que devolvem apenas os novos eventos desduplicados desde a última execução. As Listas de Vigilância filtram por entidade, com uma pontuação de relevância de 1-10 e resolução de entidades que corresponde à mesma empresa entre idiomas e jurisdições.
Os Monitores transformam uma pesquisa pontual numa vigilância contínua: cada execução devolve apenas os eventos que são novos desde a anterior. Essa é a diferença entre "pesquisar na web hoje" e "avisar-me no momento em que algo mudar".
Uma ressalva honesta sobre o enquadramento de "API de monitorização de eventos em tempo real": "tempo real" aqui significa reexecuções horárias, não streaming em subsegundos. Se precisar de notificações push em milissegundos, isto não é isso. Para uma equipa de conformidade que verifica duas vezes por dia, o horário é mais do que suficiente. A Lista de Vigilância de Empresas é o destaque para inteligência competitiva, pois resolve "Acme GmbH", "Acme Inc" e "Acme Holdings" numa única entidade rastreada em vez de três ruidosas.
A Saída JSON Estruturada (Com um Exemplo Real)
Cada resultado é um evento como um objeto JSON: um cluster_id, um title, uma pontuação de relevance, um array de entities e um array de source_citations. Sem raspagem de HTML, sem lista de links para analisar. É isto que faz do CatchAll uma genuína API de pesquisa web estruturada e não apenas um invólucro de SERP.
Aqui está um evento truncado da minha execução de incêndios em armazéns, ligeiramente limpo, mas real na forma:
{
"events": [
{
"cluster_id": "evt_8f21a",
"title": "Fire at logistics warehouse near Rotterdam",
"relevance": 9,
"entities": [
{"name": "Rotterdam", "type": "location"},
{"name": "Maasvlakte", "type": "facility"}
],
"source_citations": [
{
"url": "https://...",
"publisher": "regional trade press",
"published_at": "2026-..."
}
]
}
]
}Note que o array source_citations aponta para uma publicação comercial regional, exatamente o tipo de fonte que uma API de classificação desprioriza. Como cada evento já está estruturado, pode inserir os registos validados diretamente num pipeline RAG ou armazená-los e incorporá-los numa base de dados vetorial sem uma etapa intermédia de raspagem ou limpeza. Essa etapa poupada é a vitória silenciosa de produtividade.
Como Chamar o CatchAll em Python? (Início Rápido de Código)
Obtém uma chave de API, faz POST da sua consulta para /v3/search com o cabeçalho x-api-token e analisa o array events. Esse é todo o ciclo. Aqui está uma chamada mínima em Python:
import requests
resp = requests.post(
"https://api.newscatcherapi.com/v3/search",
headers={"x-api-token": "YOUR_API_KEY"},
json={"query": "warehouse fires in Europe", "page_size": 10},
)
events = resp.json()["events"]
for ev in events:
print(ev["title"], "—", ev["relevance"])Dica profissional e armadilha num só: o modo Lite devolve resultados em segundos, mas limita a cerca de 100 resultados, enquanto o modo Base é assíncrono e demora cerca de 15 minutos para um trabalho profundo. Para o Base, submete e sondeia em vez de bloquear numa única chamada, por isso desenhe o seu agente para disparar-e-verificar, não esperar. Se estiver a integrar o CatchAll num agente, normalmente chamá-lo-ia como uma ferramenta via chamada de função. Confirme os parâmetros exatos do pedido e a flag Lite-versus-Base contra a documentação do CatchAll antes de lançar; o cabeçalho de autenticação é x-api-token.
Quanto Custa o CatchAll? Existe um Plano Gratuito?
Os preços são baseados no uso e pagam por registo validado, cerca de $0,10 por registo, e zero resultados significa zero cobrança. Existe um plano gratuito de cerca de 2.000 créditos no registo mais cerca de 10 pesquisas por mês, sem necessidade de cartão, para que possa executar um teste de enumeração real antes de se comprometer.
Esse modelo de zero resultados-zero cobrança é importante para trabalhos de enumeração: uma consulta que legitimamente não tem eventos correspondentes não queima orçamento. Sobre a questão comum de saber se a API de pesquisa do Google é gratuita, as pesquisas nativas do Google e Bing não o são. Elas devolvem links classificados, não eventos estruturados validados, e a API de Pesquisa do Bing está a ser descontinuada, o que é parte da razão pela qual os índices independentes estão em alta.
Casos de Uso no Mundo Real
O CatchAll adapta-se a qualquer trabalho onde falhar um item seja o modo de falha. O rastreio de conformidade e regulatório depende dos Monitores mais a sua cobertura de dossiers regulatórios. A inteligência competitiva opera com a Lista de Vigilância de Empresas. A monitorização da cadeia de abastecimento segue o padrão dos incêndios em armazéns, observando eventos de disrupção. A investigação de mercado usa enumeração sobre a imprensa setorial.
O padrão em todos os quatro: está a construir uma lista completa e depois a agir sobre ela, muitas vezes dentro de um fluxo de trabalho automatizado de API de pesquisa web para agentes de IA. Algumas formas concretas:
- Conformidade: Monitor contínuo sobre ações de execução no seu setor, hourly.
- Inteligência competitiva: Lista de Vigilância em três entidades rivais, resolvidas através dos seus nomes legais.
- Cadeia de abastecimento: Enumeração de eventos de disrupção (incêndios, greves, recalls) perto das instalações dos seus fornecedores.
- Investigação de mercado: Varredura única no modo Base de todos os lançamentos de produtos num nicho neste trimestre.
Os Benchmarks: É o CatchAll Realmente 3x Melhor Que o Exa?
No benchmark próprio da Newscatcher de março de 2026 com 32 consultas, o CatchAll reporta F1 de 0,705 e 79,8% de recall (4.807 eventos), ganhando 27 de 32 consultas contra o Exa Websets, Parallel AI FindAll e OpenAI Deep Research. A Newscatcher descreve isso como aproximadamente 3x mais eventos relevantes do que a concorrência. Todos os números aqui são do próprio fornecedor.
| Ferramenta (Teste de março de 2026 da Newscatcher, 32 consultas) | F1 | Recall |
|---|---|---|
| CatchAll | 0,705 | 79,8% (4.807 eventos) |
| Exa Websets | 0,317 | 19,6% |
| Parallel AI FindAll | 0,103 | 5,5% |
| OpenAI o3 / Deep Research | 0,017 | 0,9% |
Agora a parte honesta. O benchmark rigoroso da própria Newscatcher diz 79,8% de recall; a página inicial arredonda para 86%. Vamos citar o número mais baixo. O valor de 79,8% vem da tabela datada e detalhada de 32 consultas na página do produto, enquanto a manchete de 86% é uma afirmação mais arredondada de um corte diferente na página inicial e num post de blogue. Ambos são da Newscatcher. Começo com o mais baixo porque citar o número interno mais conservador do próprio fornecedor é o movimento de confiança que uma página de marketing não pode fazer. De qualquer forma, a descoberta direcional manteve-se nos meus testes: o recall é genuinamente mais alto do que as ferramentas com foco em ranking. Para o campo completo, veja como o CatchAll se classifica contra outras 12 APIs de pesquisa de IA no nosso resumo das melhores APIs de pesquisa de IA e consulte a tabela bruta você mesmo na página do produto da Newscatcher.
Limitações Honestas: Para Que NÃO Serve o CatchAll
O CatchAll tem quatro limitações reais que as páginas de marketing escondem, e deve pesá-las antes de construir. Não é de baixa latência, não é ilimitado no seu modo rápido, ainda não é plug-and-play para agentes e não é um rastreador de rankings. Nenhum é impeditivo, mas cada um exclui um caso de uso.
- O modo Base é assíncrono (~15 minutos por trabalho). Ferramenta errada para um chatbot que precisa de uma resposta em dois segundos.
- O modo Lite limita a cerca de 100 resultados. Quer recall profundo rápido? Não pode ter ambos; o recall profundo paga o imposto de latência.
- Ainda não há servidor MCP oficial. Envolve o endpoint REST você mesmo. Se o quiser como uma ferramenta nativa de agente, deve envolver o endpoint REST como um servidor MCP, da mesma forma que construímos os servidores MCP que já usamos.
- Não é uma ferramenta de SERP ou rastreamento de rankings. Não lhe dirá onde se classifica no Google. Trabalho totalmente diferente.
Esta secção é a parte que nenhuma página de primeira mão escreverá para si. Se a latência assíncrona ou a falta do servidor MCP matar o seu caso de uso, é melhor saber agora do que após a integração.
Alternativas ao CatchAll e Quando Escolhê-las
O CatchAll vence no recall bruto para enumeração, mas não é a escolha certa para todos os trabalhos de pesquisa. Aqui estão sete alternativas reais, cada uma com a condição honesta de "escolha esta em vez disso". Sem espantalhos.
| Ferramenta | Posicionamento numa linha | Escolha esta em vez disso se… |
|---|---|---|
| Exa / Exa Websets | Pesquisa neural/semântica mais Websets enumerados | Querer descoberta semântica e relevância estilo embeddings em vez de recall bruto, com conjuntos de resultados menores e mais rápidos. |
| Parallel AI (FindAll) | API de enumeração/investigação agêntica | Já estiver no ecossistema Parallel e quiser a sua primitiva de investigação estilo tarefa. |
| OpenAI Deep Research | Investigação web multi-etapa orientada por LLM | Quiser um agente de investigação turnkey dentro da pilha OpenAI e puder tolerar amostragem em vez de recall exaustivo. |
| Tavily | Pesquisa formatada para citações construída para RAG/LangChain | Quiser a pesquisa RAG em tempo real mais simples com extração numa chamada e integrações nativas de framework. |
| Brave Search API | Índice independente, privacidade, SERP rápida | Precisar de independência de fornecedor mais baixa latência e uma página de resultados classificada for aceitável. |
| SerpAPI / Serper | Raspagem de SERP do Google/multi-motor | Precisar de rastreamento de ranking SEO, funcionalidades de SERP ou espelhar exatamente o que o Google mostra. |
| Linkup | Pesquisa focada em fontes da UE/editoras | O seu caso de uso for cobertura de editoras europeias e proveniência de fontes licenciadas. |
A heurística rápida: enumeração e monitorização apontam para o CatchAll, RAG conversacional aponta para o Tavily, descoberta semântica aponta para o Exa e rastreamento de rankings aponta para o SerpAPI.
Como a Techsy Usa Pesquisa com Foco em Recall em Construções de Agentes
Na Techsy, entregamos agentes de IA para clientes B2B, e a pesquisa com foco em recall encaixa-se limparmente para trabalhos de enumeração e monitorização: pense num agente de conformidade que precisa da lista completa de ações de execução, não das cinco principais. Recorreremos a uma API com foco em recall como o CatchAll aí, e honestamente recorremos ao Tavily ou Exa quando a tarefa é RAG conversacional ou lookup semântico. Escolher a primitiva de pesquisa errada é um dos erros mais comuns na construção de agentes que corrigimos. Precisa de ajuda para escolher? Obtenha uma consulta gratuita.
Sobre o Autor
Mert Batur Gurbuz é Co-Fundador da Techsy.io, onde a equipa entrega agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na Universidade de Birmingham e escreve sobre a pilha de ferramentas LLM que a equipa da Techsy realmente usa em produção. Conecte-se no LinkedIn.
Perguntas Frequentes
O que é a API Newscatcher CatchAll?
O CatchAll é uma API de pesquisa web com foco em recall da Newscatcher. Em vez de uma lista classificada de links, devolve registos de eventos estruturados, um objeto JSON por evento do mundo real, cada um com citações de origem e entidades extraídas. Foi criado para agentes de IA, investigação empresarial e tarefas de monitorização onde encontrar todos os eventos relevantes importa mais do que ordenar uma lista curta.
Como difere o CatchAll de uma API de pesquisa normal (SERP)?
Uma API de SERP classifica e devolve o punhado principal de links, otimizando para "o que devo ler primeiro". O CatchAll otimiza para a completude, analisando mais de 50.000 páginas por trabalho e agrupando-as em eventos estruturados desduplicados. Obtém um objeto por evento com citações e entidades, não uma página de resultados HTML que tenha de raspar e analisar você mesmo.
É o CatchAll realmente 3x melhor que o Exa Websets?
A Newscatcher reporta-o no seu próprio teste de março de 2026 de 32 consultas: CatchAll com 79,8% de recall e F1 0,705 versus Exa Websets com 19,6%, ganhando 27 de 32 consultas, o que enquadraram como aproximadamente 3x mais eventos relevantes. Note que a página inicial arredonda o recall para 86% a partir de um corte diferente. Todos os valores são do próprio fornecedor; trate-os como atribuídos, não auditados independentemente.
Quanto custa o CatchAll? Existe um plano gratuito?
Os preços são baseados no uso e pagam por registo validado, cerca de $0,10 por registo, com zero cobrança quando uma consulta não devolve resultados. O plano gratuito oferece cerca de 2.000 créditos no registo mais cerca de 10 pesquisas por mês, sem necessidade de cartão. Isso é suficiente para executar um teste de enumeração real contra o seu próprio caso de uso antes de comprometer orçamento.
Quão rápido é o CatchAll?
Depende do modo. O Lite devolve em segundos, mas limita a cerca de 100 resultados. O Base é assíncrono e demora cerca de 15 minutos por trabalho, sem limite de resultados, para enumeração profunda. Para trabalhos Base, submete e sondeia em vez de bloquear numa chamada, por isso é errado para qualquer coisa que precise de uma resposta em subsegundos, como um chatbot ao vivo.
O CatchAll tem um servidor MCP?
Ainda não tem um oficial. Para o usar como uma ferramenta nativa de agente hoje, envolve o endpoint REST você mesmo, o mesmo padrão coberto no nosso guia MCP. É um invólucro fino em torno de um único POST para /v3/search, por isso construir um pequeno servidor MCP em torno dele é direto se a sua pilha já falar o protocolo.
O que são Monitores e Listas de Vigilância?
Os Monitores são reexecuções agendadas, mínimo horário, que devolvem apenas os novos eventos desduplicados desde a última execução, transformando uma pesquisa pontual numa vigilância contínua. As Listas de Vigilância filtram resultados por entidade com uma pontuação de relevância de 1-10 e resolvem a mesma empresa entre idiomas e jurisdições. Juntos, cobrem o rastreio de conformidade e inteligência competitiva sem reconsultar a web completa de cada vez.
Posso usar o CatchAll para rastreamento de ranking SEO?
Não. O CatchAll devolve eventos estruturados validados, não rankings de motores de busca, por isso não lhe dirá onde a sua página se situa no Google. Para rastreamento de rankings, funcionalidades de SERP ou espelhar exatamente o que o Google mostra, use o SerpAPI ou Serper em vez disso. O CatchAll e os rastreadores de rankings resolvem problemas genuinamente diferentes, apesar de ambos tocarem em "pesquisa web".
Para quais casos de uso é o CatchAll melhor?
Tarefas de enumeração e monitorização onde a completude importa: conformidade e rastreio regulatório, inteligência competitiva, monitorização de disrupções na cadeia de abastecimento e investigação de mercado sobre imprensa setorial. O fio condutor é que falhar um único evento relevante é o modo de falha, que é exatamente o que a pesquisa com foco em recall foi desenhada para prevenir. Para RAG conversacional ou lookup semântico, uma ferramenta com foco em ranking adapta-se melhor.
Em suma: recall-first não é classificado, e esse é o ponto. O CatchAll troca latência por completude, e para trabalhos de enumeração essa é a troca certa. Execute o plano gratuito na sua consulta mais difícil antes de decidir, já que pode experimentar o plano gratuito do CatchAll sem cartão. Se a espera assíncrona ou a falta do servidor MCP for impeditiva, uma alternativa da tabela acima servi-lo-á melhor.