
Newscatcher CatchAll API: Probé la Búsqueda Web Recall-First para Agentes IA
Le hice a la CatchAll API de Newscatcher una pregunta difícil: encuentra todos los incendios de almacenes en Europa este trimestre. No los diez primeros. Todos. Una API de búsqueda normal te devuelve una página de enlaces ordenados por relevancia y descarta en silencio la cola larga, lo cual está bien para "mejor pizza cerca de mí" y es inútil para una tarea de enumeración. Unos 15 minutos después, en modo Base, CatchAll devolvió eventos de prensa regional y publicaciones del sector que las APIs de búsqueda por ranking de nuestra comparativa de mejores APIs de búsqueda IA 2026 nunca encontraron. Cada resultado llegó como un objeto JSON estructurado, no como un enlace. Esa diferencia lo es todo.
Aquí va el resumen antes de entrar en los detalles técnicos.
Puntos Clave
- CatchAll es una API de búsqueda web recall-first: devuelve registros de eventos estructurados, no un SERP ordenado.
- Newscatcher reporta 79,8% de recall y F1 0,705 en 32 consultas; la página principal redondea esto a 86%.
- Dos modos: Lite (segundos, tope de unos 100 resultados) y Base (asíncrono, unos 15 minutos, sin límite).
- Ideal para tareas de enumeración (compliance, inteligencia competitiva, monitorización de cadena de suministro); no es un rastreador de posiciones SERP.
La búsqueda recall-first optimiza para encontrar todo, mientras que la búsqueda ranking-first optimiza para ordenar las pocas cosas que muestra. Grábate esa frase y el resto de esta reseña encaja solo.
¿Qué es CatchAll? (Búsqueda Web Recall-First, Explicada)
CatchAll es una API de búsqueda web recall-first de Newscatcher: en lugar de una lista ordenada de los ~10 primeros enlaces, devuelve un conjunto deduplicado de registros de eventos estructurados, cada uno como un único objeto JSON con citas y entidades extraídas. Recall-first significa que el objetivo es la exhaustividad: encontrar cada evento relevante, no ordenar una lista corta por relevancia.
Newscatcher lo ilustra con un ejemplo directo: si existen 200 eventos válidos y tu sistema muestra 5, tu recall es del 2,5%. Para "cuál es el mejor portátil", eso está bien. Para "cada acción regulatoria contra fintechs europeas este año", una respuesta del 2,5% es peor que inútil porque no ves lo que te falta.
Esa es la brecha de categoría que CatchAll cubre, y vale la pena entenderla aunque nunca te registres. El pitch de lanzamiento en YC lo llama "API de búsqueda web recall-first", y puedes leer el posicionamiento directamente en la página del producto CatchAll Web Search API de Newscatcher. El encuadre honesto: una API SERP responde "¿qué debería leer primero?"; CatchAll responde "¿cuál es la lista completa?"
Cómo Funciona CatchAll: El Pipeline de Recuperación y Validación
CatchAll ejecuta un pipeline de cinco etapas: la planificación de consultas reescribe tu prompt en múltiples ángulos de recuperación, la recuperación a gran escala escanea más de 50.000 páginas por trabajo, el algoritmo de Leiden agrupa páginas relacionadas en eventos únicos, un LLM valida cada grupo contra tu consulta, y los que superan la validación llegan como JSON estructurado. El recall viene del escaneo; la precisión viene de la validación.
Veamos cada etapa rápidamente:
- Planificación de consultas. Tu consulta se convierte en varios prompts de recuperación que cubren diferentes formulaciones y tipos de eventos, así que "incendio de almacén" también captura "incendio en depósito logístico."
- Recuperación a gran escala. Newscatcher dice que un trabajo extrae más de 50.000 páginas a unas 10.000 páginas por minuto, sin límite de resultados, alcanzando prensa regional, publicaciones del sector y registros regulatorios que los SERPs convencionales entierran.
- Agrupación. El algoritmo de Leiden agrupa páginas densamente conectadas en comunidades. En términos sencillos: 30 artículos sobre el mismo incendio en Róterdam se colapsan en un evento, no en 30 filas.
- Validación con LLM. Cada grupo se puntúa contra tu consulta y los irrelevantes se descartan. Esta etapa consume llamadas reales a LLM, así que en un stack de agentes en producción querrías enrutarlas a través de un LLM gateway para controlar el gasto y los fallbacks.
- Salida estructurada. Un objeto JSON por evento validado, con un schema dinámico.
Newscatcher reporta que indexa más de 2 millones de eventos reales diariamente, con nuevos eventos disponibles en menos de horas. El artículo técnico "The Architecture of Completeness" cubre los detalles internos del algoritmo de Leiden y la validación si quieres profundizar.
Aquí fue donde viví mi prueba de incendios de almacenes. Ejecuté la consulta de enumeración en modo Base, el trabajo tardó unos 15 minutos, y el valor apareció exactamente donde el pipeline promete: fuentes regionales y del sector, agrupadas en eventos discretos, que un SERP ordenado habría enterrado debajo del pliegue o ignorado por completo.
Características Clave: Monitors, Watchlists y Extracción de Eventos
Más allá de la búsqueda puntual, CatchAll incluye Monitors y Watchlists. Los Monitors son re-ejecuciones programadas (mínimo cada hora) que devuelven solo los eventos nuevos y deduplicados desde la última ejecución. Las Watchlists filtran por entidad con una puntuación de relevancia de 1 a 10 y resolución de entidades que identifica la misma empresa en diferentes idiomas y jurisdicciones.
Los Monitors convierten una búsqueda puntual en una vigilancia permanente: cada ejecución devuelve solo los eventos nuevos desde la última vez. Esa es la diferencia entre "busca en la web hoy" y "avísame en cuanto algo cambie."
Una advertencia honesta sobre el encuadre de "API de monitorización de eventos en tiempo real": aquí "tiempo real" significa re-ejecuciones cada hora, no streaming en subsegundo. Si necesitas notificaciones push en milisegundos, esto no es lo tuyo. Para un equipo de compliance que revisa dos veces al día, cada hora es más que suficiente. La Company Watchlist es lo más destacado para la inteligencia competitiva, ya que resuelve "Acme GmbH", "Acme Inc" y "Acme Holdings" como una sola entidad rastreada en lugar de tres con ruido.
La Salida JSON Estructurada (Con un Ejemplo Real)
Cada resultado es un evento como un único objeto JSON: un cluster_id, un title, una puntuación relevance, un array entities y un array source_citations. Sin scraping de HTML, sin lista de enlaces que parsear. Esto es lo que convierte a CatchAll en una API de búsqueda web estructurada real, no en un wrapper de SERP.
Aquí hay un evento truncado de mi prueba de incendios de almacenes, ligeramente limpiado pero real en forma:
{
"events": [
{
"cluster_id": "evt_8f21a",
"title": "Fire at logistics warehouse near Rotterdam",
"relevance": 9,
"entities": [
{"name": "Rotterdam", "type": "location"},
{"name": "Maasvlakte", "type": "facility"}
],
"source_citations": [
{
"url": "https://...",
"publisher": "regional trade press",
"published_at": "2026-..."
}
]
}
]
}Fíjate en que el array source_citations apunta a un medio de comercio regional, exactamente el tipo de fuente que una API de ranking desprioriza. Dado que cada evento ya está estructurado, puedes introducir los registros validados directamente en un pipeline RAG o almacenarlos y embeddizarlos en una base de datos vectorial sin ningún paso de scraping o limpieza de por medio. Ese paso ahorrado es la ganancia silenciosa de productividad.
¿Cómo Llamas a CatchAll desde Python? (Inicio Rápido)
Obtienes una API key, haces un POST de tu consulta a /v3/search con el header x-api-token, y parseas el array events. Ese es todo el bucle. Aquí tienes una llamada mínima en Python:
import requests
resp = requests.post(
"https://api.newscatcherapi.com/v3/search",
headers={"x-api-token": "YOUR_API_KEY"},
json={"query": "warehouse fires in Europe", "page_size": 10},
)
events = resp.json()["events"]
for ev in events:
print(ev["title"], "—", ev["relevance"])Consejo y trampa en uno: el modo Lite devuelve en segundos pero topa en unos 100 resultados, mientras que el modo Base es asíncrono y tarda unos 15 minutos por trabajo profundo. Para Base, envías y consultas por polling en lugar de bloquear una sola llamada, así que diseña tu agente para disparar-y-comprobar, no para esperar. Si estás integrando CatchAll en un agente, normalmente lo llamarías como una herramienta mediante function calling. Confirma los parámetros exactos de la petición y el flag Lite/Base contra la documentación de CatchAll antes de desplegar; el header de autenticación es x-api-token.
¿Cuánto Cuesta CatchAll? ¿Tiene Nivel Gratuito?
El precio es por uso y por registro validado, aproximadamente $0,10 por registro, y cero resultados significa cero coste. Hay un nivel gratuito de unos 2.000 créditos al registrarte más unas 10 búsquedas al mes, sin tarjeta requerida, así que puedes hacer una prueba de enumeración real antes de comprometerte.
Ese modelo de cero-resultados-cero-coste importa para el trabajo de enumeración: una consulta que legítimamente no tiene eventos coincidentes no quema presupuesto. Sobre la pregunta habitual de si la API de búsqueda de Google es gratuita, ni Google ni Bing nativos son esto. Devuelven enlaces ordenados, no eventos estructurados validados, y la Search API de Bing está siendo retirada, lo cual es parte de por qué los índices independientes están ganando protagonismo.
Casos de Uso Reales
CatchAll encaja en cualquier trabajo donde perder un elemento es el modo de fallo. El compliance y el seguimiento regulatorio se apoyan en los Monitors más su cobertura de registros regulatorios. La inteligencia competitiva funciona con la Company Watchlist. La monitorización de la cadena de suministro es el patrón de incendios de almacenes: vigilar eventos de disrupción. La investigación de mercado usa la enumeración sobre prensa del sector.
El patrón en los cuatro casos: estás construyendo una lista completa y actuando sobre ella, a menudo dentro de un flujo de trabajo automatizado de API de búsqueda web para agentes IA. Algunas formas concretas:
- Compliance: Monitor permanente sobre acciones de cumplimiento en tu sector, cada hora.
- Inteligencia competitiva: Watchlist sobre tres entidades rivales, resueltas por sus nombres legales.
- Cadena de suministro: enumeración de eventos de disrupción (incendios, huelgas, retiradas) cerca de tus instalaciones de proveedores.
- Investigación de mercado: escaneo en modo Base de cada lanzamiento de producto en un nicho este trimestre.
Los Benchmarks: ¿Es CatchAll Realmente 3x Mejor que Exa?
En el propio benchmark de Newscatcher de marzo de 2026 sobre 32 consultas, CatchAll reporta F1 0,705 y 79,8% de recall (4.807 eventos), ganando 27 de 32 consultas frente a Exa Websets, Parallel AI FindAll y OpenAI Deep Research. Newscatcher describe eso como aproximadamente 3 veces más eventos relevantes que el resto del campo. Cada número aquí es del propio proveedor.
| Herramienta (prueba Newscatcher, marzo 2026, 32 consultas) | F1 | Recall |
|---|---|---|
| CatchAll | 0,705 | 79,8% (4.807 eventos) |
| Exa Websets | 0,317 | 19,6% |
| Parallel AI FindAll | 0,103 | 5,5% |
| OpenAI o3 / Deep Research | 0,017 | 0,9% |
Ahora la parte honesta. El propio benchmark riguroso de Newscatcher dice 79,8% de recall; la página principal lo redondea a 86%. Citaremos el número menor. El 79,8% proviene de la tabla detallada de 32 consultas en la página del producto, mientras que el titular del 86% es una afirmación más redondeada de un corte diferente en la página principal y un post del blog. Ambas son de Newscatcher. Prefiero el número más conservador porque citar el dato interno más cauteloso del propio proveedor es el movimiento de confianza que una página de marketing no puede hacer. En cualquier caso, el hallazgo direccional se confirmó en mis pruebas: el recall es genuinamente más alto que con las herramientas ranking-first. Para el campo completo, compara CatchAll con otras 12 APIs de búsqueda IA en nuestra guía de las mejores APIs de búsqueda IA, y revisa la tabla en bruto por ti mismo en la página del producto de Newscatcher.
Límites Honestos: Para Qué NO es CatchAll
CatchAll tiene cuatro límites reales que las páginas de marketing entierran, y deberías sopesarlos antes de construir. No es de baja latencia, no tiene tope ilimitado en su modo rápido, todavía no es plug-and-play para agentes, y no es un rastreador de posiciones. Ninguno es un deal-breaker, pero cada uno descarta un caso de uso.
- El modo Base es asíncrono (~15 minutos por trabajo). Herramienta equivocada para un chatbot que necesita respuesta en dos segundos.
- El modo Lite topa en unos 100 resultados. ¿Quieres recall profundo rápido? No puedes tener ambas cosas; el recall profundo paga el coste de latencia.
- Todavía no hay servidor MCP oficial. Tienes que envolver el endpoint REST tú mismo. Si lo quieres como herramienta nativa de agente, tendrías que envolver el endpoint REST como servidor MCP, igual que hacemos con los servidores MCP que ya usamos.
- No es una herramienta SERP ni de rastreo de posiciones. No te dirá dónde estás posicionado en Google. Un trabajo completamente diferente.
Esta sección es la parte que ninguna página de primera parte escribirá por ti. Si la latencia asíncrona o la falta del servidor MCP destruye tu caso de uso, mejor saberlo aquí que después de la integración.
Alternativas a CatchAll y Cuándo Elegirlas
CatchAll gana en recall bruto para enumeración, pero no es la elección correcta para todo trabajo de búsqueda. Aquí hay siete alternativas reales, cada una con la condición honesta de "elige esta en su lugar". Sin hombres de paja.
| Herramienta | Posicionamiento en una línea | Elige esta en su lugar si… |
|---|---|---|
| Exa / Exa Websets | Búsqueda neural/semántica más Websets enumerados | Quieres descubrimiento semántico y relevancia estilo embeddings sobre recall bruto, con conjuntos de resultados más pequeños y rápidos. |
| Parallel AI (FindAll) | API de enumeración/investigación agéntica | Ya estás en el ecosistema Parallel y quieres su primitiva de investigación tipo tarea. |
| OpenAI Deep Research | Investigación web multi-paso impulsada por LLM | Quieres un agente de investigación llave en mano dentro del stack de OpenAI y puedes tolerar el muestreo sobre el recall exhaustivo. |
| Tavily | Búsqueda con forma de cita construida para RAG/LangChain | Quieres la búsqueda RAG en tiempo real más sencilla con extracción en una llamada e integraciones nativas con frameworks. |
| Brave Search API | Índice independiente, privacidad, SERP rápido | Necesitas independencia de proveedor más baja latencia y una página de resultados ordenados está bien. |
| SerpAPI / Serper | Scraping SERP de Google/multi-motor | Necesitas rastreo de posiciones SEO, características SERP, o reflejar exactamente lo que muestra Google. |
| Linkup | Búsqueda centrada en fuentes europeas/de editores | Tu caso de uso es cobertura de editores europeos y procedencia de fuentes licenciadas. |
La heurística rápida: enumeración y monitorización apuntan a CatchAll, RAG conversacional apunta a Tavily, descubrimiento semántico apunta a Exa, y rastreo de posiciones apunta a SerpAPI.
Cómo Usa Techsy la Búsqueda Recall-First en Proyectos de Agentes
En Techsy desarrollamos agentes IA para clientes B2B, y la búsqueda recall-first encaja perfectamente para tareas de enumeración y monitorización: imagina un agente de compliance que necesita la lista completa de acciones de cumplimiento, no los cinco primeros. Para eso recurrimos a una API recall-first como CatchAll, y honestamente recurrimos a Tavily o Exa cuando la tarea es RAG conversacional o búsqueda semántica. Elegir la primitiva de búsqueda equivocada es uno de los errores más comunes que corregimos en proyectos de agentes. ¿Necesitas ayuda para elegir? Solicita una consulta gratuita.
Sobre el Autor
Mert Batur es Cofundador de Techsy.io, donde el equipo desarrolla agentes IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Escribe sobre el stack de herramientas LLM que el equipo de Techsy usa realmente en producción. Conecta en LinkedIn.
Preguntas Frecuentes
¿Qué es la Newscatcher CatchAll API?
CatchAll es una API de búsqueda web recall-first de Newscatcher. En lugar de una lista ordenada de enlaces, devuelve registros de eventos estructurados, un objeto JSON por evento real, cada uno con citas de fuentes y entidades extraídas. Está construida para agentes IA, investigación empresarial y tareas de monitorización donde encontrar cada evento relevante importa más que ordenar una lista corta.
¿En qué se diferencia CatchAll de una API de búsqueda normal (SERP)?
Una API SERP ordena y devuelve el puñado de enlaces más relevantes, optimizando para "¿qué debería leer primero?". CatchAll optimiza para la exhaustividad, escaneando más de 50.000 páginas por trabajo y agrupándolas en eventos estructurados deduplicados. Obtienes un objeto por evento con citas y entidades, no una página de resultados HTML que tienes que scrapear y parsear tú mismo.
¿Es CatchAll realmente 3 veces mejor que Exa Websets?
Newscatcher lo reporta en su propia prueba de 32 consultas de marzo de 2026: CatchAll con 79,8% de recall y F1 0,705 frente a Exa Websets con 19,6%, ganando 27 de 32 consultas, lo que presentan como aproximadamente 3 veces más eventos relevantes. Ten en cuenta que la página principal redondea el recall a 86% desde un corte diferente. Todos los datos son del propio proveedor; trátalo como atribuido, no como auditado de forma independiente.
¿Cuánto cuesta CatchAll? ¿Tiene nivel gratuito?
El precio es por uso y por registro validado, unos $0,10 por registro, con coste cero cuando una consulta no devuelve resultados. El nivel gratuito da unos 2.000 créditos al registrarte más unas 10 búsquedas al mes, sin tarjeta requerida. Es suficiente para hacer una prueba de enumeración real contra tu propio caso de uso antes de comprometer presupuesto.
¿Qué rapidez tiene CatchAll?
Depende del modo. Lite devuelve en segundos pero topa en unos 100 resultados. Base es asíncrono y tarda unos 15 minutos por trabajo, sin límite de resultados, para enumeración profunda. Para trabajos en modo Base envías y consultas por polling en lugar de bloquear una sola llamada, así que no es adecuado para nada que necesite respuesta en subsegundo como un chatbot en directo.
¿Tiene CatchAll un servidor MCP?
Aún no hay uno oficial. Para usarlo como herramienta nativa de agente hoy, tienes que envolver el endpoint REST tú mismo, el mismo patrón cubierto en nuestra guía de MCP. Es un wrapper fino alrededor de un único POST a /v3/search, así que construir un pequeño servidor MCP a su alrededor es sencillo si tu stack ya habla el protocolo.
¿Qué son los Monitors y las Watchlists?
Los Monitors son re-ejecuciones programadas, mínimo cada hora, que devuelven solo los nuevos eventos deduplicados desde la última ejecución, convirtiendo una búsqueda puntual en una vigilancia permanente. Las Watchlists filtran resultados por entidad con una puntuación de relevancia de 1 a 10 y resuelven la misma empresa en diferentes idiomas y jurisdicciones. Juntos cubren el seguimiento de compliance y la inteligencia competitiva sin tener que re-consultar toda la web cada vez.
¿Puedo usar CatchAll para rastreo de posiciones SEO?
No. CatchAll devuelve eventos estructurados validados, no posiciones en motores de búsqueda, así que no te dirá dónde está tu página en Google. Para rastreo de posiciones, características SERP, o reflejar exactamente lo que muestra Google, usa SerpAPI o Serper en su lugar. CatchAll y los rastreadores de posiciones resuelven problemas genuinamente diferentes a pesar de que ambos tocan "búsqueda web."
¿Para qué casos de uso es mejor CatchAll?
Tareas de enumeración y monitorización donde la exhaustividad importa: compliance y seguimiento regulatorio, inteligencia competitiva, monitorización de disrupciones en la cadena de suministro, e investigación de mercado sobre prensa del sector. El hilo común es que perder un solo evento relevante es el modo de fallo, que es exactamente para lo que está diseñada la búsqueda recall-first. Para RAG conversacional o búsqueda semántica, encaja mejor una herramienta ranking-first.
Conclusión: recall-first no es ranking, y ese es el punto. CatchAll cambia latencia por exhaustividad, y para tareas de enumeración ese es el intercambio correcto. Ejecuta el nivel gratuito con tu consulta más difícil antes de decidir, ya que puedes probar el nivel gratuito de CatchAll sin tarjeta. Si la espera asíncrona o el servidor MCP faltante es un deal-breaker, una alternativa de la tabla anterior te servirá mejor.