Todos los servicios web

Scraping web en Okou

Dale un enlace a un agente y vuelve con lo que la página dice de verdad, en texto limpio y legible. Sin darte de alta en ningún proveedor de scraping.

Datos web · Sin configuración · Dos modos de facturación, standard y enhanced

Dale a un agente un enlace público y te lee la página: las palabras, no los menús de navegación, los avisos de cookies ni los pies de página. Pídela como texto limpio, o solo la lista de sus enlaces cuando lo que toca es decidir qué leer después.

La lectura funciona sobre Firecrawl y está ahí en cuanto la pides: sin configuración, sin clave y sin nada que tu equipo tenga que mantener. Se mantiene deliberadamente estrecha: una página por petición. Encontrar páginas es trabajo de la búsqueda web, y todo lo que está tras un inicio de sesión o un clic pertenece al navegador remoto.

Qué es Scraping web

Toda tarea de investigación llega al punto en que un resultado de búsqueda no basta y necesitas lo que la página dice de verdad. Hacerlo bien es más difícil de lo que parece. Las páginas cargan la mitad de su contenido con scripts, y el texto útil queda entre menús, banners y anuncios.

En Okou esa parte ya está resuelta por ti. El agente envía un enlace público y recibe la página como texto limpio que puede leer y resumir, o como una lista de todos sus enlaces.

Algunas páginas se resisten a una lectura normal. Para esas hay un modo más potente, y el agente tiene que pedirlo, porque cuesta más por página y deberías poder ver cuándo un flujo lo eligió.

Es lo mismo que la gente busca como API de scraping web. La diferencia es que no tienes que buscar: ya está en la ejecución, así que pides la página en un mensaje y el agente trae lo que hay en ella.

Qué puede hacer Scraping web

Qué puede hacer un agente con él y qué recibe cuando lo hace.

Qué le dasEl enlace de una página web pública
Qué recibesLa página como texto limpio y legible, o la lista de sus enlaces
Para páginas difícilesUn modo más potente que el agente pide a propósito
Qué no puede abrirCualquier cosa detrás de un inicio de sesión

Alcance y límites

Lo que no hace, dicho por delante, para que nadie planifique un flujo alrededor de algo que queda fuera.

Solo páginas públicas

No hay inicio de sesión de por medio, así que una página tras un login, un muro de pago o un muro antibots queda fuera. Para eso está el navegador remoto.

Una página cada vez

Lee la página que le señalas. No recorre el resto del sitio, así que leer un sitio entero significa pedir página a página y pagar página a página.

El modo caro es una elección

La mayoría de las páginas se leen bien en modo normal. El modo potente cuesta más y el agente tiene que pedirlo, así que un flujo nunca se encarece en silencio.

Lo que vuelve es información, no órdenes

El texto de una página web se trata como algo que leer, nunca como instrucciones que seguir. Eso es lo que impide que una página hostil convenza a un agente de hacer otra cosa.

Cuánto cuesta Scraping web

Los servicios web se facturan en créditos por llamada, no por token. No hay una factura de proveedor aparte que cuadrar.

FacturaciónDos modos de facturación, standard y enhanced
Se apoya enFirecrawl
Comandozero scrape

Leer una página consume créditos, y el modo más potente cuesta más que el normal. No hay nada más que comprar ni ningún mínimo, así que un flujo que lee tres páginas por semana solo paga el trabajo que hace.

Los nombres de producto y los logotipos pertenecen a sus propietarios y aparecen aquí solo para indicar sobre qué funciona cada servicio. No implican ningún respaldo ni ninguna asociación.

Configuración y acceso

Nada que configurar

Nada que conectar. Sin registro, sin clave que pegar, sin nada añadido a tu lista de conectores. Esa es la diferencia con el conector de Firecrawl del catálogo de Okou: el conector trabaja contra tu propia cuenta de Firecrawl cuando ya tienes una, y esto simplemente está ahí para que lo use cualquier agente.

Quién puede usarlo

Leer páginas web es un permiso que concedes, no algo que todo agente tenga. Dáselo a los agentes y a las personas que lo necesiten, durante el tiempo que lo necesiten, y retíralo sin tocar nada más de lo que ese agente puede hacer.

Para qué usan los equipos Scraping web

Leer la página que hay detrás de un resultado de búsqueda

La búsqueda te da un titular y dos líneas. Casi todo el trabajo necesita el cuerpo, así que el patrón es buscar primero, elegir los dos o tres resultados que importan y leer solo esos.

Vigilar páginas sin otra vía de entrada

Precios de la competencia, changelogs, páginas de estado, avisos regulatorios. Un agente programado lee la página, la compara con la semana pasada y solo te avisa cuando algo se ha movido.

Convertir un documento largo en material de trabajo

Una especificación, una memoria anual, un centro de ayuda. El texto limpio es la diferencia entre un resumen del documento y un resumen de su menú de navegación.

Cuándo no usar Scraping web

Sáltalo cuando la página necesite un inicio de sesión, un clic o un formulario, y usa el navegador remoto. Sáltalo para leer un sitio entero, donde el coste por página se acumula más rápido de lo que vale la respuesta. Y sáltalo cuando la fuente publique datos propios en condiciones, que casi siempre son más estables que leer sus páginas.

Cómo se llama esto en otros sitios

Lo mismo recibe varios nombres en el mercado. Si has buscado alguno de ellos, así es como se corresponde con lo que obtienes aquí.

API de scraping web

El nombre habitual de pagar a un servicio para que traiga una página y devuelva su texto. Eso es exactamente esto. La cuenta y la clave son de Okou, no tuyas.

Scraping sin escribir un scraper

Nada que construir y nada que mantener. Pides la página en un mensaje, y la descarga y la limpieza ocurren dentro de la ejecución.

De HTML a Markdown

La conversión que normalmente escribe uno mismo: entra una página de HTML, sale Markdown limpio. Ocurre antes de que el texto llegue al agente, y por eso el modelo dedica su atención al contenido y no al marcado.

Scraping web con IA o para LLM

Scraping cuya salida está pensada para que la lea un modelo y no para parsearla con código. Es la misma descarga, juzgada por si el texto se lee bien y no por si un selector sigue coincidiendo.

Scraping web sin código

Aquí nadie escribe un scraper. Pides la página en un mensaje y el agente la descarga, que es lo que busca quien busca scraping sin código.

Scraping web comparado

Scraping web frente a construir tu propio scraper

El mismo resultado, una cantidad de trabajo muy distinta. Por tu cuenta es elegir un servicio o escribir el descargador, una clave que alguien tiene que guardar y mantenimiento cada vez que una página cambia de forma. Aquí preguntas y lees la respuesta, y el acceso es un permiso en lugar de un secreto compartido.

Scraping web frente a el conector de Firecrawl

Okou también ofrece un conector de Firecrawl, y esa es la opción correcta si ya tienes una cuenta de Firecrawl y quieres el consumo ahí, o necesitas algo que este servicio no cubre. El integrado es el correcto cuando prefieres simplemente pedir y recibir la página.

Scraping web frente a manejar un navegador tú mismo

Un navegador que tú operas es más capaz y mucho más trabajo, y aún tienes que convertir la página en texto legible después. Usa el navegador remoto cuando el trabajo necesite clics de verdad, y esto cuando solo quieras lo que dice la página.

En resumen

La forma por defecto de leer una página web en Okou. Si la página es pública y quieres lo que hay en ella, es un paso, sin cuenta y con un cargo por página. Todo lo que necesite iniciar sesión o hacer clic pertenece al navegador remoto.

Preguntas frecuentes

¿Necesito una cuenta de Firecrawl?

No. Leer una página es algo que cualquier agente ya sabe hacer, así que solo lo pides. No hay cuenta que crear ni clave que guardar.

¿En qué se diferencia del conector de Firecrawl?

El conector trabaja contra tu propia cuenta de Firecrawl cuando ya tienes una y quieres el consumo ahí. El servicio integrado está listo para usar sin configurar nada.

¿Puede leer páginas tras un login?

No. Abre páginas públicas sin inicio de sesión. Usa el navegador remoto, que puede quedarse con la sesión iniciada y que una persona puede retomar a mitad de camino.

¿Puede leer un sitio entero?

Por sí solo no. Cada lectura es una página, así que cubrir un sitio significa pedir página a página, y cada página se cobra. Conviene poner un límite.

¿Cuánto cuesta leer una página?

Créditos por lectura correcta, con un cargo mayor para el modo potente que se usa en páginas que se resisten a una lectura normal. Ese modo nunca se elige en silencio.

¿Es seguro actuar según lo que devuelve?

Trátalo como información. Okou maneja el texto de una página web como material para leer y no como instrucciones que seguir, que es lo que impide que una página redirija al agente que la leyó.

¿Sigo necesitando una herramienta de scraping?

Para obtener texto limpio de una página dentro de un flujo, no: se lo pides a un agente y lo tienes. Si quieres la interfaz propia y el conjunto completo de funciones de un proveedor de scraping, conecta tu cuenta a través del conector.

¿Cómo se compara el coste con un plan de scraping propio?

Las herramientas de scraping suelen vender planes mensuales con un mínimo. Aquí leer una página consume créditos sin compromiso mensual, lo que encaja con un flujo que lee unas pocas páginas por semana y conviene recalcular a volúmenes muy altos.

¿Puede devolver Markdown para que lo lea un modelo?

Sí. El Markdown limpio es la forma por defecto, y es lo que convierte una página en contexto utilizable en lugar de un muro de marcado.

¿Tengo que escribir un scraper o mantener selectores?

No. No hay nada que escribir ni nada que se rompa cuando rediseñan una página, porque pides el texto de la página y no el contenido de un elemento concreto.

Cómo pides Scraping web

Describes lo que quieres en lenguaje corriente. El agente deduce qué servicio necesita y hace las llamadas.

Leer una página

Lee esta página y dame las cinco cosas que importan, con la formulación exacta de cada una.

Encontrar qué leer y luego leerlo

Saca los enlaces de este índice de documentación, luego lee los tres sobre precios y compáralos.

Vigilar una página con el tiempo

Revisa la página de precios de nuestro competidor cada lunes y avísame solo si algo ha cambiado.