Tous les services web

Le scraping web sur Okou

Donnez un lien à un agent et il revient avec ce que la page dit vraiment, en texte propre et lisible. Aucun prestataire de scraping chez qui s'inscrire.

Données web · Aucune mise en place · Deux modes de facturation, standard et enhanced

Donnez un lien public à un agent et il lit la page pour vous : les mots, pas les menus de navigation, les bandeaux de cookies et les pieds de page. Demandez la page en texte propre, ou seulement la liste de ses liens quand il s'agit de décider quoi lire ensuite.

La lecture repose sur Firecrawl et elle est là dès que vous la demandez : aucune configuration, aucune clé, rien que votre équipe doive maintenir. Le service reste volontairement étroit : une page par requête. Trouver les pages est le travail de la recherche web, et tout ce qui se trouve derrière une connexion ou un clic relève du navigateur distant.

Ce qu'est Scraping web

Toute recherche finit par atteindre le point où un résultat ne suffit plus et où il faut ce que la page dit vraiment. Y arriver est plus difficile qu'il n'y paraît. Les pages chargent la moitié de leur contenu par script, et le texte utile se niche entre les menus, les bandeaux et les publicités.

Sur Okou, cette partie est déjà réglée pour vous. L'agent envoie un lien public et récupère la page en texte propre qu'il peut lire et résumer, ou sous forme de liste de tous ses liens.

Certaines pages résistent à une lecture normale. Pour celles-là il existe un mode plus puissant, que l'agent doit demander explicitement, parce qu'il coûte plus cher par page et que vous devez pouvoir voir quand un workflow l'a choisi.

C'est ce que l'on cherche sous le nom d'API de scraping web. La différence, c'est que vous n'avez pas à chercher : c'est déjà dans l'exécution, donc vous demandez la page dans un message et l'agent rapporte ce qu'elle contient.

Ce que Scraping web sait faire

Ce qu'un agent peut en faire, et ce qui revient quand il le fait.

Ce que vous fournissezLe lien d'une page web publique
Ce qui revientLa page en texte propre et lisible, ou la liste de ses liens
Pour les pages récalcitrantesUn mode plus puissant que l'agent demande à dessein
Ce qu'il ne peut pas ouvrirTout ce qui est derrière une connexion

Portée et limites

Ce qu'il ne fait pas, dit d'emblée, pour que personne ne bâtisse un workflow autour de quelque chose qui est hors périmètre.

Pages publiques uniquement

Aucune connexion n'entre en jeu : une page derrière un login, un paywall ou un mur anti-robots est hors périmètre. C'est à cela que sert le navigateur distant.

Une page à la fois

Il lit la page que vous lui indiquez. Il ne se promène pas dans le reste du site : lire un site entier signifie donc demander page par page et payer page par page.

Le mode coûteux est un choix

La plupart des pages se lisent très bien en mode normal. Le mode puissant coûte davantage et l'agent doit le demander, si bien qu'un workflow ne devient jamais discrètement plus cher.

Ce qui revient est de l'information, pas des ordres

Le texte d'une page web est traité comme quelque chose à lire, jamais comme des instructions à suivre. C'est ce qui empêche une page hostile de convaincre un agent de faire autre chose.

Ce que coûte Scraping web

Les services web sont facturés en crédits par appel, pas par token. Il n'y a pas de facture fournisseur séparée à rapprocher.

FacturationDeux modes de facturation, standard et enhanced
Fonctionne surFirecrawl
Commandezero scrape

Lire une page consomme des crédits, et le mode renforcé coûte plus cher que le mode normal. Il n'y a rien d'autre à acheter et aucun minimum, donc un flux qui lit trois pages par semaine ne paie que le travail effectué.

Les noms de produits et les logos appartiennent à leurs propriétaires et figurent ici uniquement pour indiquer sur quoi repose chaque service. Ils n'impliquent ni approbation ni partenariat.

Mise en place et accès

Rien à mettre en place

Rien à connecter. Pas d'inscription, pas de clé à coller, rien d'ajouté à votre liste de connecteurs. C'est la différence avec le connecteur Firecrawl du catalogue Okou : le connecteur fonctionne sur votre propre compte Firecrawl lorsque vous en avez déjà un, et ceci est simplement là, utilisable par n'importe quel agent.

Qui peut l'utiliser

Lire des pages web est une permission que vous accordez, pas quelque chose que tout agent possède. Donnez-la aux agents et aux personnes qui en ont besoin, aussi longtemps qu'ils en ont besoin, et reprenez-la sans toucher à quoi que ce soit d'autre que cet agent sait faire.

Ce que les équipes font avec Scraping web

Lire la page derrière un résultat de recherche

La recherche vous donne un titre et deux lignes. La plupart du travail a besoin du corps du texte : le schéma est donc de chercher d'abord, choisir les deux ou trois résultats qui comptent, puis ne lire que ceux-là.

Surveiller des pages sans autre porte d'entrée

Tarifs d'un concurrent, changelogs, pages de statut, avis réglementaires. Un agent planifié lit la page, la compare à la semaine dernière et ne vous prévient que si quelque chose a bougé.

Transformer un long document en matière de travail

Une spécification, un rapport annuel, un centre d'aide. Le texte propre fait la différence entre un résumé du document et un résumé de son menu de navigation.

Quand ne pas utiliser Scraping web

Passez votre chemin quand la page demande une connexion, un clic ou un formulaire, et utilisez le navigateur distant. Passez votre chemin pour lire un site entier : le coût à la page s'accumule plus vite que la réponse ne le vaut. Et passez votre chemin quand la source publie ses propres données en bonne et due forme, presque toujours plus stables que la lecture de ses pages.

Comment cela s'appelle ailleurs

La même chose porte plusieurs noms sur le marché. Si vous avez cherché l'un d'eux, voici à quoi il correspond ici.

API de scraping web

Le nom courant du fait de payer un service pour récupérer une page et en renvoyer le texte. C'est exactement cela. Le compte et la clé appartiennent à Okou, pas à vous.

Du scraping sans écrire de scraper

Rien à construire et rien à maintenir. Vous demandez la page dans un message, et la récupération et le nettoyage se font dans l'exécution.

HTML vers Markdown

La conversion que l'on écrit d'habitude soi-même : une page HTML en entrée, du Markdown propre en sortie. Elle a lieu avant que le texte n'atteigne l'agent, et c'est pourquoi un modèle consacre son attention au contenu plutôt qu'au balisage.

Scraping web par IA ou pour LLM

Un scraping dont la sortie est destinée à être lue par un modèle plutôt qu'analysée par du code. C'est la même récupération, jugée sur la lisibilité du texte et non sur la validité d'un sélecteur.

Scraping web sans code

Ici personne n'écrit de scraper. Vous demandez la page dans un message et l'agent va la chercher — c'est ce que cherchent ceux qui cherchent du scraping sans code.

Scraping web comparé

Scraping web face à construire votre propre scraper

Le même résultat, une quantité de travail très différente. Par vous-même, c'est un service à choisir ou un récupérateur à écrire, une clé que quelqu'un doit garder en sécurité, et de la maintenance chaque fois qu'une page change de forme. Ici vous demandez et vous lisez la réponse, et l'accès est une autorisation plutôt qu'un secret partagé.

Scraping web face à le connecteur Firecrawl

Okou propose aussi un connecteur Firecrawl, et c'est le bon choix si vous avez déjà un compte Firecrawl et voulez y voir l'usage, ou s'il vous faut quelque chose que ce service ne couvre pas. L'intégré est le bon quand vous préférez simplement demander et obtenir la page.

Scraping web face à piloter un navigateur vous-même

Un navigateur que vous opérez est plus capable et bien plus lourd, et il reste ensuite à transformer la page en texte lisible. Prenez le navigateur distant quand le travail exige vraiment des clics, et ceci quand vous voulez simplement ce que dit la page.

En bref

La façon par défaut de lire une page web sur Okou. Si la page est publique et que vous voulez ce qu'elle contient, c'est une étape, aucun compte, et un coût à la page. Tout ce qui doit se connecter ou cliquer relève du navigateur distant.

Questions fréquentes

Ai-je besoin d'un compte Firecrawl ?

Non. Lire une page est quelque chose que tout agent sait déjà faire : vous le demandez, c'est tout. Il n'y a pas de compte à créer ni de clé à conserver.

En quoi est-ce différent du connecteur Firecrawl ?

Le connecteur fonctionne sur votre propre compte Firecrawl lorsque vous en avez un et que vous voulez y voir l'usage. Le service intégré est prêt à l'emploi, sans rien à configurer.

Peut-il lire des pages derrière un login ?

Non. Il ouvre des pages publiques sans connexion. Prenez le navigateur distant, qui peut rester connecté et qu'une personne peut reprendre en cours de route.

Peut-il lire un site entier ?

Pas tout seul. Chaque lecture est une page : couvrir un site signifie demander page par page, et chaque page est facturée. Il vaut mieux fixer une limite.

Combien coûte la lecture d'une page ?

Des crédits par lecture réussie, avec un montant plus élevé pour le mode puissant utilisé sur les pages qui résistent à une lecture normale. Ce mode n'est jamais choisi en silence.

Peut-on agir en confiance sur ce qui revient ?

Traitez-le comme de l'information. Okou considère le texte d'une page web comme de la matière à lire et non comme des instructions à suivre, ce qui empêche une page de détourner l'agent qui l'a lue.

Ai-je encore besoin d'un outil de scraping ?

Pour obtenir le texte propre d'une page à l'intérieur d'un flux, non : vous le demandez à un agent et vous l'avez. Si vous voulez l'interface et l'ensemble des fonctionnalités d'un prestataire de scraping, connectez votre propre compte via le connecteur.

Comment le coût se compare-t-il à une formule de scraping à moi ?

Les outils de scraping vendent en général des forfaits mensuels avec un minimum. Ici, lire une page consomme des crédits sans engagement mensuel, ce qui convient à un flux qui lit quelques pages par semaine et mérite d'être recalculé à très gros volume.

Peut-il renvoyer du Markdown lisible par un modèle ?

Oui. Le Markdown propre est la forme par défaut, et c'est ce qui rend une page utilisable comme contexte plutôt que comme un mur de balisage.

Dois-je écrire un scraper ou maintenir des sélecteurs ?

Non. Il n'y a rien à écrire et rien qui casse quand une page est refondue, parce que vous demandez le texte de la page et non le contenu d'un élément précis.

Comment demander Scraping web

Vous décrivez ce que vous voulez en langage courant. L'agent en déduit le service dont il a besoin et fait les appels.

Lire une page

Lis cette page et donne-moi les cinq points qui comptent, avec la formulation exacte de chacun.

Trouver quoi lire, puis le lire

Extrais les liens de cet index de documentation, puis lis les trois qui portent sur les tarifs et compare-les.

Surveiller une page dans le temps

Vérifie la page tarifs de notre concurrent chaque lundi et préviens-moi uniquement si quelque chose a changé.