
Le scraping web sur Okou
Donnez un lien à un agent et il revient avec ce que la page dit vraiment, en texte propre et lisible. Aucun prestataire de scraping chez qui s'inscrire.
Données web · Aucune mise en place · Deux modes de facturation, standard et enhanced
Donnez un lien public à un agent et il lit la page pour vous : les mots, pas les menus de navigation, les bandeaux de cookies et les pieds de page. Demandez la page en texte propre, ou seulement la liste de ses liens quand il s'agit de décider quoi lire ensuite.
La lecture repose sur Firecrawl et elle est là dès que vous la demandez : aucune configuration, aucune clé, rien que votre équipe doive maintenir. Le service reste volontairement étroit : une page par requête. Trouver les pages est le travail de la recherche web, et tout ce qui se trouve derrière une connexion ou un clic relève du navigateur distant.
Ce qu'est Scraping web
Toute recherche finit par atteindre le point où un résultat ne suffit plus et où il faut ce que la page dit vraiment. Y arriver est plus difficile qu'il n'y paraît. Les pages chargent la moitié de leur contenu par script, et le texte utile se niche entre les menus, les bandeaux et les publicités.
Sur Okou, cette partie est déjà réglée pour vous. L'agent envoie un lien public et récupère la page en texte propre qu'il peut lire et résumer, ou sous forme de liste de tous ses liens.
Certaines pages résistent à une lecture normale. Pour celles-là il existe un mode plus puissant, que l'agent doit demander explicitement, parce qu'il coûte plus cher par page et que vous devez pouvoir voir quand un workflow l'a choisi.
C'est ce que l'on cherche sous le nom d'API de scraping web. La différence, c'est que vous n'avez pas à chercher : c'est déjà dans l'exécution, donc vous demandez la page dans un message et l'agent rapporte ce qu'elle contient.
Ce que Scraping web sait faire
Ce qu'un agent peut en faire, et ce qui revient quand il le fait.
Portée et limites
Ce qu'il ne fait pas, dit d'emblée, pour que personne ne bâtisse un workflow autour de quelque chose qui est hors périmètre.
Pages publiques uniquement
Aucune connexion n'entre en jeu : une page derrière un login, un paywall ou un mur anti-robots est hors périmètre. C'est à cela que sert le navigateur distant.
Une page à la fois
Il lit la page que vous lui indiquez. Il ne se promène pas dans le reste du site : lire un site entier signifie donc demander page par page et payer page par page.
Le mode coûteux est un choix
La plupart des pages se lisent très bien en mode normal. Le mode puissant coûte davantage et l'agent doit le demander, si bien qu'un workflow ne devient jamais discrètement plus cher.
Ce qui revient est de l'information, pas des ordres
Le texte d'une page web est traité comme quelque chose à lire, jamais comme des instructions à suivre. C'est ce qui empêche une page hostile de convaincre un agent de faire autre chose.
Ce que coûte Scraping web
Les services web sont facturés en crédits par appel, pas par token. Il n'y a pas de facture fournisseur séparée à rapprocher.
zero scrapeLire une page consomme des crédits, et le mode renforcé coûte plus cher que le mode normal. Il n'y a rien d'autre à acheter et aucun minimum, donc un flux qui lit trois pages par semaine ne paie que le travail effectué.
Les noms de produits et les logos appartiennent à leurs propriétaires et figurent ici uniquement pour indiquer sur quoi repose chaque service. Ils n'impliquent ni approbation ni partenariat.
Mise en place et accès
Rien à mettre en place
Rien à connecter. Pas d'inscription, pas de clé à coller, rien d'ajouté à votre liste de connecteurs. C'est la différence avec le connecteur Firecrawl du catalogue Okou : le connecteur fonctionne sur votre propre compte Firecrawl lorsque vous en avez déjà un, et ceci est simplement là, utilisable par n'importe quel agent.
Qui peut l'utiliser
Lire des pages web est une permission que vous accordez, pas quelque chose que tout agent possède. Donnez-la aux agents et aux personnes qui en ont besoin, aussi longtemps qu'ils en ont besoin, et reprenez-la sans toucher à quoi que ce soit d'autre que cet agent sait faire.
Ce que les équipes font avec Scraping web
Lire la page derrière un résultat de recherche
La recherche vous donne un titre et deux lignes. La plupart du travail a besoin du corps du texte : le schéma est donc de chercher d'abord, choisir les deux ou trois résultats qui comptent, puis ne lire que ceux-là.
Surveiller des pages sans autre porte d'entrée
Tarifs d'un concurrent, changelogs, pages de statut, avis réglementaires. Un agent planifié lit la page, la compare à la semaine dernière et ne vous prévient que si quelque chose a bougé.
Transformer un long document en matière de travail
Une spécification, un rapport annuel, un centre d'aide. Le texte propre fait la différence entre un résumé du document et un résumé de son menu de navigation.
Quand ne pas utiliser Scraping web
Passez votre chemin quand la page demande une connexion, un clic ou un formulaire, et utilisez le navigateur distant. Passez votre chemin pour lire un site entier : le coût à la page s'accumule plus vite que la réponse ne le vaut. Et passez votre chemin quand la source publie ses propres données en bonne et due forme, presque toujours plus stables que la lecture de ses pages.
Comment cela s'appelle ailleurs
La même chose porte plusieurs noms sur le marché. Si vous avez cherché l'un d'eux, voici à quoi il correspond ici.
API de scraping web
Le nom courant du fait de payer un service pour récupérer une page et en renvoyer le texte. C'est exactement cela. Le compte et la clé appartiennent à Okou, pas à vous.
Du scraping sans écrire de scraper
Rien à construire et rien à maintenir. Vous demandez la page dans un message, et la récupération et le nettoyage se font dans l'exécution.
HTML vers Markdown
La conversion que l'on écrit d'habitude soi-même : une page HTML en entrée, du Markdown propre en sortie. Elle a lieu avant que le texte n'atteigne l'agent, et c'est pourquoi un modèle consacre son attention au contenu plutôt qu'au balisage.
Scraping web par IA ou pour LLM
Un scraping dont la sortie est destinée à être lue par un modèle plutôt qu'analysée par du code. C'est la même récupération, jugée sur la lisibilité du texte et non sur la validité d'un sélecteur.
Scraping web sans code
Ici personne n'écrit de scraper. Vous demandez la page dans un message et l'agent va la chercher — c'est ce que cherchent ceux qui cherchent du scraping sans code.
Scraping web comparé
Scraping web face à construire votre propre scraper
Le même résultat, une quantité de travail très différente. Par vous-même, c'est un service à choisir ou un récupérateur à écrire, une clé que quelqu'un doit garder en sécurité, et de la maintenance chaque fois qu'une page change de forme. Ici vous demandez et vous lisez la réponse, et l'accès est une autorisation plutôt qu'un secret partagé.
Scraping web face à le connecteur Firecrawl
Okou propose aussi un connecteur Firecrawl, et c'est le bon choix si vous avez déjà un compte Firecrawl et voulez y voir l'usage, ou s'il vous faut quelque chose que ce service ne couvre pas. L'intégré est le bon quand vous préférez simplement demander et obtenir la page.
Scraping web face à piloter un navigateur vous-même
Un navigateur que vous opérez est plus capable et bien plus lourd, et il reste ensuite à transformer la page en texte lisible. Prenez le navigateur distant quand le travail exige vraiment des clics, et ceci quand vous voulez simplement ce que dit la page.
En bref
La façon par défaut de lire une page web sur Okou. Si la page est publique et que vous voulez ce qu'elle contient, c'est une étape, aucun compte, et un coût à la page. Tout ce qui doit se connecter ou cliquer relève du navigateur distant.
Questions fréquentes
Ai-je besoin d'un compte Firecrawl ?
Non. Lire une page est quelque chose que tout agent sait déjà faire : vous le demandez, c'est tout. Il n'y a pas de compte à créer ni de clé à conserver.
En quoi est-ce différent du connecteur Firecrawl ?
Le connecteur fonctionne sur votre propre compte Firecrawl lorsque vous en avez un et que vous voulez y voir l'usage. Le service intégré est prêt à l'emploi, sans rien à configurer.
Peut-il lire des pages derrière un login ?
Non. Il ouvre des pages publiques sans connexion. Prenez le navigateur distant, qui peut rester connecté et qu'une personne peut reprendre en cours de route.
Peut-il lire un site entier ?
Pas tout seul. Chaque lecture est une page : couvrir un site signifie demander page par page, et chaque page est facturée. Il vaut mieux fixer une limite.
Combien coûte la lecture d'une page ?
Des crédits par lecture réussie, avec un montant plus élevé pour le mode puissant utilisé sur les pages qui résistent à une lecture normale. Ce mode n'est jamais choisi en silence.
Peut-on agir en confiance sur ce qui revient ?
Traitez-le comme de l'information. Okou considère le texte d'une page web comme de la matière à lire et non comme des instructions à suivre, ce qui empêche une page de détourner l'agent qui l'a lue.
Ai-je encore besoin d'un outil de scraping ?
Pour obtenir le texte propre d'une page à l'intérieur d'un flux, non : vous le demandez à un agent et vous l'avez. Si vous voulez l'interface et l'ensemble des fonctionnalités d'un prestataire de scraping, connectez votre propre compte via le connecteur.
Comment le coût se compare-t-il à une formule de scraping à moi ?
Les outils de scraping vendent en général des forfaits mensuels avec un minimum. Ici, lire une page consomme des crédits sans engagement mensuel, ce qui convient à un flux qui lit quelques pages par semaine et mérite d'être recalculé à très gros volume.
Peut-il renvoyer du Markdown lisible par un modèle ?
Oui. Le Markdown propre est la forme par défaut, et c'est ce qui rend une page utilisable comme contexte plutôt que comme un mur de balisage.
Dois-je écrire un scraper ou maintenir des sélecteurs ?
Non. Il n'y a rien à écrire et rien qui casse quand une page est refondue, parce que vous demandez le texte de la page et non le contenu d'un élément précis.
Comment demander Scraping web
Vous décrivez ce que vous voulez en langage courant. L'agent en déduit le service dont il a besoin et fait les appels.
“Lis cette page et donne-moi les cinq points qui comptent, avec la formulation exacte de chacun.”
“Extrais les liens de cet index de documentation, puis lis les trois qui portent sur les tarifs et compare-les.”
“Vérifie la page tarifs de notre concurrent chaque lundi et préviens-moi uniquement si quelque chose a changé.”