
Lo scraping web su Okou
Dai un link a un agente e ti riporta quello che la pagina dice davvero, in testo pulito e leggibile. Senza iscriverti a nessun servizio di scraping.
Dati dal web · Nessuna configurazione · Due modalità di addebito, standard ed enhanced
Dai a un agente un link pubblico e ti legge la pagina: le parole, non i menu di navigazione, i banner dei cookie e i piè di pagina. Chiedila come testo pulito, oppure solo l'elenco dei suoi link quando si tratta di decidere cosa leggere dopo.
La lettura gira su Firecrawl ed è lì nel momento in cui la chiedi: nessuna configurazione, nessuna chiave, niente che il tuo team debba mantenere. Resta volutamente stretta: una pagina per richiesta. Trovare le pagine è compito della ricerca web, e tutto ciò che sta dietro un accesso o un clic appartiene al browser remoto.
Che cos'è Scraping web
Ogni ricerca arriva al punto in cui un risultato non basta e serve quello che la pagina dice davvero. Farlo bene è più difficile di quanto sembri. Le pagine caricano metà dei contenuti con degli script, e il testo utile sta in mezzo a menu, banner e pubblicità.
Su Okou quella parte è già risolta per te. L'agente invia un link pubblico e riceve la pagina come testo pulito che può leggere e riassumere, oppure come elenco di tutti i suoi link.
Alcune pagine resistono a una lettura normale. Per quelle esiste una modalità più forte, e l'agente deve chiederla, perché costa di più a pagina e devi poter vedere quando un workflow l'ha scelta.
È la stessa cosa che si cerca come API di scraping web. La differenza è che non devi cercarla: è già dentro l'esecuzione, quindi chiedi la pagina in un messaggio e l'agente riporta quello che c'è scritto.
Che cosa può fare Scraping web
Che cosa può farci un agente, e che cosa torna indietro quando lo fa.
Copertura e limiti
Che cosa non fa, detto subito, così nessuno costruisce un workflow attorno a qualcosa che è fuori portata.
Solo pagine pubbliche
Non c'è nessun accesso di mezzo: una pagina dietro un login, un paywall o un muro anti-bot è fuori portata. Per quello c'è il browser remoto.
Una pagina alla volta
Legge la pagina che gli indichi. Non gira per il resto del sito: leggere un sito intero significa chiedere pagina per pagina e pagare pagina per pagina.
La modalità costosa è una scelta
La maggior parte delle pagine si legge bene in modo normale. La modalità più forte costa di più e l'agente deve chiederla, così un workflow non diventa mai più caro di nascosto.
Quello che torna è informazione, non ordini
Il testo di una pagina web è trattato come qualcosa da leggere, mai come istruzioni da seguire. È questo che impedisce a una pagina ostile di convincere un agente a fare altro.
Quanto costa Scraping web
I servizi web si pagano in crediti per chiamata, non per token. Non c'è una fattura separata da riconciliare.
zero scrapeLeggere una pagina consuma crediti, e la modalità più forte costa più di quella normale. Non c'è altro da comprare e non c'è un minimo, quindi un flusso che legge tre pagine a settimana paga solo il lavoro che fa.
I nomi dei prodotti e i loghi appartengono ai rispettivi proprietari e compaiono qui solo per indicare su cosa gira ciascun servizio. Non implicano alcuna approvazione né alcuna partnership.
Configurazione e accesso
Niente da configurare
Niente da collegare. Nessuna registrazione, nessuna chiave da incollare, niente che finisca nel tuo elenco di connettori. È questa la differenza rispetto al connettore Firecrawl nel catalogo di Okou: il connettore lavora sul tuo account Firecrawl quando ne hai già uno, e questo è semplicemente lì, a disposizione di qualsiasi agente.
Chi può usarlo
Leggere pagine web è un permesso che distribuisci, non qualcosa che ogni agente possiede. Dallo agli agenti e alle persone che ne hanno bisogno, per il tempo che serve, e riprendilo senza toccare nient'altro di ciò che quell'agente sa fare.
Per che cosa i team usano Scraping web
Leggere la pagina dietro un risultato di ricerca
La ricerca ti dà un titolo e due righe. Quasi tutto il lavoro ha bisogno del corpo del testo: lo schema è cercare prima, scegliere i due o tre risultati che contano e leggere solo quelli.
Tenere d'occhio pagine che non hanno altra porta d'ingresso
Prezzi dei concorrenti, changelog, pagine di stato, avvisi normativi. Un agente programmato legge la pagina, la confronta con quella della settimana scorsa e ti avvisa solo quando qualcosa si è mosso.
Trasformare un documento lungo in materiale di lavoro
Una specifica, un bilancio annuale, un centro assistenza. Il testo pulito è la differenza tra il riassunto del documento e il riassunto del suo menu di navigazione.
Quando non usare Scraping web
Lascia perdere quando la pagina richiede un accesso, un clic o un modulo, e usa il browser remoto. Lascia perdere per leggere un sito intero, dove il costo a pagina cresce più in fretta di quanto valga la risposta. E lascia perdere quando la fonte pubblica dati propri, quasi sempre più stabili della lettura delle sue pagine.
Come si chiama altrove
La stessa cosa gira sul mercato con nomi diversi. Se hai già cercato uno di questi, ecco a che cosa corrisponde qui.
API di scraping web
Il nome consueto per pagare un servizio che recuperi una pagina e ne restituisca il testo. È esattamente questo. L'account e la chiave sono di Okou anziché tuoi.
Scraping senza scrivere uno scraper
Niente da costruire e niente da mantenere. Chiedi la pagina in un messaggio, e il recupero e la pulizia avvengono dentro l'esecuzione.
Da HTML a Markdown
La conversione che di solito ci si scrive da sé: entra una pagina HTML, esce Markdown pulito. Avviene prima che il testo arrivi all'agente, ed è per questo che un modello spende attenzione sul contenuto e non sul markup.
Scraping per l'IA o per gli LLM
Scraping il cui output è pensato per essere letto da un modello anziché analizzato da del codice. È lo stesso recupero, giudicato su quanto il testo sia leggibile e non su se un selettore corrisponde ancora.
Scraping senza codice
Qui nessuno scrive uno scraper. Chiedi la pagina in un messaggio e l'agente la recupera: è quello che si cerca quando si cerca lo scraping senza scrivere codice.
Scraping web a confronto
Scraping web contro costruirsi uno scraper
Stesso risultato, una quantità di lavoro molto diversa. Per conto proprio significa scegliere un servizio o scrivere il recupero, una chiave che qualcuno deve custodire e manutenzione ogni volta che una pagina cambia forma. Qui chiedi e leggi la risposta, e l'accesso è un permesso invece di un segreto condiviso.
Scraping web contro il connettore Firecrawl
Okou offre anche un connettore Firecrawl, ed è la scelta giusta se hai già un account Firecrawl e vuoi vedere lì l'utilizzo, o se ti serve qualcosa che questo servizio non copre. Quello integrato è giusto quando preferisci semplicemente chiedere e avere la pagina.
Scraping web contro pilotare tu un browser
Un browser che manovri tu è più capace e molto più faticoso, e alla fine devi comunque trasformare la pagina in testo leggibile. Usa il browser remoto quando il lavoro ha davvero bisogno di clic, e questo quando ti serve solo quello che la pagina dice.
In breve
Il modo predefinito di leggere una pagina web su Okou. Se la pagina è pubblica e ti serve quello che c'è scritto, questo è un passo solo, senza account, con un costo a pagina. Tutto ciò che richiede un accesso o un clic spetta al browser remoto.
Domande frequenti
Mi serve un account Firecrawl?
No. Leggere una pagina è una cosa che qualsiasi agente sa già fare, quindi basta chiederlo. Non c'è nessun account da creare e nessuna chiave da custodire.
In che cosa differisce dal connettore Firecrawl?
Il connettore lavora sul tuo account Firecrawl quando ne hai uno e vuoi vedere lì l'utilizzo. Il servizio integrato è pronto all'uso senza configurare niente.
Può leggere pagine dietro un login?
No. Apre pagine pubbliche senza alcun accesso. Usa il browser remoto, che può restare connesso ed essere ripreso in mano da una persona a metà strada.
Può leggere un sito intero?
Non da solo. Ogni lettura è una pagina: coprire un sito significa chiedere pagina per pagina, e ogni pagina è addebitata. Conviene fissare un limite.
Quanto costa leggere una pagina?
Crediti per lettura riuscita, con un costo più alto per la modalità più forte usata sulle pagine che resistono a una lettura normale. Quella modalità non viene mai scelta in silenzio.
È sicuro agire su ciò che torna indietro?
Trattalo come informazione. Okou gestisce il testo di una pagina web come materiale da leggere e non come istruzioni da seguire, ed è questo che impedisce a una pagina di dirottare l'agente che l'ha letta.
Mi serve comunque uno strumento di scraping?
Per avere il testo pulito di una pagina dentro un flusso, no: lo chiedi a un agente e ce l'hai. Se vuoi l'interfaccia e l'intero set di funzioni di un fornitore di scraping, collega il tuo account tramite il connettore.
Come si confronta il costo con un piano di scraping mio?
Gli strumenti di scraping vendono di solito piani mensili con un minimo. Qui leggere una pagina consuma crediti senza impegno mensile, il che si adatta a un flusso che legge poche pagine a settimana e va rifatto due conti a volumi molto alti.
Può restituire Markdown da far leggere a un modello?
Sì. Il Markdown pulito è la forma predefinita, ed è ciò che rende una pagina utilizzabile come contesto invece che come muro di markup.
Devo scrivere uno scraper o mantenere dei selettori?
No. Non c'è niente da scrivere e niente che si rompa quando una pagina viene ridisegnata, perché stai chiedendo il testo della pagina e non il contenuto di un elemento particolare.
Come si chiede Scraping web
Descrivi quello che vuoi in parole tue. L'agente capisce di quale servizio ha bisogno ed effettua le chiamate.
“Leggi questa pagina e dammi le cinque cose che contano, con le parole esatte per ciascuna.”
“Prendi i link da questo indice della documentazione, poi leggi i tre sui prezzi e confrontali.”
“Controlla ogni lunedì la pagina prezzi del nostro concorrente e avvisami solo se è cambiato qualcosa.”