全部Web服务

Okou上的网页抓取

给智能体一个链接,它把页面上真正写了什么带回来,是干净好读的正文。不用再去注册一家抓取服务商。

网页数据 · 无需配置 · 两种计费模式:标准与增强

把一个公开链接丢给智能体,它就替你把页面读出来:只要正文,不要导航菜单、cookie提示条和页脚。你可以要干净的正文,也可以在还没想好下一步读什么时,只要页面上的链接清单。

抓取跑在Firecrawl上,你一开口它就在:不用设置,不用密钥,团队也没有东西要维护。它的范围是刻意收窄的——一次请求只读一个页面。找页面是网页搜索的活,需要登录或点击才能拿到的内容则归远程浏览器管。

网页抓取是什么

任何研究任务都会走到这一步:搜索结果不够用了,你得知道页面上到底写了什么。把这件事做对,比看上去难。页面有一半内容是脚本加载出来的,有用的文字还夹在菜单、横幅和广告中间。

在Okou上,这部分已经替你解决好了。智能体发一个公开链接过去,拿回来的是可以直接阅读和总结的干净正文,或者页面上所有链接的清单。

有些页面用常规方式读不动。为此准备了一个更强的模式,而且必须由智能体主动要求,因为它单页成本更高,你也该看得到工作流什么时候选了它。

这就是大家在市面上到处挑的网页抓取API。区别在于你不用挑:它已经在这次运行里了,你在消息里说要读哪个页面,智能体就把上面的内容带回来。

网页抓取能做什么

智能体能用它做什么,做完又会拿回什么。

你给它什么一个公开网页链接
拿回什么干净好读的页面正文,或者页面上的链接清单
遇到难啃的页面由智能体主动要求的更强模式
它打不开什么任何需要登录才能看的内容

覆盖范围与限制

把它做不到的事先说清楚,免得有人围着能力范围之外的东西去设计工作流。

只读公开页面

整个过程不涉及登录,所以登录墙、付费墙或反爬墙后面的页面不在范围内。那是远程浏览器该做的事。

一次一个页面

它只读你指定的那个页面,不会顺着站点到处爬,所以读完整个网站就意味着一页一页地问、一页一页地付费。

贵的模式是主动选的

多数页面用常规方式就读得好。更强的模式更贵,必须由智能体主动要求,所以工作流不会悄悄变贵。

拿回来的是信息,不是指令

网页上的文字一律当作供阅读的材料,绝不会被当成要执行的指令。正是这一点,让怀有恶意的页面没法把智能体说动去做别的事。

网页抓取怎么收费

Web服务按调用次数扣积分,不按token计费。也没有另一份厂商账单要对。

计费两种计费模式:标准与增强
运行在Firecrawl
命令zero scrape

读一个页面会消耗积分,更强的模式比常规模式贵。除此之外没有别的要买,也没有起步门槛,所以一周只读三个页面的工作流,就只为这三次付费。

产品名称和标识归各自所有者所有,出现在这里只是为了说明某项服务基于什么运行,不代表任何背书或合作关系。

设置与接入

无需设置

没有什么要连接。不用注册,不用粘贴密钥,也不会往你的连接器列表里加东西。这正是它和Okou目录里那个Firecrawl连接器的区别:连接器走的是你自己的Firecrawl账号,前提是你已经有一个;而这个服务就在那儿,任何智能体都能用。

谁可以用

读网页是一项你分配出去的权限,不是每个智能体天生就有。把它给需要的智能体和需要的人,需要多久就给多久;收回时也不用动这个智能体的其他能力。

团队都用网页抓取做什么

读搜索结果背后的页面

搜索只给你一个标题加两行字。大部分工作需要正文,所以常见做法是先搜索,挑出真正要紧的两三条结果,再只读这几个页面。

盯住没有别的入口的页面

竞品定价、更新日志、状态页、监管通告。定时运行的智能体读一遍页面,和上周对比,只在有变化时才告诉你。

把长文档变成能用的材料

一份规范、一份年报、一个帮助中心。有没有干净的正文,决定了你拿到的是这份文档的摘要,还是它导航菜单的摘要。

什么时候不该用网页抓取

页面需要登录、点击或填表时别用它,改用远程浏览器。要读完整个网站时别用它,单页成本涨得比答案的价值还快。数据源本身就对外提供正经数据时也别用它——直接取数几乎总是比读它的页面更稳。

别处怎么称呼它

同一件事在市场上有好几种叫法。如果你比较过其中某一类产品,这里说明它对应到这边的什么能力。

网页抓取API

花钱让一个服务去取页面、把正文交回来,通常就叫这个名字。它做的正是这件事。区别只是账号和密钥归Okou,不归你。

不用写爬虫的抓取

没有东西要开发,也没有东西要维护。你在消息里说要读哪个页面,取回和清洗都在这次运行里完成。

HTML转Markdown

大家平时自己动手写的那道转换:一页HTML进去,干净的Markdown出来。它在文字送到智能体之前就做完了,所以模型的注意力花在内容上,而不是标记上。

AI或LLM网页抓取

输出是给模型读的抓取,而不是给代码解析的。取页面的动作一样,评判标准变成文字是否好读,而不是某个选择器还能不能匹配上。

无代码网页抓取

这里没人写爬虫。你在消息里说要读哪个页面,取页面的活交给智能体——大家搜索「不写代码的抓取」时想要的正是这个。

网页抓取横向对比

网页抓取对比自己做一套抓取

产出一样,工作量差得远。自己做,就要挑一家服务商或者自己写取页面的程序,要有人保管密钥,页面每改一次版就得维护一次。在这里你问一句、读答案,使用权是一项权限,而不是一份共享的密钥。

网页抓取对比Firecrawl连接器

Okou同时提供Firecrawl连接器。如果你本来就有Firecrawl账号、希望用量记在那边,或者需要内置服务覆盖不到的能力,那就用连接器。内置服务适合你只想开口要一个页面、直接拿到内容的场景。

网页抓取对比自己操作浏览器

自己操作浏览器能力更强,但工作量也大得多,事后还得把页面转成能读的文本。任务确实需要点击时用云端浏览器,只想知道页面写了什么时就用它。

一句话总结

在Okou上读网页的默认方式。页面是公开的、你要的就是上面的内容,那就一步到位:不用账号,按页计费。需要登录或点击的事,交给云端浏览器。

常见问题

我需要Firecrawl账号吗?

不需要。读网页是每个智能体本来就会做的事,你开口就行。不用注册账号,也不用保管密钥。

它和Firecrawl连接器有什么区别?

连接器走你自己的Firecrawl账号,适合你已经有账号、也希望用量记在那边的情况。内置服务不用配置,开箱就能用。

它能读需要登录才能看的页面吗?

不能。它只打开无需登录的公开页面。这类页面请用云端浏览器:它能保持登录状态,中途还可以由人接手。

它能读完整个网站吗?

它自己做不到。每次读取只针对一个页面,想覆盖整站就得一页一页地要,每页都计费。建议设一个上限。

读一个页面要花多少积分?

每次读取成功按积分计费;遇到普通方式读不动的页面,会用更强的模式,费用更高。这个模式不会被悄悄启用。

拿回来的内容可以直接照着做吗?

把它当成信息看。Okou把网页文本当作可阅读的素材,而不是要执行的指令,这样一个页面就无法反过来指挥读它的智能体。

我还需要专门的抓取工具吗?

如果只是在工作流里拿到页面的干净文本,不需要:跟智能体说一声就有。如果你想要抓取厂商自己的仪表盘和完整功能,那就通过连接器接入你自己的账号。

和我自己买抓取套餐比,成本如何?

抓取工具通常按月售卖套餐,还有起步门槛。这里读一个页面消耗积分,没有按月的承诺,适合每周只读几页的工作流;量特别大的时候,值得先算一笔账。

它能返回Markdown给模型读吗?

可以。默认就是干净的Markdown,页面因此能当作上下文使用,而不是一堆标记。

我需要写爬虫或者维护选择器吗?

不需要。没有代码要写,页面改版也不会把什么弄坏,因为你要的是页面的文本,而不是某个元素里的内容。

怎么让智能体用网页抓取

你用日常语言说清楚要什么,智能体自己判断该用哪个服务,再去发起调用。

读一个页面

读这个页面,告诉我最要紧的五件事,每件都附上原文措辞。

先找再读

把这个文档索引页上的链接抓出来,再读其中和定价相关的三篇,做个对比。

持续盯一个页面

每周一检查竞品的定价页,只在有变化时告诉我。