Back to all posts

如何在不减少使用的情况下降低 AI 智能体成本

如何在不减少使用的情况下降低 AI 智能体成本

看着积分余额不断减少,尤其是在使用 AI 智能体的头几周,难免会感到不安。但积分的消耗并不意味着你在错误地使用 Zero,通常恰恰说明 Zero 正在切实地完成工作。

让我们来看看普通的一个周二,这些工作是什么样子的。下班前,你要求对一家竞争对手进行分析。整夜,Zero 打开他们的定价页面,发现某个套餐层级有所变动,核实这究竟是真正的新变化还是对上个月内容的重新表述,从你的收件箱中调取相关邮件线索作为背景参考,判断这一变化是否值得关注,用四句话写成摘要,并发布到团队每天早上第一时间查看的频道。整个过程无需任何人监督,早上醒来答案就已经在那里了。

积分计量器之所以转动,正是因为这一系列操作。其中每一步都是一次判断:读哪个页面、差异是否重要、哪些内容可以省略、发送到哪里。你付费购买的正是这种判断力,也正因如此,输出结果才值得一读。

所以,更有价值的问题不是"这项工作为什么要花钱",而是"这项工作是否为其产出使用了恰当的智能、上下文和工具"。

这一区别至关重要,因为 AI 智能体并不是另一个 20 美元的软件席位。工具等你打开,然后按你的点击执行操作。而能够运行智能体工作流的 AI 助手则会按照你一次性设定的计划,在电子邮件、Slack、文档和数百个连接服务之间进行研究、起草、监控、跟进和切换。有意义的比较不是"另一个应用程序要多少钱",而是"这项工作如果交给一位团队成员或外部专家需要多少时间"。

20 美元的订阅定价的是软件访问权限,无法为某人一天的产出定价。以工具的标准来衡量,每一个积分看起来都很贵;以同事一个下午的工作来衡量,大多数积分看起来都很划算。这也是为什么以月度席位价格来选择最佳 AI 助手是在衡量错误的东西:席位价格告诉你的是访问权限的成本,而不是完成了什么工作。

一旦你改变了这个参照点,AI 自动化成本就变成了一个你可以主动设计的预算,而不是一个被动观察的计量器。目标不是减少使用 Zero,而是将昂贵的推理能力保留给真正能改变结果的时刻。这就是 AI 成本优化对于智能体的意义,也是在不削减智能体为你所做工作的前提下降低 AI 智能体成本的实际方法。这也是为什么 AI 智能体的成本无法用一个固定数字来概括:你的花费是由你掌控的四个决策决定的,而不是你一次性选择的某个方案。

影响大部分成本的四个变量:

  1. 哪个模型执行任务。
  2. 任务执行的频率。
  3. 模型需要读取和解析的上下文量。
  4. 任务使用了哪些外部能力。

第一个通常是最大的调节杠杆。

1. 让模型成本与任务相匹配

许多 AI 产品为你选择一个固定模型。这让体验变得简单,但也让每项任务都继承了相同的成本结构。

Zero 是模型中立的。你可以将不同的工作路由到不同的模型和提供商,包括受支持的订阅和你自己的 API 密钥。这意味着模型选择成为一个运营决策,而不是产品约束。

原则很简单:并非每项任务都需要最强大的可用模型。

以下两种情况通常值得使用最强大的可用模型:

  • 你尚不知道答案,甚至不知道从何入手。 你需要模型进行探索、挑战假设,并与你共同创造。
  • 交付结果需要特别可靠。 输出结果足够重要,额外的推理和验证可以避免代价高昂的返工。

对于判断简单的高频工作,使用你的工作区允许的最低成本模型。对于日常专业工作的大多数情况,使用中间层模型:比最轻量的选项更有能力,同时比在所有工作上使用最强模型要便宜得多。

工作类型模型层级示例
没有明确起点,或必须稳定的高风险交付最高能力共同制定战略、设计复杂计划、审查重要交付物
需要适度判断的日常工作中间层摘要、改写、结构化研究、常规邮件草稿
规则简单的大批量工作较低成本分类、标记、路由、字段提取、简短通知

你实际可以选择哪些模型

Zero 不运行单一的内置模型。打开聊天输入框旁边的模型选择器,你将看到你的工作区被授权使用的模型,来自两个系列:OpenAI 的 GPT 系列和 Anthropic 的 Claude Opus 系列。每个条目显示其路由方式,以及适用时的相对成本层级。

模型可用性是工作区设置,而不是固定的产品列表,因此你的选择器可能比同事的更短或更长。在假设某个模型不可用之前,请先检查一下,并查看 Zero 支持的模型 了解当前阵容。

这两个系列比具体的模型名称更重要。不同提供商之间的 LLM token 定价差异显著,同一任务在不同提供商上的成本可能相差数倍。大多数 LLM 成本优化建议止步于缩短提示词;而你拥有的最大杠杆——降低 LLM 成本——是从一开始就将工作路由到合适的模型。由于 Zero 允许你自主选择,这种价差就成为你可以掌控的杠杆,而不是你只能接受的费率。

在合适时使用自己的提供商

如果你的团队已经为受支持的提供商付费,你可以连接该账户并通过它路由模型。推理费用将按照你现有的条款出现在你自己的提供商账单上,而不是作为 Zero 推理积分收费。

这并不意味着整个运行是免费的。工具调用、连接器使用、存储和媒体生成仍然消耗 Zero 积分。你获得的是控制权:你可以为每种类型的工作决定提供商关系和模型。

切换只需一次点击。打开聊天输入框旁边的模型选择器,选择模型,该对话的其余部分就在该模型上运行。

2. 在优化提示词之前先设计自动化触发器

什么是智能体工作流,成本在哪里?

智能体工作流是你描述一次、然后由智能体端到端执行的任务,智能体自行决定任务所需的步骤和工具。在 Zero 中,这分为两个值得区分的概念:

  • 工作流是可复用的程序或技能,在有人调用时运行。
  • 自动化将触发器、工作流和智能体结合在一起,使工作无需每次都有人发起请求即可重复运行。

一次性请求只产生一次成本。自动化每次运行都会产生成本。这使得自动化设计成为复利节省的主要来源。如果你想了解这些在实践中的形态,我们的工作流自动化示例展示了如何为重复性工作构建 AI 智能体,而不是每次都手动重新发起请求。

将此视为你的 AI 成本计算器。一个有用的近似公式是:

monthly automation cost = number of runs × average cost per run

你可以减少等式的任意一侧,而两侧的行为方式不同:运行量是你一次性做出的调度决策,而每次运行的成本是你随时可以重新审视的模型决策。

根据真实业务需求设置频率

每小时运行一次的自动化每天执行 24 次。如果决策每天只需要三次更新,更改计划可将运行量减少 87.5%。

在选择节奏之前,先问一个问题:有人会多快对新结果采取行动?

竞争对手监控、注册摘要和内容检查通常不需要实时运行。让计划与决策的速度相匹配,而不是与产品允许的最短间隔相匹配。

优先使用事件触发器而非空轮询

计划会在无论是否有任何变化的情况下唤醒自动化。事件触发器仅在有内容需要处理时才启动,例如:

  • 新邮件到达。
  • GitHub 标签被应用。
  • 日历事件发生变化。
  • 收到表单提交或 webhook。

如果来源可以发出事件,就使用它。这样可以避免为智能体反复发现没有新工作而付费。

在自动化所在位置设置模型

大多数自动化运行是重复性且有边界的。它们执行提取、比较、分类、摘要或通知操作。最强大的模型可以完成这些工作,但其较高的成本会在每次触发器触发时重复产生。

自动化在你创建它的对话中运行,该对话保留了你在编辑器中选择的模型。因此,你在设置自动化时恰好使用的模型,就是以后每次运行所使用的模型,无论你是否在关注。请在那一刻有意识地选择它。如果某个自动化一直在使用你最强大的模型来分类几个条目并发布 Slack 消息,请在该线程上切换模型,之后的每次运行都会随之改变。

这也使模型选择成为个人而非全局的设置。两个人可以以不同的成本运行相同的工作流,因为每个人的工作流都携带各自编辑器中设置的模型。

这是一个在比较 AI 自动化成本与无代码自动化平台(如 Zapier 定价n8n 定价)时容易忽视的成本控制层。这些平台主要暴露任务或执行量。而使用 AI 智能体,你还可以控制每次执行内部使用的智能程度。

任务运行越频繁,你就越应该仔细选择其背后的模型。

3. 减少上下文并消除意外的模糊性

模型选择和运行频率是可见的。AI token 成本则更容易被忽视,因为上下文在每次对话轮次中都会悄悄计费,而不是一次性公告。

每一个额外的页面、消息、文件和之前的对话轮次都会给模型提供更多需要阅读的材料和更多需要考虑的路径。有些上下文是必不可少的,而无关的上下文只是付费的干扰。

目标不是让每个提示词都简短,而是让每个输入都相关。

为不相关的工作开启新对话

长对话会将其历史记录向前传递。如果新请求与旧任务毫无关系,请开启新线程,这样模型就不必将有用的上下文与昨天的讨论区分开来。

当连续性有帮助时,保持同一线程。当主题、结果或来源材料发生变化时,重新开始。

明确范围、规则和输出

模糊的请求会迫使智能体在执行任务之前先定义任务。清晰的提示词为其提供了直接执行的路径。

对于重复性工作,请明确:

  • 工具或数据来源。
  • 时间范围。
  • 要应用的规则或比较。
  • 输出格式和目的地。

比较以下两个提示词:

回顾我们的增长情况。

智能体首先必须决定"增长"是什么意思、检查哪个系统、使用哪个日期范围,以及什么样的答案是有用的。

从 Plausible 提取上周的注册数据,与前一周进行比较,并在 #growth 频道发布一句话结论。

第二个提示词有明确的边界。执行更快,更易于验证,也不太可能花费积分去探索错误的问题。

将开放式工作拆分为有边界的阶段

开放式探索并不总是浪费。当你真正需要一个思考伙伴时,使用强大的模型并让它自由探索。这正是第一部分中值得使用它的两种场景之一。

浪费发生在常规任务意外变成开放式任务的时候。

与其要求一个智能体"改善我们的市场推广策略",不如拆分工作:

  1. 从最近 30 次销售通话中提取客户异议。
  2. 将其归纳为五个反复出现的主题。
  3. 将这些主题与当前落地页进行比较。
  4. 请更强大的模型推荐三个影响最大的信息传递改变。

前三个阶段是有边界且可重复的,只有最后的判断才需要昂贵的模型。

4. 使用能完成工作的最轻量能力

模型只是智能体运行的一部分。搜索、浏览器交互、抓取、文件处理和媒体生成也有不同的成本结构。

同样的规则适用:使用能可靠产生结果的最轻量能力。

不要为普通图表使用生成式媒体

图像、视频和语音生成比纯文本或代码成本更高。如果任务是柱状图、折线图或简单的数据可视化,直接从数据生成即可。只有当输出真正需要艺术指导或设计视觉效果时,才使用图像模型。

给 Zero 提供已知的 URL

如果你已经知道来源页面,请直接提供 URL,不要让智能体搜索网络重新发现它。

对于内容静态的公开页面,直接获取或抓取通常就足够了。只有当页面需要身份验证、JavaScript 交互、截图或有状态导航时,才使用完整浏览器。

将积分花在工作本身上,而不是花在寻找工作入口上。

让 AI 智能体成本可见且可管理

AI 支出管理始于可见性:一旦你能看到积分实际流向哪里,成本优化就会容易得多。

打开设置,然后是积分余额,位于账单和定价下方。它显示你剩余的积分,并按对话逐一细分最近的支出,按实际消耗来源分类:LLM 模型、图像模型、视频模型、连接器等。在我的使用情况团队使用情况之间切换,并更改日期范围,以查看支出是你的还是团队的,以及是否在增加。

这就是你发现某个自动化悄悄花费超过其回报的地方:按最大行排序,阅读智能体实际在做什么。当你需要充值、更改计划或开启自动充值(以免长时间运行的自动化被中断)时,账单和发票也在同一菜单中。

然后优先审查成本最高的工作流。寻找四种常见模式:

  • 高能力模型附加到简单的重复工作上。
  • 可以被事件替代的轮询计划。
  • 比业务能够响应的速度更快的节奏。
  • 反复触发不必要研究的宽泛提示词。

你可以请 Zero 与你一起审查这些工作流。一个实用的初始提示词是:

审查我成本最高的三个自动化。对于每一个,识别我是否可以在不降低输出价值的情况下降低模型成本、运行频率、上下文或工具使用。

两三个月的这种视图也是真正进行 AI 预算规划的输入,因为你是根据自动化实际消耗的情况进行预测,而不是根据标题价格。这不是要将每次运行压缩到最便宜的可能配置。便宜但失败的工作是昂贵的。目标是恰好购买结果所需的智能和基础设施。

一次性构建系统,然后让它静默运行

AI 智能体最经济的使用方式不是让它永远重复相同的即兴任务,而是使用智能体帮助设计一个可靠的系统,然后让该系统以最少的干预运行。

这就是 Zero 背后的成本理念:

  • 当你需要共同创造或异常稳定的交付时,使用最强大的模型。
  • 对于日常专业工作,使用中间层模型。
  • 对于可预测的大批量步骤,使用较低成本的模型。
  • 仅在有工作存在时触发自动化。
  • 保持上下文相关,能力与任务相称。

选择哪个模型

上述层级对应你模型选择器中的真实条目。工作区可以允许更多或更少,但结构是相同的:

工作需求Zero 中的模型适用场景
最深度推理Claude Opus 5你尚不知道方法,或交付物必须一次做对
日常默认GPT 5.6 Sol摘要、改写、结构化研究、常规起草、大多数对话工作
每次运行成本最低GPT 5.6 Luna分类、标记、路由、字段提取、简短通知、大多数定时自动化

我们的建议,如果你本周只改变一件事:保持你的交互式聊天不变,将你最繁忙的自动化降低一个层级。重复性工作是模型选择不断重复的地方,因此也是单次改变产生复利效果的地方。从仍能保持质量的最低层级开始,将顶行保留给你真正在深入思考问题的对话。

做好这一点,"降低 AI 智能体成本"就不再意味着"减少使用 AI",而是让你的 AI 团队成员将其时间、上下文和智能花在最能创造价值的地方。这也是比较顶级 AI 智能体平台彼此之间以及与传统业务流程自动化软件之间最公平的方式:不是按标价,而是按单位支出实际完成了什么。

常见问题

为什么我不使用 Zero 时积分也在减少?

因为自动化按其触发器运行,而不是按你的关注运行。每小时触发一次的计划每天计费 24 次,无论是否有任何变化。打开使用情况视图,按计划排序,检查每个节奏是否仍与有人对结果采取行动的速度相匹配。

AI 智能体每月应该花多少钱?

没有单一的正确数字,将其与 20 美元的软件席位进行比较会误导你。有用的基准是它所替代的工作:团队成员的一个下午,或外部专家的发票。如果一个工作流的成本低于它节省的工时,那么无论积分额度看起来多大,它的定价都是合理的。

我应该为重复性自动化使用哪个模型?

从能保持质量的最低层级开始,通常对于分类、路由、提取和通知来说是 GPT 5.6 Luna。只对真正需要更深推理的那一步进行升级。由于运行继承了其所在对话中设置的模型,在那里更改它就会改变以后的每次运行。

AI 智能体比无代码自动化平台更贵吗?

按任务定价,通常是的。Zapier 和 n8n 按执行次数计费;智能体还需要为每次执行内部的智能付费。重要的比较是按完成的结果,因为传统自动化在应用之间移动数据,而智能体则读取数据、做出决策、起草内容并跟进。

Zero 是 AI 智能体构建器吗?

在实践中,是的。你用普通语言描述一项工作,Zero 将其转化为可复用的工作流,添加触发器就将该工作流变成可自行运行的自动化。无需连接节点画布,这也是为什么这里的成本控制是关于模型、节奏、上下文和能力,而不是关于步骤数量。

什么真正驱动 AI 智能体定价?

大致按以下顺序排列的四件事:任务背后的模型、任务运行的频率、它重新读取的上下文量,以及它调用的能力。公布的 AI 智能体成本是工作区中这四个决策的平均值,这就是为什么同一计划上的两个团队可能花费差异很大。

如何计算 AI 智能体的投资回报率?

将其与它节省的工时进行比较,而不是与软件席位进行比较。选取一个自动化,在使用情况视图中查看其积分支出,并将其与有人手动完成相同工作所需的时间进行对比。AI 智能体的投资回报率在单个重复工作流的层面上通常是显而易见的,而当你只看月度总计时则很难看出来。

长对话比短对话成本更高吗?

是的。每次新的对话轮次都会重新读取之前的所有轮次,因此长线程会持续为它不再需要的上下文付费。在主题不变时保持同一线程,主题改变时开启新对话。

我可以使用自己的提供商账户而不是 Zero 积分吗?

可以。连接受支持的提供商并通过它路由模型,推理费用将按照你现有的条款出现在你自己的账单上。工具调用、连接器使用、存储和媒体生成仍然消耗 Zero 积分。

打开 Zero 并请它审查你最常使用的三个自动化。这是找到你第一个复利成本改进的最快途径。

Stay in the loop

// Get the latest insights on AI teammates and collaboration.