跳到主要内容

Universe 产品定价

Universe 采用按量计费模式,根据模型实际消耗的 token 数量收费,用多少付多少,无预付和月费。本文档详细说明计费规则、模型价格及成本优化策略,帮助您合理规划使用预算。


基本概念

什么是 Token

Token 是模型处理自然语言文本的最小单位。它可以是一个词、一个数字、一个标点符号,也可以是一个子词(subword)。

语言大致换算关系
中文1 个汉字 ≈ 1-2 个 token(常用字约 1 个,生僻字约 2 个)
英文1 个单词 ≈ 1-1.5 个 token(常见词约 1 个,长词约 2 个)
数字/符号1 个数字或标点 ≈ 1 个 token

实际 token 数量以接口返回的 usage 字段为准。 每次 API 调用的响应中包含 prompt_tokens(输入 token 数)、completion_tokens(输出 token 数)和 total_tokens(总 token 数)三个字段。

计费单位

所有模型价格均以元/百万 tokens为单位。计费时分别统计输入 token 和输出 token,各自按对应单价计算。


模型价格

文本生成模型

模型定位输入(缓存命中)输入(缓存未命中)输出
Universe 3.0轻量高效型0.05 元/百万 tokens2 元/百万 tokens4 元/百万 tokens
Universe 3.0 Pro专业增强型0.1 元/百万 tokens9 元/百万 tokens18 元/百万 tokens
Universe 4.5旗舰全能型0.2 元/百万 tokens12 元/百万 tokens20 元/百万 tokens

各模型的能力定位和适用场景请参考 模型产品介绍

价格对比一览

下表以更直观的方式展示三个模型在不同场景下的成本差异(以 100 万次调用、每次输入 500 tokens + 输出 200 tokens 为例,缓存未命中):

模型输入费用输出费用合计费用
Universe 3.01,000 元800 元1,800 元
Universe 3.0 Pro4,500 元3,600 元8,100 元
Universe 4.56,000 元4,000 元10,000 元

以上为估算参考,实际费用取决于您的调用量和输入输出比例。


Prompt Cache(提示缓存)

什么是 Prompt Cache

Prompt Cache 是一种自动降低重复调用成本的优化机制。当多次请求中包含相同的前缀内容(如固定的 System Prompt、长文档、工具定义等)时,系统会自动缓存这部分内容的处理结果。

后续请求中相同的输入内容将命中缓存,按远低于正常价格的缓存价格计费,无需修改代码或接口,系统自动识别和匹配。

缓存命中价格

缓存命中时,输入价格仅为正常输入价格的 1%~2.5%,大幅降低重复调用成本:

模型正常输入价格缓存命中价格节省比例
Universe 3.02 元/百万 tokens0.05 元/百万 tokens节省约 97.5%
Universe 3.0 Pro9 元/百万 tokens0.1 元/百万 tokens节省约 98.9%
Universe 4.512 元/百万 tokens0.2 元/百万 tokens节省约 98.3%

如何最大化利用缓存

建议说明
保持 System Prompt 一致固定的 System Prompt 放在消息列表最前面,避免频繁修改措辞导致缓存失效。
长文档放在输入前部将不变的参考资料、上下文文档等放在输入内容的前缀位置,提高缓存命中率。
工具定义保持稳定如果使用 Function Calling,尽量保持工具定义的 JSON Schema 不变。
避免在固定内容前插入动态内容缓存按前缀匹配,动态内容(如用户输入)应放在固定内容之后。

缓存计费示例

假设使用 Universe 3.0 Pro,每次请求包含 800 tokens 的固定 System Prompt 和 200 tokens 的用户动态输入:

计费项首次请求(缓存未命中)后续请求(缓存命中)
System Prompt(800 tokens)800 × 9 / 1,000,000 = 0.0072 元800 × 0.1 / 1,000,000 = 0.00008 元
用户输入(200 tokens)200 × 9 / 1,000,000 = 0.0018 元200 × 9 / 1,000,000 = 0.0018 元
输入合计0.009 元0.00188 元

缓存命中后,输入成本降低了约 79%


计费规则

计费公式

每次 API 调用的费用由输入和输出两部分组成:

单次费用 = 输入 token 数(百万) × 输入单价 + 输出 token 数(百万) × 输出单价

其中输入单价取决于是否命中缓存。

计费示例

场景:使用 Universe 3.0 Pro 进行文本生成,一次请求输入 1,000 tokens(缓存未命中),输出 500 tokens。

输入费用 = 1,000 / 1,000,000 × 9 元 = 0.009 元
输出费用 = 500 / 1,000,000 × 18 元 = 0.009 元
单次总费用 = 0.009 + 0.009 = 0.018 元

场景:同一模型,输入 5,000 tokens(其中 4,000 tokens 命中缓存),输出 1,000 tokens。

缓存命中输入 = 4,000 / 1,000,000 × 0.1 元 = 0.0004 元
缓存未命中输入 = 1,000 / 1,000,000 × 9 元 = 0.009 元
输出费用 = 1,000 / 1,000,000 × 18 元 = 0.018 元
单次总费用 = 0.0004 + 0.009 + 0.018 = 0.0274 元

扣费方式

  • 费用从账户充值余额中实时扣减,每次 API 调用完成后立即结算。
  • 如果余额不足,API 请求将返回错误,请及时充值以保持服务可用。
  • 失败的请求(返回非 2xx 状态码)不产生 token 消耗,不计费。

成本优化建议

优化策略适用场景预期效果
选择合适的模型简单任务用 Universe 3.0,复杂任务才用 4.5。同等任务下,3.0 的成本仅为 4.5 的约 1/5。
利用 Prompt Cache保持 System Prompt 和固定前缀一致。缓存命中可节省约 97%-99% 的输入费用。
精简输入内容去除不必要的上下文和冗余的历史对话。直接减少输入 token 数量。
控制输出长度合理设置 max_tokens,在 Prompt 中约束输出篇幅。避免输出过长导致的不必要花费。
批量处理将多条简单任务合并到一次请求中处理。减少请求次数,提高 token 利用率。

成本预估工具

您可以使用以下公式快速估算月度费用:

月费用 ≈ 日均调用次数 × 30 × (平均输入 tokens / 1,000,000 × 输入单价 + 平均输出 tokens / 1,000,000 × 输出单价)

小贴士:建议在控制台的费用中心查看实际的 token 消耗明细,结合历史数据进行更精准的费用预估。


常见问题

Q:有免费试用额度吗?

新注册用户可获得一定的免费体验额度,具体额度和有效期请以控制台注册页面的说明为准。免费额度用尽后,需充值后继续使用。

Q:如何查看消费明细?

登录控制台,在费用中心可以查看每日/每月的消费趋势、按模型维度的 token 消耗明细,以及每个 API Key 的独立消费统计。

Q:价格会变动吗?

产品价格可能随市场和技术发展进行调整。如有变动,我们将提前通过平台公告通知。请以本页面的最新价格信息为准,建议定期查看。

Q:支持哪些支付方式?

支持支付宝、微信支付、银行转账等主流充值方式。企业用户如需对公转账或开具发票,请联系商务团队。

Q:请求失败会计费吗?

不会。只有成功返回结果(HTTP 2xx)的请求才会产生 token 消耗和计费。因认证失败、限流、服务端错误等原因导致的请求失败不产生费用。


更多帮助

  • 了解各模型的能力差异和选型建议,请参考 模型产品介绍
  • 查看 API 调用方式和代码示例,请参考 接口文档
  • 学习如何编写高效 Prompt 以降低调用成本,请参考 Prompt 工程指南
  • 遇到其他问题,请查阅 常见问题 或联系技术支持。