Universe 产品定价
Universe 采用按量计费模式,根据模型实际消耗的 token 数量收费,用多少付多少,无预付和月费。本文档详细说明计费规则、模型价格及成本优化策略,帮助您合理规划使用预算。
基本概念
什么是 Token
Token 是模型处理自然语言文本的最小单位。它可以是一个词、一个数字、一个标点符号,也可以是一个子词(subword)。
| 语言 | 大致换算关系 |
|---|---|
| 中文 | 1 个汉字 ≈ 1-2 个 token(常用字约 1 个,生僻字约 2 个) |
| 英文 | 1 个单词 ≈ 1-1.5 个 token(常见词约 1 个,长词约 2 个) |
| 数字/符号 | 1 个数字或标点 ≈ 1 个 token |
实际 token 数量以接口返回的
usage字段为准。 每次 API 调用的响应中包含prompt_tokens(输入 token 数)、completion_tokens(输出 token 数)和total_tokens(总 token 数)三个字段。
计费单位
所有模型价格均以元/百万 tokens为单位。计费时分别统计输入 token 和输出 token,各自按对应单价计算。
模型价格
文本生成模型
| 模型 | 定位 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|---|
| Universe 3.0 | 轻量高效型 | 0.05 元/百万 tokens | 2 元/百万 tokens | 4 元/百万 tokens |
| Universe 3.0 Pro | 专业增强型 | 0.1 元/百万 tokens | 9 元/百万 tokens | 18 元/百万 tokens |
| Universe 4.5 | 旗舰全能型 | 0.2 元/百万 tokens | 12 元/百万 tokens | 20 元/百万 tokens |
各模型的能力定位和适用场景请参考 模型产品介绍。
价格对比一览
下表以更直观的方式展示三个模型在不同场景下的成本差异(以 100 万次调用、每次输入 500 tokens + 输出 200 tokens 为例,缓存未命中):
| 模型 | 输入费用 | 输出费用 | 合计费用 |
|---|---|---|---|
| Universe 3.0 | 1,000 元 | 800 元 | 1,800 元 |
| Universe 3.0 Pro | 4,500 元 | 3,600 元 | 8,100 元 |
| Universe 4.5 | 6,000 元 | 4,000 元 | 10,000 元 |
以上为估算参考,实际费用取决于您的调用量和输入输出比例。
Prompt Cache(提示缓存)
什么是 Prompt Cache
Prompt Cache 是一种自动降低重复调用成本的优化机制。当多次请求中包含相同的前缀内容(如固定的 System Prompt、长文档、工具定义等)时,系统会自动缓存这部分内容的处理结果。
后续请求中相同的输入内容将命中缓存,按远低于正常价格的缓存价格计费,无需修改代码或接口,系统自动识别和匹配。
缓存命中价格
缓存命中时,输入价格仅为正常输入价格的 1%~2.5%,大幅降低重复调用成本:
| 模型 | 正常输入价格 | 缓存命中价格 | 节省比例 |
|---|---|---|---|
| Universe 3.0 | 2 元/百万 tokens | 0.05 元/百万 tokens | 节省约 97.5% |
| Universe 3.0 Pro | 9 元/百万 tokens | 0.1 元/百万 tokens | 节省约 98.9% |
| Universe 4.5 | 12 元/百万 tokens | 0.2 元/百万 tokens | 节省约 98.3% |
如何最大化利用缓存
| 建议 | 说明 |
|---|---|
| 保持 System Prompt 一致 | 固定的 System Prompt 放在消息列表最前面,避免频繁修改措辞导致缓存失效。 |
| 长文档放在输入前部 | 将不变的参考资料、上下文文档等放在输入内容的前缀位置,提高缓存命中率。 |
| 工具定义保持稳定 | 如果使用 Function Calling,尽量保持工具定义的 JSON Schema 不变。 |
| 避免在固定内容前插入动态内容 | 缓存按前缀匹配,动态内容(如用户输入)应放在固定内容之后。 |
缓存计费示例
假设使用 Universe 3.0 Pro,每次请求包含 800 tokens 的固定 System Prompt 和 200 tokens 的用户动态输入:
| 计费项 | 首次请求(缓存未命中) | 后续请求(缓存命中) |
|---|---|---|
| System Prompt(800 tokens) | 800 × 9 / 1,000,000 = 0.0072 元 | 800 × 0.1 / 1,000,000 = 0.00008 元 |
| 用户输入(200 tokens) | 200 × 9 / 1,000,000 = 0.0018 元 | 200 × 9 / 1,000,000 = 0.0018 元 |
| 输入合计 | 0.009 元 | 0.00188 元 |
缓存命中后,输入成本降低了约 79%。
计费规则
计费公式
每次 API 调用的费用由输入和输出两部分组成:
单次费用 = 输入 token 数(百万) × 输入单价 + 输出 token 数(百万) × 输出单价
其中输入单价取决于是否命中缓存。
计费示例
场景:使用 Universe 3.0 Pro 进行文本生成,一次请求输入 1,000 tokens(缓存未命中),输出 500 tokens。
输入费用 = 1,000 / 1,000,000 × 9 元 = 0.009 元
输出费用 = 500 / 1,000,000 × 18 元 = 0.009 元
单次总费用 = 0.009 + 0.009 = 0.018 元
场景:同一模型,输入 5,000 tokens(其中 4,000 tokens 命中缓存),输出 1,000 tokens。
缓存命中输入 = 4,000 / 1,000,000 × 0.1 元 = 0.0004 元
缓存未命中输入 = 1,000 / 1,000,000 × 9 元 = 0.009 元
输出费用 = 1,000 / 1,000,000 × 18 元 = 0.018 元
单次总费用 = 0.0004 + 0.009 + 0.018 = 0.0274 元
扣费方式
- 费用从账户充值余额中实时扣减,每次 API 调用完成后立即结算。
- 如果余额不足,API 请求将返回错误,请及时充值以保持服务可用。
- 失败的请求(返回非 2xx 状态码)不产生 token 消耗,不计费。
成本优化建议
| 优化策略 | 适用场景 | 预期效果 |
|---|---|---|
| 选择合适的模型 | 简单任务用 Universe 3.0,复杂任务才用 4.5。 | 同等任务下,3.0 的成本仅为 4.5 的约 1/5。 |
| 利用 Prompt Cache | 保持 System Prompt 和固定前缀一致。 | 缓存命中可节省约 97%-99% 的输入费用。 |
| 精简输入内容 | 去除不必要的上下文和冗余的历史对话。 | 直接减少输入 token 数量。 |
| 控制输出长度 | 合理设置 max_tokens,在 Prompt 中约束输出篇幅。 | 避免输出过长导致的不必要花费。 |
| 批量处理 | 将多条简单任务合并到一次请求中处理。 | 减少请求次数,提高 token 利用率。 |
成本预估工具
您可以使用以下公式快速估算月度费用:
月费用 ≈ 日均调用次数 × 30 × (平均输入 tokens / 1,000,000 × 输入单价 + 平均输出 tokens / 1,000,000 × 输出单价)
小贴士:建议在控制台的费用中心查看实际的 token 消耗明细,结合历史数据进行更精准的费用预估。
常见问题
Q:有免费试用额度吗?
新注册用户可获得一定的免费体验额度,具体额度和有效期请以控制台注册页面的说明为准。免费额度用尽后,需充值后继续使用。
Q:如何查看消费明细?
登录控制台,在费用中心可以查看每日/每月的消费趋势、按模型维度的 token 消耗明细,以及每个 API Key 的独立消费统计。
Q:价格会变动吗?
产品价格可能随市场和技术发展进行调整。如有变动,我们将提前通过平台公告通知。请以本页面的最新价格信息为准,建议定期查看。
Q:支持哪些支付方式?
支持支付宝、微信支付、银行转账等主流充值方式。企业用户如需对公转账或开具发票,请联系商务团队。
Q:请求失败会计费吗?
不会。只有成功返回结果(HTTP 2xx)的请求才会产生 token 消耗和计费。因认证失败、限流、服务端错误等原因导致的请求失败不产生费用。
更多帮助
- 了解各模型的能力差异和选型建议,请参考 模型产品介绍。
- 查看 API 调用方式和代码示例,请参考 接口文档。
- 学习如何编写高效 Prompt 以降低调用成本,请参考 Prompt 工程指南。
- 遇到其他问题,请查阅 常见问题 或联系技术支持。