模型与倍率

每个模型消耗多少,全部写在这一页

这个品类最大的信任杀手是额度算不清。所以这页把所有系数、能力、地域限制,连同历史上每一次倍率调整,一次性摊开。

CU 是怎么定义的

1 CU = 基准模型 1,000 个输出 token

跨模型比较需要一个统一单位,否则「等价切换」无从谈起。输入和输出分开计系数,因为两者的真实成本差着一个数量级。

怎么算

输入 token × 输入系数 + 输出 token × 输出系数

都按每 1,000 token 计。前沿推理组的输出系数恒为 1.00,它就是基准,其余组相对它折算。

为什么分开

输入比输出便宜得多

长上下文的成本主要在输出,不在把资料喂进去。分开计系数才不会让「贴一大段代码进去」变得莫名其妙地贵。

怎么核对

每一次调用都有明细

控制台记录每次请求的输入输出 token、扣减 CU、追踪号,可按时间段导出 CSV,自己拿计算器就能验。

不会变的

已售出订阅在周期内口径固定

任何倍率调整只对新周期生效;上调提前 30 天公告。这是数据库层面的约束——套餐版本不可变。

全部可用模型

同一能力组内的模型可以互为灾备。你可以直接指定某一个模型,也可以只指定能力组,让 Prism 在组内挑。

前沿

最难的那些任务。贵,但该用的时候省不得
2/2 可用
  • frontier-a
    可用
    前沿
    上下文
    1050K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥0.40·¥0.237
    输出¥2.00·¥1.19
    缓存读¥0.04·¥0.0237
    缓存写¥0.50·¥0.296
    • 工具调用
    • 读图
    • 结构化输出
    • 长上下文
  • frontier-b
    可用
    前沿
    上下文
    1050K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥0.40·¥0.237
    输出¥2.00·¥1.19
    缓存读¥0.04·¥0.0237
    缓存写¥0.50·¥0.296
    • 工具调用
    • 读图
    • 结构化输出
    • 长上下文

均衡

日常写代码与长对话的默认选择
3/3 可用
  • balanced-a
    可用
    均衡
    上下文
    1000K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥0.16·¥0.0948
    输出¥0.84·¥0.498
    缓存读¥0.016·¥0.00948
    缓存写¥0.20·¥0.119
    • 工具调用
    • 读图
    • 结构化输出
    • 长上下文
  • balanced-b
    可用
    均衡
    上下文
    1000K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥0.16·¥0.0948
    输出¥0.84·¥0.498
    缓存读¥0.016·¥0.00948
    缓存写¥0.20·¥0.119
    • 工具调用
    • 读图
    • 结构化输出
    • 长上下文
  • balanced-c
    可用
    均衡
    上下文
    1000K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥0.16·¥0.0948
    输出¥0.84·¥0.498
    缓存读¥0.016·¥0.00948
    缓存写¥0.20·¥0.119
    • 工具调用
    • 读图
    • 结构化输出
    • 长上下文

国产

大陆可用,合规路径最短
3/3 可用
  • domestic-a
    可用
    国产
    上下文
    128K
    大陆
    可用
    每百万 token后付费 · 套餐(pro5)
    输入¥0.06·¥0.0356
    输出¥0.36·¥0.213
    缓存读¥0.006·¥0.00356
    缓存写¥0.075·¥0.0445
    • 工具调用
    • 结构化输出
  • domestic-b
    可用
    国产
    上下文
    128K
    大陆
    可用
    每百万 token后付费 · 套餐(pro5)
    输入¥0.06·¥0.0356
    输出¥0.36·¥0.213
    缓存读¥0.006·¥0.00356
    缓存写¥0.075·¥0.0445
    • 工具调用
    • 结构化输出
  • domestic-c
    可用
    国产
    上下文
    128K
    大陆
    可用
    每百万 token后付费 · 套餐(pro5)
    输入¥0.06·¥0.0356
    输出¥0.36·¥0.213
    缓存读¥0.006·¥0.00356
    缓存写¥0.075·¥0.0445
    • 工具调用
    • 结构化输出

快速

改个措辞、跑个分类,越快越好
4/4 可用
  • fast-a
    可用· 目录值
    快速
    上下文
    0K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥0.02·¥0.0119
    输出¥0.12·¥0.0711
    缓存读¥0.002·¥0.00119
    缓存写¥0.025·¥0.0148
  • fast-b
    可用· 目录值
    快速
    上下文
    0K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥0.02·¥0.0119
    输出¥0.12·¥0.0711
    缓存读¥0.002·¥0.00119
    缓存写¥0.025·¥0.0148
  • fast-c
    可用· 目录值
    快速
    上下文
    0K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥0.02·¥0.0119
    输出¥0.12·¥0.0711
    缓存读¥0.002·¥0.00119
    缓存写¥0.025·¥0.0148
  • fast-d
    可用· 目录值
    快速
    上下文
    0K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥0.02·¥0.0119
    输出¥0.12·¥0.0711
    缓存读¥0.002·¥0.00119
    缓存写¥0.025·¥0.0148

可直接点名的模型

把下面这些标识直接填进 model 就会锁定这一条线。我们不会替你换成别的模型—— 它此刻不可用时你拿到的是 503 model_unavailable, 而不是一次悄悄的替换。需要自动切换的话用上面那些能力组的标识。

价目按这条线自己的计费系数算, 可能和它所属能力组的不一样——那正是点名的代价与收益: 放弃自动换线,换来按这条线自己的价计费。两栏仍然是同样两个口径: 后付费零买,和套餐内折算。

  • gpt-6-sol
    可直接调用
    前沿
    上下文
    922K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥1.50·¥0.888
    输出¥7.49·¥4.44
    缓存读¥0.15·¥0.0888
    缓存写¥1.87·¥1.11
    • 工具调用
    • 结构化输出
    • 读图
    • 长上下文
    • responses
  • gpt-6-luna
    可直接调用
    均衡
    上下文
    922K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥1.50·¥0.888
    输出¥7.49·¥4.44
    缓存读¥0.15·¥0.0888
    缓存写¥1.87·¥1.11
    • 工具调用
    • 结构化输出
    • 长上下文
    • responses
  • claude-fable-5
    可直接调用
    前沿
    上下文
    1000K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥18.95·¥11.23
    输出¥94.74·¥56.15
    缓存读¥1.89·¥1.12
    缓存写¥23.68·¥14.04
    • 工具调用
    • 结构化输出
    • 读图
    • 长上下文
    • 深度思考
  • claude-opus-5
    可直接调用
    前沿
    上下文
    1000K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥9.47·¥5.62
    输出¥47.37·¥28.08
    缓存读¥0.947·¥0.562
    缓存写¥11.84·¥7.02
    • 工具调用
    • 结构化输出
    • 读图
    • 长上下文
    • 深度思考
  • claude-opus-4-8
    可直接调用
    前沿
    上下文
    1000K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥9.47·¥5.62
    输出¥47.37·¥28.08
    缓存读¥0.947·¥0.562
    缓存写¥11.84·¥7.02
    • 工具调用
    • 结构化输出
    • 读图
    • 长上下文
    • 深度思考
  • claude-sonnet-5
    可直接调用
    均衡
    上下文
    1000K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥3.79·¥2.25
    输出¥18.95·¥11.23
    缓存读¥0.379·¥0.225
    缓存写¥4.74·¥2.81
    • 工具调用
    • 结构化输出
    • 读图
    • 长上下文
  • claude-fable-5-1
    可直接调用
    前沿
    上下文
    1000K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥67.37·¥39.93
    输出¥336.84·¥199.65
    缓存读¥1.68·¥0.998
    缓存写¥84.21·¥49.91
    • 工具调用
    • 结构化输出
    • 读图
    • 长上下文
    • 深度思考
  • grok-4.5
    可直接调用
    均衡
    上下文
    500K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥3.40·¥2.02
    输出¥10.20·¥6.05
    缓存读¥0.51·¥0.302
    缓存写¥0.20·¥0.119
    • 工具调用
    • 结构化输出
    • 长上下文
  • glm-5.3-flash
    可直接调用
    国产
    上下文
    128K
    大陆
    可用
    每百万 token后付费 · 套餐(pro5)
    输入¥0.08·¥0.0474
    输出¥0.28·¥0.166
    缓存读¥0.023·¥0.0136
    缓存写¥0.10·¥0.0593
    • 工具调用
    • 结构化输出
    • 深度思考
  • grok-4.6
    可直接调用
    均衡
    上下文
    500K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥3.40·¥2.02
    输出¥10.20·¥6.05
    缓存读¥0.85·¥0.504
    缓存写¥0.20·¥0.119
    • 工具调用
    • 结构化输出
    • 长上下文
  • gpt-5.6
    可直接调用
    前沿
    上下文
    922K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥3.00·¥1.78
    输出¥14.99·¥8.88
    缓存读¥0.30·¥0.178
    缓存写¥3.75·¥2.22
    • 工具调用
    • 结构化输出
    • 读图
    • 长上下文
    • responses
  • gpt-5.5
    可直接调用
    前沿
    上下文
    1050K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥3.75·¥2.22
    输出¥22.48·¥13.33
    缓存读¥0.375·¥0.222
    缓存写¥0.50·¥0.296
    • 工具调用
    • 结构化输出
    • 读图
    • 长上下文
    • responses
  • gpt-6-astra
    可直接调用
    前沿
    上下文
    922K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥7.49·¥4.44
    输出¥37.47·¥22.21
    缓存读¥0.749·¥0.444
    缓存写¥9.37·¥5.55
    • 工具调用
    • 结构化输出
    • 读图
    • 长上下文
    • responses
  • gpt-image-2
    暂不可用
    均衡
    上下文
    1K
    大陆
    不提供
    每百万 token后付费 · 套餐(pro5)
    输入¥0.16·¥0.0948
    输出¥0.84·¥0.498
    缓存读¥0.016·¥0.00948
    缓存写¥0.20·¥0.119
    • image

全部可用模型

同一能力组内的模型可以互为灾备。你可以直接指定某一个模型,也可以只指定能力组,让 Prism 在组内挑。

模型能力组输入输出上下文能力地域状态
frontier-a前沿推理0.201.001050K工具调用视觉结构化输出长上下文仅境外正常
frontier-b前沿推理0.201.001050K工具调用视觉结构化输出长上下文仅境外正常
balanced-a均衡通用0.080.421000K工具调用视觉结构化输出长上下文仅境外正常
balanced-b均衡通用0.080.421000K工具调用视觉结构化输出长上下文仅境外正常
balanced-c均衡通用0.080.421000K工具调用视觉结构化输出长上下文仅境外正常
domestic-a国产旗舰0.030.18128K工具调用结构化输出境内可用正常
domestic-b国产旗舰0.030.18128K工具调用结构化输出境内可用正常
domestic-c国产旗舰0.030.18128K工具调用结构化输出境内可用正常
fast-a高速轻量0.010.060K—仅境外正常
fast-b高速轻量0.010.060K—仅境外正常
fast-c高速轻量0.010.060K—仅境外正常
fast-d高速轻量0.010.060K—仅境外正常

状态来自每 15 分钟一次的真实探测,不是手工维护的表。完整的可用率历史在状态页,保留 90 天。

模型标识为占位。正式上线时这张表由目录服务实时驱动,含真实模型名与当前系数。

什么任务用哪一组

我们不希望你多花钱。下面这张表是按「同等产出下哪一组最省」列的,不是按「哪一组最贵」列的。

你在做什么建议为什么
长链路 agent、跨文件重构前沿推理错一步会连锁放大,返工的成本远高于省下来的那点钱。
日常写代码、代码审查均衡通用绝大多数人的默认档。质量差距在这类任务上基本感知不到。
中文长文本、资料整理国产旗舰中文语料上本来就更强,顺便还便宜。这不是降级,是选型。
批量分类、格式转换高速轻量任务本身没有难度,付前沿组的价钱纯属浪费。
补全、行内建议高速轻量这类场景延迟比质量重要,快的那个就是对的。
拿不准交给 Prismauto 会按每一次请求的实际难度判断,比你一次性选一个组更准。

倍率变更历史

只给当前值,等于让你猜我们改没改过。所以这里给完整历史:每一次调整、公告日期、生效日期,都在。

还没有过任何调整——服务尚未正式上线,这张表是空的。 它空着不是因为我们没记,是因为确实没发生过;第一次调整会按行追加在这里,包括公告日期和生效日期。

倍率**上调**提前 30 天公告,且只对新周期生效——你手上的订阅在周期内不受影响。下调(对你更便宜)立即生效。

地域可用性

标注为「仅境外」的模型未在中国大陆完成生成式人工智能服务备案,按规定不向中国大陆用户提供。

  1. 01

    控制台会按你的所在地过滤

    不可用的模型会置灰并说明原因,不会让你选中之后才失败。Prism 的路由也会自动排除它们。

  2. 02

    请如实填写所在地

    绕开地域限制去使用不向你所在地提供的模型,后果由使用者自行承担。这一条写在服务条款第 4 条。

  3. 03

    地域限制会变

    备案状态是动态的。模型的可用地域调整时我们会提前通知,并允许你切换到其他能力组,或按未使用比例退款。

看完了倍率,去看看它怎么帮你省

同一份额度,交给 Prism 按任务难度分配,通常能多做一倍以上的活。倍率是原料,调度才是省钱的地方。