第 03 期 · 行业

算力账单开始反向决定产品路线

当推理成本进入季度财报,产品路线就不再只由能力决定。

第 03 期 · 行业
本页目录

几家公司的季度电话会里,「推理成本」第一次被单独拿出来讲。这件事的意义不在于数字,而在于它进了被公开追问的清单

一旦某项成本需要向投资人解释,它就会开始反向塑造产品:哪些功能默认开启、哪些留给付费档、哪些干脆砍掉。

三个可观察的信号

  1. 免费档的功能开始「静默降级」——不是砍掉,而是把默认模型换小;
  2. 「思考时间」被做成了可控参数,因为它直接对应账单;
  3. 一些演示效果很好但调用链很长的功能,悄悄下线了。

真正的分水岭不是谁更便宜,而是谁能把成本结构讲清楚。讲不清楚的那个,路线会被账单牵着走。

把上下文窗口写进价目表

一家厂商这周把定价页改了:不再按「输入 / 输出」两栏,而是按上下文长度分档,短上下文的单价明显更低。

表面上是涨价,实际是在告诉用户别把所有东西都塞进去

长上下文的成本结构和短上下文不同,之前统一计价等于让短任务补贴长任务。分档之后,选择「只放进相关的部分」第一次有了明确的经济动机。

值得留意的是这对产品设计的影响:RAG、摘要、检索这些「少放一点」的技术,重新变得划算。过去一两年大家把它们当成效果妥协,现在它们同时是成本优化。

新模型不再比参数,开始比「什么时候不说话」

这一周有三家发布了新模型,发布会上的关键词却出奇一致:不是更聪明,而是更少的干预。参数规模、跑分榜单都退到了第二屏,第一屏讲的是「它什么时候不说话」。

从能力上限到行为下限

过去两年的发布逻辑是加能力:更长的上下文、更多的模态、更高的榜单分数。这套逻辑的问题是,用户很快会发现能力上限不决定体验,行为下限才决定体验——模型在不确定的时候会不会硬答,在无关的时候会不会插话。

这周的三个发布都在这条线上做文章:

  • 一家把「主动澄清」变成了默认行为:信息不足时先问一句,而不是先猜一个答案;
  • 一家把工具调用的门槛提高,宁可少调一次,也不要调错一次;
  • 一家干脆在评测集里加了「不该回答的问题」,把沉默当作可量化的能力。

把「不做什么」写进评测集,意味着它变成了可比较的指标。

—— 本期的观察

这对使用者意味着什么

直观的变化是交互变慢了:会多一次确认、多一句追问。对习惯了一步到位的人来说,这是退步。

但对真正在做事的人来说,返工的成本远高于确认的成本。一个会问清楚的模型,可以放心交给它更长的任务链。

// 能力上限与行为下限是两条不同的曲线
type Release = { capability: number; restraint: number };

// 榜单只反映前一条,体验由后一条决定
const usable = (r: Release) => r.capability > 7 && r.restraint > 6;

接下来盯什么

「会问问题」很容易被做成新的表演:每件事都追问一遍,用户会立刻厌烦。真正的分水岭是澄清的准确率——它能不能只在真正需要的时候问。

下一期我们会盯一下这些模型的澄清率数据,看它是被调优出来的,还是被规则硬编码的。

评论

由 GitHub Discussions 驱动

正在载入评论…