我的判断顺序是:先看底层能力是否变化,再看它是否改变 Token 消费方式,最后看新消费方式能否形成稳定产品和可持续收入。

01

当前跟踪的四组信号

01High signal

Scaling 从训练走向推理与 Agent

扩大预训练仍重要,但更多进步来自后训练、推理时计算和任务中的多轮搜索。Scaling 没有消失,而是换了发生位置。

观察
长程任务成功率、推理预算与能力增益
风险
成本增长快于可交付价值
02High signal

Token 消费从问答走向任务

Chatbot 的单位任务短,而 Coding Agent 和企业流程需要规划、工具调用、校验与重试。每个任务的 Token 密度显著提高。

观察
单位用户消耗、留存、后台常驻任务
风险
高消耗却没有对应成功率或 ROI
03Forming

产品从单点工具走向上下文系统

Agent 外壳容易被复制,竞争会逐渐落到上下文管理、权限、数据、评测和系统集成。产品价值更像“组织记忆 + 执行系统”。

观察
迁移成本、私有上下文复用率、跨工具完成率
风险
上下文无法维护,错误随链路放大
04Emerging

交互走向实时、多模态与全双工

下一代助手不只是文本框,而是能持续听、看、说并主动操作的界面。多模态理解与生成统一,会改写内容生产和设备入口。

观察
实时延迟、打断处理、跨模态一致性
风险
隐私、信任与设备权限成为采用瓶颈

02

这些信号不是独立事件

底层能力、消费形态、产品护城河和交互入口构成一条连续链路。只看其中一段,很容易高估短期产品或低估长期需求。

A

能力变长

模型能承接更长任务,并在过程中规划、调用工具和纠错。

B

消费变深

一次需求触发更多轮推理,Token 消费从交互量转向任务量。

C

系统变重

业务上下文、评测和权限进入产品,真正的迁移成本开始形成。

这也是我不把“某个 Agent 界面很火”直接等同于护城河的原因。产品热度只证明需求存在,能否沉淀上下文并稳定交付结果,才决定价值是否留在产品层。

03

下一步,我会看什么

比发布会更重要的验证清单

  • 同一组真实任务在不同版本上的端到端成功率,而不是单项 Benchmark。
  • 推理成本下降后,用户是否主动增加任务长度、频率和授权范围。
  • 企业是否把 Agent 从“辅助工具”升级为有责任边界的正式流程节点。
  • 模型能力收敛时,价值是否向拥有数据、入口和交易闭环的应用迁移。