我的判断顺序是:先看底层能力是否变化,再看它是否改变 Token 消费方式,最后看新消费方式能否形成稳定产品和可持续收入。
01
当前跟踪的四组信号
01High signal
Scaling 从训练走向推理与 Agent
扩大预训练仍重要,但更多进步来自后训练、推理时计算和任务中的多轮搜索。Scaling 没有消失,而是换了发生位置。
- 观察
- 长程任务成功率、推理预算与能力增益
- 风险
- 成本增长快于可交付价值
02High signal
Token 消费从问答走向任务
Chatbot 的单位任务短,而 Coding Agent 和企业流程需要规划、工具调用、校验与重试。每个任务的 Token 密度显著提高。
- 观察
- 单位用户消耗、留存、后台常驻任务
- 风险
- 高消耗却没有对应成功率或 ROI
03Forming
产品从单点工具走向上下文系统
Agent 外壳容易被复制,竞争会逐渐落到上下文管理、权限、数据、评测和系统集成。产品价值更像“组织记忆 + 执行系统”。
- 观察
- 迁移成本、私有上下文复用率、跨工具完成率
- 风险
- 上下文无法维护,错误随链路放大
04Emerging
交互走向实时、多模态与全双工
下一代助手不只是文本框,而是能持续听、看、说并主动操作的界面。多模态理解与生成统一,会改写内容生产和设备入口。
- 观察
- 实时延迟、打断处理、跨模态一致性
- 风险
- 隐私、信任与设备权限成为采用瓶颈
02
这些信号不是独立事件
底层能力、消费形态、产品护城河和交互入口构成一条连续链路。只看其中一段,很容易高估短期产品或低估长期需求。
能力变长
模型能承接更长任务,并在过程中规划、调用工具和纠错。
消费变深
一次需求触发更多轮推理,Token 消费从交互量转向任务量。
系统变重
业务上下文、评测和权限进入产品,真正的迁移成本开始形成。
这也是我不把“某个 Agent 界面很火”直接等同于护城河的原因。产品热度只证明需求存在,能否沉淀上下文并稳定交付结果,才决定价值是否留在产品层。
03
下一步,我会看什么
比发布会更重要的验证清单
- 同一组真实任务在不同版本上的端到端成功率,而不是单项 Benchmark。
- 推理成本下降后,用户是否主动增加任务长度、频率和授权范围。
- 企业是否把 Agent 从“辅助工具”升级为有责任边界的正式流程节点。
- 模型能力收敛时,价值是否向拥有数据、入口和交易闭环的应用迁移。