随着OpenAI o-series 的出现,LLM scaling 正从 training-time scaling 逐渐转向 test-time scaling。更多 inference compute 可以带来更强推理能力,但同时也带来了 reasoning token 增长、Agent trajectory 扩展以及推理成本上升等问题。如何让模型在有限计算预算下获得更高的 intelligence per compute,成为当前 LLM inference efficiency 的核心问题。

Screenshot 2026-08-12 at 18.44.04.png

让模型投入更多 inference compute,可以显著提升复杂任务上的表现。模型通过生成更长的 reasoning trajectory、执行更多自我验证步骤、搜索多个候选答案。但 test-time scaling 也带来了更高的成本。对于单轮 reasoning 任务,主要成本来自不断增长的 thinking tokens;而对于 agent 系统,成本进一步扩大,因为模型需要持续处理历史轨迹、工具调用结果以及环境反馈。

e.g. Qwen3-Coder-Next 在 SWE-rebench 上平均每道题消耗约 800 万 token、154 轮交互;Kimi-K2.5 在单道竞赛数学题上最多可以生成 96k thinking tokens。

Screenshot 2026-08-12 at 10.36.30.png

Screenshot 2026-08-12 at 10.36.48.png

Screenshot 2026-08-12 at 10.35.27.png

Screenshot 2026-08-12 at 17.25.43.png

如何让模型使用更少的 test-time compute/cost,完成同样甚至更复杂的任务?

围绕这一问题,展开讨论模型层的 token 成本、单轮的 Efficient Reasoning,以及多轮的 Agent Inference Efficiency。(本次不讨论纯 serving 层的优化。讨论的都是模型侧和轨迹侧。)

Where the Money Goes

当我们谈论效率时,我们在谈论什么?

Screenshot 2026-08-12 at 11.58.20.png

单轮交互

Cost = Prefill成本 × 输入长度 + Decode成本 × 生成长度

Agentic 交互

Cost = Σ_step [ Prefill成本 × (1 - prefix cache 命中率_step) × 输入长度 + Decode成本 × (思考 + 动作)_step ]

优化方向

0. Token成本控制(prefill和decode成本降低)

由于attention的复杂度,test-time scaling 遇到瓶颈。降低token成本是进一步test-time scaling的前提。

0.1 稀疏注意力