随着OpenAI o-series 的出现,LLM scaling 正从 training-time scaling 逐渐转向 test-time scaling。更多 inference compute 可以带来更强推理能力,但同时也带来了 reasoning token 增长、Agent trajectory 扩展以及推理成本上升等问题。如何让模型在有限计算预算下获得更高的 intelligence per compute,成为当前 LLM inference efficiency 的核心问题。

让模型投入更多 inference compute,可以显著提升复杂任务上的表现。模型通过生成更长的 reasoning trajectory、执行更多自我验证步骤、搜索多个候选答案。但 test-time scaling 也带来了更高的成本。对于单轮 reasoning 任务,主要成本来自不断增长的 thinking tokens;而对于 agent 系统,成本进一步扩大,因为模型需要持续处理历史轨迹、工具调用结果以及环境反馈。
e.g. Qwen3-Coder-Next 在 SWE-rebench 上平均每道题消耗约 800 万 token、154 轮交互;Kimi-K2.5 在单道竞赛数学题上最多可以生成 96k thinking tokens。




如何让模型使用更少的 test-time compute/cost,完成同样甚至更复杂的任务?
围绕这一问题,展开讨论模型层的 token 成本、单轮的 Efficient Reasoning,以及多轮的 Agent Inference Efficiency。(本次不讨论纯 serving 层的优化。讨论的都是模型侧和轨迹侧。)
当我们谈论效率时,我们在谈论什么?

Cost = Prefill成本 × 输入长度 + Decode成本 × 生成长度
Cost = Σ_step [ Prefill成本 × (1 - prefix cache 命中率_step) × 输入长度 + Decode成本 × (思考 + 动作)_step ]
由于attention的复杂度,test-time scaling 遇到瓶颈。降低token成本是进一步test-time scaling的前提。