213:1的Token悬殊背后,智能体正在改写推理方式

芯东西(公众号:aichip001)

作者 | 江宇

编辑 | 漠影

9月21日下午,北京中关村国际创新中心,开源推理框架SGLang核心贡献者王书文放出一组数据:在Agent流量里,一次请求的中位数输入是8.8万个Token,输出却只有413个Token,两者相差213倍

“智能体时代,算力并不是花在输出上,而是花在反复携带的历史上下文上。”他说。

这里,便是AICC2026人工智能计算大会下设的“AI软件栈”分论坛。现场,SGLang团队围绕Agent时代推理负载的变化进行了分享。

213:1的Token悬殊背后,智能体正在改写推理方式

当天,AICC2026人工智能计算大会在北京中关村国际创新中心举行,近3000名产业人士来到现场。大会一口气设置了AI芯片、Token工厂、开放超节点、大模型、AI软件栈、具身智能与智算发展、AI Work智能体七场专题论坛,把芯片、系统、软件、模型与应用等产业链不同环节聚到了一起。

就在同一天、同一个大会里,芯片厂商、系统厂商与推理框架的开发者,都聚到了同一张桌子前。

从长上下文带来的缓存压力,到多元芯片适配,再到互连、调度与软件栈协同,讨论的焦点已经很难被拆成某一个环节的问题。

他们最终指向的是同一道题——当智能体从一次调用走向持续任务链,中国AI计算的下一步,该怎么走?

一、智能体爆发,AI计算每一层都在被重新定义

智能体的爆发,正在把算力推上国家战略基础设施的位置。

2026年,智能体从发布会上的演示,走进了真实的生产、科研和社会服务;一次智能体任务,可能包含规划、多轮推理、工具调用、记忆、校验和重试,负载变长、并发增加,系统还必须可恢复、可观测、可承担成本。

在AICC现场,大会把这种变化拆成了三层产业信号来讨论。

其一,智能体改变了计算的服务对象。

基础设施过去服务一次模型调用,现在要服务一段持续的任务。

其二,真实应用负载正在反向定义计算体系。

2026年6月,OpenAI与博通发布的Jalapeño芯片,直接以模型路线、计算内核、推理服务和产品需求来指导芯片设计,模型与应用的需求,正沿着产业链向上游延伸。

其三,全球同时发生技术路线多元化与系统级整合加深。

在Hot Chips 2026上,GPU、定制芯片、晶圆级计算、RISC-V、Chiplet、存算一体同台出现,头部企业又在围绕真实负载,加强从芯片到软件的全栈协同。

放到中国AI计算产业的语境里,AI正在同时向两个方向延伸:

一场向上,推理、工具使用、长程任务和科学发现能力不断突破智能上限;一场向外,成本下降与智能体普及,让智能从少数机构掌握的能力,走向企业、个人和社会普遍需要的生产力。

智能体改变的是整条AI计算产业链的组织方式。理解这一点,是读懂这场大会、以及下文聚焦的infra层的起点。

二、从“回答一个问题”到“持续干活”:一次Agent任务,推理侧发生了什么

回到开篇王书文的那组数据,这直接揭示了一个变化:Agent正在把推理从一次调用,变成一段连续的任务链。

过去,一次推理就是“回答一个问题”:请求进来,模型算一遍,Token返回,结束。现在,智能体要“持续干活”:为了完成一个任务,它一遍遍调用模型,先规划、再搜索、再调用工具、再读取结果,上下文随之越积越长,并且每一次调用模型,都需要输入完整的历史上下文。

推理系统要面对的,从一次次独立的计算,变成了一段连续的任务链。

负载的形态变了,计算压力也随之发生变化。213:1的输入输出比例意味着,在智能体场景里,大量历史信息会随着每轮调用反复进入模型,真正新增的内容反而只占很小一部分。

这些负载高度集中在三种模式上:多轮复用与追加、子智能体分叉,以及工具循环与重试。

三种模式叠在一起,数据的结构“更像一棵树”:用户只和智能体对话了几轮,智能体后端却已经和模型交互了几十轮,到后来90%以上的Token,都花在了历史上下文的累积上,真正需要重新计算的只是一小段。

据SemiAnalysis的报告,智能体现在已经贡献了约70%的推理流量。

负载变了,推理系统的优化目标也要随之变化。这正是SGLang这类开源推理框架多年在做的事:既然大量Token是在重复计算同一个上下文,那就想办法让它“复用”,而不是重算

SGLang最早提出的RadixAttention,用一个前缀数来查找KV Cache,让共享前缀的Request能够通过前缀数快速查找到已经计算好的KV Cache,并进行复用;显存放不下时,再用HiCache把缓存下沉到内存甚至SSD,把上下文拉得更长。

这种变化的效果是实打实的。王书文现场给出的实测数据显示,早期缓存命中率只有10%至30%,接入跨实例存储后,可以提升至80%至90%,首Token延迟也随之明显下降。

从回答一个问题到持续干活,推理侧的核心矛盾,从算得快变成了少重复算。理解了这一点,才能看懂接下来两层:推理框架和算子系统,各自在解决什么。

三、从模型发布到跑起来,infra层要闯过“九道关”

用户看到的只是一个“能用”的模型,但一个模型从发布到真正跑进产业,中间隔着一条很长的流水线。

应用与智能体提出需求、模型发布、推理框架支持、算子补齐、芯片适配、功能跑通(day 0)、精度对齐、单算子/单机性能调优、系统级推理优化,再到生产化投产。

在AICC现场,这条链路被多位讲者反复梳理,业内把它称作“九道关”。

这条流水线,大体可以分成两层来看。

上层是推理框架,回答一款新模型今天发布,推理服务最快什么时候能跑起来;下层是算子与系统,回答一款模型要在国产多元芯片上都跑起来、结果对、性能也够好,需要解决什么。

这两层在大会前后,各有一个看得见的标志性进展。

框架这一侧,答案落在“Day-0”上——新模型发布当天,推理框架就能完成支持。SGLang核心贡献者在现场列出了近期第一时间完成支持的DeepSeek-V4.1、千问3.8 Flash、Nemotron 3.5等模型。

算子这一侧,变化发生在大会召开前不到一个月。阿里Qwen3.8-Flash-Next、智谱GLM-5.3-Flash、腾讯Hy4 preview三款MoE模型接连上新,带来了全新的注意力结构、复杂的混合注意力部署,以及770B超大参数等不同适配难题。

智源牵头的众智FlagOS社区,在四天之内连续完成三轮多芯适配,其中两款实现了发布当日Day0,适配范围覆盖摩尔线程、沐曦、昆仑芯、海光、天数智芯、清微智能等10款AI芯片。

213:1的Token悬殊背后,智能体正在改写推理方式

这种速度背后,是一套逐渐沉淀下来的公共技术资产,包括算子库、编译器,以及对接vLLM和SGLang的插件层。

新模型出现后,共性的能力可以沉淀在公共层,芯片之间的差异则尽可能收敛到插件和底层适配环节,从而减少各家重复完成同一套工作的成本。

我们在现场观察到,这条过去由各家厂商各自为战的流水线,正在变成一套可以复用的公共基础设施。

四、需求在涨、供给受限,中国AI计算的答案是开源协同

当然,对中国市场来说,这条流水线还有一层更现实的约束。当智能体加速进入生产、科研和社会服务,推理需求持续增长,对算力供给的规模、效率和适配能力也提出了更高要求。

这道题怎么解?

我们在大会现场看到的一个共同方向,是开源与多元

围绕这一方向,产业正在形成多种探索路径,其中,开源框架、基础软件与多元算力适配,是一条值得关注的路线:把不同芯片、系统和软件组织起来,转化为稳定、高效、可规模供给的系统能力。

具体来看,可以观察两类样本。

SGLang等开源推理框架,就是其中一个缩影。通过缓存、调度和系统级优化,推理框架正在进一步提升计算资源利用效率,让有限的硬件资源承载更多推理任务。

另一类探索发生在多元芯片适配层。以智源牵头的FlagOS为例,其希望通过更加统一、开放的基础软件体系,降低不同模型、框架与AI芯片之间的适配成本,让新模型能够更快运行在不同计算平台之上。

FlagOS社区将这一问题概括为,让复杂的“M×N”适配尽可能向“M+N”模式演进。过去,每种模型框架和每款芯片都可能需要单独适配;如果算子、编译、框架等公共层能够形成更统一的接口和协作方式,框架侧与硬件侧分别对接公共层,就有机会减少重复适配,提高技术复用效率。

213:1的Token悬殊背后,智能体正在改写推理方式

这种开源协同的价值,也开始落到具体的数字上。我们在现场听到一种形象的说法,是把推理服务看成一座“Token工厂”:投入的是GPU、服务器、网络和电力等固定成本,产出的是Token这一可变收益。

有厂商基于开源推理框架和分布式缓存系统搭建推理底座,日均Token产量已稳定突破1万亿,生产效率较此前提升3倍总产能增长超过30倍

可以看到,在算力需求持续增长、硬件供给存在约束的情况下,中国AI计算正在尝试借助开源协同,把有限的单卡性能、分散的多元芯片和快速变化的模型,组织成更稳定、更高效、可规模供给的推理能力。

结语:让智能可获取、可负担,是中国AI计算的下一个命题

智能体时代,中国AI计算的真正命题,是如何把多元的芯片、系统和软件组织起来,持续支撑智能体的规模化运行——既让前沿智能不断突破上限,也让智能普遍进入千行百业。

AICC2026给出的答案是开放与协同。大会现场,推理框架与算子层所呈现的进展,看似技术而细微,其实都在回答同一个问题:如何让一款新模型更快地跑起来、在更多芯片上跑起来、让更多人以更低的成本用上它。

当智能体从少数机构的演示,变成企业、个人和社会普遍需要的生产能力,AI计算的竞争,已经升级为一场开放协同的竞争。谁能把多元的芯片与软件拧成一股可以规模供给的算力,谁就能定义智能普惠的底座。

这正是这场大会,以及中国AI计算产业,正在书写的下一步。

本文来自大风号,仅代表大风号自媒体观点。