让Token生产更高效:异构混推的关键技术演进与创新实践
Token经济加速爆发,算力需求发生结构性反转,推理需求已取代训练,成为算力增长主引擎。
以下正文同步自 量子位,版权归原站所有,已转换为易读排版。
Token经济加速爆发,算力需求发生结构性反转,推理需求已取代训练,成为算力增长主引擎。
随之而来的,是AI基础设施面临的全新命题与挑战:当Token调用量迈向千倍级增长,推理系统如何承接持续攀升的需求?如何通过异构算力实现高效、稳定的Token生产?
在近日举办的“2026全球AI芯片峰会·Token工厂异构混训混推技术研讨会”上,商汤大装置资深技术专家罗伟以《Token工厂:以异构算力构建新一代Al基础设施》为主题发表演讲,深入剖析规模化推理面临的系统挑战,并分享商汤大装置在异构推理架构、模型适配及关键技术演进等方面的实践与探索。
01行业挑战:Agent时代,推理负载瓶颈贯穿整套系统
Agent时代的负载特征,和传统单轮对话的推理需求有明显不同。
首先是长上下文,带来了输入计算和KV Cache占用的持续增长;其次是连续多轮的对话,意味着前缀复用和热点不断变化;再者是突发与长尾需求多,意味着流量和长度的分布会持续波动。
罗伟表示,面对这些变化,商汤大装置的底层逻辑已经转向“以Token、状态与时延预算为中心”,所有设计都围绕Token的生产效率、交付质量与单位成本,进行资源的组织和利用。
这一以Token为中心的系统设计,也支撑商汤大装置持续提升规模化Token生产与服务能力。如今,商汤大装置的日均Token服务量,已经从年初2月的0.46万亿,增长至8月4.5万亿。
02创新实践:横向串资源、纵向拉效率,系统级提高Token产能
如何把单点效率组织成系统级Token产能?罗伟分享了商汤大装置的两条主线:“横向编排”与“纵向优化”。两条主线最终指向共同目标:模型质量达标、SLO达标、有效吞吐提升、单位产能成本下降。
正文由 FLUX 从来源站点 RSS 同步,内容未经改写;遇到排版缺失或需要图片、视频时请以原文为准。