您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [上海交通大学]:迈向Token服务新范式——从评测到调度的全链路优化供给 - 发现报告

迈向Token服务新范式——从评测到调度的全链路优化供给

报告封面

——从评测到调度的全链路优化供给 演讲人:冷静文上海交通大学计算机学院副院长 Token调用量高速增长 Token调用量增长分析 Token增长主要来自AI工作流的自我消耗 Agent化、编程智能体、多步骤执行、中国模型供给扩张,共同把Token从交互用量推向生产用量 Token服务形式的优势 通过云平台将大模型封装为Token调用服务,是人工智能目前的主要服务模式 中国是Token服务发展的沃土—政策支持 国务院发文《关于深入实施“人工智能+”行动的意见》,指出 “培育人工智能应用服务商,发展‘模型即服务’、‘智能体即服务’等,打造人工智能应用服务链” 中国是Token服务发展的沃土-市场环境 中国Token服务现状 「从一个异常发现说起」 便宜模型的账单悖论引发警觉 开发者很喜爱的claude code,调用便宜模型,实际费用异常偏高,打破了"单价低则成本低"的直觉认知按某用户当天计费日志做样本(该模型当天148次请求) 反常现象:便宜约4倍的模型,单次花费却和旗舰打平 同为当天真实请求|柱高=单次平均成本|柱内配色=输入侧缓存构成 一眼看懂 两根柱几乎一样高=单次花费打平。但便宜模型76%是红色全价、旗舰98%是绿色打折——单价本该便宜4倍,全被「未命中缓存」抹平了。 为什么会存在这样的情况? •进一步排查发现:同一个会话的多轮请求,缓存命中率极低 -提示词中有计费内容块,其中包含一个每轮都在变化的cch值,导致缓存无法命中 (Claude Code,自版本2.1.36起)为了计费归因,会在请求的提示词最前面注入一段计费内容块 会处理的服务商 不处理的第三方服务商 •处理前自动剥离该计费内容块•结果:即使cch每轮变,服务商看到的缓存前缀仍然稳定→命中正常。 •把含变化的cch的完整前缀当成缓存key•结果:大量输入未命中缓存,成本提升数倍 设计对比实验,把问题测成了“可验证事实” 构造多轮会话 交叉验证 对比实验 一路包含计费内容块,一路剥离计费内容块生成对比请求,交织发送请求进行对比。 取真实请求会话,将其中的消息块打散/脱敏后构造anthropic协议的多轮会话。 使用claude code直连服务商进行抽查,作为对比实验的交叉验证,确保实验结论具备统计学意义与行业参考价值。 测试结果:问题具有普遍性 •共测试62个模型×服务商组合,覆盖主流国产模型(DeepSeek v4、glm 5.1等)与主流服务商•在具备缓存能力的组合中,约43%的组合被cch击穿 测试结果:问题具有普遍性 •以DeepSeek-V4-Flash为例,近半数服务商被击穿,缓存命中为0 优化方案 网关转发前统一剥离计费内容块 在网关层将发往服务商的请求体中计费块整段删除,使服务商重新看到稳定前缀。 算指纹前剥除计费头整行 确保缓存键生成基于干净且稳定的内容,消除cch破坏性同时不误伤正常缓存。 降低实施复杂度与推广门槛 网关层统一处理无需逐个服务商协调,具备强工程可行性与通用适配性。 优化效果实现多重提升 命中率、缓存量、成本同时改善 命中率从20%跃升至80% Token成本最高下降75% 该模型token成本最高可下降约75%,使模型单价优势真正转化为成本优势,为企业级AI应用成本控制提供可复制的实践路径。 Coding场景下缓存命中率实现四倍增长,从约20%提升至约80%,恢复缓存机制应有作用。 Token:AI时代的水电 挑战-1:如何选择合适大模型? 模型适用场景不同 不同Benchmark评分不一致 面临现状:用户反复切换不同模型,互相对比验证效果 挑战-2:如何选择合适Token服务商? 供给侧 Token服务商的服务各具特色,用户的需求各不相同,如何对齐供需?面对众多Token服务商,对于同样的大模型,用户该选择哪家服务商? 问题 Token质量参差不齐 AI开发者到底需要什么系统? w w w . a i p i n g . c n 接入层全面聚合主流厂商与模型 600+大模型:文本、图片、视频…… 阿里云百炼百度智能云百灵大模型并行智算云DeepSeek硅基流动华为云火山方舟基石智算金山云星流京东云可灵AI快手万擎蓝耘元生代零克云MiniMaxMoonshot AI模力方舟PPIO派欧云七牛云SCNetSophNet商汤大装置腾讯云天翼云UCloud无问芯穹讯飞星辰智谱··· 评测驱动:让Token服务质量「透明可见」 •AI Ping的评测体系:从真实用户视角出发,端到端匿名评测 评测机制 评测维度 •7×24小时不间断运行,非一次性快照•北京、深圳、上海、成都异地分布式测试•动态输入机制,避免服务商「针对评测作弊」•同模型同输入同时段公平对比•与云厂商性能监测交叉验证,误差控制在1%以内 •首字延迟(TTFT)•输出吞吐(TPM)•可靠性(可用率、错误率)•价格透明度(输入/输出单价、隐性费用)•Cache命中率(直接影响实际成本) •成果:客观、可验证的性能榜单,让「黑箱」变「白箱」 性能评测:Token吞吐-延迟坐标图 性能评测:Token服务性能随时间变化趋势图 7 x 24小时高频率、多时段测试,性能数据实时更新 Token服务指标信息汇总 多关键字筛选 根据指标筛选、排序 智能路由:Token调度的「导航系统」 •AI Ping智能路由≠简单的API转发,而是实时路径规划 路由决策维度(多指标动态权衡) 路由策略模式 •价格:输入、输出、缓存的综合成本•首字延迟:用户体感响应速度、交互流畅度•输出吞吐:生成速度、长文本生成耗时•可靠性:调用成功率、故障概率•模型效果:任务匹配度、输出质量 •默认模式:综合最优平衡•成本优先:相同质量下选择最低成本路径•性能优先:最低延迟、最高吞吐•质量优先:复杂任务路由至最强模型 智能路由:模型路由 智能路由:模型路由 智能路由:模型路由原理 智能路由:Token服务商路由 智能路由:实时感知服务商多维状态 •服务商多维状态感知 服务商静态能力感知 实时维护不同服务商的参数支持状态,动态映射最大上下文窗口、最大输入/输出长度限制 服务商动态限流监控 解析单模型级和全局级的并发限制(RPM/TPM等),监控分钟级/小时级的配额消耗速率 服务商性能时序波动 捕捉同一供应商在不同时段的延迟抖动与吞吐衰减特征 智能路由:Token服务商路由原理 智能路由:提供统一路由API 智能路由效果 效能优势 智能路由效果 评测×路由:1+1 >2的协同效应 没有评测的路由=盲飞 没有路由的评测=白测 •不知道每条「路」的真实路况•只能基于静态价格做决策•服务商波动时无法自适应•容易陷入「低价陷阱」:单价低但Cache命中率也低,最终总成本反而更高•无法验证路由决策是否有效 •测数据无法转化为实际价值•用户看完榜单仍不知该选哪家•手动切换服务商成本高、效率低•无法应对服务商性能的实时波动•评测成为「信息消费品」而非「生产工具」 如何高效生产Token:大模型推理引擎 赤兔大模型推理引擎国产算力高质量Token输出 中国Token服务进入分层时代 焦点从“算力(FLOPS)”转向“Token (词元)” 2026年,中国AI产业核心焦点已从“技术攻坚”转向“规模化落地”。衡量价值的标尺正从算力(FLOPS)逐步被Token(词元)取代。AI基础设施(AI Infra)的核心任务,也从单纯“提供算力”转变为“构建高效的Token流转网络”。 01 /底层生产层 03 /顶层调度层 02 /中层中转层 •定位:AI产能核心,解决Token“从无到有”•核心:物理算力资源转化为Token产能•竞争:规模、稳定性、能耗、适配效率 •定位:资源枢纽与连接器,解决“产能分散”•核心:整合分散资源,提供统一Token接入•竞争:上游资源抢占、渠道与流量运营 •定位:AI基建的“大脑”与智能核心•核心:“评测+路由”算法,实现Token价值最大化•竞争:评测精度、路由效率、跨Infra适配能力 价值核心凸显 调度层技术壁垒高,引领行业标准制定 竞争逻辑转变:从单一算力比拼→全链路Token流转效率未来趋势:三层协同,推动算力依托Token实现普惠化 Token服务调度层实现逻辑 THANKS 迈向Token服务新范式——从评测到调度的全链路优化供给