硅基流动亮相亚马逊云科技中国峰会,解码“Token 供应平台”推理基建实践

市场活动
2026-06-25
作者:硅基流动

近日,硅基流动作为生态合作伙伴受邀亮相亚马逊云科技中国峰会,与智元机器人、月之暗面(Kimi)等顶流明星项目及数十家初创先锋集体亮相「AI独角兽展区」。硅基流动解决方案总监唐安波在大会分论坛发表题为《大规模 AI 推理基础设施的工程实践》的专题演讲,深度分享了在 AI 推理基建领域的工程积淀与创新实践。

Token 消耗爆发,推理基建新要求

过去两年,模型推理逐步超过训练成为算力消耗的主阵地。多种因素共同推高 Token 消耗,对推理基础设施提出了新要求。

我们看到,AI 应用经历了从最早的生成式模型,如 Chatbot 多轮对话,然后到 Reasoning 模型、再到 Agentic AI 应用的连续跃迁。每一次 AI 应用交互模式的升级,都带来底层 Token 消耗的指数级上升。与此同时,模型本身的参数量也在持续膨胀,从 70B 到 400B 再到 1T 量级,还没看到规模的尽头。伴随模型能力升级与新应用场景解锁,Token 用量的爆炸性增长带来越来越高的 AI 账单。

除此之外,在企业场景里,普遍存在 GPU 利用率不足与资源浪费的情况。当 AI 应用从 POC 验证转向规模化扩展,企业级稳定性成为硬要求。

于是,推理基础设施建设的核心命题演变为:如何构建高效率、规模化、低成本的工业级 Token 生产线

硅基流动的解法:开放、独立 Token 供应平台

硅基流动通过公有云 / 私有云 MaaS、AI 算力运营服务等多元解决方案落地“Token 供应平台”模式。平台上累计支持 170 多款主流开源大模型,满足多样化场景需求;日均 Token 消耗达数万亿;已服务超 1000 万用户与 1 万多家企业。

硅基流动“Token 供应平台”,稳定、高效、规模化生产并调度 Token,依托于其从底层至上层的系统性技术架构:

  • 算力层:统一纳管遍布多数据中心的算力资源,支持多厂商异构 GPU/NPU 硬件。
  • 框架层:基于自研推理加速框架,针对不同负载进行极致优化,支持高并发、高吞吐、超长上下文的场景需求,实现硬件理论峰值。
  • 模型层:深度适配与优化主流开源大模型,通过模型-机制-框架-算子联合优化,让同一模型在不同算力上都能跑出最佳性能。提供从部署到观测的模型全生命周期管理,沉淀了不同场景的最佳实践模板。
  • 服务层:通过标准化 API 接口统一输出模型能力,兼容 OpenAI 和 Anthropic 主流行业标准。用户可以开箱即用丰富的模型能力,无需关注底层架构复杂度,专注业务创新。

全链路推理优化实践:实现极致性能与资源效率

针对大模型的推理优化,硅基流动在超大规模生产级模型服务实践中积累了丰富的工程化经验,重点分享以下几点:

算子层的优化是最“原子级”的基础工作。通过自研推理框架,在算子优化、显存利用、批处理调度和通信效率等方面进行深度优化,实现数倍的推理加速,帮助企业在相同算力资源下获得更高吞吐能力。

PD 分离(Prefill-Decode 分离),提升集群吞吐效率。针对大参数类的 MoE 模型,引入 PD 分离的部署架构,在同等算力数量下,PD 分离部署相较于非 PD 分离部署方案,单从并发能力来看,即可实现 3-4 倍的提升。 同时针对大规模应用,支持 PD 实例根据业务流量自动扩缩容,提升高并发场景下的资源利用率和服务弹性。

KV Cache 分级卸载,提升长上下文吞吐,降低显存占用和推理总成本。随着 Coding、Open Claw 等场景的火爆,带来了推理场景上的改变,超长的输入,给 Prefill 以及 HBM 带来的极大的压力。通过 KV Cache 分级缓存机制,将高频缓存数据优先保留在高性能存储介质中,并结合长文本、多轮对话场景下的缓存复用策略,减少重复计算和显存占用压力。该架构不仅能够提升单模型推理性能,也为多模型并发服务、弹性扩缩容、异构算力适配和企业级大规模部署提供了更强的工程支撑。

网关智能化的调度策略,以全局视角进行优化。网关具备丰富的智能路由策略,如针对不同场景的处理:客服场景短输入短输出但对延迟极度敏感,追求秒级响应;舆情分析场景做批量处理,要的是单位时间内的吞吐能力而非首字延迟。网关根据不同的流量特征进行智能分发,保障应用侧对性能指标的要求,以及通过合理分配流量,让不同集群的吞吐能力得到充分利用。针对 KV Cache,则通过跨集群的分布式 Prefix Cache 感知策略,最大化命中可复用的前缀缓存,进一步压低算力消耗,降低成本,提升推理效率。

算力调度引擎,解决算力资源配置难题。硅基流动推出基于 AI 云原生理念、具备极致弹性与企业级高可用的算力调度引擎。传统模式下,客户配置算力资源,很难绕开一个经典困境:按波峰配,平时闲置浪费;按波谷配,峰值一来就扛不住。算力调度引擎的核心能力是自动弹性扩缩容,根据业务指标自动拉起或缩减模型实例,实现削峰填谷,保障模型服务稳定性。

总结:以“Token 供应平台”撬动算力价值

在 AI 应用场景持续解锁、Token 消耗指数级增长的当下,推理基础设施的工程深度,正在成为决定 AI 应用是否具备竞争力的隐性分水岭。硅基流动“Token 供应平台”将持续用更多样的算力方案、更灵活的调度策略以及对新模型的持续快速适配,让开发者与企业把算力真正用出性价比,助力 AI 应用落地

相关资讯

硅基流动亮相 AICon 大会、华为鲲鹏昇腾开发者大会、思科科技创新 AI 峰会

市场活动
2025-05-28

硅基流动在 WAIC 2025:连接 AI 生态新朋友,共话产业未来

市场活动
2025-08-01

硅基流动亮相服贸会、外滩大会,与业界交流 AI 前沿观点

市场活动
2025-09-16