Kaiyun(中国大陆智能科技)股份有限公司-官网

联系我们CONTACT US
地址:盖州市西海工业园区
手机:13364175009
电话:0417-7630288
邮箱:sysgtg001@163.com
查看更多
R行业动态RECENT NEWS
你的位置: 首页 > 行业动态

内部智能体平均上下文已达6万百度百舸开始优化推理基础设施

发布时间:2026-09-26 04:31:49  点击量:

  

内部智能体平均上下文已达6万百度百舸开始优化推理基础设施(图1)

  智能云联合SGLang社区举办“Agent时代的推理基础设施”Meetup,探讨了多芯适配、上下文缓存、KV Cache优化、显存优化、MoE专家压缩和推理服务治理等议题,探讨Agent走向生产环境所需要的推理底座。

  智能云主任架构师黎世勇在会上透露,“Agent(智能体)时代带来了很多的变化,典型的就是(上下文)序列的长度变得非常长,去年我们聊推理服务优化时一个典型的Workload还是输入4k、输出1k这种短输入的上下文,现在内部平均上下文在60k左右,而且还在继续往上涨,100k、500k都有可能。”

  当前,Agent工作负载正在呈现长输入、多轮次、强复用的特征。因此,Agent时代的推理基础设施不能只关注模型一次“答得多快”,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。

  对此,百度介绍,面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和MoE专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。在相关测试中,MoE专家压缩50%后,长输出和高并发场景下的输出吞吐峰值可达到原来的2.23倍。

  而在多芯适配方面,sglang-kunlun插件打通SGLang与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动SGLang社区建立硬件可插拔插件机制,并从芯片Kaiyun研究所算子、任务下发和通信等层面进行优化。

  百度智能云高级工程师董新宇称,依托插件机制,国产卡开发可复用70%至80%的CUDA生态经验。

【返回列表页】

顶部

地址:盖州市西海工业园区  电话:0417-7630288 手机:13364175009
Copyright © 2025 Kaiyun中国大陆智能科技股份有限公司 版权所有   ICP备案编:辽ICP备09016534号-1