📄️ PD(Prefill&Decode)分离
深入探讨LLM推理中的PD(Prefill&Decode)分离技术,分析其原理、指标、优势及实现方案,提升大模型推理性能和用户体验
📄️ NVIDIA Dynamo: 分布式AI推理的高效引擎
介绍NVIDIA Dynamo,一个分布式AI推理的高效引擎,分析其架构设计、组件功能及工作原理,了解如何通过PD分离、智能路由和分布式KV缓存管理等技术提升大模型推理性能
📄️ 单机多卡部署,GPU之间无法使用NVLINK通信问题排查
详细分析和解决单机多卡部署中GPU之间无法使用NVLINK通信的问题。以PD分离技术为例,深入探讨GPU资源隔离机制、容器特权模式配置、GPU拓扑结构发现等关键技术,提供可供参考的解决方案。