漫步远方,心荡神往

vLLM 多机多卡推理测试与验证(Docker)

使用 Docker 容器与 Ray 引擎搭建跨节点 vLLM 多机多卡分布式大模型推理环境

介绍使用 Docker + Ray 启动 vLLM 跨主机分布式集群(Ray Head/Worker 模式)的配置步骤、包含 Raylet 节点通信、NCCL 环境变量设置与多卡张量并行(Tensor Parallelism)性能测试。

vLLM 多机多卡推理测试与验证(Kubernetes)

基于 KubeRay / RayCluster 在 Kubernetes 上部署 vLLM 分布式张量与流水线并行推理服务

实战讲解在 Kubernetes 容器集群中使用 KubeRay 部署分布式 vLLM 多机多卡推理服务的全过程,包含 RayCluster 资源分配、RDMA 网络配置、TP/PP 架构调优与灰度发布实践。

云原生 AI 能力引擎(大模型 AI 基础套件)

从底层 GPU 驱动、虚拟化调度到分布式训推框架与国产化算力的全栈技术地图

全景式整理云原生 AI 与大模型基础设施技术图谱:涵盖 CUDA/NVIDIA-Container-Toolkit 基础依赖、NVIDIA-GPU-Operator、KubeFlow/Volcano 异构资源调度、RoCE 高性能网络、DeepSpeed/Megatron 训练框架及 vLLM 推理引擎生态。

2025 新年快乐(Happy New Year)

新年的钟声已经敲响,我们迎来了崭新的 2025年!🎉 感谢过去一年里大家的陪伴与支持,新的一年,愿我们一起迎接更多美好的时刻。🌟 祝愿大家在 2025 年 ✨ 身体健康,平安顺遂; ✨ 事业顺利,蒸蒸日上; ✨ 家庭幸福,温馨和睦; ✨ 心想事成,笑口常开! 愿所有的努力都有回报,所有的期待都能实现。让我们怀揣希望,共同书写新一年的辉煌篇章!新年快乐,万事如意!🎊🎁

记一次 NVIDIA 卡训练任务出现 OOM 排查过程和解决思路

要求机器配置、驱动、CUDA、PyTorch、大模型、OOM、GPU、容器、虚拟化、内核、存储网络、兼容性、初始化、共享模式等配置相辅相成,排查过程复杂,需综合分析

本次OOM问题表现为GPU显存充足但PyTorch无法申请,具有概率性、偶发性特征。排查覆盖资源限制、容器运行时、GPU插件、CUDA环境、驱动、内核、存储网络等多个层面,排除了主存限制、存储I/O、网络及runtime实现问题。关键线索包括:nvidia-smi显示初始化显存异常(仅4M)、旧内核(3.10)与新驱动(535+)兼容性存疑、GPU共享模式干扰、前后脚本连续执行可能导致CUDA上下文污染。综合判断,问题核心并非真实显存不足,而是CUDA上下文初始化失败或状态异常,由前置脚本隐式加载CUDA、GPU虚拟化干扰、旧内核兼容性不足等多重因素叠加导致,属于“伪OOM”。