漫步远方,心荡神往

vLLM 多机多卡推理测试与验证(Docker)

使用 Docker 容器与 Ray 引擎搭建跨节点 vLLM 多机多卡分布式大模型推理环境

介绍使用 Docker + Ray 启动 vLLM 跨主机分布式集群(Ray Head/Worker 模式)的配置步骤、包含 Raylet 节点通信、NCCL 环境变量设置与多卡张量并行(Tensor Parallelism)性能测试。

vLLM 多机多卡推理测试与验证(Kubernetes)

基于 KubeRay / RayCluster 在 Kubernetes 上部署 vLLM 分布式张量与流水线并行推理服务

实战讲解在 Kubernetes 容器集群中使用 KubeRay 部署分布式 vLLM 多机多卡推理服务的全过程,包含 RayCluster 资源分配、RDMA 网络配置、TP/PP 架构调优与灰度发布实践。

云原生 AI 能力引擎(大模型 AI 基础套件)

从底层 GPU 驱动、虚拟化调度到分布式训推框架与国产化算力的全栈技术地图

全景式整理云原生 AI 与大模型基础设施技术图谱:涵盖 CUDA/NVIDIA-Container-Toolkit 基础依赖、NVIDIA-GPU-Operator、KubeFlow/Volcano 异构资源调度、RoCE 高性能网络、DeepSpeed/Megatron 训练框架及 vLLM 推理引擎生态。

2025 新年快乐(Happy New Year)

新年的钟声已经敲响,我们迎来了崭新的 2025年!🎉 感谢过去一年里大家的陪伴与支持,新的一年,愿我们一起迎接更多美好的时刻。🌟 祝愿大家在 2025 年 ✨ 身体健康,平安顺遂; ✨ 事业顺利,蒸蒸日上; ✨ 家庭幸福,温馨和睦; ✨ 心想事成,笑口常开! 愿所有的努力都有回报,所有的期待都能实现。让我们怀揣希望,共同书写新一年的辉煌篇章!新年快乐,万事如意!🎊🎁

NVIDIA GPU 系统诊断与运维排查手册:常用命令与一键脚本指南

全面掌握 GPU 系统诊断:从硬件到驱动的一站式排查指南

本文系统整理了在使用 NVIDIA GPU 及其他加速卡时常见的系统诊断工具与命令,覆盖硬件信息、操作系统状态、内核日志、网络互联(OFED/Fabric)、IPMI 管理以及 NVIDIA 专属监控工具(如 nvidia-smi、nvidia-bug-report.sh) 等关键维度,为 GPU 用户提供全面的系统诊断工具箱。