返回 ELI5 知识库首页 ☀️ AI DISTRIBUTED ORCHESTRATION
☀️ KubeRay · Ray on Kubernetes · Distributed AI Orchestrator

什么是 KubeRay(大模型分布式工头)?

原生的 K8s 只懂管理常规微服务(Web 网页/数据库),根本不懂大模型并行的“张量切分、GPU 拓扑和 Actor 调度”;而 KubeRay 就像驻扎在 K8s 港口里的“分布式 AI 施工总工头” —— 把几万张 GPU 凝聚成一台超级大电脑,驱动 vLLM、DeepSeek 训练与强化学习!

📦 原生 K8s 调度 AI:水土不服

把 AI 任务当成普通网页硬塞

K8s 原生只懂容器副本(ReplicaSet),不懂大模型的流水线并行与跨节点对象共享。Python 分布式任务(Ray)一跑,节点故障或动态扩容时代码瞬间崩溃!

普通 K8s Pod 无 Python 拓扑感知 AI 动态扩缩容 内存对象丢失崩溃 ⚠️ 原生 K8s 缺乏对 AI 分布式计算范式的支持
  • 缺乏 Ray 拓扑生命周期:分不清谁是 Head 节点、谁是 Worker 节点
  • 无法智能自动缩容:不能根据 GPU 利用率或请求排队数做毫秒级扩缩
VS
☀️ KubeRay:云原生与 AI 完美合体

声明式掌控 Ray 整个 AI 集群

通过 K8s Operator 机制注入 RayCluster / RayService / RayJob 自定义资源。K8s 负责底层硬件自愈,Ray 负责上层 Python 算力编排,天作之合!

☸️ KubeRay Operator (CRD 控制器) RayCluster: 统一显存池 & GPU 拓扑 ☀️ Head GCS 调度 Worker-01 8x H100 GPU Worker-02 8x H100 GPU ✨ 云原生基础设施与 Python AI 算力的终极桥梁!
  • CRD 声明式定义:像写普通 K8s YAML 一样秒级拉起百卡集群
  • 零停机服务(RayService):vLLM 权重升级无缝切换,请求零丢包
💡

一句话顿悟:为什么全世界做大模型的公司都必须用 KubeRay?

大模型时代有两个绝对霸主:底层的云原生标准是 Kubernetes,上层的 Python 分布式标准是 Ray(vLLM/DeepSeek/RLHF 都在用)KubeRay 就是连接这两大霸主的“官方超级粘合剂” —— 让你用最标准的云原生方式,掌控最狂暴的 AI 算力!

拆解 KubeRay 体系的 4 大核心神器

从底层 CRD 资源到大模型服务化部署,搞懂分布式 AI 基础设施

🏗️

1. RayCluster (集群级 CRD)

K8s 里的自定义资源。声明一个 Head 节点(调度大脑)和一组 Worker 节点(GPU 打手),KubeRay 自动建立集群通信拓扑。

🚀

2. RayService (零宕机大模型推理)

专为 vLLM / Ray Serve 打造。支持根据实时 QPS 自动伸缩 GPU Worker,并能在模型升级换代时做到完全零中断滚动发布

🏃

3. RayJob (离线训练与微调)

跑完即焚。提交一个大模型 LoRA 微调任务,KubeRay 自动拉起 64 张显卡,跑完后自动保存 Checkpoint 并立即释放硬件省钱!

4. 共享对象存储 (Plasma Store)

Ray 独创的分布式内存共享机制。节点内多进程通过共享内存(Zero-Copy)毫秒级传输千亿参数张量,彻底击碎数据搬运瓶颈。

🕹️ KubeRay 弹性大模型集群演练台

观察 KubeRay 如何根据不同 AI 场景动态调度 Ray Head 与 GPU Worker 节点:

☀️ Ray Head (GCS 调度元数据中枢) Active
GPU Worker 节点池 (Pods):
Worker-1
8x H100
Worker-2
8x H100
Worker-3
Idle
Worker-4
Idle
☸️ kind: RayService (vLLM 推理服务)
服务已就绪:vLLM 实例运行在 2 个 Worker Pod (16x H100) 上。
支持张量并行 (TP=8) + 管道并行 (PP=2)!
✔ KubeRay Operator 维持最优状态
👑 加州伯克利神作

从 RISELab 到 Anyscale

Ray 诞生自加州大学伯克利分校(当年诞生了 Spark 的 RISELab 实验室)。

创始人创办了商业化公司 Anyscale,并将 KubeRay 捐赠给云原生计算基金会(CNCF),成为行业事实标准。

🤖 强化学习 RLHF 首选

PPO 与多模型动态协同

在 ChatGPT 的 RLHF 训练中,需要同时跑 Actor、Critic、Reward 与 Reference 四个大模型

只有 Ray 的动态 Actor 调度能力能够完美协调这 4 个模型在多卡之间的显存与数据流转。

💰 降本增效神器

GPU 抢占式实例 (Spot Instances)

KubeRay 深度集成了云厂商的便宜竞价实例(Spot)。

当机器被意外收回时,KubeRay 能在几秒内自动在其他机器上重新拉起 Worker 节点并恢复上下文,训练成本直降 70%