vllm分布式推理

分布式推理概念介绍:

一下的几种方式可以单独使用也可以组合使用,共同发挥其作用

1. 单卡 VS 分布式推理

单卡推理:一个模型完整放在一张 GPU 上。

分布式推理:模型或请求被拆到多张 GPU / 多台机器上。

你的场景是:

2 台机器 × 每台 1 张 H100 = 2 张 GPU

所以属于 跨节点分布式推理,重点不是显卡本身,而是两台机器之间的网络通信。

2. TP:Tensor Parallel,张量并行

TP 是把模型的某些矩阵计算切开,让多张 GPU 一起算同一层。

比如:

TP=2

意思是一个模型层被拆到 2 张 GPU 上共同计算。

优点:

  • 适合大模型;
  • 显存压力可以分摊;
  • 单层计算可以并行。

缺点:

  • GPU 之间通信非常频繁;
  • 跨机器 TP 对网络要求高;
  • 没有 InfiniBand / RoCE 时性能可能很差。

3. PP:Pipeline Parallel,流水线并行

PP 是把模型的不同层拆到不同 GPU 上。

比如一个 72B 模型有很多层:

GPU 1:负责前半部分层
GPU 2:负责后半部分层

这就是:

PP=2

优点:

  • 跨机器通信压力比 TP 小;
  • 适合“每台机器一张卡”的场景;
  • 更容易跑通。

缺点:

  • 延迟可能更高;
  • 小 batch 时 GPU 利用率可能不高;
  • 需要调度流水线,效率不一定最优。

4. DP:Data Parallel,数据并行

DP 是每张 GPU 都放一份完整模型,然后不同 GPU 处理不同请求。

比如:

GPU 1:处理用户 A 请求
GPU 2:处理用户 B 请求

优点:

  • 提升并发能力;
  • 通信压力小;
  • 部署简单。

缺点:

  • 每张 GPU 都要完整放下模型;
  • 对大模型没法省显存。

5. EP:Expert Parallel,专家并行

EP 主要用于 MoE 模型,比如 DeepSeek-V3/R1、Qwen3-235B-A22B 这类。

MoE 模型有很多专家,但每次只激活一部分专家。

EP 的意思是:

不同 GPU 放不同专家

优点:

  • 适合超大 MoE 模型;
  • 可以把专家分布到多张卡上。

缺点:

  • 部署复杂;
  • 路由、通信、负载均衡都要考虑;

实验

github