分布式推理概念介绍:
一下的几种方式可以单独使用也可以组合使用,共同发挥其作用
1. 单卡 VS 分布式推理
单卡推理:一个模型完整放在一张 GPU 上。
分布式推理:模型或请求被拆到多张 GPU / 多台机器上。
你的场景是:
2 台机器 × 每台 1 张 H100 = 2 张 GPU
所以属于 跨节点分布式推理,重点不是显卡本身,而是两台机器之间的网络通信。
2. TP:Tensor Parallel,张量并行
TP 是把模型的某些矩阵计算切开,让多张 GPU 一起算同一层。
比如:
TP=2
意思是一个模型层被拆到 2 张 GPU 上共同计算。
优点:
- 适合大模型;
- 显存压力可以分摊;
- 单层计算可以并行。
缺点:
- GPU 之间通信非常频繁;
- 跨机器 TP 对网络要求高;
- 没有 InfiniBand / RoCE 时性能可能很差。
3. PP:Pipeline Parallel,流水线并行
PP 是把模型的不同层拆到不同 GPU 上。
比如一个 72B 模型有很多层:
GPU 1:负责前半部分层
GPU 2:负责后半部分层
这就是:
PP=2
优点:
- 跨机器通信压力比 TP 小;
- 适合“每台机器一张卡”的场景;
- 更容易跑通。
缺点:
- 延迟可能更高;
- 小 batch 时 GPU 利用率可能不高;
- 需要调度流水线,效率不一定最优。
4. DP:Data Parallel,数据并行
DP 是每张 GPU 都放一份完整模型,然后不同 GPU 处理不同请求。
比如:
GPU 1:处理用户 A 请求
GPU 2:处理用户 B 请求
优点:
- 提升并发能力;
- 通信压力小;
- 部署简单。
缺点:
- 每张 GPU 都要完整放下模型;
- 对大模型没法省显存。
5. EP:Expert Parallel,专家并行
EP 主要用于 MoE 模型,比如 DeepSeek-V3/R1、Qwen3-235B-A22B 这类。
MoE 模型有很多专家,但每次只激活一部分专家。
EP 的意思是:
不同 GPU 放不同专家
优点:
- 适合超大 MoE 模型;
- 可以把专家分布到多张卡上。
缺点:
- 部署复杂;
- 路由、通信、负载均衡都要考虑;