21 · 批处理与效率优化
批量生成、XY Plot 对比实验、显存优化、速度提升技巧
01 批量生成
Queue Size 批量
右上角 Queue Size 设置 > 1,ComfyUI 自动重复执行整个工作流多次。
每次执行 seed 会自动变化(取决于 control_after_generate 设置)。
Batch Size 批量
在 Empty Latent Image 里设置 batch_size > 1,GPU 一次处理多张图。显存充足时效率最高。
| 方式 | 优点 | 缺点 |
|---|---|---|
| Queue Size | 不额外消耗显存 | 慢,一张一张来 |
| Batch Size | 快,GPU 并行 | 吃显存,batch_size=4 约需要 4 倍显存 |
02 XY Plot:参数对比神器
用 Efficiency Nodes 里的 XY Plot 节点,可以自动对比不同参数的效果。
用法
- 添加 XY Plot 节点
- 设置 X 轴变量(比如不同 CFG 值)和 Y 轴变量(比如不同采样器)
- 它会自动生成一张对比大图——每一格是一种参数组合
常用对比实验:
- CFG: 3, 5, 7, 9, 12
- Steps: 10, 20, 30, 50, 100
- Sampler: euler, dpmpp_2m, dpmpp_sde, ddim
- 不同 LoRA 权重: 0.3, 0.5, 0.7, 1.0
03 显存优化技巧
| 技巧 | 效果 |
|---|---|
--lowvram 参数 | 显著降低显存占用 |
| 使用 fp16 模型(.safetensors 通常是) | 比 fp32 省一半显存 |
VAEDecodeTiled 代替 VAE Decode | 大图解码不爆显存 |
| 减小 batch_size | 最直接的省显存方式 |
| 关闭浏览器其他标签页 | 浏览器也吃显存 |
| 不用时卸载模型 | Manager 里有 Unload Models 功能 |
04 速度优化技巧
| 技巧 | 加速效果 |
|---|---|
| 降低 steps(20-25 足够) | 步数越少越快 |
| 用 LCM/Turbo 模型 | 4-8 步就能出图 |
--highvram 参数(显存 > 12GB) | 预加载模型,切模型快 |
| 用 SD 1.5 代替 SDXL | 快 2-3 倍 |
| xformers 加速 | PyTorch 编译优化 |
| 升级显卡 | …这不用说了吧 |
💡 一句话总结:XY Plot 是参数探索最佳工具,
--lowvram+VAEDecodeTiled是低显存救星。