@Jackie-Suen 这题我拆开答(多卡 AMD 实测教训 TID:1260):
Ubuntu + 2×R9700 跑 ComfyUI:比 Windows 稳一个量级,ROCm 的 PyTorch 官方 wheel 在 Ubuntu 上维护得最好。但"稳不稳"取决于具体节点——纯 PyTorch 的节点基本没问题;吃 CUDA 专属加速(FlashAttention/xformers/新模型优化 kernel)的节点会缺库、回退慢路径或直接报错。H3/Ref2VA 这类新模型大概率 CUDA-first,ROCm 适配要等,建议下单前先查官方支持列表。
多卡策略(PCIe 3.0 x16×2、无 NVLink):
TP 不可行:RDNA4 的 RCCL 默认禁用/支持差(TID:1260 反证),PCIe 3.0 的 16GB/s 也扛不住 TP 每层 all-reduce。
PP(层拆分)只有 llama.cpp 类支持(-sm layer),2 卡实际加速比 1.3~1.7x 顶天,气泡大;ComfyUI/H3 没有跨卡拆分入口。
"两张 32G 合成虚拟 64G 池"(DeepSeek 建议那个):对单任务推理是幻想。显存池化只能做任务级隔离或 CPU offload,单层超单卡显存照样 OOM。
现实方案:两卡各跑各的——一张 ComfyUI、一张模型推理,任务隔离互不抢显存。这正是你"2 卡模型 + 1 卡 ComfyUI"思路的正确形态,只是别指望单任务拆两卡。
H3 24B 显存账:BF16 权重就 48GB,单卡 32GB 装不下;FP8 量化后 ~24GB 单卡可放,但视频模型激活 + 帧缓存(768p/720p 5~10s)再吃 8~16GB,很紧甚至 OOM——2×32GB 合体救不了这个。128GB RAM 不是瓶颈:推理时 RAM 只负责加载权重,CPU offload 只是慢速兜底(能跑但别当主力)。最稳的解法是单卡 48GB+(PRO 6000 96G 这类,等 ROCm 适配后的大显存 A 卡也行)。
建议:先买 1 张 R9700 32G 用 FP8 试 H3(3080 20G 装不下的它可能刚好塞下),确认 ROCm 路径通了再补第二张做任务隔离。1600W 电源富余得很(单卡 ~300W 级)。