产品服务

PC-Farm 4U4H/6U6H:把可插拔PC节点装进标准机架的运维粒度、750W背板与冗余供电设计

2026-08-226 分钟阅读PC-Farm / 4U4H / 6U6H

军航科工 PC-Farm 分布式节点服务器把 4 个(4U4H)或 6 个(6U6H)可插拔 PC 节点装进标准机架机箱。本文解释这一形态针对的负载形状:为什么节点热插拔与完全独立上下电把运维粒度和故障域切到单节点、背板 750W 峰值/节点与 4 路 CRPS 1100W 冗余电源构成的两层供电设计意味着什么,以及每节点一张 GPU 卡为什么恰好匹配渲染农场与批量推理这类按数量扩展的业务。

一类负载,两种错误的承接方式

渲染农场按帧分发任务,批量推理按请求分流,云桌面一人一机——这类业务的共同形状是大量互相独立的小任务,每个任务一颗 CPU、至多一张 GPU 卡就够。用 8-10 卡 GPU 服务器承接它们,昂贵的多卡密度与大风道完全用不上;散放几十台塔式 PC,供电、散热与资产管理又会失控。PC-Farm 系列给出的答案介于两者之间:4U4H 把 4 个可插拔 PC 节点装进 4U 机箱,6U6H 装 6 个,节点各自独立运行,机箱统一解决供电与机架安装,让“一堆小机器”进入标准机房的管理体系。

热插拔加完全独立上下电:运维粒度切到单节点

PC-Farm 的节点支持热插拔,并且完全独立上下电,两者合起来决定了运维动作的粒度。某个节点系统崩溃或硬件故障,处置动作是对该节点单独断电、拔出、推入备件,机箱内其余节点全程在线;重装系统、升级驱动这类计划内操作,同样不需要为整箱协调停机窗口。与虚拟化整合方案相比,节点之间没有共享的宿主机内核,一个节点的软件故障波及不到邻居——故障域的边界就是节点的物理边界。这对无人值守时段的流程尤其友好:值班只需把问题节点下电隔离出集群,修复可以等到白天。

750W 背板与 4 路 CRPS 1100W:供电设计的两层

供电要分两层看。节点层,背板给每个节点的供电峰值为 750W,这个预算框定了节点内 CPU、GPU 卡与外设的功耗上限,也意味着节点满载时彼此不抢电——预算按节点划死,而不是全箱共享后各凭运气。整机层,4 路 CRPS 1100W 冗余电源统一供电,单路故障时其余电源继续承载,支持在线更换;CRPS 是服务器通用冗余电源规格,备件可与机房其它设备打通。集中供电取代每台 PC 各配一只电源,故障点更少,而电源冗余本身就是散放的桌面机根本不具备的能力。

每节点一张 GPU 卡:按数量扩展的负载

6U6H 的每个节点支持一张 GPU 卡,对应的负载画像是按节点数横向扩展:渲染农场把帧或镜头切给各节点独立渲染,节点之间零通信;推理服务在每个节点部署一份模型副本,请求按节点分流,单节点故障只损失一份副本的吞吐;云图形终端则是一个节点服务一组用户。判别标准只有一条:任务之间是否需要 GPU 互联。需要多卡并行、大显存单任务的训练与大模型推理,属于 8-10 卡平台的领地——PC-Farm 扩展的是节点数量这个维度,不是单机算力。

4U4H 与 6U6H 之间

两个型号的节点热插拔、独立上下电、背板供电与 CRPS 冗余设计一致,差别在密度与形态:4U 装 4 节点,6U 装 6 节点。机柜 U 位紧张、以节点数量为先的场景选 6U6H,每节点一张 GPU 卡的支持也让它更贴近推理与渲染农场;4U4H 则以更小的机箱粒度起步,适合按业务批次逐柜扩容。说到底,PC-Farm 回答的是一个朴素的问题:当业务由几十个互不相干的小任务组成时,机架里更合理的形态是几十台可以被单独处置的小机器,而不是一台不能停的大机器。

키워드
PC-Farm4U4H6U6H分布式节点服务器节点热插拔独立上下电CRPS冗余电源渲染农场批量推理军航科工