
M-CRPS (Modular Hardware Common Redundant Power Supply):即模块化硬件通用冗余电源,我们对其中一些关键指标做一些解读。

如上图所示(公开网络可查询),是一个典型的1800W M-CRPS电源的规格书首页信息,列出了一些典型的规格特性。为了更好的理解其中规格的涵义,我们接下来对其中的一些典型特性进行一些说明。
在M-CRPS(Modular Hardware Common Redundant Power Supply)规范中,1800W 级别的电源尺寸有着非常严格的标准化定义,以确保不同厂家的模块可以互换(Interchangeable)。
根据 Intel 发布的 CRPS 规格标准,1800W 电源通常采用以下典型的尺寸规格:
1. 标准物理尺寸 (Standard Dimensions)
最常见的 1800W M-CRPS 电源外形规格如下:
注意:也有一些高密度版本或更长尺寸的版本(如265 mm),但对于 1800W 这个功率段,185mm是目前技术水平下追求高功率密度的黄金标准。
这种极高的功率密度正是电源必须使用80PLUS 钛金效率的原因——如果效率低,产生的热量在这么小的体积内根本无法散出去,后续我们会介绍80PLUS效率标准。
2. 关键结构特征
虽然 73.5mm 是 CRPS 的标准宽度,但随着散热技术(如使用 SiC/GaN 器件)的进步,市场上也出现了更窄的变体:
在设计 185mm 长度的 1800W 电源时,内部磁性元器件的扁平化设计是最大的挑战。
Closed loop throttle闭环节流控制(指电源根据温度、电流等反馈信号,自动实时调节输出功率或频率,以防止系统过热或过载。)
在服务器电源(M-CRPS电源)中,闭环节流控制(Closed Loop Throttle)是一项极其关键的保护与可靠性机制。它不仅仅是简单的“过热保护”,而是一种智能的动态平衡策略。以下是为什么需要它的核心原因:
1. 防止硬件受损与系统崩溃
在高功率密度的电源中,如果内部元件(如 MOSFET、变压器或电感)由于高负载或散热条件恶化而过热,传统做法是直接关断(Shut down)。
直接关断的危害:如果电源直接关断,服务器会立即掉电,导致内存数据丢失、硬盘损坏或业务中断,这是服务器电源不允许的动作。
节流控制的优势:通过闭环控制,电源会向系统(通过SMBAlert 或 PMBus)发出信号,告知其“我快撑不住了”。此时电源不会直接断电,而是限制输出功率,给服务器留出降低 CPU 频率或迁移任务的时间。
2. 应对瞬态环境恶化
环境 Spec 中定义的 50°C 是稳态值,但在实际运行中可能出现突发状况:
机房空调故障:环境温度迅速升高。
风道堵塞:服务器滤网灰尘过多导致风量减小。
风扇故障:电源内部风扇转速下降。闭环节流可以让电源在这些不利条件下“带病生存”,以较低的功率维持系统最基本的运行,而不是直接罢 工。
3. 实现“功率借用”与最大化输出
在冗余系统中,设计闭环节流保护功能下,允许工程师在设计时将功率推向极限。
电源可以短时间内工作在超载状态(例如 1800W 电源短时输出 2100W)。只要闭环系统监测到内部温度或电流仍在安全边际内,它就继续运行。
一旦触及预设的阈值(Throttle Threshold),环路会立即介入,将功率压回额定值。
4. 工作原理图解
感知层:传感器(NTC 或电流采样电阻)实时监测关键部件的温度和电流。
决策层:控制器将采集值与安全曲线进行比较。
执行层:触发SMBus Alert信号通知主机。
通过PWM 占空比调整限制主功率级的最大输出功率。电压会稍微下降或限制电流,从而降低内部发热。
闭环节流控制将电源从一个“被动的供电盒子”变成了“主动参与系统管理的组件”。对于处在散热边缘的电源,这项技术是保障业务连续性(Business Continuity)的最后一道防线。
Cold redundancy冷冗余(一种节能冗余模式。在负载较低时,部分电源模块进入待机/休眠状态,仅保留必要的电源工作,从而提高系统整体效率。)
冷冗余(Cold Redundancy)是现代数据中心电源管理中的一项核心节能技术。在由多个 M-CRPS 电源模块组成的冗余系统中,并非所有电源都需要全时全力工作。
以下是需要冷冗余功能的核心原因:
1. 显著提升低负载下的系统效率
这是冷冗余最直接的目的。
背景:开关电源(如 1800W 钛金电源)在负载低于10%-20%时,由于其自身的开关损耗、磁损和辅助电源功耗,效率会急剧下降。
现状:在 1+1 冗余系统中,如果服务器处于待机或低负荷状态,两台电源可能各承担 5% 的负载,此时两台电源都在低效率区间运行,浪费大量电能。
冷冗余做法:系统通过总线通信,让其中一台电源进入“休眠”(Standby)状态,而让另一台电源承担全部负载(例如从 5% 升至 10% 或 20%)。这样主电源就进入了其高效工作区间,减少了不必要的电能损耗。
2. 降低数据中心 PUE 和运营成本
对于拥有成千上万台服务器的大型数据中心,每一台电源节省 1W-2W 的功耗,累计起来就是巨大的电费开支。
冷冗余通过优化电源阵列的整体负载分布,帮助数据中心达到更低的PUE(能源使用效率)指标。
3. 均衡与延长设备寿命
轮换机制:智能的冷冗余算法不会固定让某一台电源一直工作。系统会定期切换“主/从”状态。
目的:确保所有电源模块的累积工作时间基本一致,防止单台电源长期高负荷运行导致提前老化,从而提高整个电源阵列的长期可靠性。试想一下,这种策略是否和用EEPROM算法在FLASH上模拟EE功能时的策略有异曲同工之妙?
4. 冷冗余的工作逻辑
负载监测:系统通过均流总线或管理芯片监测总负载电流。
休眠判定:当负载低于设定阈值时,系统通过CRPS 引脚信号(如 Cold_Redundancy_Bus)通知其中一台电源关闭主功率级(Main Output),仅保留微弱的待机电源(12Vs b)和监控电路。
快速唤醒:当总负载突然增加或正在工作的电源发生故障时,处于冷冗余状态的电源必须在1ms - 100ms内(视具体规范而定)迅速跳回满载工作状态,以确保服务器不断电。
Inrush current control(浪涌电流控制)
含义:在电源接入交流电的瞬间(冷启动),对给大容量滤波电容充电产生的巨大瞬时电流进行限制。
实现:通常使用热敏电阻(NTC)配合继电器,或电子开关电路。
目的:防止大电流触发断路器跳闸、烧毁保险丝或损坏前端整流桥及连接器接触点。
在大功率电源(如 M-CRPS)中,浪涌电流控制(Inrush Current Control)是最基本的输入端安全保障机制。
简单来说,如果没有这项控制,电源在插上电的一瞬间,可能会产生巨大的火花,甚至直接导致空气开关跳闸。
物理起因:大电容的“短路效应”
大功率电源内部都有一个体积巨大的大容量电解电容(Bulk Capacitor),用于能量存储和 Hold-up Time。
初始状态:在插电前,电容两端的电压为 0V。
插电瞬间:根据电容特性,交流电接入瞬间,电压变化率极快,电容在这一刻相当于短路。
结果:瞬间产生的电流可能高达数百安培(A)。
2. 为什么必须控制这个电流?
A. 防止前端断路器(空气开关)误跳闸
数据中心的机柜里通常安装了多台服务器。如果每台电源在启动瞬间都产生 100A+ 的浪涌电流,多台电源同时上电的总电流会瞬间超过机柜断路器的阈值,导致整个机柜“掉电”。
B. 保护输入端元器件
整流桥(Rectifier Bridge):巨大的瞬时电流产生的热量可能超过整流管的额定值,导致二极管烧毁。
保险丝(Fuse):频繁的浪涌冲击会产生热疲劳,缩短保险丝寿命,甚至导致误熔断。
连接器插头:巨大的电流在插头接触瞬间会产生电弧,烧蚀插头金属表面,导致接触电阻变大。
C. 防止电压跌落(Voltage Sag)
巨大的涌浪电流会导致电网电压瞬时跌落,可能干扰同一线路上运行的其他敏感电子设备。
80PLUS® Titanium efficiency(80PLUS® 钛金级效率)
这是目前 80PLUS 标准中最高级别的效率等级。
标准要求:在 230V 典型负载下,电源在 10%、20%、50% 和 100% 负载时的效率分别需达到90%、94%、96% 和 91%。
技术门槛:达到钛金级通常需要使用图腾柱 PFC(Totem-pole PFC)架构、SiC(碳化硅)/ GaN(氮化镓)功率器件以及全桥同步整流技术。
N+N, N+1 redundant(N+N, N+1 冗余)
这描述了电源系统的容错能力。
N+1:满足系统负载共需要 N 台电源,额外增加 1 台备份。如果任意 1台坏了,剩下的电源仍能支撑系统运行。这里指总共有一台备份电源。
N+N:通常指双路供电(A+B 路)。例如 2+2,即两台电源工作,两台备份,即使其中一路电网断电,系统也不会关机。这里指每一台都有备份电源。
Hot-pluggable(热插拔)
Active current sharing(有源均流)
当多个电源模块并联输出时,确保每个电源分担的电流基本一致。
在 M-CRPS 或高性能电源并联系统中,Current Sharing(均流)的目的是确保负载电流在多个电源模块之间均匀分配。如果没有均流机制,由于各模块输出电压存在微小差异(即使只有几毫伏),电压稍高的模块会承担绝大部分负载,甚至触发过流保护,而电压低的模块则可能处于空载状态。
均流主要分为无源均流和有源均流,现代服务器电源几乎全部采用有源均流(Active Current Sharing)。
1. 基本原理:反馈调节
有源均流的核心思想是:通过调整电源的输出电压来匹配电流。
每个并联的电源模块都会实时监测自己的输出电流。如果发现自己的电流低于平均值,它就微调升高自己的输出电压,从而“抢”到更多负载;反之,则降低电压。
2. 实现方式:均流总线(I-Share Bus)
M-CRPS 电源的金手指上有一个专门的引脚叫ISHARE(或 I-Share)。所有并联电源的这个引脚都连在同一根信号线上。
其他电源会读取这个Vshare总线电压,并将其作为参考目标。
注意:均流环的带宽通常远低于电压环。这是为了防止多个电源在调整电流时产生振荡,导致系统不稳定。
Conducted/Radiated EMI Class A Limits传导/辐射电磁干扰(EMI)Class A 等级限值
EMI 的 Class A 与 Class B 区别
由于我们分析的是 1800W 的服务器前端电源,这类设备通常安装在受控的工业环境或数据中心中,因此达到Class A即可。
在M-CRPS(模块化硬件通用冗余电源)规范中,“Standby模式”通常被称为待机模式。
在服务器电源中,即便主电源(Main Output,通常是 12V)已经关闭,电源仍然会提供一路输出,这是为了维持系统的“生命体征”。
1. 为什么会有输出?
Standby 模式下输出的通常是12Vs b(Standby Voltage)。它之所以存在,是因为服务器需要“永不掉电”的管理系统:
给 BMC 供电:服务器的主板上有一个独立的“小电脑”叫BMC(基板管理控制器)。它是实现远程开关机、监控温度和风扇速度的核心。如果没有 Standby 输出,你就无法通过网络远程唤醒服务器(Wake-on-LAN)。
激活逻辑电路:电源内部的 MCU 和监控电路也需要这路电源来维持运行,以便随时接收主机的 PS_ON 信号(开机指令)。
FRU 信息读取:即使关机状态下,系统也需要通过 I2C/PMBus 读取电源的资产信息(如厂商、序列号)。
2. Standby 模式的特点
低功耗限制:在 Standby 模式下,电源的效率通常不做钛金级要求,但有严格的待机功耗限制(例如待机功耗需小于1W 或 0.5W,视具体标准而定)。
独立转换路径:内部通常有一个独立的小功率反激(Flyback)电路专门负责 12Vs b,而主功率级此时处于关闭状态。
3. 与“冷冗余(Cold Redundancy)”的关系
前面提到的Cold Redundancy其实就是 Standby 模式的高级应用:
M-CRPS 状态切换简图
<关于Hold up time的说明>:
Hold-up Time(掉电维持时间)是开关电源(SMPS)的一个至关重要的性能指标。简单来说,它指的是当输入交流电(AC)突然中断后,电源仍能维持其输出电压在额定范围内运行的时间。
1. 为什么需要 Hold-up Time?
这个时间的存在并不是为了让设备在断电后继续长时间工作,而是为了给系统提供一个“生存缓冲区”,主要有以下三个目的:
2. 这个时间大概是多少?
Hold-up Time 的长短通常由电源内部的大容量电解电容(Bulk Capacitor)储能决定。
Hold-up Time > 12ms ~ 16ms。
这个数值是基于AC 电网频率(50/60Hz)设定的,通常至少要覆盖一个完整的周波(20ms)。
典型规格:消费级 PC 电源:很多优质电源标注为16ms或17ms。
服务器/工业电源(如M-CRPS):通常要求在12ms(满载)到20ms之间。
3. 能量是怎么维持的?(物理原理)
Hold-up Time 的能量完全来自一次侧(Primary side)的大电容。其计算公式可以用电容储能公式表示:

4. 与 PWR_OK 信号的关系
电源不仅要维持电压,还要及时“通风报信”。
在电源设计中,将输出纹波(Output Ripple)限制在1%左右(例如 12V 输出限制在 120mV 峰峰值以内)并不是一个随意的数字,而是基于系统稳定性、器件寿命和信号完整性的综合考量。
以下是限制纹波的主要原因:
1. 逻辑电路的容差要求 (Logic Voltage Tolerance)
现代数字芯片(如 CPU、FPGA、GPU)的工作电压越来越低(如 0.8V、1.0V),但电流极大。
电压裕量:芯片通常有 3% 或 5% 的电压容差要求。
叠加效应:电源输出的1% 纹波只是基础。当负载发生瞬态变化(Load Transient)时,电压会产生更大的跌落或过冲。如果静态纹波就已经占据了 2% 或 3%,那么在动态负载下,电压极易跌出芯片的正常工作范围,导致逻辑错误、计算坏块甚至系统死机。
2. 电解电容的寿命与发热
纹波本质上是电容不断充放电的过程,这会产生纹波电流 (Ripple Current)。
3. 电磁兼容性 (EMI) 考量
输出纹波不仅是直流电上的噪声,它还包含了开关频率及其高次谐波。
4. 防止磁性元件饱和
在某些拓扑结构中,输出纹波过大意味着电感电流纹波(Inductor Ripple Current)也很大。
5. 行业标准:为什么偏偏是 1%?
在Intel CRPS规范和ATX3.0标准中,对于 12V 主输出的纹波要求通常就是120mV (1%)。
在服务器电源(以及 M-CRPS 规范)中,冷启动 (Cold Start)并不是指在寒冷的环境下启动,而是指电源系统从完全不带电(或仅有待机电量)的状态切换到全功率工作状态的过程。
具体可以从以下三个层面来理解:
1. 物理层面的定义:能量从零开始
冷启动是指电源的内部组件(特别是大容量电解电容和磁性元件)处于“冷”状态——即没有任何电荷存储且温度处于环境温度时,接通交流电(AC)的过程。
2. 逻辑时序层面的定义:从 AC 到 Standby
在服务器应用中,冷启动通常包含两个阶段:
3. 与“热启动”和“冷冗余”的区别
为了更清晰地定义冷启动,我们可以对比以下概念:
冷启动面临的挑战
技术提示:这里所分析的 1800W 电源中,冷启动过程中最关键的调试点是PFC 的预充电时序。如果继电器闭合太早,NTC 还没起到限流作用,可能会直接炸掉整流桥。
在硬件开发和工程设计领域,环境 Spec(Environment Specification,环境规格书)是一份详细规定产品在整个生命周期内必须能够承受的外部物理条件的技术文档。
对于我们分析的 1800W 服务器电源(M-CRPS)或高压功率变换器来说,环境 Spec 直接决定了元器件的选择(如电容的耐温)、结构设计(如风扇风量)以及 PCB 的防护工艺。
环境 Spec 通常包含以下几个核心维度:
1. 温度规格 (Temperature)
这是最基础也是最重要的指标。
2. 湿度与大气压力 (Humidity & Altitude)
3. 机械应力 (Mechanical Stress)
4. 腐蚀与化学环境 (Corrosive Environment)
比如银离子迁移风险密切相关。
5. 散热环境 (Cooling/Airflow)
对于 M-CRPS 电源,环境 Spec 会严格规定:
声明: