首页/文章/ 详情

自由度、AI、贝叶斯:信息的压缩与降维

3月前浏览1483

核心直觉

我们从一个直觉出发:

物理自由度给了我们一个巨大的状态空间,但信号只占据其中很小的一部分。如果我们能精确地知道信号"在哪里",就能只在那个区域提取信息,把其余的噪声全部丢掉——信噪比的提升就从这里来。

这个直觉贯穿全文。下面逐步展开。


一、自由度的全景

Franceschetti 给出了电磁波场自由度数的统一公式。三维球面系统:

 

第一个因子是时间-频率自由度(积分时间 × 带宽),第二个是空间-波数自由度(口径 × 频率),极化是每个空间模式的两个正交通道。三者的共同特征:都是物理场本身的结构性自由度,由 Maxwell 方程 + 边界条件直接决定。

但除了物理手段,AI 降噪也能等效提高信噪比。这引出了自由度的完备分类:

类别      
增益机制      
改善的贝叶斯因子      
上限      
物理自由度
增加         (有效通道数)      
似然               
Heisenberg 不确定性      
量子自由度
在已有维度上优化噪声分配      
似然的精细结构      
不确定性原理 + 能量约束      
计算自由度
降低         (有效噪声)      
先验               
数据量和算力      

量子效应(压缩态、纠缠)不创造新的自由度类型,而是在已有自由度上实现经典不可能的噪声分配。AI 降噪的物理本质是信号流形学习——真实信号在高维观测空间中集中在一个低维流形上。


二、信号在状态空间中是稀疏的

物理自由度定义了一个巨大的状态空间     ,但信号并不是稠密分布的——它只占据一小片低维流形。

问题在于:如果不加区分地在整个状态空间上做积分,就把大量"信号不会出现的方向上的噪声"也白白吃进来了。

  • 噪声:在每个维度上独立同分布,均匀铺满整个        维空间
  • 信号:只在        维流形上有非零分量

在全部维度上积分时,信号功率为     (只在      个维度上有贡献),噪声功率为     (所有      个维度的噪声都积进来了)。噪底被抬高了,但信号没有相应增加——信噪比就被压下去了。

AI 学到的就是信号的低维流形结构。投影到这个      维流形后,信号功率不变(信号本来就在      维上),噪声功率降到     。丢弃的      个维度上,信号分量为零,噪声分量不为零——丢掉它们只丢掉了噪声,没有丢掉任何信号。

这就是信噪比提升的全部来源:

信号的结构来自它的产生链条上的每一步约束:信源比特(不是所有组合都有意义)→ 信道编码(施加冗余)→ 调制符号(星座点是离散的)→ 基带波形(脉冲成型固定)→ 射频信号(发射机物理特性)。每一步约束都在压缩信号的"可能性空间"。


三、贝叶斯公式:统一的语言

物理自由度和 AI 学习的分工,贝叶斯公式给出了完美的统一:

 
  • 物理自由度改善的是似然:增加独立观测数       ,使似然函数更尖锐
  • AI 学习改善的是先验:降低信号有效维度       ,约束流形

两者是乘法关系,不是加法关系。 当先验很差时,增加物理自由度的收益被浪费在噪声维度上。当先验很好时,物理自由度的增益才被充分利用。

AI 学习信号流形结构,本质上是在做数据驱动的非线性 KL 展开。线性 KL 展开在高斯/近高斯信号、主导模式少的场景下有效;但真实信号需要非线性,因为物理定律本身的非线性(光照→反射→遮挡→图像)、观测过程的非线性(传感器饱和、量化)、信号的语义结构是分层的。Kolmogorov-Arnold 表示定理告诉我们:任何连续多元函数都只能表示为单变量函数的非线性叠加。深度学习就是在学习数据驱动的、非线性版本的 KL 展开


四、三层降维:从理论到信号到语义

从      到最终的语义判断,存在三层嵌套的降维:

以一个 MIMO-OFDM 系统为例(带宽 100 MHz,载频 3 GHz,64T64R Massive MIMO,双极化):

第一层:    (理论→实际)

 

工程实现损耗(滤波器过渡带、CP、天线互耦、信道有效秩等)后,    ,利用率 3.75%。

第二层:    (实际→信号)

调制符号(64QAM)→ 视频压缩(H.265)→ 帧间冗余 → 有效独立信息量 ≈ 500 bit。    

第三层:    (信号→语义)

从干净信号推断意图(攻击/侦察/路过),语义维度      极小。

两层降维的数学本质:


     
第一层 (        )      
第二层 (        )      
数学操作
SVD      
EVD / KL 展开      
核的性质
确定性(Maxwell 方程)      
统计性(信号产生过程)      
贝叶斯含义
似然的有效观测数      
先验的有效维度      

总压缩比是乘性的:    

降维过程中功率守恒。 压缩是正交投影,满足 Parseval 定理。信号在      维流形上的功率 = 总功率(信号在其余维度分量本来为零)。噪声功率从      降到     功率没变,噪底降了,SNR 就上去了。


五、从物理空间到语义空间

前两层是能量域的操作,第三层是信息域的操作,但数学本质相同——都是贝叶斯后验。

在物理空间中,"相干叠加"是复数振幅相加,信号功率 ∝     (相干积累),噪声功率 ∝     (非相干叠加),SNR 随      线性增长。

在语义空间中,"相干叠加"是似然函数的乘积

 

当多个观测都指向同一个语义状态时,后验概率被不断锐化。以判断雷达意图为例:单次观测(脉冲频率)时三种意图概率接近;加入第二个观测(脉冲重复间隔)后开始收敛;加入第三个观测(波束指向模式)后几乎确定。每个观测都在"投票"——证据相乘,后验越来越尖锐。

两层贝叶斯可以合并成一个大公式:

 

这本质上仍是一个贝叶斯公式。 从      到      的每一步降维,都是同一个操作:用先验知识排除噪声,用观测证据锐化判断。

能量转化为判断力的桥梁是 Fisher 信息:

 

信号功率越大、噪声越小、独立观测越多,Fisher 信息越大,语义可分辨力越强。Cramér-Rao 下界给出了估计精度的理论极限:    


六、压缩即智能:从物理滤波到认知滤波

前面五章讨论的是电磁波场景下的降维与滤波。但同样的数学结构,换一个输入就变成了认知科学的核心问题。

同构的投影链

人脑视觉处理和电磁信号处理是同构的

电磁信号:  电磁场 N₀  →  观测 n  →  信号 K  →  意图 D
人脑视觉:  视网膜光子  →  V1 特征  →  物体类别  →  判断决策
             ~10⁶/秒/细胞   边缘纹理    几十类       几个选项

视网膜每秒接收的光子量级为     ,经过 V1→V2→V4→IT 皮层的层层压缩,到颞叶变成几十个物体类别,再到前额叶变成几个决策选项。压缩比和电磁波场景惊人地一致。

为什么压缩就是智能

关键区别在于:不是随便丢数据叫压缩,是丢掉噪声保留信号才叫压缩。

一个好的压缩器必须回答一个问题:这堆数据里,哪些是结构性的,哪些是随机的?这个问题本身就要求"理解"——你必须知道数据的产生机制,才能区分结构和噪声。

用贝叶斯语言说:差的压缩对应弱先验     ,不知道信号在哪,要么丢太多(欠采样),要么留太多(过拟合噪声);好的压缩对应精确先验     ,知道信号在      维流形上,精准投影,SNR 最大化。压缩的质量 = 先验的质量 = 智能的水平。

这个观点在学术上有独立的支撑:Solomonoff 归纳(最优预测 = 最短描述 = 最优压缩)、Hutter 的 AIXI(智能体最优策略等价于对环境的最优压缩)、Schmidhuber 的好奇心理论(创造力 = 寻找新的可压缩模式)、认知科学的 chunking(专家和新手的区别就是专家把大量信息压缩成少量"块")。

面向目标的有损压缩

但人脑的压缩不是无损的——它是有目的的有损压缩。保留什么、丢弃什么,取决于下游任务。

同一张照片,不同任务导向产生不同的压缩器:

  • 识别物体 → 压缩掉光照、视角、背景,保留物体类别
  • 判断拍摄时间 → 保留光照、阴影,压缩掉物体类别
  • 判断照片真假 → 保留高频细节(压缩伪影),压缩掉语义内容

同一个输入,不同的任务导向,产生不同的压缩器。 用贝叶斯语言:先验      不仅取决于信号的物理结构,还取决于你关心的语义变量      是什么。智能不只是压缩,是面向目标的压缩。

压缩器本身也有自由度

这就引出了一个元问题:压缩器本身的容量应该多大?

  • 太小(欠拟合):学不到流形结构,,增益不够
  • 太大(过拟合):把噪声也当信号学进去了,      ,丢掉真实信号分量
  • 最优:      ,恰好匹配信号的真实维度

AI 模型的参数量、层数、注意力头数——这些是压缩器的自由度。训练过程就是在这些自由度上寻找最优配置,使得压缩器的输出维度恰好等于信号的内在维度。学习压缩器的过程本身,也是一个贝叶斯推断:

 

其中      是压缩器(模型)的参数。似然衡量模型对数据的解释能力,先验衡量对模型复杂度的偏好(如正则化)。

完整的图景:物理自由度决定了"能观测到什么",工程实现决定了"实际拿到了什么",AI 的智能体现在"知道什么重要什么不重要",而 AI 本身的训练是在学习"怎么学到这个映射"。贝叶斯公式贯穿所有层级——用观测更新信念,用信念指导压缩,压缩后的数据又成为下一层的观测。


七、流形学习的工程问题

怎么知道信号的低维流形? 特征值断崖法(协方差矩阵特征值分解,前      个大、后面骤降)粗估维度,MLE 估计器细估。流形形状的学习:经典方法(PCA、Isomap、LLE)适合探索理解,深度学习方法(自编码器、VAE、归一化流)适合实际降噪。核心点:不需要推导流形方程,只需要提供数据。

泛化性有限但比想象的好。 同一类物理过程内(不同参数、不同噪声水平),泛化性通常很好。提高泛化性:学流形映射      比学端到端降噪函数更好;物理信息嵌入(Physics-Informed)把约束嵌入模型结构;元学习用少量新样本快速适应。

流形随环境变化: 把上下文参数作为模型额外输入(条件流形学习),或用混合专家模型维护一组专家各擅长一个流形,或用卡尔曼滤波在线追踪。建议分层处理:物理不变量硬编码,慢变流形离线训练+在线微调,快变参数实时估计。


总结

  
  1. 起点:物理自由度给了一个巨大的状态空间       
  2. 洞察:信号只占据其中很小的        维流形,噪声铺满整个空间
  3. 机制:投影到信号流形上,丢掉        个纯噪声维度,SNR 提升       
  4. 语言:贝叶斯公式统一了物理自由度(改善似然)和 AI 学习(改善先验)
  5. 推广:从物理空间到语义空间,每一层都是同一个操作——用先验知识排除噪声
  6. 统一:压缩即智能——人脑视觉、AI 降噪、语义推理共享同一个贝叶斯投影结构
  7. 本质:从        到        的每一步降维,都是一个滤波器。知识越深,滤得越狠

物理自由度给了我们一片海洋(       维状态空间),信号只是海里的一条鱼(       维流形)。AI 的作用就是告诉你鱼在哪里——你只需要捞那个位置的水。信噪比的提升,本质上就是"从捞整片海"到"只捞鱼所在的那一勺"的差距。贝叶斯公式是贯穿所有层级的统一语言,每一层降维都是一个滤波器,用先验知识排除噪声,用观测证据锐化判断。而这条投影链不只属于电磁波——人脑视觉、认知推理、乃至一切智能系统,都在做同一件事:面向目标,压缩信息,保留结构,滤除噪声。压缩即智能。


来源:麦克斯火
Maxwell非线性海洋理论
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-05-07
最近编辑:3月前
麦克斯火
博士 兴起的时候发点有用的东西
获赞 26粉丝 131文章 12课程 3
点赞
收藏
作者推荐
未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈