首页/文章/ 详情

机器学习、监督学习、深度学习、强化学习,傻傻分不清楚?

5月前浏览717
大家好呀,我是李慢慢。
作为一名天天和代码、数据、自动驾驶车辆打交道的工程师,也是长期写技术科普的小小博主,我发现一个很普遍的问题:有很多刚入门的技术新手,甚至一些自动驾驶领域的自身工程师(比如我),一听到机器学习、深度学习、端到端大模型这些词,就立马犯懵:
1.它们到底有啥区别?
2.谁才是自动驾驶的主流?

今天彻底抛开晦涩公式,全程大白话,用自动驾驶的真实场景当例子,把这些技术的关系讲得明明白白,哪怕你是纯小白,也能一眼看懂;中间穿插清晰的家族树形图,收藏起来,以后别人聊起这些概念,你也能轻松接话、不露怯~

一张思维导图,分清所有技术的从属关系


先看这张树形图,所有技术的从属关系、核心定位一眼看清(请横屏查看,建议保存,反复看):
简单总结一句:机器学习是大统称,只要是让机器通过数据学东西、找规律,都属于机器学习;监督学习、深度学习、强化学习是机器学习的不同分支;大模型/VLA/世界模型,都是深度学习的进阶加强版,本质还是深度学习的范畴。

所以,深度学习才是主流呀。

下面逐个拆解这些技术,重点说它们在自动驾驶里具体干啥活。咱们聊技术不玩虚的,结合日常开车能遇到的场景,讲得明明白白。

1、机器学习


官方定义:机器学习(Machine Learning,简称ML)是人工智能(Artificial Intelligent,简称AI)的一个分支,研究如何通过计算手段,利用经验数据自动改进系统性能,在不显式编程的前提下,从数据中学习规律并用于预测、分类或决策。

大白话定义:不用人手动写死每一条操作规则,让机器通过学习大量数据,自己总结规律、做出判断。

举个例子:你给机器看10000张猫和狗的照片,让机器自己学习规律来区分猫和狗,等它学完,你再给它一张全新的照片,它就能自己判断是猫还是狗。这就是机器学习的核心数据喂进去,规律学出来,判断做出来

机器学习有4大分支:监督学习,无监督学习,半监督学习和强化学习。详看下文的解释。

2、监督学习


官方定义:监督学习(Supervised Learning,简称SL)是机器学习的一类分支,利用带有标注的训练数据集,学习从输入空间到输出空间的映射函数,通过最小化预测误差实现对未知样本的预测。

大白话定义:属于机器学习的核心分支,核心是有标准答案,即每一份训练数据都有明确的标签(也就是标准答案,所以称为监督嘛),机器跟着标准答案学,学完就能精准做判断。

还是用猫和狗的例子:你给机器看10000张猫和狗的照片,但是你给机器的每一张照片都标好了猫或狗(这就是标准答案),机器学的就是照片特征和标准答案的对应关系:比如,有尖耳朵、毛茸茸、体型小→猫,有垂耳朵、体型大、尾巴粗→狗。

这就是监督学习的核心:有标签、有标准答案,学的是输入→输出的固定对应关系,也是目前自动驾驶里用得最多、最成熟的技术,没有之一。

再举一个在自动驾驶里的例子-图像识别:这是监督学习最核心的应用。比如车载摄像头拍路面,机器要快速识别出红绿灯(红/黄/绿)、行人(大人/小孩)、车辆(轿车/货车/摩托车)、路标(限速/让行/转弯),这些都是提前给机器喂了几十万、几百万张带标签的图片,机器学完之后,就能实时识别路面上的各种元素,不认错、不遗漏。

 
监督学习的特点:靠谱、稳定,只要有足够多的带标签数据,就能达到很高的准确率;但缺点也很明显需要人工标注大量数据(耗时耗力耗钱),而且只能处理学过的场景,遇到没见过的情况就容易懵圈,比如你给它学习了10000张猫狗的照片,但你给他一张猪的照片,他就不认识啦。  

那有没有不依赖标注的学习方式呢,让他自己学呗,有,看看下面这个强度学习吧。

3、强化学习


官方定义:强化学习(Reinforcement Learning,简称RL)是一种序贯决策学习范式,智能体与环境交互,通过试错获得奖励信号,学习最大化长期累积回报的策略,不依赖标注数据,侧重动态决策与最优行为选择。

大白话定义:同样是机器学习的分支,和监督学习不一样,它没有固定的标准答案,核心是让机器通过试错,结合奖励和惩罚的反馈,慢慢找到最优的操作方式。

举个例子:让机器学玩贪吃蛇游戏,没人告诉它该按哪个键、该往哪走,但它知道吃到金币=奖励,撞到障碍物=惩罚。机器反复试错、不断调整,慢慢就知道怎么移动才能吃到更多金币、不撞到障碍物:这就是强化学习的核心:试错、反馈、优化,最终找到最优策略
贪吃蛇大作战:贪吃蛇的击杀技巧是什么? - 贪吃蛇大作战攻略-小米游戏中心

强化学习不适合识别类的工作(比如识别红绿灯),但特别适合决策类的工作(比如遇到复杂路况,该怎么开才最安全、最高效)这类没有固定答案的场景。

在自动驾驶里的典型应用场景:

1)路径规划与决策:比如在拥堵路段,是变道超车还是跟车等待?在无保护转弯时,是加速通过还是减速观察?这些场景没有唯一标准答案,需要根据实时路况动态调整。

2)工程师会给机器设定奖励规则:比如安全通过路口就+10分,撞到行人就-100分,延误时间就-1分,机器在模拟场景里反复试错(比如模拟1000次无保护转弯、10000次拥堵路段通行),慢慢就学会什么时候该加速、什么时候该减速、什么时候该变道,找到最安全、最高效的决策方式。

3)泊车辅助:自动泊车时,车辆需要不断调整方向、控制车速,避开障碍物,精准停进车位(这也是强化学习的强项),机器通过反复模拟各种泊车场景(倒车入库、侧方位停车、斜列泊车),学会最优的泊车路径和车速控制策略。

强化学习的特点:它的优点是擅长处理动态场景,能自主优化策略,适合决策类任务;但缺点是试错成本高,在真实道路上试错太危险,所以大多在模拟场景里训练(论仿真工程师的重要性),再逐步迁移到真实道路。

强化学习能训练出来是真的不容易,它可能是在失败了无数次后才最终成才,一路走来头破血流,充分诠释了什么叫失败是成功之母。

4、深度学习


官方定义:深度学习(Deep Learning,简称DL)是机器学习/监督学习的子领域,基于深度神经网络模型,从原始数据中自动学习多层次抽象特征表示,无需人工特征工程,在高维复杂数据建模上具有优势。

大白话定义:属于监督学习的一个重要分支,它模仿人类的神经网络结构,能处理更复杂的数据(比如模糊图片、连续视频),不用人手动提取数据特征,自己就能从海量数据里找规律、找重点。

还是用图像识别举例:传统的监督学习,需要人手动告诉机器要关注图片的颜色、形状这些特征,比如红灯是圆形、红色;而深度学习则不用,它自己就能从图片里提取特征,比如红灯的红色像素分布、圆形轮廓,甚至能识别出被树叶遮挡的红绿灯,大雾天、暴雨天的红绿灯,抗干扰能力远超传统监督学习。

既然不需要人工费时费力的提供特征,抗干扰能力还强,那肯定拥抱深度学习呀。

深度学习的核心优势:擅长处理复杂、模糊、海量的数据,尤其是图片、视频类数据,这正是自动驾驶最需要的。车载摄像头、激光雷达每天会产生大量复杂数据,全靠深度学习来解读。

深度学习几乎承包了自动驾驶的视觉识别和复杂决策,是目前自动驾驶技术的核心支柱,没有它,就没有现在的高阶辅助驾驶。

在自动驾驶里的具体应用:
1)目标检测与分割:不只是简单识别有行人、有车辆,还能精准区分行人的身体部位车辆的轮廓路面的车道线路边的护栏,比如在暴雨天,摄像头画面模糊,深度学习也能精准识别出车道线,避免车辆压线、跑偏。

2)语义分割:把路面精准分成可行驶区域行人区域障碍物区域绿化带区域,让车辆清楚哪里能走、哪里不能走,比如遇到施工路段,深度学习能快速识别出施工围挡,并判断出围挡外的区域可以行驶,避免误判。

3)行为预测:预测行人、车辆的下一步动作比如行人正在过马路,下一步可能继续往前走前车打了转向灯,下一步可能变道非机动车可能闯红灯,让车辆提前做好应对准备(比如减速、避让),减少突发事故。

重点提醒: 深度学习属于监督学习的一种(因为它也需要带标签的数据),但它比传统的监督学习更聪明更强大,能处理更复杂的场景,是目前自动驾驶视觉处理的核心技术。

5、自动驾驶的技术路线


传统自动驾驶系统通常采用“基于规则 + 模块化”的架构,整体分为感知、决策、控制三大核心环节。

感知模块中,早期方案较多使用传统机器学习方法:1)针对场景分类、目标聚类等任务,常用无监督学习、聚类算法;2)针对目标检测、识别等有标签任务,则常用监督学习,典型代表如 SVM(支持向量机) 等经典模型。

而在决策与控制模块,因为需要车辆在动态环境中不断试错、优化驾驶策略,强化学习是更适合的机器学习范式。

传统基于规则的模块化自动驾驶,将感知、决策、控制拆分为独立环节串行工作,存在两大致命问题:1)环节间误差累积,容错性差;2)模块协同性弱,难以应对动态交互;因此,业界开始探索没有中间过程的端到端自动驾驶技术(一端是传感器数据等输入,一端是车辆控制指令输出)。

而端到端自动驾驶的发展,也逐渐有了端到端1.0 和端到端2.0的区别。

端到端1.0:
传统端到端自动驾驶主要采用了“机器学习/监督学习/深度学习/卷积神经网络CNN”架构,根据传感器输入,采用模仿学习的方式,直接做黑箱映射,由于是模仿学习,只做人类动作的复刻,不做认知理解,所以这种端到端具有不可解释的特性,在路上行驶的车辆的驾驶逻辑不可解释,那怎么行呢,国家不允许呀(难以满足车规级安全要求),所以这中间又出现了两端式(大感知+大规控)的端到端自动驾驶。

端到端2.0:
业内搞VLA的那群人喜欢把这个技术称为端到端2.0,使用Transformer架构,叠加扩散模型,就做出来了VLA(Vision Language Action,视觉语言大模型),这种大模型的决策可解释、链路可追溯,故障定位与安全验证更易,更适合量产落地。

传统端到端:V→A,黑箱、无推理、只会模仿、泛化弱、不可交互。
VLA 端到端:V→L→A,可解释、会推理、懂常识、能交互、强泛化、全链路可优化。

说到这里也不得提一下基于世界模型的自动驾驶,它和VLA一样,也用的 Transformer + 扩散模型的范式,但是世界模型和VLA是两种完全不一样的解题思路:

1)VLA的本质则是模仿人类。根据当前传感器数据(Vision)和听到的人类指令(Language),进而采取相应的驾驶策略(Action)。VLA = Visual-Language-Action,看(视觉)+ 听 / 理解(语言)→ 做动作(驾驶策略)。

2)世界模型的本质是预测未来。根据当前传感器数据预测接下来的世界动态,进而提前采取驾驶控制策略。世界模型也可以用来生成训练数据哦,反过来训练世界模型或者VLA。

总结


看完这篇自动驾驶领域的 AI 技术科普,相信大家再也不会对机器学习、深度学习、强化学习、端到端大模型这些概念感到困惑啦!我们抛开晦涩公式,以自动驾驶真实场景为锚点,理清了各类 AI 技术的核心区别与层级关联,也明确了当下自动驾驶领域的主流技术方向。其实看似复杂的 AI 技术概念,拆解开来都是有清晰逻辑的,不用被专业名词吓住,找对方法就能轻松理解。

这些技术干货是不是超实用?收藏起来随时回看,也转发给身边正在入门 AI、深耕自动驾驶的小伙伴,一起扫清技术认知盲区!关于机器学习、自动驾驶技术应用,你还有哪些想弄懂的问题,或者有自己的独到见解,都在评论区留言交流吧,咱们一起解锁更多技术干货~

来源:车路漫漫
ACT化学自动驾驶科普游戏控制人工智能
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-03-25
最近编辑:5月前
李慢慢
硕士 自动驾驶仿真工程师一枚
获赞 14粉丝 93文章 320课程 0
点赞
收藏
作者推荐

Waymo刚刚的世界模型分享:自动驾驶仿真的新进展...

编辑 | 自动驾驶之心本文只做学术分享,如有侵权,联系删文Waymo上周五晚些更新了一些新的技术进展,本着周末让大家好好休息的原则,所以柱哥周末没卷大家(不是)。本次更新主要是Waymo世界模型的一些的内容,核心是利用Google DeepMind Genie3的生成能力做闭环仿真(Camera + Lidar)。今天给大家分享一下~ 原文:https://waymo.com/blog/2026/02/the-waymo-world-model-a-new-frontier-for-autonomous-driving-simulation概览Waymo自动驾驶系统的完全自动驾驶里程已近2亿英里,成为美国主要城市交通脉络的重要组成部分,持续提升道路安全水平。而乘客与当地社区未曾看到的是,这套系统早已在虚拟世界完成了数十亿英里的仿真行驶,在现实道路遭遇复杂场景前,就已将其悉数掌握。今日,我们欣喜地推出Waymo世界模型 —— 一款前沿生成式模型,为大规模、超写实的自动驾驶仿真树立了全新标杆。仿真是Waymo人工智能生态系统的核心组成部分,也是我们打造可验证安全人工智能体系的三大关键支柱之一。下文将详细介绍的Waymo世界模型,正是负责生成超写实仿真环境的核心模块。Waymo 世界模型基于谷歌深度思维研发的新一代通用世界模型 “Genie3” 打造,该基础模型可生成真实的交互式三维环境,我们针对自动驾驶领域的严苛需求完成了专属适配。借助 Genie3 积淀的海量世界认知能力,Waymo 世界模型能够仿真各类极罕见场景——从龙卷风天气到偶遇大象,这些场景在现实中几乎无法大规模捕捉。模型架构具备高度可控性,工程师仅通过简单的文本指令、驾驶操作参数和场景布局设置,即可对仿真内容进行调整。值得一提的是,Waymo世界模型可生成高保真多传感器输出数据,涵盖摄像头视觉数据与激光雷达点云数据。 视觉&激光仿真更贴合Waymo实际的仿真需要,对于纯视觉方案来说,点云重建不是必须。国内主要做的是视觉重建,像理想(StreetGaussian)、小米(WroldSplat)、英伟达(OmniRe),Lidar重建工作不是很多,也推荐几个世界模型的汇总仓库仓库一:https://github.com/worldbench/awesome-3d-4d-world-models仓库一:https://github.com/LMD0311/Awesome-World-Model海量的世界认知、精细化的可控能力与多模态的真实感相结合,大幅提升了Waymo在更多地区、全新驾驶环境中安全落地服务的能力。在下文内容中,我们将展示Waymo世界模型的实际应用效果,呈现系统应对各类罕见边缘场景的仿真行驶案例。🌎 涌现式多模态世界认知能力自动驾驶行业的多数仿真模型均仅依托采集的道路实测数据从零开始训练,这就导致系统的学习经验存在局限性。Genie3通过在海量多元视频数据上完成预训练,积淀了强大的世界认知能力,让我们得以探索车队从未直接观测到的各类场景。通过专属的后训练环节,我们将这种海量的世界认知能力从二维视频数据,转化为适配Waymo专属硬件套件的三维激光雷达输出数据。摄像头擅长还原视觉细节,而激光雷达传感器能提供精准深度信息等高价值互补信号。Waymo世界模型可针对任意场景生成多模态传感器数据,无论是日常常规驾驶,还是各类罕见的长尾场景,均能实现全覆盖。 🕹️ 强大的仿真可控性Waymo世界模型主要通过三种机制实现强大的仿真可控性:驾驶行为控制、场景布局控制与文本指令控制。驾驶行为控制可让仿真系统响应精准,严格遵循设定的驾驶操作参数。借助这一功能,我们能够仿真各类“假设性”反事实场景,例如在某一特定场景下,Waymo自动驾驶系统若选择更果断的行驶策略而非避让,是否仍能保障安全。反事实驾驶仿真:我们可基于历史实测行驶的原始路线,或完全全新的路线开展仿真。传统重构式仿真方法(如3DGS)存在明显短板 —— 当仿真路线与原始行驶路线偏差过大时,会因观测数据缺失出现视觉失真;而全自学习的Waymo世界模型凭借强大的生成能力,可在该类场景下保持良好的真实度与一致性。场景布局控制支持对道路布局、交通信号灯状态及其他道路参与者的行为进行自定义设置。通过这一功能,我们可通过精准布置道路参与者、对道路布局进行自定义改造,打造专属仿真场景。场景布局适配效果 文本指令控制是灵活性最高的工具,通过该功能,我们可调整仿真的时段、天气条件,甚至生成全新的合成场景(如前文展示的各类长尾场景)。🎞️ 行车记录仪视频的仿真转化人们在风景优美的路段行驶时,常会用手机或行车记录仪记录沿途画面,可能拍下积雪堆、日落时分的高速公路等场景。Waymo世界模型可将这类行车记录仪视频,或普通相机拍摄的任意视频,转化为多模态仿真场景,还原Waymo自动驾驶系统对该真实场景的感知效果。由于这类仿真场景源自实际影像素材,其真实度与还原度达到了最高水平。部分待仿真的场景需要更长的行驶时长才能完成,例如在窄车道中小心避让通行。这类仿真的实现难度更高,因为仿真时长越长,计算量需求越大,保持画质稳定的难度也越高。不过,基于Waymo世界模型的轻量化优化版本,我们能够在大幅降低计算量的同时,实现长时程场景仿真,且保持高真实度与高保真度,为大规模仿真提供技术支撑。通过对这些“现实中极难遇见”的场景开展仿真训练,我们让Waymo自动驾驶系统提前对各类罕见复杂场景做好应对准备。这一方式构建了更严格的安全基准,确保系统在现实道路遭遇各类长尾挑战前,就已具备成熟的应对能力。结语Waymo的世界模型强调的是生成式方法,看似和国内生成+重建的路子不一样。但从文中一些有限的信息来看,生成模型避免了原生3DGS新视角的伪影,下图红色箭头是原始3DGS特有的新视角伪影。 还可以看出一些端倪,下图红色箭头围栏的效果还可以,近处的围栏的点云效果就比较差了。这也是生成式方法固有的弊端,虽然给了很多layout和条件,生成的质量其实不太可控,猜测Waymo应该也是加了Depth的监督,这种镂空状的栏杆/栅栏其实很难做。但整体点云效果还是可以的。 柱哥个人观点:Waymo这两个月的技术分享频率挺高,希望大家看到自己技术能力的迭代,但还没有敞开心扉把一些硬菜呈现给大家。本文算是前一阵Waymo基座模型的世界模型仿真模块,整体上和国内的方向一致,也欢迎大家在评论区分享自己的观点和补充柱哥可以落下的技术细节。以上,原文完。来源:车路漫漫

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈