英伟达的Cosmos是个什么东东
作者 | 李慢慢编辑 | 李慢慢出品 | 车路漫漫大家好,我是李慢慢。最近开始痴迷世界模型,慢慢也学了一点关于世界模型的东西:通过上述学习,大致了解了世界模型的原理和应用现状,然后想着开始自己部署和测试一下世界模型。于是了解到英伟达有开源的世界模型Cos mos,就想着在此基础上进行一下尝试。于是便有了本篇文章关于英伟达的世界模型Cos mos的介绍。如下内容来自英伟达官网。NVIDIA Cos mos 是什么?NVIDIA Cos mos是一个整合前沿生成式世界基础模型(WFM)先进分词器、护栏以及用于加速数据处理和管理的高效工作流的集成平台。该技术为世界模型训练提供支持,并加速智能汽车(AV)和机器人的物理AI开发。官话好难理解,用大白话说就是:NVIDIA Cos mos是个集成平台,它靠生成式世界基础模型、先进分词器、和数据处理管理工作流,来支持世界模型的训练,加速智能汽车和机器人的物理AI开发。Cos mos 基础世界模型Cos mos主要由三个部分组成:Cos mos Predict、Cos mos Transfer、Cos mos Reason。1、 Cos mos PredictCos mos Predict 是Nvidia Cos mos的世界基础模型的组件之一,它以文本、图像或者短视频为输入,生成符合物理规律的未来场景视频帧、目标轨迹等,辅助自动驾驶与机器人做前瞻规划并生成训练数据。高性能基础模型,根据单个图像和文本提示生成 30 秒的预测世界状态视频。Cos mos Predict-2 现已推出,可实现更快、更出色的世界生成,并支持多帧速率和分辨率。 Predict,预测,顾名思义,Cos mos Predict就是用来预测未来轨迹的。所以这个很适合用来做自动驾驶或者机器人的行为预测。2、Cos mos TransferCos mos Transfer是Nvidia Cos mos世界基础模型的组件之一,它接收分割图、激光雷达等结构化输入,生成符合物理规律且可控的逼真视频,为自动驾驶和机器人高效产出高质量合成训练数据。多控制模型可跨各种环境和光照条件快速扩展单个模拟或空间视频。通过将 Cos mos Transfer 与物理模拟器和 NVIDIA Omniverse、CARLA 等平台结合使用,加速可控合成数据的生成。 Transfer,迁移/转换,顾名思义,Cos mos Transfer是用来做风格迁移/数据转换的,给场景换个背景,合成新的数据。所以这个很适合用来做数据合成。 3、Cos mos ReasonCos mos Reason是Nvidia Cos mos的推理组件,对视频做思维链推理,评估合成数据、生成标注与描述,助力自动驾驶和机器人整理数据集、优化决策与做视频分析。完全可定制的推理视觉语言模型,使用视频和图像的结构化推理,在理解物理世界方面表现出色。该平台可在运行时为视频分析 AI 智能体提供支持,使其能够从时空角度理解城市和工业运营,或为机器人和智能汽车整理训练数据。 Reason,推理,顾名思义,Cos mos Reason是用来做推理的,擅长做视频的后处理,比如评价,比如标注。 我的粗暴的理解:Cos mos Predict负责预测场景变化,Cos mos Transfer负责生成符合物理规律的逼真可控视频,两者协作产出场景视频;这些视频再由Cos mos Reason完成数据评估、标注与分析,最终形成可用的自动驾驶和机器人训练集。 来举个栗子吧。 我们以自动驾驶雨天道路测试场景为例: 1. Cos mos Predict 输入一段雨天车辆行驶的短视频,预测出接下来5秒内车辆、行人、积水路面的动态变化轨迹。 2. Cos mos Transfer 依据这个轨迹和激光雷达点云数据,生成一段完整、逼真且符合物理规律的雨天道路行驶视频。 3. Cos mos Reason 对这段合成视频做分析,标注出车辆位置、行人动作、危险区域等信息,评估数据有效性,最终形成一套可直接用于自动驾驶模型训练的标注数据集。 数据管护-Cos mos Curate借助 Cos mos Curate,开发者可以快速处理大量传感器数据,创建满足模型需求的定制数据集。加速高效的视频分割、注释、过滤、重复数据删除和数据集生成。开发者如何使用 NVIDIA Cos mos加速下游基础模型开发,通过合成数据生成和后训练推动视觉 AI 和具身 AI 的发展。1、机器人训练机器人需要大量不同的训练数据,才能有效感知环境并与之交互。借助 Cos mos WFM,开发者可以生成可控的高保真合成数据,以训练机器人感知和策略模型。2、智能汽车训练多样化、高保真的传感器数据对于安全的训练、测试和验证智能汽车至关重要。通过在车辆数据上进行后训练的 Cos mos WFM,开发者能够丰富现有数据的多样性,添加新的天气、光照和地理位置条件,或扩展至多传感器视角——从而大幅节省时间与成本,也可利用 Cos mos 中的数据管护工具整理数据。3、视频分析 AI 智能体这些 AI 智能体可以分析、总结实时或录制的视频流,并与之进行交互,以提高工业和城市环境的自动化水平、安全性和运营效率。Cos mos Reason 是一种可定制的视觉语言模型 (VLM) ,可为视频分析 AI 智能体提供先进的物理世界视觉理解和时空推理能力。这些 AI 智能体提供实时问答、快速警报和丰富的情境洞察,为边缘端和云端的部署中提供更智能、响应更灵敏的系统支持。来源:车路漫漫