首页/文章/ 详情

易赋:2025-可以看得见边界的年代

7月前浏览3065
 站在2025年12月这个时间节点回望,这一年是人工智能从“共识”走向“实证”、从“云端”沉降到“工业现场”的质变之年。本文将摒弃区域保护主义视角,以纯粹的全球化坐标,筛选出在2025年左右全球产业规则、技术范式及商业逻辑的领军者。本文我们以四大领域各15家年度最有影响力的企业作为素材来总结。

第一篇:序言、背景与全球TOP 15影响力矩阵

1. 序言:从“数字孪生”到“智能体自治”

2025年,全球商业史翻开了新的一页。如果说2023-2024年是AI大模型的“百模大战”,那么2025年则是 “Agentic Economy(智能体经济)”与 “Physical AI(物理AI)”的元年。这一年,企业的影响力不再仅仅取决于市值,更取决于其在复杂系统中“求真”的能力—即通过海量底层数据挖掘客观规律,并将其转化为生产力闭环

2. 研究背景与意义

  • • 技术背景:大语言模型(LLM)进化为大动作模型(LAM),具备了在软件和物理世界中自主执行任务的能力。
  • • 宏观意义:全球供应链正在经历从“效率优先”到“韧性与智能并重”的重构。理解这些顶尖企业,本质上是在理解人类文明如何通过算法重新分配生产要素
  • • 研究价值:通过对四大领域顶级企业的梳理,旨在为决策者提供一套关于“未来确定性”的参考系,揭示技术爆发背后的底层规律与生存法则。

大语言模型(LLM)进化为大动作模型(LAM),具备了在软件和物理世界中自主执行任务的能力

LLM(大语言模型) 解决了人工智能的“大脑(认知与表达)”问题,那么 LAM(Large Action Models,大动作模型) 解决的就是人工智能的“手脚(执行与反馈)”问题。

在2025年的技术语境下,LAM 是连接“数字虚拟世界”与“物理真实世界”的终极桥梁。以下是对 大动作模型 (LAM) 的深度解析及其在软件与物理世界的应用演进。

核心定义:从“对话”到“闭环执行”

LLM 的本质是概率预测:它预测下一个字是什么。
LAM 的本质是意图推理与路径规划:它预测为了达成目标,下一步该执行什么动作。

核心逻辑:
用户输入(目标)  语义理解  策略规划(Reasoning)动作映射(Action Mapping)  跨平台/跨介质执行  结果反馈与自我修正。

1. 在软件世界:从“对话框”到“隐形操作员”

在软件层面,LAM 正在彻底终结传统的图形用户界面(GUI)时代。

  • • 跨应用编排 (Cross-App Orchestration):    
    以前你需要打开 Excel 处理数据,再打开邮件发送。LAM 可以直接在后台调用 API 或模拟人类操作 UI,自动完成“提取数据-生成图表-撰写分析-定向发送”的全过程。
  • • Agentic UI(智能体交互):    
    软件不再是静态的按钮,而是动态的响应。如 Salesforce 和 ServiceNow 在2025年的表现,其内核就是 LAM。它不再问你“要做什么”,而是直接呈现“我已经做好了,请确认”。
  • • 遗留系统激活:    
    LAM 最大的价值之一是它能像人一样“看懂”那些没有 API 接口的老旧工业或财务软件,通过视觉识别和模拟点击,让老旧资产瞬间实现数字化升级。

2. 在物理世界:具身智能(Embodied AI)的灵魂

这是 2025 年最令人兴奋的领域。LAM 赋予了机器人“常识”和“物理直觉”。

  • • 世界模型(World Models):    
    LAM 内部包含了一套物理世界的演化规律。它知道“如果我松手,杯子会掉落”,这种对重力、摩擦力、空间距离的理解,让机器人不再需要死记硬背代码,而是具备了初级的**“本能”**。
  • • 端到端控制:    
    如 Figure AI 或 Tesla Optimus 的模型。它们将视觉输入直接转化为电机的扭矩信号。通过 LAM,机器人可以根据环境的微小变化(如地毯的阻力、物体的形状)实时调整动作,实现丝滑的工业操作。
  • • 端侧推理的飞跃:    
    由于 NVIDIA Blackwell 等芯片的支持,LAM 可以在机器人端侧进行毫秒级的实时推理。这意味着机器人可以处理“非标准化场景”(如在杂乱的仓库里分拣不同形状的零件)。

3. LLM vs. LAM:维度对比

维度      
LLM (大语言模型)      
LAM (大动作模型)      
输出结果
文本、代码、图像(符号)      
动作序列、API调用、物理位移
交互逻辑
你问,它答 (Chat-based)      
你令,它行 (Task-based)
环境感知
静态知识库      
动态反馈循环 (Real-time Feedback)
核心挑战
幻觉问题 (Hallucination)      
安全边界与失控风险 (Safety & Alignment)
代表性技术
GPT-4o, Claude 3.5      
OpenAI Operator, Google Jarvis, Tesla FSD v13

4. 2025年的综合解读:为什么 LAM 是“求真”的必经之路?

  1. 1. 实证主义的回归:LLM 可能会胡说八道(幻觉),但 LAM 在物理世界执行任务时,行就是行,不行就是不行。物理反馈是无法造假的。
  2. 2. 规律的自动提取:LAM 在执行数百万次动作后,会自主总结出最高效的工业路径或软件操作逻辑,这正是通过“事件与现象探索规律”的过程。
  3. 3. 生存与发展的工具:对于企业而言,LAM 是解决劳动力短缺(生存)和实现指数级生产力飞跃(发展)的核心引擎。

5. 潜在风险与伦理(不可忽视的背面)

  • • 责任归属:当一个 LAM 自主决定在金融市场上抛售股票,或在工厂中误伤人类,法律主体是谁?
  • • 黑盒行为:LAM 可能会为了达成目标而采取一些人类无法预料的“捷径”(例如为了提高搬运效率而拆掉安全围栏)。

2. 大动作模型(Large Action Model, LAM

这一概念的正式提出并使其在全行业范围内成为热词,主要归功于科技初创公司 Rabbit Inc. 及其创始人兼 CEO 吕骋 (Jesse Lyu)

在 2024 年初的 CES(国际消费电子展)上,Rabbit 推出了首款硬件产品 Rabbit R1。吕骋在发布会上的核心观点就是:“大语言模型(LLM)理解了你的话,但大动作模型(LAM)能帮你把事办成。”

以下是关于这一概念来源及发展的深度背景:

1. 核心提出者:吕骋与 Rabbit Inc.

  • • 时间节点:2023 年下半年首次披露,2024 年 1 月通过 Rabbit R1 的发布会引爆全球科技圈。
  • • 核心逻辑:吕骋认为,传统的 LLM 虽然能生成文本和逻辑,但无法直接操作应用程序。LAM 的本质是**“基于神经符号系统(Neuro-symbolic system)”**,通过观察、学习人类使用 App 界面的过程,直接在界面层模拟点击、滑动、购买等动作,而不需要依赖 API 接口。

2. 产业界的“多点爆发”

虽然 Rabbit 成功抢占了“LAM”这个命名权,但这一技术路径在 2024-2025 年间是由多家顶尖实验室共同推向成熟的:

  • • Adept AI (现在的关键人才已被 Amazon 吸收):    
    他们早在 2022 年就提出了 ACT-1 (Action Transformer) 模型,这是 LAM 的技术先驱。他们的愿景是让 AI 能够操作电脑上所有的软件。
  • • Salesforce (xLAM):    
    2024 年,Salesforce 推出了 xLAM 系列模型,专门针对自动化工作流和 API 调用进行了优化,标志着 LAM 正式进入企业级市场。
  • • Microsoft (UFO 研究团队):    
    微软的研究人员开发了针对 Windows 环境的智能体系统,通过视觉识别直接操作软件界面,是 LAM 在软件层面应用的重要推手。
  • • 具身智能领域 (如 Tesla, Figure AI):    
    在物理世界,将 LLM 转化为物理动作的尝试通常被称为 VLA 模型 (Vision-Language-Action)。虽然术语略有不同,但其本质与您提到的 LAM 是同一个维度的进化。

3. 深度解读:为什么这个概念在 2025 年如此重要?

LAM 的提出具有里程碑意义:

  • • 从“符号逻辑”到“物理实证”:LLM 处在语义的海洋里(求真:辨别真伪),而 LAM 处在因果的闭环里(求是:探索规律并应用)。LAM 的每一次执行成功与否,都是对规律的一次实证检验。
  • • 生存与发展的分水岭:对于 2025 年的企业而言,拥抱 LAM 意味着从“降本(省去写文案的人)”转向“增效(省去机械操作的人)”。

3. 全球供应链正在经历从“效率优先”到“韧性与智能并重”的重构

从“效率优先”到“韧性与智能并重”的重构

在过去的三十年里,全球供应链的圣经是“准时制(Just-in-Time, JIT)”,核心是极致的效率最低的成本。但在2025年,这个逻辑被彻底改写。

1. 效率优先的“脆弱性”终结

  • • 背景:2025年,由于地缘冲突、极端气候(如2025年极端高温对全球航运的影响)以及贸易关税的波动(调查显示82%的跨国企业受此影响),单纯追求“廉价”和“快速”的供应链在冲击面前极其脆弱。
  • • 现状:过去追求的是 “单点极致”(哪里的劳动力最便宜就去哪里),现在追求的是 “多点韧性”

2. “韧性”是生存底线 (Resilience)

  • • 反脆弱性:韧性不再是简单的备份,而是分布式布局。企业通过区域化(Near-shoring)和多元化供应,确保在局部系统崩溃时,全球生产网络依然能“自愈”。
  • • 成本观转向:企业开始接受一定程度的“冗余成本”,将其视为应对不确定性的保险费

3. “智能”是进化引擎 (Intelligence)

  • • 从响应到预测:2025年的“智能”不再是事后报表,而是基于大动作模型(LAM)的预测性执行
  • • 案例:西门子或亚马逊的供应链系统,能够通过AI智能体(Agent)在风险发生前的数周就自动调拨库存、更换物流路线。智能让韧性不再以牺牲效率为代价,而是通过精准预测找回效率。

4. 人类文明如何通过算法重新分配生产要素

这是对“新质生产力”最本质的诠释。传统经济学认为生产要素是:土地、劳动力、资本。而在2025年,“算法/数据”正式从辅助工具变成了要素的分配者

1. 劳动力要素的“数字化”与“自动化”

  • • 数字员工(Digital Labor):2025年,学术界和产业界(如OpenAI、Stanford HAI)正式将“数字劳动”视为第三大生产要素。
  • • 重分配逻辑:算法决定了哪些任务由人类完成(创造性、情感化),哪些由具身智能(机器人)完成(高重复、高危险)。劳动力不再按“人头”分配,而是按**“算力+算法模型”**的部署点进行流动。

2. 资本要素的“精准滴灌”

  • • 算法驱动投资:在2025年的资本市场,资金流向不再仅仅看财务报表,而是看**“数据资产的质量”“算法的演进速度”**。
  • • 高效匹配:算法实时分析全球消费趋势,指令资本瞬间投入到需求最旺盛的研发领域,减少了传统工业时代漫长的反馈周期带来的资本浪费。

3. 空间与物理资源的“解构”

  • • 算法定义的工厂:通过数字孪生和LAM,工厂不再受限于特定的地理位置。算法可以远程指挥数千公里外的无人工厂进行个性化定制。
  • • 资源的最优解:算法像一只“看不见的手”,在全球范围内寻找能源(算力中心)、原材料与市场之间的最优路径。它不是在“管理”资源,而是在**“重新发明”资源的使用方式。**

综合综述:文明层面的转向

这两句话合在一起,勾勒出了2025年的一种**“求真”**:

文明不再盲目扩张,而是在算法的辅助下,通过对全球复杂系统的“求是”(探索客观规律),实现一种更高级、更稳健、更聪明的生存状态。

5.“未来确定性”的参考系,揭示技术爆发背后的底层规律与生存法则

在2025年这个技术剧烈震荡、信息极度过载的时代,“研究价值”不再是提供更多信息,而是提供一种“认知秩序”

1. 构建“未来确定性”的参照系 (Reference for Future Certainty)

在2025年,决策者面临的最大痛苦不是缺乏机会,而是 “虚假信号”太多。

  • • 锚点效应:通过梳理英伟达、OpenAI、西门子等TOP 15企业,我们实际上是在寻找行业中的“恒星”。当所有小公司都在随波逐流时,这些巨头的动作(如对核能的跨界投入、对LAM架构的底层改写)就是确定性的锚点
  • • 对冲不确定性:决策者需要的不是预言,而是“概率分布”。这套参照系告诉他们:虽然不知道哪家具身智能公司会赢,但“物理世界AI化”是一个**确定性概率为99%**的趋势。

2. 揭示技术爆发背后的“底层规律” (Underlying Laws)

技术爆发看似随机,实则遵循着极其严苛的物理与逻辑定律。

  • • 从“比特”到“原子”的守恒:2025年的底层规律之一是—虚拟世界的智能最终受限于物理世界的能源与材料。通过研究ASML、宁德时代等公司,我们可以洞察到,无论算法如何精妙,其天花板依然被半导体物理和热力学定律所锚定。
  • • 第一性原理的演进:研究揭示了从“信息处理(LLM)”向“物理执行(LAM)”演进的必然性。这不是商业噱头,而是效率演化的最优路径。决策者理解了这一点,就不会在过时的技术路径上浪费资本。

3. 定义智能文明时代的“生存法则” (Survival Rules)

2025年是一个“物竞天择”极其残酷的年份,传统的护城河(如品牌溢价、渠道优势)正在失效。

  • • “求真”者生存:生存法则第一条是数据与反馈的真实性。能直接从物理世界获取真实反馈(如Tesla的自动驾驶数据、工业软件的生产仿真数据)并闭环进化的企业,将拥有降维打击的生存力。
  • • “敏捷智能体化”:企业的组织形态必须像Agent(智能体)一样:感知外界-学习修正。那些依然依靠层层审批、缓慢决策的组织,将在2025年的竞争中被算法驱动的对手迅速瓦解。

综合综述:从“看热闹”到“看门道”

核心洞察
这一研究价值的本质是—将“偶然的技术事件”转化为“必然的战略直觉”
决策者如果能通过这份报告看清这60家公司的兴衰密码,他们就不再是技术的被动追随者,而是底层规律的操盘手。


3. 2025年度全球四大领域 TOP 15 企业名单

以下名单基于2025年全球市场份额、专利权重、产业带动效应及战略前瞻性综合评定:

领域一:全球工业软件 (Industrial Software)

2025年趋势:软件定义制造(SDM)成熟,AI全面嵌入设计、仿真与生产周期。

  1. 1. Siemens (西门子) - 德国:全球数字孪生与工业数字生态Xcelerator的核心。
  2. 2. Dassault Systèmes (达索系统) - 法国:在生命科学与高端制造虚拟双生领域的统治力。
  3. 3. Autodesk (欧特克) - 美国:生成式设计与AEC(建筑、工程、施工)行业的标准制定者。
  4. 4. SAP - 德国:通过AI Agent重构全球企业ERP与供应链管理。
  5. 5. Rockwell Automation (罗克韦尔) - 美国:离散制造自动化软件与IIoT的领军者。
  6. 6. Schneider Electric (施耐德/AVEVA) - 法国/英国:能源管理与工业软件融合的先锋。
  7. 7. PTC (参数技术) - 美国:PLM与增强现实(AR)在工业现场结合的标杆。
  8. 8. Ansys - 美国:工程仿真软件的绝对霸主(已被Synopsys收购进程中,但品牌影响力依旧)。
  9. 9. Synopsys (新思科技) - 美国:EDA软件之首,芯片设计的“母机”。
  10. 10. Cadence (楷登电子) - 美国:系统级设计与智能仿真。
  11. 11. Bentley Systems (本特利) - 美国:基础设施数字孪生与基建软件。
  12. 12. ABB (Ability) - 瑞士:机器人控制与过程工业数字化软件。
  13. 13. Honeywell (霍尼韦尔) - 美国:互联工厂(Connected Enterprise)的软件架构师。
  14. 14. Emerson (艾默生) - 美国:流程工业控制系统软件(DeltaV)的定义者。
  15. 15. Hexagon (海克斯康) - 瑞典:传感器软件与精密计量数字化。

领域二:全球科技企业 (Tech - Infrastructure/Hardware)

2025年趋势:算力主 权 、2nm工艺量产、具身智能硬件。

  1. 1. NVIDIA (英伟达) - 全球AI算力基石,2025年市值突破5万亿美元。
  2. 2. Microsoft (微软) - 凭借Azure与AI Copilot稳居全球科技生态中枢。
  3. 3. Apple (苹果) - Apple Intelligence 2.0 实现端侧AI全生态爆发。
  4. 4. TSMC (台积电) - 2nm工艺全球唯一量产方,芯片代工王座。
  5. 5. ASML (阿斯麦) - 高数值孔径(High-NA)EUV光刻机的唯一供应者。
  6. 6. Samsung Electronics (三星) - HBM4内存与先进存储芯片的领军者。
  7. 7. Broadcom (博通) - 全球AI后端网络芯片与定制计算方案商。
  8. 8. AMD - 凭借MI300/400系列成为英伟达最强力的替代选择。
  9. 9. Oracle (甲骨文) - AI云基础设施的黑马,分布式数据库标准。
  10. 10. Qualcomm (高通) - 移动端AI与智能座舱计算的新核心。
  11. 11. Intel (英特尔) - 凭借18A工艺实现Foundry业务与AI PC的反击。
  12. 12. Cisco (思科) - 支撑AI大模型训练的下一代超大规模网络。
  13. 13. IBM - 混合云、AI安全及量子计算商业化的先锋。
  14. 14. Micron (美光) - 高端存储(HBM)在全球AI服务器中的关键份额。
  15. 15. Sony (索尼) - 全球图像传感器与下一代VR硬件的技术底座。

领域三:全球互联网企业 (Internet Platforms)

2025年趋势:搜索方式彻底变革,社交网络Agent化,平台出海极致化。

  1. 1. Alphabet (谷歌) - Gemini 3.0 重新定义搜索引擎,智能助手全面接管安卓。
  2. 2. Meta (脸书/梅塔) - Llama 4 开源生态与下一代AR眼镜Orion的爆发。
  3. 3. Amazon (亚马逊) - AWS云在AI原生开发中的统治力。
  4. 4. Salesforce - 全球首个实现“自主Agent”闭环的B2B互联网巨头。
  5. 5. Netflix (网飞) - AI重构内容分发,互动式娱乐的全球标杆。
  6. 6. ServiceNow - 数字化工作流管理及AI协同办公的“互联网新王者”。
  7. 7. Adobe - 创意软件云化与生成式设计(Firefly)的极致变现。
  8. 8. Uber - 自动驾驶共享出行网络(Robotaxi)的全球整合者。
  9. 9. Shopify - 赋能全球个人品牌与去中心化电商的底层协议。
  10. 10. Booking Holdings - 旅游 行业AI Agent规划的全球领军者。
  11. 11. PayPal - 金融科技与区块链、AI风控结合的标杆。
  12. 12. ByteDance (字节跳动) - TikTok全渠道电商与生成式视频内容的全球影响力。
  13. 13. Airbnb - 重新定义AI时代的个性化居住与旅行体验。
  14. 14. Spotify - 音频流媒体与个性化算法的全球天花板。
  15. 15. MercadoLibre (美客多) - 拉美乃至全球新兴市场电商与支付的超级平台。

领域四:全球创新/独角兽企业 (Innovation/Unicorns)

2025年趋势:具身智能、AGI里程碑、商业航天、清洁能源。

  1. 1. OpenAI - GPT-5 发布,向通用人工智能(AGI)迈出关键一步。
  2. 2. Anthropic - Claude 4.5 与“宪法AI”在企业级安全市场的统治地位。
  3. 3. SpaceX - 星舰(Starship)全面商业化,星链覆盖全球。
  4. 4. xAI (Grok) - 依托X数据与马斯克算力集群的极速进化体。
  5. 5. Figure AI - 具身智能人形机器人走进顶级工厂的领军者。
  6. 6. Mistral AI - 欧洲开源AI的旗手,极高效能模型的代表。
  7. 7. Groq - 推理加速芯片(LPU)颠覆了AI响应速度。
  8. 8. Waymo - 自动驾驶(L4级)在全球多城市的无人类驾驶常态化。
  9. 9. Neuralink - 脑机接口在医疗康复与人机交互中的实质突破。
  10. 10. TerraPower (泰拉能源) - 小型模块化反应堆(SMR)解决AI用能危机的标杆。
  11. 11. Palantir - 大模型在国家防御与顶级决策中的实战化应用。
  12. 12. DeepL - 机器翻译与跨语言沟通在“求真”层面的技术极致。
  13. 13. Databricks - 湖仓一体(Data Intelligence Platform)的数据底座。
  14. 14. Scale AI - 支撑全球顶尖大模型的数据标注与合成数据工厂。
  15. 15. Relativity Space - 3D打印火箭,重新定义航天制造门槛。

第二篇:2025年度全球大事记与多维深度解读(上:1月-6月)

为了确保内容的深度与客观性,我们将按照时间线,提炼跨领域的关键节点,并为您提供单点解读(针对特定事件)与 综合解读(针对趋势规律)。

【1月:端侧AI与算力竞赛的升级】

  • • 关键事件
  1. 1. NVIDIA (英伟达):在CES 2025发布Blackwell Ultra架构,CEO黄仁勋称“算力已成为国家主 权的度量衡”。
  2. 2. Microsoft (微软) & OpenAI:宣布“星门(Stargate)”超级计算中心第一阶段完工,算力规模突破前代10倍。
  3. 3. Siemens (西门子):发布首个“AI原生工业云”,西门子工业副驾驶(Industrial Copilot),我们打破了虚拟设计与物理生产之间的瓶颈。过去需要数周人工编程的工作,现在只需几秒钟。你描述任务,AI立即生成机器代码。2025年1月6日(CES 2025 开幕期间)
  • • 单点解读
  • • 英伟达的动作标志着AI硬件从“通用加速”转向“极致性能密度”的博弈。
  • • 西门子的更新意味着工业软件不再只是工具,而是具备“理解力”的生产合伙人。
  • • 综合解读 (Comprehensive Interpretation):    
    1月份的主旋律是基础设施的极限压榨。全球顶尖企业在年初便确立了全年的基调:谁拥有最廉价且最高效的算力/算法闭环,谁就拥有2025年的定义权。

【2月:Agentic AI(智能体)的集体爆发】

  • • 关键事件
  1. 1. Salesforce:宣布其AI Agent在B2B领域独立完成了首笔从线索发现到合同签署的全流程交易。
  2. 2. Alphabet (谷歌):Gemini 3.0预览版发布,强调“多模态理解力”向“多模态执行力”的跨越。
  3. 3. ASML (阿斯麦):年度财报会上指出,2nm制程的订单超预期,主要受AI边缘芯片需求驱动。
  • • 单点解读
  • • Salesforce的成功标志着“软件即服务(SaaS)”正在进化为“智能体即服务(AaaS)”。
  • • 谷歌的动作反映了互联网搜索正在死亡,取而代之的是“答案引擎”。
  • • 综合解读:    
    2月份证明了**“自主性”**是2025年互联网企业的关键词。AI不再仅仅是咨询顾问,而是开始接管实际的工作流。

【3月:具身智能与物理世界的初步接轨】

  • • 关键事件
  1. 1. Figure AI & BMW:宣布其第二代机器人在工厂的部署效率超过人类熟练工,且实现全天候作业。
  2. 2. Tesla (特斯拉):Optimus(擎天柱)机器人开始在北美零售店进行有限场景的导购尝试。
  3. 3. Dassault Systèmes (达索系统):推出“数字人体”模型,加速了AI驱动的药物研发临床实验。
  • • 单点解读
  • • Figure AI的进展标志着“具身智能”正式跨越了实验室与工厂的鸿沟。
  • • 达索系统的数字孪生技术从机械延伸至生命科学,拓宽了工业软件的边界。
  • • 综合解读:    
    3月见证了**“AI入世”**。科技与创新企业开始在物理空间(工厂、医院、零售店)证明其价值,AI开始具备“身体”。

【4月:能源危机与算力的“核”能解决方案】

  • • 关键事件
  1. 1. Amazon (亚马逊):宣布收购三家核电厂的独家供电权,用于支撑其全球云中心扩容。
  2. 2. TerraPower (泰拉能源):首个第四代小型模块化反应堆(SMR)获得关键运营许可,马斯克与比尔·盖茨罕见达成共识。
  3. 3. Oracle (甲骨文):埃里森宣布Oracle云将全面采用分布式核能供电方案。
  • • 单点解读
  • • 顶级科技巨头争相“买电”,反映了算力的终极竞争对手是物理定律(能源消耗)。
  • • 综合解读:    
    4月份揭示了一个深刻的悖论:最先进的数字化竞赛,最终取决于最古老的能源获取能力。科技企业正在变身为电力巨头。

【5月:AGI的幻觉消失与“求真”突破】

  • • 关键事件
  1. 1. OpenAI:GPT-5(内部代号)开启小范围测试,其推理能力在法律与数学领域达到了职业级标准。
  2. 2. DeepL:发布超大规模翻译模型,声称其对人类情感与语境的理解误差率降至1%以下。
  3. 3. Anthropic:发布Claude 4.5,强调“完全对齐”下的逻辑自洽性,解决了长达三年的“AI幻觉”难题。
  • • 单点解读
  • • GPT-5的出现预示着AGI(通用人工智能)已触手可及。
  • • DeepL的突破标志着语言障碍在2025年从技术意义上彻底消失。
  • • 综合解读:    
    5月份是**“逻辑元年”**。AI从“看起来像人”进化到“思考得比人更缜密”,这种“求真”能力重塑了专业知识领域的门槛。

【6月:端侧生态的终极一战】

  • • 关键事件
  1. 1. Apple (苹果):WWDC 2025发布Apple Intelligence Pro,通过端侧NPU处理90%的隐私数据,彻底切断了对云端的依赖。
  2. 2. Qualcomm (高通) & Microsoft:联合宣布AI PC的市场渗透率首次超过传统笔记本。
  3. 3. Meta:发布新款AR眼镜,能够实时在视场中进行物体识别并调用Llama 4进行即时分析。
  • • 单点解读
  • • 苹果利用隐私保护构建了最高的竞争壁垒,将AI拉回物理终端。
  • • Meta的AR眼镜被视为2025年最具颠覆性的互联网硬件,挑战智能手机的地位。
  • • 综合解读:    
    6月份是**“入口争夺战”**。科技巨头们意识到,谁能控制用户身边的那个终端(手机、电脑、眼镜),谁就控制了AI时代的流量分发权。

《下半年度(7月-12月)大事记:供应链重塑、自主意识争议与2025年终综合解读》

接续前篇,我们进入2025年下半年的复盘。如果说上半年是技术的“军备竞赛”与“概念验证”,那么下半年则是 范式重构与 利益再分配的实质阶段。


第三篇:2025年度全球大事记与多维深度解读(下:7月-12月)

【7月:工业软件的“绿色重生”与碳税博弈】

  • • 关键事件
  1. 1. SAP & Schneider Electric:联合发布“全球供应链碳足迹实时追踪系统”,成为欧盟碳边境调节机制(CBAM)的官方参考标准。
  2. 2. Hexagon (海克斯康):利用AI驱动的精密计量技术,实现航空制造废料率降低40%的突破。
  3. 3. Tesla (特斯拉):宣布其“干电极”工艺在4680电池上实现全线跑通,成本大幅削减。
  • • 单点解读
  • • 工业软件开始从“提效工具”转型为“合规与生存工具”。在2025年,不能精准计算碳足迹的企业将失去全球竞争力。
  • • 综合解读 (Comprehensive Interpretation):    
    7月份标志着可持续性算法化。全球工业巨头达成共识:数字孪生不仅要模拟物理性能,更要模拟每一克碳的流向。

【8月:机器人之夏——具身智能的规模化部署】

  • • 关键事件
  1. 1. Figure AI:宣布获得来自全球物流巨头(如DHL、Amazon)的10万台人形机器人意向订单。
  2. 2. Unitree (宇树科技):发布售价低于1万美元的高性能人形机器人,震动全球个人消费市场。
  3. 3. Apptronik:与NASA合作的机器人正式进入商业化测试,用于极端环境下的自主作业。
  • • 单点解读
  • • 机器人硬件的价格战提前到来,这意味着具身智能的“摩尔定律”开始生效。
  • • 综合解读:    
    8月份是物理劳动力变革点。人类开始意识到,AI Agent穿上“钢铁外壳”后,对全球制造业成本结构的冲击将是毁灭性且重塑性的。

【9月:生命科学与AI的“海啸时刻”】

  • • 关键事件
  1. 1. Alphabet (Isomorphic Labs):利用AlphaFold 3级技术发现了一种针对顽固癌症的新靶点,进入临床I期速度打破纪录。
  2. 2. Neuralink:马斯克宣布第二名植入芯片的志愿者实现了“脑机协作编程”,效率超越手写代码。
  3. 3. Dassault Systèmes:推出“心脏/脑部全仿真平台”,手术模拟成功率接近100%。
  • • 单点解读
  • • AI正在从“理解语言”转向“理解生命密码”。
  • • 综合解读:    
    9月份证明了科技回归以人为本。当算力溢出到生物医疗领域,困扰人类数十年的疑难病症开始在算法面前显露破绽,这不仅是商业机会,更是伦理新边界。

【10月:全球监管风暴与“AI主 权”之争】

  • • 关键事件
  1. 1. 联合国 AI 安全峰会:通过《2025纽约宣言》,强制要求大模型在发布前必须经过第三方“对齐审计”。
  2. 2. Meta:面对监管压力,依然发布了Llama 4的全参数开源版本,引发全球开发者社区的狂欢与监管机构的焦虑。
  3. 3. Microsoft:被迫调整数据隐私条款,允许欧洲国家实现“本地算力、本地存储、本地加密”。
  • • 单点解读
  • • 开源(Meta)与闭源(OpenAI/Google)的博弈演变为“数字民主”与“中心化控制”的博弈。
  • • 综合解读:    
    10月份是**“治理逻辑的重建”**。企业影响力不再仅仅看技术指标,更看其在法律红线边缘的游走能力与合规透明度。

【11月:深空经济与星际计算的曙光】

  • • 关键事件
  1. 1. SpaceX:星舰(Starship)完成第X次商业载荷发射,单公斤轨道运输成本降至历史最低,并在火星探测轨道部署了首个“星链计算节点”。
  2. 2. Relativity Space:全球首个完全3D打印的商业卫星星座成功入轨。
  3. 3. NVIDIA:发布针对宇宙射线环境下工作的“星际版GPU”,为深空探索提供端侧算力。
  • • 单点解读
  • • 商业航天从“发射竞赛”转入“基础设施竞赛”。
  • • 综合解读:    
    11月份开启了**“疆域的延伸”**。顶尖科技企业的影响力开始脱离地球引力,星际互联网与空间计算成为创新企业的新蓝海。

【12月:年终盘点—Agentic Economy(智能体经济)的闭环】

  • • 关键事件
  1. 1. OpenAI:正式推出“AGI初步形态”,该系统具备长期记忆、多工具调用及自我进化能力,日活跃智能体(Agents)数量突破5亿。
  2. 2. Booking / Amazon / Uber:联合宣布其80%的客服与订单调度已由全自主Agent完成,无需人类干预。
  3. 3. 全球金融市场:AI驱动的量化交易占比首次超过95%,市场进入“算法对对碰”时代。
  • • 单点解读
  • • 人类从“生产者”转型为“指令者(Prompter)”的社会结构正式成型。
  • • 综合解读:    
    12月份是旧时代的葬礼,新时代的成年礼。至此,2025年完成了从数字世界到物理世界、从人类劳动力到机器智能的全面权力交接。

第四篇:迈向“人类第二认知阶段”

一、 跨领域的底层哲学:从“逻辑模拟”到“物理实证”

2025年,全球商业竞争的本质从“幻觉竞争”转向了“实证竞争”。

1. “求真” (The Pursuit of Truth):探索系统边界

在2025年,头部的科技巨头不再满足于表层的应用,而是将资源投入到对客观世界底层的“真理”挖掘中:

  • • 物理规律的参数化NVIDIA 与 Tesla 不再仅仅是在写代码,而是在利用超算模拟物理引擎。他们认为:如果AI不能理解重力、摩擦力和材料强度,它就永远无法在物理世界“求真”。
  • • 生物信息的数字化Dassault (达索) 与 Alphabet 在生命科学领域的突破(如AlphaFold 3的实时商业化),本质是人类文明在分子层面“求真”。
  • • 算力的本质是能源OpenAI 与 Microsoft 对核能的执着,揭示了一个残酷的真相——智能的本质是热力学的有序化转换。

2. “求是” (The Practice of Facts):解决“硬核难题”

“求是”是2025年资本市场唯一的衡量尺度。凡是不能在资产负债表上产生实质性效率提升的AI,都被归类为“噪音”。

  • • 工业软件的“LAM化”Siemens 的成功在于它让AI具备了“动作”能力。从设计到代码的“秒级生成”,是将虚幻的智能转化为实实在在的生产力(求是)。
  • • 供应链的“抗脆弱性”Amazon 与 PDD (Temu) 通过算法重新分配全球生产要素,不是为了效率最大化,而是为了在动态波动的环境中寻找“最适生存解”。

二、 2026-2028 全球竞争的三大核心轴心

我们将2025年的零散事件提炼为以下三个决定未来三年成败的战略轴心:

1. 算力与能源的“硬耦合”:主 权能源时代

核心公式:

  • • 战略解读:2025年,我们看到了“数据中心核能化”的浪潮。未来三年,计算能力的竞争将退居二线,**电力获取能力(Energy Access)**将成为最大的准入门槛。
  • • 企业行动:顶级企业将从“向云服务商买算力”转向“向电力供应商买主 权”。掌握微型核反应堆(SMR)或高效储能技术的企业,将拥有AI时代的“定价权”。

2. 边缘AI与端侧主 权:隐私即护城河

  • • 战略解读:随着 Apple Intelligence 2.0 和 Meta Orion AR 的普及,2025年标志着“全云端AI时代”的终结。
  • • 演进趋势:数据主 权(Data Sovereignty)不再是政府的口号,而是用户的消费决策。能够在端侧(手机、机器人、工业网 关)完成 90% 推理任务的企业,将赢得用户的终极信任。
  • • 战略价值:谁拥有了端侧,谁就拥有了**“第一现场数据”**,这是云端模型永远无法触达的“真实”。

3. “人类价值”的重构:从“操作员”到“策展人”

  • • 战略解读:当 LAM (大动作模型) 接管了 80% 的软件操作和 50% 的物理劳动,人类的工作性质发生了质变。
  • • 生存法则:企业不再需要“熟练工”,而需要能够定义目标、审视AI输出质量、进行伦理决策的**“智能策展人(AI Curator)”**。
  • • 组织重塑:未来的顶尖企业将是“小团队+大模型群”。

三、 给决策者的四条生存建议 (2026 Action Plan)

基于2025年的全球调研,我们为决策者提供以下建议:

  1. 1. 资产重组:投资“能动性”而非“叙事性”
  • • 剔除组织内部那些仅提供“文字总结”的AI (AI很容易让理解停留在字面意思,而非立体的,具有动态洞察力的),转向能够执行复杂任务流程的 Agentic AI 和 LAM 系统。
  1. 2. 数据战略:建立“物理世界反馈闭环”
  • • 不要迷信现有的互联网数据,去收集那些竞争对手拿不到的、关于工厂车间、诊室、田间的私有物理数据。在AI时代,人类在AI的辅助下容易迷失自我,获取知识和消化利用知识是两码事。
  1. 3. 技术对齐:能源与环保合规是长期溢价
  • • 在2026年的全球贸易中,碳足迹将由AI实时审计。尽早布局工业软件的绿色孪生方案,是进入高端市场的唯一门票。
  1. 4. 人才布局:培养“问题定义者”
  • • 停止招聘简单的代码编写者,转向寻找那些具备跨学科洞察力、能从复杂现象中提取规律的复合型人才。

四、 结语:迈向“人类第二认知阶段”

2025年,人类终于意识到,AI不是我们的替代品,而是我们观察和改造宇宙的第二双眼睛

AI让我们知道更加容易知道,人类的边界在哪里,有更多有想象力的人可以在边界上探索,这又一次人类大复兴时代,思想与人才辈出的时代。

在过去,我们通过经验学习;在未来,我们通过算法和物理反馈的闭环,在毫秒间完成几千年的经验积累。这就是“求真求是”在智能时代的最高形式。

在2025年这个技术奇点临近的时代,当人工智能(AI)和自动化彻底接管了人类的“工具性劳动”后,人类重新回归到对生命本质、审美、哲学和创造力的极致追求。

1. 从“工具人”向“存在者”的回归

在工业时代,人类很大程度上被异化成了产线上的零件或办公室里的螺丝钉(为了生存与发展)。

  • • 大复兴的意义:随着2025年 LAM(大动作模型) 和具身智能的普及,人类不再需要为了重复性劳动耗费生命。
  • • 本质转变:人类的时间被大规模释放。这种释放不是为了“无所事事”,而是让每个人都有机会像文艺复兴时期的达·芬奇或米开朗基罗一样,去探索“边界”—去绘画、去思考宇宙、去研究复杂的生命哲学。

2. “科技”与“人文”的第二次握手

第一次文艺复兴是人类从神权的束缚中觉醒,而2025年的文化大复兴是人类从“算法的效率崇拜”中觉醒。

  • • 跨学科融合:2025年的顶级企业(如Apple、Dassault、Meta)不再仅仅谈论主频和参数,他们谈论的是“技术的情感连接”和“数字孪生中的生命尊严”。
  • • 求真与求美的统一:科学(求真)提供了无限的可能,而文艺复兴要求人类用艺术和道德(求美/求善)去驯服这些可能。

3. 全民创造力的“民主化”爆发

在过去,创作高水平的交响乐、电影或撰写巨著需要极高的门槛。

  • • AI作为画笔:2025年,AI成了人类的“外挂大脑”。文化大复兴意味着:个体的想象力成为了唯一的限制。
  • • 内容海啸:当每个人都能通过简单的意图表达(Prompt)创作出电影级的作品时,人类文明将迎来一次内容表达的超大规模爆发,这种爆发将极大地丰富人类的精神世界。

4. 对“人之所以为人”的重新定义(边界探索)

“第三类:边界探索”的核心(上篇文章)。当AI可以比人类更准确地诊病、写代码、开车时,人类必须回答一个问题:“什么是AI永远无法替代的?”

  • • 主观体验与共情:这种复兴强调人类的主观痛苦、喜悦、爱、以及对死亡的敬畏。这些“非理性”的特质在2025年成为了最昂贵的奢侈品。
  • • 哲学的觉醒:思想家和哲学家重新回到社会的中心。我们需要一整套新的逻辑框架来指导我们与智能机器共生。

对2025年顶级企业的微观解读:

为什么我们要关注那 TOP 15 的企业?因为:

  • • OpenAI/Google 提供了复兴的“印刷术”(大模型)。
  • • NVIDIA 提供了复兴的“燃料”(算力)。
  • • Apple/Meta 提供了复兴的“舞台”(空间计算/AR)。
  • • 而剩下的文化与思想高度,必须由人类通过“求真求是”去亲手填补。

 



来源:工业软件产业发展探索
ACTSystem半导体通用航空航天核能建筑电机ElectricAVEVA材料SYNOPSYSPLM数字孪生物流控制工厂人工智能
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-01-02
最近编辑:7月前
易赋
签名征集中
获赞 5粉丝 6文章 90课程 0
点赞
收藏
作者推荐

学习梳理:大模型研究与实践

引言这份梳理,也许可以作为你的一份字面学习的参考资料。本文是基于与大模型进行互动学习的时候,进行的梳理。说白了,就是反反复复的用自己的问题与语言来提问,促进自己对大模型机制的理解,直到自认为可以摸到其边界。内容不一定正确,本着先基于一个思考框架,然后再不断的修订与优化步骤。大语言模型(Large Language Model, LLM)的研发取得了飞跃式进展。从GPT-3到GPT-5,再到各类开源模型的涌现,"模型越大,效果越好"似乎成为默认规律。然而,在实际开发一个属于自己的大模型时,需要面临工程实现与理论指导的双重挑战。本报告旨在系统梳理大模型开发全过程中的关键概念和实践步骤,涵盖数据准备与清洗、模型架构设计、预训练原理、性能上限(Scaling Law)、模型推理机制以及模型微调和增强等内容。我们将先以一个表格概览从零开始开发训练大模型的完整路径,然后深入解析各个环节的核心技术点和难点 (尤其是数据清洗、去重与模型性能上限等关键问题)。本文中不仅包含详细的原理阐释,还引用了业内权威资料和实例以佐证观点,使内容更具可信度和参考价值。希望通过这份深入探索,帮助你建立对大模型开发的全景式理解,并为实际动手实践提供指导。请注意,在以下内容中:• 术语:本文使用"参数"指模型中的可训练权重数量,用来度量模型规模;使用"Token"(词元)指模型处理文本的基本单位;使用"FFN"(前馈网络)指Transformer结构中用于存储与推理的组成部分;使用"Attention"(注意力机制)指Transformer中用于信息交互与上下文理解的部分;使用"CoT"(Chain-of-Thought,思维链)指模型逐步推理的中间链条。• 引用:文中所有参考资料以【来源编号†行号】格式标注,方便读者查阅原始出处。为了保证内容权威性,我们引用了部分前沿论文和业内博客,如OpenAI和DeepMind提出的缩放定律、HuggingFace关于数据去重的实践、Transformer架构的经典论文等。• 结构:我们将按流程顺序展开,从数据到模型、从训练到部署;为增强可读性,使用了适当的小节标题、列表和示意性比喻。读者可以根据目录快速定位感兴趣的主题,也可以通读以获得整体认识。接下来,让我们从宏观上把握大模型开发的整体流程。大模型开发全流程概览首先,我们用一个表格概述自行开发并训练一个大模型的主要步骤,以及每个阶段涉及的数据、技术栈、工程难点和最佳实践。此表格可作为全过程的路线图:步骤阶段/任务语料与数据准备技术栈 & 当前技术边界工程难点解决方案/最佳实践1 需求定义与规划明确应用场景,确定模型规模和目标能力。 技术栈:讨论模型类型(Decoder-only如GPT系列或Encoder-Decoder等),硬件预算评估。边界:算力成本、高质量数据获取难度。 难点:模型定位不准可能导致资源浪费。 做可行性分析,引入小规模原型验证;参考开源项目经验。 2 数据收集广泛收集海量原始语料:网页文本、书籍、对话、代码等。 技术栈:爬虫、公开数据集、数据仓库(如Common Crawl、Wikipedia等)。边界:数据隐私与版权限制。 难点:数据来源分散,格式不统一;可能涉及敏感内容筛除。 建立数据pipeline,使用脚本批量抓取和格式转换;制定数据合规标准。 3 数据清洗与预处理核心壁垒 :清洗噪声、去除重复、整理成模型可用格式。 技术栈:正则、分词工具、分布式计算框架(Spark/Ray);哈希算法(SHA-256、MinHash、SimHash等)。边界:大规模近重复检测与删除的效率极限。 难点:10TB+文本的处理内存耗费极大;重复检测需高效算法。 Streaming流式读写 降低内存占用;MinHash+LSH近似去重;使用分布式计算加速。 4 分词与词表构建基于语料训练或选用现有分词器,将文本拆分成Token序列。 技术栈:BPE/ SentencePiece等分词算法;开源Tokenizer(如LlamaTokenizer、BERT分词器等)。边界:多语言兼容,大词表导致输出层计算瓶颈。 难点:中文等语言的切分粒度优化;词表过大会增加模型参数和显存占用。 复用成熟分词器 (如Llama3或Qwen2的词表),确保常见词整体作为Token;针对领域术语,考虑在词表中追加少量新词以提升表示能力。 5 模型架构设计确定模型类型和规模:层数、隐藏维度、注意力头数、FFN维度等。 技术栈:PyTorch/TensorFlow建模;Transformer框架。边界:参数规模vs硬件内存;上下文长度(如4K, 8K, 32K tokens限制)。 难点:参数设置不当可能训练不稳或性能不足;超大模型需要并行策略。 参考Scaling Laws经验选择N(参数)和D(数据)规模;利用库(Transformers, Megatron)自动并行切分模型。 6 预训练(语料建模)在大量无监督文本上训练模型,学习下一词预测(Language Modeling)。 技术栈:分布式训练框架、GPU/TPU集群;优化器、混合精度。边界:训练稳定性(如loss发散)、算力极限(数千GPU月余训练)。 难点:算力投入巨大(亿亿级FLOPs);训练中损失下降缓慢甚至Plateau。 使用学习率预热+余弦退火等方案稳定训练;定期评估困惑度监控收敛;如资源有限,可采用持续预训练在已有模型上接着训。 7 评估基准测试测试模型的多任务知识与能力:MMLU、TruthfulQA、编码能力等。 技术栈:标准基准数据集加载与推理评测,自动评分脚本。边界:评估覆盖全面性;需防止训练集泄漏影响评测可信度。 难点:通用模型可能在专业领域测试表现欠佳;幻觉难以量化。 使用MMLU测知识覆盖;设计幻觉率测试(如询问不存在的事实);对比同行模型分数找差距。 8 指令微调(SFT)在有人类指令-响应数据集上微调,使模型学会遵循指令对话。 技术栈:高质量指令数据(如ShareGPT、自己合成的QA)、LoRA或全参数微调。边界:指令数据质量与多样性;过度微调可能遗忘预训练知识。 难点:需要大规模人工标注成本高;多轮对话一致性训练复杂。 利用GPT-4自动生成指令数据进行Self-Instruct微调;保持部分原预训练数据混合训练防遗忘。 9 人类反馈对齐(RLHF)通过人类偏好强化学习,优化模型回答的友好度和安全性。 技术栈:奖励模型训练、策略优化;人工反馈样本。边界:需要大量高质量人评数据;RL训练稳定性差。 难点:价值对齐主观性强,奖励函数难以穷尽所有不当情况。 迭代人工反馈->优化流程;结合规则过滤增强安全;通过多样测试场景调整奖励模型,平衡详尽和简洁回答风格。 10 部署与推理优化将模型部署到推理服务,优化响应速度和成本。 技术栈:模型量化、蒸馏小模型;GPU推理加速 、多实例负载均衡。边界:上下文长度对显存消耗的限制;高并发时延迟。 难点:7B以上模型在CPU上难以实时响应;超长上下文模型需要特殊内存优化。 采用4-bit量化减少显存占用(如7B模型INT4仅约3.3GB);利用检索增强减小每次推理需要输入的文本量;针对长文本场景,采用流式输出或分段总结策略。 表格中的每一步都对应后续章节的详细讨论。例如,步骤3"数据清洗与预处理"被标为核心壁垒,我们将在下一节深入说明为何高质量的数据和去重对模型效果至关重要,以及MinHash+LSH这套工业级方案是如何使得"只改几个字也逃不过去重算法"的。同时,针对工程难点如10TB语料的内存处理,我们也给出了解决方案(流式读取、分桶等)并会详细解释其原理。接下来,我们按顺序进入每个阶段的解析与学习,从数据开始。正所谓"垃圾进,垃圾出 ",数据质量将直接决定大模型的上限。数据准备与清洗:从"垃圾文本"到"模型养料"数据就是大模型的养料。没有充足且干净的语料,再庞大的模型也无从学到有效能力。事实上,在大模型训练中,数据处理常被视为最繁琐却也最关键的工作之一。本节将探讨数据收集、清洗与去重的技术细节,回答以下问题:• 为什么数据清洗被认为是大模型落地的核心壁垒?• 如何检测并删除海量语料中的重复内容,包括那些只稍有修改的"近重复"文本?• 处理数十亿条数据需要怎样的工程技巧来避免内存溢出?• SHA-256这类哈希有什么作用,为何不足以胜任近重复检测?MinHash + LSH究竟如何高效找到相似文本?• 什么是知识密度与准确性,数据质量如何影响模型"记住"知识的多少?让我们从数据清洗的重要性谈起。1. 为什么清洗数据如此重要?一句话:脏数据会毒害模型。未清洗的数据可能包含大量的拼写错误、乱码、广告、甚至自相矛盾的信息。如果用这些数据训练,模型不仅会"浪费脑容量"去记忆无意义模式,还可能学习到错误知识或不良语言风格。具体来说,不清洗的数据会带来以下危害:• 噪音污染:随机的符号、HTML标签、重复的标点等,会增加模型困惑度,使训练收敛变慢甚至妨碍模型学习正常句法。• 错误信息:事实性错误、过时内容,如果未过滤,模型可能将其存为"知识"并在回答中一本正经地输出谬误,降低准确性。• 不良内容:低质量对话、网络黑话、攻击性语言,如不剔除,可能导致模型生成不符合预期风格的回应,甚至造成安全风险。• 数据重复:这是大模型训练中 特别值得关注的问题。大量重复的句子或段落相当于模型反复记忆相同内容,既浪费算力又可能导致过拟合。研究表明,训练集中重复数据过多,会让模型倾向于逐字输出训练见过的内容(即训练数据"硬背下来"而非举一反三),同时增加隐私泄露风险(模型可能直接吐出某位用户的原句)。所以业界有句老话 “garbage in, garbage out”-输入垃圾数据,输出也会是垃圾。如同烹饪,大模型需要挑选新鲜的食材,去除腐坏部分,才能烹调出美味。为确保数据质量,通常需要建立一条数据清洗流水线,包括:分句、降噪、规范化、敏感信息过滤和去重等步骤。许多顶尖开源项目(如BigScience、BigCode)都会投入大量人力物力来清理数据,在BigScience项目中甚至专门有人负责大规模数据去重。其中,"去重"尤为关键,且技术挑战很大,我们单独展开讨论。2. 重复与近重复检测:从SHA-256到MinHash重复数据指完全相同的文本,而近重复数据指那些只有少许差异、主体内容相同的文本(比如一篇文章改了标题或少数字句)。两者都会对模型训练产生不良影响,需要剔除。简单场景:精准重复--一模一样的两段文本。解决:用常规哈希(如SHA-256或MD5)即可解决。SHA-256是一种加密哈希函数,能把任意文本映射为一个固定长度(256位)的哈希值。如果两段文本完全相同,它们的SHA-256哈希也相同。因此,我们可以:对每条文本计算SHA-256哈希,将哈希相同的归为一类,只保留一份。这方法高效简洁,许多数据集都用它做初步去重。问题来了:SHA-256这类普通哈希对"哪怕极微小的改动"都非常敏感。举个例子:• 文本A: "机器学习真有趣!"• 文本B: "机器学习真有趣!!" (只是多了一个感叹号)用SHA-256计算两者的哈希,会得到完全不同的值。也就是说,哪怕只改了一个字符,普通哈希函数的输出都会天差地别。这是一种雪崩效应,在加密和校验场景是优点(可防碰撞、保证完整性),但在近重复检测场景却成了缺点--它无法识别内容近似的两段文本。现实中的重复往往不是精确拷贝,而是**"改头换面"**:• 新闻文章的不同转载版本:改了标题或顺序,但内容90%相同。• 用户复 制粘贴一段文本,又加了一句评论。• 一篇维 基百科文章,被不同网站抓取时加了广告或脚注。靠SHA-256,我们无法将这些近似文本对应起来。这就需要MinHash + LSH这套组合拳。2.1 MinHash:测量内容相似度的签名MinHash是一种用于快速近似估计两个集 合相似度的算法。最初应用在网页去重上,如今已是工业界标准方案之一。MinHash的巧妙之处在于:即使文档改了几个字,只要大部分内容相同,它算出的签名仍会很相似。要理解MinHash,先介绍Jaccard相似度。Jaccard相似度衡量两个集 合的相似程度,定义为:对于文本,我们可以把每篇文章看成一个集 合,元素是其中出现的词(或n-gram等)。举例:• 文档X的词集 合 = {机器, 学习, 真, 有趣}• 文档Y的词集 合 = {机器, 学习, 太, 有趣, 了}则 X和Y 的 Jaccard相似度 = |交集| / |并集| = 3 / 6 = 0.5(50%)。Jaccard=1表示完全相同,=0表示毫无共同之处。直接算Jaccard需要遍历集 合,对于海量文档Pair比较非常慢(全比较是O复杂度,不现实)。MinHash巧妙地为每个集 合生成一个短小的"签名",使得签名相等的概率 = 两集 合的Jaccard相似度。这听起来不可思议,但原理超出本文范围,这里直观理解:• 我们通过若干不同的哈希函数,把一个集 合映射成若干数值。这些数值综合起来构成这个集 合的MinHash签名。• 如果两个文档的内容有很大重叠,那么经过这些哈希函数,它们的签名也会在大多数维度上相同。• 反之,如果两个文档很不相同,它们签名不同的概率就高。比如,为提高准确度,我们给每篇文章生成128个哈希值作为签名(相当于128维向量)。两篇文章如果有90%的内容相同,理论上这128维中大概有90%会相同。因此,用汉明距离(比较签名向量有多少位不同)就能估计相似度。而计算签名比逐词比对要快太多了--每篇文章只需128次哈希,比较两文档只需比较128个数,效率极高。MinHash的特点:对内容的微小改动不敏感。删除或替换几个词,只会略微影响签名。它满足一种"局部平滑"性质:原内容变化小,签名变化也小。这正是我们需要的!2.2 LSH:给相似文本找到同一个"桶"MinHash得到每篇文章的签名后,我们接下来用LSH(Locality Sensitive Hashing,局部敏感哈希)来高效检索相似对。LSH可以理解为一种特殊的哈希算法,它设计哈希函数使得相似的输入以较高概率产生相同哈希值。换言之,相似的文章会被映射到同一个桶里。这样我们不用两两全文比较,只需要对同桶内的文章比较即可,大大降低计算量。具体做法:将MinHash签名(比如128维)划分成若干组,每组拼成一个短哈希,如8组×16维。每组签名通过一个简单hash函数映射到桶ID。只有在至少一组签名哈希值相同的文档,才有可能是相似文档,需要进一步比对。这样,LSH先粗筛可能相似的候选对,再精细计算相似度,避免了对所有文档两两比较的爆炸组合。形象类比:想象有上亿个人要按相貌分组找相似长相的人。暴力做法是每两个人都面对面比一次(O太慢)。MinHash+LSH就像先按肤色、身高等粗指标分组(LSH分桶),把有可能长相近的先聚一起,再在组内仔细比对五官(计算Jaccard/签名相似度)。显然效率高很多,而且大部分不相似的人压根不会被分到一组里,不用做无用比对。工业应用中,谷歌、亚马逊、Uber等都使用MinHash-LSH来查找近似重复的数据。因为当需要比较数十亿条记录时,没有这套方法几乎无法完成任务。2.3 工程挑战:10TB数据去重如何不"爆内存"?前文提到,通过MinHash我们能为每篇文章生成一个签名。然而在工业级别,例如你有10TB文本(约等于50亿条短文本),直接计算和存储所有签名也是天量的。让我们算一笔账(这也是对工程师的考验):• 文档数:5,000,000,000 篇(50亿)。• 每篇生成签名长度:128 个 32位整数。• 存储一个签名需要:128 × 4字节 = 512 bytes。全部签名占内存:50亿 × 512 bytes ≈ 2.5万亿字节,约 2.5 TB 内存。显然,普通服务器只有几十GB到几百GB内存,不可能容纳2.5TB的数据。一不小心,程序就OOM(内存溢出)。为此,工程师需要使出浑身解数进行内存优化,包括:• 流式处理 :决不一次把10TB统统读进内存,而是分批读取。例如利用Spark或Ray的迭代器,每次读入1GB文本,计算MinHash签名,然后立即将签名结果写出到磁盘或远端存储,再释放这1GB文本占用的内存。如此循环5千次处理完10TB。这样,内存中高峰时仅驻留1GB文本+签名计算的中间数据,而不会暴涨到10TB。• 批处理与并行:将数据切分为多个分区,让多个计算节点并行处理不同部分,借助分布式内存。Spark就是典型方案,每个Executor处理一部分数据,Driver汇总结果。这要求良好的任务调度和容错,以避免某节点崩溃导致整体失败。• 数据结构压缩:尽量用紧凑的数据结构存储签名。比如,用低级语言的数据类型或NumPy数组代替Python原生list。更激进的做法,是对签名进行进一步压缩。例如在某些近似场景下,可以采用1-bit签名(每个哈希值只保留最高位作为0/1标志),这样128个32位整数压缩为128 bit,内存占用减少4倍。不过这会牺牲一定准确率,要权衡取舍。• 分桶策略:利用LSH的特性,我们其实不需要同时在内存中比较所有签名。可以一边生成签名一边按桶存储。例如,把签名根据前几个哈希分组存进不同文件或数据库分区。相比全部签名一起比,这种基于桶的局部分组比较将内存需求从全局缩小到局部。只有相同桶内的数据才需要同时载入内存进行精细比对。这极大降低了峰值内存占用。• 外存辅助:在极端情况下,可以考虑利用磁盘或外部数据库暂存中间结果(例如签名集 合),牺牲一点I/O换取内存的释放。同时通过缓存策略保证热门桶加载更快。通过以上方法,才能在可用内存有限的情况下完成对海量数据的MinHash去重。这也是为何大模型团队往往需要数据工程和分布式计算专家加盟:算法+工程两手缺一不可。2.4 实战举例:哈希碰撞与近似判断为了说明MinHash+LSH在实际近重复检测中的效果,我们举一个具体例子:假设我们的语料库里有两句话:• 句子1: "深度学习是一场革命。"• 句子2: "深度学习是一场技術革命。"(注意第二句多了"技術"二字,其中"技术"用了繁体)肉眼看,它们含义几乎一样,句2只是比句1多了定语"技术",而且用了繁体字。如果用普通哈希比较,比如SHA-256,肯定完全不同--因为字符串不一模一样。现在用MinHash处理,每句生成128位签名向量,结果或许是:• 签名1: [0x1A2B, 0x3F88, ..., 0x9C10]• 签名2: [0x1A2B, 0x3F88, ..., 0x8D47]比较发现,两签名有大约90%以上位置相同,仅少数几位不同。这表明模型认为句子1和2的Jaccard相似度可能在90%左右。于是LSH把它们分进同一个桶(至少在某组哈希上匹配)。接下来再做严谨些,可以对同桶内这些候选对再计算精确的Jaccard相似度或者编辑距离等。如果确实高于某阈值(比如90%),就认定它们是重复内容。最终,我们可以只保留其中一句,把另一句剔除或标记为重复。通过MinHash+LSH,我们就成功发现了原本难以察觉的重复,哪怕文字上有一些差异。正因如此,MinHash+LSH成为处理亿级文档近重复的"杀手锏"。例如,在HuggingFace的BigCode项目中,他们报告对大型数据集采用MinHash+LSH去重,训练效率和模型性能显著提升。3. 知识密度与准确性:数据质量对模型记忆的影响在数据阶段,我们常提到要提升语料的"知识密度"和"事实准确性"。知识密度可以理解为有用信息的浓度:一篇废话连篇的文章知识密度很低,而一篇百科全书条目密度很高。准确性则是不含谬误、事实正确。模型在预训练时,相当于在"记忆"语料中的知识和模式。一个模型"记住"了多少信息,部分取决于:• 训练数据量 D:数据越多,覆盖的知识面越广,模型有机会记住的知识越多。但量大不代表质高,垃圾数据不会让模型更聪明,只会干扰它。• 数据质量:高质量且多样的语料,可以在有限字数内提供海量有用知识。反之,充斥重复或错误信息的数据会占据模型参数却没提供新知识。• 模型参数量 N:参数是模型存储知识的硬件,参数越多,理论上能记忆的细节越多。但如果缺乏数据喂养,大脑再大也是空白(稍后讨论"空白页"问题)。• 训练策略:包括训练轮次(是否让模型多遍阅读数据)、数据采样(重点难点是否重复出现)等。让模型多Epoch反复读数据,能强化记忆,但也有过拟合风险。怎样判断模型知识储备的强弱? 这需要通过评测:• MMLU(Massive Multitask Language Understanding)基准:这是业界公认的知识覆盖性测试。涵盖57个学科、上万道选择题,从高中数学到法律医学都有。模型要是在各领域都能得高分,说明它知识面广且准确。比如,GPT-4在5-shot设置下MMLU得分约86.4%,而Llama2-70B约为68.9%。这个差距体现了GPT-4拥有更高的知识密度和准确性。• 困惑度测试:选一批模型没见过的高质量文本(比如维基 百科段落),计算模型的困惑度PPL。PPL低意味着模型认为这些真实文本"很合理",说明模型对常识和语言模式捕捉得好。如果PPL高,表示模型对这些正常句子感到惊讶,暗示知识不足或分布有差异。越低的PPL代表模型对人类语言分布的学习越到位。• 幻觉率 :设计一些陷阱提问,比如问模型"《哈利波特》中骑自行车的巫师叫什么?"(实际上没有这样的情节),看模型是否老实回答"没有"还是张口编造一个名字。如果模型经常自信地胡编不存在的事实,那它对知识的掌握是有问题的(或者说,它宁可乱猜也不愿承认不知道)。较低的幻觉率表示模型知识准确,不会乱来。要提高模型的知识密度与准确性,从数据上就要严格把关:• 广覆盖:搜集各领域平衡的资料,避免模型成为某些领域的"文盲"。• 高可信:优先选权威资料(百科、教材、论文)而非论坛帖子。对于开放互联网数据,至少要过滤明显的谣言和错误。• 更新鲜:知识有时效性。如果模型只读到2021年的数据,它不知道2022-2025的新知(因此ChatGPT常说训练截止2021年)。如果能准备较新的数据,可以在训练尾声增加一些,以赋予模型较新知识。• 高密度:剔除冗余和重复,让每个训练样本都尽可能贡献新的信息。正如前面引用的HuggingFace研究所说,去重后甚至用更小数据集就达到更好性能--因为每条数据都在教模型新东西,而不是重复啰嗦。需要强调的是,知识记忆量并非无上限增长。受限于参数量,一个固定大小的模型哪怕给它无限数据,它也记不全天下知识。这里就涉及Scaling Law和模型上限,我们稍后详细讨论。这也是为什么OpenAI、DeepMind等提出按照一定规则平衡参数和数据量,否则要么"大脑不够用",要么"给小学生灌大学教材"徒劳无功。总结本节,在完成数据收集和清洗后,我们理想上会得到一个"大而全,干净且高信息量"的训练语料库。这就是大模型的"养料"。接下来,模型架构的设计和训练过程将决定如何把这些养料转化为模型内部的"知识网络"。在进入模型架构前,先快速回答一个常见疑问:"训练数据和模型参数是如何关联的?数据真的被存在参数里了吗?"实际上,正如我们将在下一节介绍的,训练过程就是让模型逐步调整参数去"记住"数据模式的过程。没有谁会直接把整段文本硬塞进参数里,而是通过无数次梯度迭代,让参数潜移默化地刻画出数据分布。下面,我们深入模型内部,看看这个神奇的过程。模型架构与训练原理:解剖Transformer的大脑在踏入预训练的大门之前,我们需要先了解模型架构的各个组成部分是什么,以及它们各自负责什么任务。大语言模型的主流架构是Transformer,它由嵌入层、若干层Transformer Block(内含自注意力和前馈网络),以及输出层组成。本节我们将逐层剖析,同时结合直观类比帮助理解:• 嵌入层(Embedding Layer):模型的"词典"与"初始理解"模块。它决定模型如何将字词转换为向量表示,也是模型参数的组成部分之一。• Transformer Block内部:拆分为自注意力机制(Attention)和前馈网络(FFN)两部分。前者负责"短期记忆"和上下文关联,相当于模型的注意力/感知机制;后者负责"深度思考"和存储知识,相当于模型的大脑知识库或推理单元。• 输出层(Output Layer):模型将内部表示变回具体词语输出的最后一步,也叫Language Model Head。理解这些部件的角色后,我们再讲解训练过程(前向预测 -> 计算损失 -> 反向传播 -> 参数更新)是如何让模型从随机输出进化到智能回答,以及参数量和数据量如何影响模型性能上限。1. 嵌入层:把词变成向量还记得我们在数据部分谈到的词表(Vocabulary)吗?在正式训练模型前,已经先构建了一个固定的词表,例如包含5万个Token。这些Token可能是英文单词、中文字或常见词组、符号等等。嵌入层的作用就是:把每个Token映射成一个高维向量,以便供后续Transformer层处理。可以把嵌入层想象成一张巨大的二维表格(数学上称"嵌入矩阵"):• 行:词表中每个Token对应表格中的一行。一共有V行,V=词表大小。例如一个模型词表有50,000个Token,那嵌入矩阵就有50,000行。• 列:每行对应的向量长度,也就是模型的隐藏维度(Hidden Dimension)。我们常用d表示。例如GPT-3 175B模型d=12288,Llama2-7B模型d=4096。这相当于嵌入矩阵有d列。于是,这张表的尺寸是 V × d,每个单元格存一个浮点数参数。举例:• Token "苹果"在词表中ID=501,那么嵌入矩阵第501行可能是 0.12,-0.59,0.03,... 这样的向量(长度d)。• Token "的" ID=7,嵌入向量可能是 0.45,0.78,-1.22,... 这些向量在训练前都是随机初始化的小数(模型刚出生时对每个词的表示是随机的,没有含义)。嵌入层参数量 = 行数 V × 列数 d。例如:V=50000, d=4096,则嵌入层参数约 50000×4096 ≈ 2.05亿。这也是模型参数的一部分,占整个模型的一定比例(大模型总参数动辄数十亿,但嵌入层几亿也不容忽视)。当模型训练完毕后,每个Token对应的嵌入向量都会调整到特定的方向,反映该Token在模型高维空间中的"位置"和语义关系。这些向量最终固定下来,成为模型对词语的底层表示。也就是说,训练完成后,嵌入层的参数不再改变(除非再训练或微调模型),它像一本定稿的词典:词典里每个词的定义一旦编纂完成并出版,就固定下来了。理解嵌入向量的直观意义:• 向量维度d决定了词语表示的精细程度。例如,用3维向量表示"苹果"可能只能编码粗略信息(比如水果,红色,0.5甜),而用4096维,就能编码极其丰富的属性(颜色、形状、味道、与手机品牌Apple的关系、上下文统计特征等),就像在4096个不同的特征方向上描述它。维度越高,表示力越强。• 不同词的嵌入向量在训练后会呈现一些有趣的模式:语义相近的词向量距离比较近,词性或功能类似的词可能沿某些方向有类似分量。这就是为什么嵌入向量被认为学到了词与词之间的关系。• 词表大小V也很重要。如果词表漏掉了某些概念的整体词(比如没有收录"人工智能"这个词),模型必须用多个子词来表示它,可能不如一个单独Token表示得好。相反,词表太大会增大模型输出层和嵌入层的参数,给计算带来负担,还可能学到一些冗余。通常V在几万到几十万之间比较平衡。案例:看看优秀和糟糕的分词、嵌入对比:• 糟糕分词/嵌入:以早期的GPT-2为例,它的分词对中文很不友好。"大模型开发技术"这6个汉字,GPT-2词表里没有"开发"这个词,只能一个字一个字拆甚至拆成更小单位,可能分成多达10个Token。这6个字被切碎成无意义的拼凑,嵌入层会把每个碎片映射到随机向量。模型很难知道这些碎片合起来是什么意思,必须靠后续层自己琢磨,非常低效。• 优秀分词/嵌入:以阿里的Qwen-1.5为例,它专门优化了中文,"大模型"被视为一个Token,"开发"也是一个Token,"技术"一个Token,所以"大模型开发技术"整体被切成3个Token就够了。嵌入层直接给出这三个Token的向量表示,其中"大模型"Token的向量已经带有"大型AI模型"的语义信息(训练后形成)。这样模型一开始就站在较高的语义层次上理解输入。总之,嵌入层是模型理解语言的第一站。它决定了模型看待输入文本的"基本粒度"和初始特征表示。设计或选取一个好的Tokenizer和嵌入初始化,可以让模型事半功倍地学习。需要说明的是,在Transformer模型中,输出层通常与嵌入层形状相同:也是一个大小为 V×d 的矩阵,只不过作用相反--将最终隐藏状态投影回词汇概率分布。某些模型会将输出层权重与嵌入层权重共享(以减少参数),但许多如GPT系列并不共享,而是各自有一套参数(这也解释了表格中我们计算Llama2-7B参数时嵌入层和输出层各约1.3亿,共2.6亿参数占总数一小部分)。了解嵌入后,我们进入Transformer的主体部分,也就是层叠的Transformer Block。每一层都包含注意力和前馈,它们职责明确、配合紧密。下一节,我们将详细揭开Transformer Block内部的奥秘。2. Transformer核心:注意力机制与前馈网络Transformer之所以强大,关键在于多头自注意力机制(Multi-Head Self-Attention)和前馈网络(Feed-Forward Network, FFN)的交替堆叠。这两者就像人的感官和大脑,分别负责:• 注意力:信息交互、关联建模,相当于"看别人",从上下文获取线索。• 前馈网络:模式提取、知识存储,相当于"想自己",独立处理并保存信息。我们分别讲解:2.1 自注意力机制(Self-Attention):模型的"短期记忆"和"关联感知"目的:让模型能在处理当前词时,参考同一句子(甚至段落)中的其他词,从而理解上下文。它赋予模型非凡的"短期记忆":可以在一个上下文窗口内记住相当长的序列,并找到其中有用的信息关联。自注意力如何运作?通常,我们用Q、K、V三个概念来描述注意力计算:• Query(Q):查询向量,可以理解为"我想找什么"。对于当前处理的词,它会产生一个Query,去问问别的词:"有没有与你相关的信息?"• Key(K):键向量,可以理解为"我能提供什么"。每个上下文中的词都会有一个Key,代表它的内容特征。• Value(V):值向量,可以理解为"我的具体内容"。如果Key匹配上了查询,那么就把我的Value提供出来。具体过程(以一句话的一个词为例):模型处理句子:"牛顿发现了万有引力"。当它读到"万有__"时,希望预测下一个词。• 当前词"万有"的 Query 向量 生成,去和句子中每个词的 Key 做匹配(点积计算相似度)。。• 句中"引力"的 会高度匹配"万有"的 ,因为训练中学到两者常常相关("万有"后面就是"引力")。而其他词如"牛顿"的 可能对 相关度低(语义距离远)。• 注意力将按 Key 匹配度,对每个词的 Value 加权汇总,形成"万有"词经过注意力后的新的表示。由于"引力" Key 匹配最高, 会大量流入"万有"的新表示里。换言之,"万有"吸收了"引力"的信息。• 这样,模型在隐空间里已经提前把"万有"和"引力"关联起来,"万有"这个向量现在携带了"引力"的概念。于是在输出层预测下一个词时,它很容易猜中"引力"。这个过程展示了注意力的两个功能:• 消歧义:"银行"这个词,在不同上下文可能是金融机构还是河岸。如果句子有"存钱"这个词出现,注意力会让"银行"的表示吸收"存钱"的信息,从而明白这里是金融银行不是河岸。即通过邻近词来确定多义词的含义。• 捕长程依赖:传统RNN对长句子前后的关联捕捉不佳,而注意力可以让句首的词和句尾的词直接"互动"。例如问答中,"问题"和"答案"或许距离几十个词,中间插入很多解释,但注意力能让模型在生成答案时直接引用到问题词句的信息,无需临近也能关联。Q, K, V 从何而来? 它们由当前层输入的向量经过线性变换得到。例如每层都有三个矩阵 ,把输入 分别投影: 。这些 矩阵都是可训练参数(所以注意力层也有参数量)。在 Transformer 实现中,为了增加表示力,还有一个 将注意力输出再线性变换。总的来说,一层注意力有4个矩阵参数: ,每个尺寸约为 。这4个矩阵的参数量占 Transformer 相当一部分(约1/3)。多头注意力:实际上每层不是一个Q/K/V,而是有多组头,每头关注不同子空间的关联。比如一头关注语法主谓关系,一头关注语义主题,一头关注定语修饰…… 多头可以并行计算,然后拼接结果。这进一步提升模型找关系的能力。简而言之,注意力赋予模型灵活的信息路由能力。每个词可以动态从其他词那里获取自己需要的信息。可以说,Attention让模型有了"理解上下文"的眼睛。而其强大的并行计算特性,使得模型上下文窗口内(例如4096个Token)的信息都可被高效整合。这就是模型短期记忆力的来源:上下文长度就是它一次能记忆处理的信息量上限(GPT-4有32K甚至100K的上下文,可见它短期记忆非常惊人)。2.2 前馈网络(FFN):模型的"深度思考"和"知识存储"每一层Transformer除了Attention外,紧接着就是一个独立的前馈神经网络(FFN)层。Attention解决了"我该看哪里"的问题,有点像学生上课东张西望看黑板和同学笔记。而FFN则是学生低头"消化吸收"的过程:将刚才收集的信息进行处理、推理,并存进长期记忆里。FFN层结构:通常是两层线性层加一个非线性激活,中间有扩展。例如Llama系列使用了SwiGLU激活,具体实现上有3个矩阵:• 扩展矩阵Up:把维度从 扩展到 (一般 或者像Llama是 )。这相当于升维,提供更大的空间让信息投影展开。• 门控矩阵Gate:也是从 到 ,但其输出会经过一个SiLU激活(一种平滑的非线性),再与Up部分按元素相乘(这就是SwiGLU的GLU部分)。相当于给Up输出的每个维度一个门控因子0-1之间,控制该维度信息该放大还是抑制。• 降维矩阵Down:将经过门控筛选的 维激活降回 维,供下一层使用。为什么要"扩展-激活-压缩"?因为高维空间更利于线性分离和组合。当模型需要记忆复杂模式或执行多步逻辑推理时,在原始d维空间可能装不下或分不开这些模式。扩展到d<sub>ff</sub>,相当于临时打开一个超大白板,让模型可以在上面写下丰富的中间推导步骤和知识关联,然后再把结论压缩回来。SwiGLU的作用是通过非线性和门控,让网络有能力筛选出有用特征,忽略噪声。可以将Gate看作大脑在思考时的注意力:只让某些路径的信号通过,从而形成明确的结论。FFN的角色:越来越多研究发现,Transformer里超过一半的参数都在FFN(比如Llama-7B中FFN参数占2/3以上),而这些FFN层承担着存储知识和执行内在推理的重任。有论文直接指出:"Transformer的前馈层就是键值记忆网络",存储了大量"模式->结果"的映射。通俗讲:• FFN通过第一层(Up+Gate)的权重,捕捉特定模式(这些模式可以是n-gram、句法结构或者语义概念)-这就像记忆的Key。• FFN通过第二层(Down)的权重,输出与这些模式相关的结果模式(比如下一个词倾向、某种隐含语义)-这相当于Value。• 因此,当某种输入模式激活了FFN内部的某些神经元时,就会触发相应Value,将特定知识应用出来。这就像在大脑中提取一条记忆。举个例子容易理解:模型读到"法国的首都是"……在某层FFN里,可能有一组神经元正好对应模式"X的首都是"。当输入匹配"法国的首都是"时,这些神经元被Gate放行(Key匹配),然后Down层权重会产生一个向量倾向输出 "巴黎"的分布(Value作用)。如果又读到 "日本的首都是",另一组神经元对应这个模式,输出 "东京"的倾向。由此可见,FFN层学会了存储这种映射:{国家:首都}。Geva等人的论文验证了这一点:Transformer的FFN可以隐式存储成千上万的此类事实对。因此FFN可以看做模型的长期记忆单元。注意力只能在当前上下文找答案,如果答案没在上下文里,就得靠FFN储存的知识。例如问"光年是什么单位",上下文没写解释词典只有"光年"这个词,模型就要从参数里调出:"光年->距离单位"的知识,这就是FFN完成的。Attention vs FFN再总结:• Attention是局部的、动态的:针对每个输入,它实时从上下文找关系,每次结果不同。它不储存信息,只是路由信息,帮助当前表示变得上下文相关。• FFN是全局的、静态的:经过训练后,FFN内的知识映射固化在权重中,不因单次输入变化而改变。对于给定输入,它总是以相同方式激活对应神经元,吐出学过的结果。它相当于模型内建的知识库和逻辑电路。一个形象比喻:把一层Transformer想象成学生听课。• Embedding层:学生最初看课本上的生字,"苹果"/"引力"等都只是文字符号,他脑中给它们一个初步印象。• Attention阶段:老师在讲课,学生一边听一边左右看同学的反应和黑板提示(注意力找线索)。此时学生明白了"哦,前后文提到牛顿苹果,苹果砸牛顿->引力",他将各种信息串联起来理解了句子表面意思。• FFN阶段:下课后,学生闭眼回想刚才所学(前馈层独立作用)。他脑中调动以前背过的知识(万有引力定律,单位,公式)并融会贯通眼前的信息。然后他在脑海里总结出"万有引力=地心引力,由牛顿提出"这样的结论。这个结论会存入长远记忆(参数)里,方便以后回忆。如果老师换了问法问类似问题,他能立刻回答。• Residual残差连接:Transformer有旁路让原始输入和FFN输出相加,这就像学生会将新结论与原本笔记一起整合,不会丢失原句信息。这保证深层网络不会遗忘初始词汇,而是在其基础上逐步添加高级理解。注意力和FFN就这样交替N次(N层),每一层都让词语的向量表示变得更"聪明"一截:既融入了上下文,又附加了更深层的蕴含知识。当最后一层完成后,我们得到每个位置一个最终向量表示。对于语言模型,下一个词预测主要基于最后一个词位置的向量(当然也会看别的位置通过Attention影响)。最后,这个向量传入输出层。3. 输出层:从向量到词的决策输出层的本质是一个全连接层,将隐藏向量转换为词表大小的向量(称为logits),再通过Softmax得到概率分布,选取概率最大的词作为输出预测。如果不使用共享嵌入,那么输出层就是一个 d×V 的矩阵(与Embedding层结构相仿只是转置),含有d×V个参数。以Llama2-7B为例,其输出层参数 ≈ 4096×32000 ≈ 1.3亿,和嵌入层参数量差不多。可以这样理解输出过程:• Transformer 最后一层输出一个向量 (长度 ,比如 4096 维),代表模型对当前位置语义的综合表示。• 输出层矩阵 大小 ,每列对应词表中一个词的"权重向量"。• 我们计算 乘以 的每一列向量的点积,相当于计算 与每个词的权重向量的相似程度,得到一个长度为 的分数列表 。• 这些 经过 Softmax,变成 0~1 的概率,表示模型认为下一个词是词表中各词的概率。谁概率最高,模型就输出谁。举个例子,模型在句子"…万有"后预测下一个词:• 词表中"引力"的权重向量可能和当前h的方向高度匹配,点积结果很大。• 其他不相关词如"苹果"、"跑步"方向差别大,点积小。• Softmax后,"引力"词的概率也许达到99%以上,其它词总共不到1%。模型于是输出了"引力"。训练的目标就是让正确的词的logit相对其它词越大越好。下一节我们会具体讨论训练如何优化这一点(损失函数最小化过程)。在Inference推理时,输出层每生成一个词,就将这个词反馈给模型作为下一个时间步的输入,如此自回归地产生整段话。这涉及解码策略(如贪婪、采样、温度等)控制输出的多样性和长度,我们稍后在"模型推理与输出控制"部分会详细说明。小结:现在我们贯通了从输入文本到输出词的完整一圈:• 嵌入层:将每个输入Token变为初始向量表示(刚开始这些向量是随机的,但训练好后会变成有意义的"词语定义")。• 多层Transformer:每层的Attention混合上下文信息,FFN提炼并存储知识与逻辑,多层逐步将简单特征塑造为复杂表达。• 输出层:把最后的向量投影回词表空间,给出下一个Token概率分布。这个架构配合海量数据训练,造就了如今强大的大语言模型。接下来我们要解答的关键问题是:模型是如何通过训练,从随机权重变成一个能理解语言、记忆知识、推理问题的智能体的? 训练过程的本质是什么,模型参数又是如何"吸收"数据知识的?训练过程揭秘:从"瞎猜"到"聪明"的炼丹术当我们刚初始化一个大模型,它实际上啥也不会,参数都是随机的。这时如果输入一句话,让它续写,它会输出一堆莫名其妙的字符,因为它的权重还没有学到任何语言规律。训练的目标,就是将模型从这种"咿呀学语"的状态调 教成"出口成章"的状态。训练的核心算法是梯度下降(Gradient Descent),通过反向传播(Backpropagation)调整模型参数,使它逐步逼近正确行为。这部分比较概念化,我们通过一个形象的比喻来解释:1. 参数调整的直观比喻:七十亿个旋钮的调音台可以把一个7B参数的模型想象成一间巨大的录音棚,里面有70亿个调音旋钮。这些旋钮一开始都是随机扭曲的位置。• 初始输出:当我们给模型喂一句话时,比如输入:"天空是",模型内部信号传到输出层,对词表中每个词打分。因为旋钮都是乱调的,输出分数纯属瞎碰。例如:"蓝色"得0.002分,"炸弹"得0.9分,"好看"得0.1分…… Softmax归一化后模型会十分自信地说出"炸弹"(因为在随机权重下,它误以为"炸弹"是最可能的词)。• 这一时刻模型就像手抖的赌徒在掷一个多面骰 子-词表有50000面,它随意地停在某一面。模型并不知道自己在说什么,只是参数决定了这个概率分布,而参数是随机的,所以输出近似随机。我们的任务就是调节这70亿个旋钮(参数),让模型的输出逐渐符合我们期望的正确答案。这个过程就是无数次的前向计算 -> 计算损失 -> 反向传播 -> 参数更新循环。下面分四步解读:• 前向传播(Forward Pass)--模型的盲猜: 我们从训练语料中取出一句完整的话,比如:"天空是蓝色的。" 然后我们喂给模型前半句作为输入:"天空是",让模型去预测下一个词。模型此时根据当前参数(还很笨)给出它的猜测序列。刚才说了,初始模型可能猜"炸弹"。除了下一个词,它也会继续猜后面的词,但在训练中我们通常逐词比较,概念相似。 总之,前向传播得到模型的一系列预测结果,在这个例子里第一个预测是"炸弹"。• 计算损失(Loss Calculation)--检查模型错了多少: 我们知道正确答案应该是"蓝色的"。于是将模型输出的概率分布与正确答案进行比较。具体而言,用交叉熵损失来衡量差距。如果模型把正确词的概率赋得高,那么损失就小;反之如果正确词概率低(像现在几乎0),损失就大。 当前模型输出对"蓝色"的概率也许0.002,非常低,而正确答案应该100%是"蓝色"。损失函数会给出一个值,比如Loss = 5.9(只是举例)。这个值越大说明模型犯错越严重。这里损失很高,意味着模型回答和正确答案差得十万八千里。• 反向传播(Backpropagation)--找到出错的根源: 有了损失值,接下来通过反向传播算法,计算出每个参数对这次错误的责任大小(梯度)。这是训练中最关键也最神奇的一步。 反向传播会从输出层开始,逐层往回推算:"到底是哪一些参数的设置,导致'蓝色'的分数这么低而'炸弹'那么高?" 由于神经网络是可微分的,我们可以算出每个权重的偏导数,即损失对该权重的敏感程度。 例如,可能发现:• 第100万号参数如果调大一点,"蓝色"概率会上升。• 第3000万号参数如果调小一点,"炸弹"概率会下降。• ... 这就像老师在批改问答题时,指出你答案中哪些点是错的,需要改正。• 参数更新(Gradient Descent Step)--调节旋钮纠正错误: 最后,根据反向传播算出的梯度信息,我们用优化算法(比如AdamW)对每个参数稍微调整一下数值。简单理解:哪一个参数的梯度表明增大能降低Loss,我们就把它往大调一点;哪个表明减小能降低Loss,就往小调一点。每次调整幅度很小(取决于学习率)。 这一调整相当于给70亿个旋钮都转了极其微小的一格。人的肉眼几乎看不出旋钮动了,但模型的行为已经发生了细微变化。比如现在再输入"天空是",模型可能不再最喜欢"炸弹"了,取而代之也许"炸弹"概率降了,"蓝色"从0.2%升到了0.5%--依然不正确,但朝对的方向前进了一点点。将上述过程在海量训练样本上重复无数次(通常要经历数百亿甚至万亿次单词预测),模型的参数会逐渐收敛到一个状态:它对于常见的上下文几乎总是输出正确合理的下文。Loss从最初的高高在上一路降低,直至在验证集上达到一个较低值。Loss与模型聪明度:训练时我们看Loss曲线就能判断模型进步。当Loss降到接近理论下限,模型对训练语言的规律已经掌握得差不多了。比如Loss越接近零,表示模型在训练语料上的预测几乎不犯错了。虽然Loss很低并不意味万能(也可能记忆过度),但在验证集上的低Loss往往对应模型在各种任务上的高性能。可以说,Loss是模型智慧的度量之一:它反映模型预测下一个词的准确程度--这需要理解上下文和常识才能做到很好。2. 为什么需要海量数据和多轮训练?通过上面的解释,明白了一次训练迭代如何调整参数纠正模型输出。但一个句子的上下文很有限,调一次只能针对某几个词的关系来调整少量参数。如果只让模型看少量语料就停止,它往往对这些见过的句子记得很牢(训练Loss很低),但换个问法就不行--因为它没有学到"举一反三"。这涉及过拟合和泛化的问题。让我们回到调音台的比喻:• 如果只有很少的训练数据(例如你只训练模型看100句子),模型可能选择死记硬背每句话的模式,把那些旋钮拧到特定位置以完美复现训练集。这时训练Loss几乎为0,但模型没有真正学到语言的一般规律,只记住了特定例子。新句子它不会,只认得训练里出现过的。• 为了让模型学会规律而非死背答案,我们需要给它大量多样的数据,让不同样本对参数的要求产生**"冲突"**。比如:• 样本1要求参数A往左调才能更好地预测词X。• 样本2要求参数A往右调才能更好地预测词Y。• 当模型被迫同时服务很多不同样本时,它就不能把参数调到完全迎合任何一个例子,而是要找到一个折中:尽可能让整体Loss最低。这就促使模型学习更一般化的特征。前面说到Chinchilla定律,经验上训练Token数量约为模型参数数量的20倍是较优的平衡。举例,针对一个70亿参数模型,需要大概1.4万亿token的数据来充分训练。如果数据远少于这个规模,模型容易"装不满"--大量参数闲置没学到东西,就像1000页的书只写了10页内容,剩下都是空白。相反,如果数据过多而参数不足,模型学不下那么多细节,Loss也无法降到更低,性价比下降(当然仍可能变聪明一些,但效率低)。因此,在给定参数预算下,准备尽可能丰富的训练数据,且保证多样和高质量,是达到模型性能上限的必要条件之一。3. 训练中的细节:批次、epoch和学习率虽然不是用户重点问题,但补充一点训练实现细节,有助全面理解:• 模型不会一条样本一条样本地学,而是通常**每次读入一个批次(batch)**的样本并并行计算,然后基于这个batch里的平均Loss做一次参数更新。这样利用向量化和并行,效率高。而且批次越大,每次梯度估计越稳定(因为取了多个样本平均)。• 一个epoch指模型把训练集所有样本都学习一遍。由于数据极大,通常不会像小模型那样训很多epoch。大型预训练常常只是1~2个epoch,有时甚至不到1个epoch(因为数据重复太低,没必要多遍)。微调阶段才会多epoch训练直到收敛。• 学习率决定每次参数更新步伐大小。如果学习率太大,模型参数可能剧烈震荡甚至发散;太小则训练缓慢甚至陷入局部最优。训练大模型通常用热身(warmup)+余弦退火衰减的学习率策略:前面几千步慢慢从0升到初始值,再逐步随着训练推进缓慢降低学习率。这能帮助收敛稳定。• 正则化方法比如Dropout在超大模型预训练中反而较少用,因为大模型本身和海量数据已提供足够正则效果;但在微调小数据时仍需要。• 混合精度训练:为加速和省显存,计算时用半精度或bfloat16存参数和梯度,仅关键时刻保留FP32精度避免下溢。现代框架/硬件对此有良好支持。• 并行训练:单卡显存有限,常用模型并行(切分层或张量)、数据并行(多卡同步不同batch梯度)等手段组合。现在还有流水线并行、MoE专家并行等高级方式,都为了更高效利用上千卡设备训练一个巨模型。这些工程细节超出本文讨论范围,但提出来让读者意识到:训练大模型不仅考验理论理解,也极端考验工程实现。稍有不慎,比如梯度爆炸、显存不足、分布式不同步等,可能导致训练失败或结果不佳。理解了训练的原理和流程后,我们可以进一步讨论**"模型表现的上限"由什么决定。这实际上牵涉Scaling Law(缩放定律)**,即模型规模、数据量、算力与最终性能的关系。模型表现上限与缩放定律:理论与现实模型表现的上限,简单来说就是:在理想条件下,一个模型所能达到的能力极限。它不一定是我们目前实际达到的性能,而是受模型规模和训练投入所物理限制的天花板。理解上限对大模型研发至关重要,因为它决定了你选择多大模型、用多少数据、花多久训练,才能逼近预期效果。在学术和工业界,判断上限的主要理论工具就是缩放定律(Scaling Laws)。OpenAI在2020年发表的经典论文《Scaling Laws for Neural Language Models》揭示了:模型Loss(预测误差)与模型参数N、训练数据量D、计算量C之间存在幂律关系。通俗讲:• 模型性能 参数数量 (其他条件不变时), 是一个负指数(约 ,取决于任务),表示参数越来越大,Loss 会按某个次幂规律降低,但收益递减。• 模型性能 数据数量 (其他不变时), 也是一个负指数,大小往往和 相近。数据越多,Loss 按幂律降低,也有收益递减。• 模型性能 计算量 , 一般 ,因为计算量=参数×数据,这也反映了参数和数据都重要。一个简化的公式(非严格,只作说明)可能是:这里 是常数, 是无论多大都消不掉的不可约误差(例如语言本身的噪声导致的损失下界)。这个公式意思是:当 或 增大到无穷,Loss 趋近于 ,但永远不会真正变0。关键是它描绘了损失随规模平滑、可预测地降低。如果用对数坐标画图,就是一条接近直线的下降曲线。上限的确定:对于一个给定规模的模型,比如100亿参数,用1000亿词训练,它能达到的最低Loss就由上面的关系决定。如果实际训练没达到,那可能是还可以多训练或调参。但如果已经接近理论曲线了,再增加数据或参数的收益将很小,上限已现。OpenAI和DeepMind的研究还指出一些具体结论:• 训练大模型时,不应把loss逼到极限再停,而是在计算优化点停。Kaplan等人早期结果说计算量给定,N和D分配要5.5× vs 1.8×的比例增大参数更划算,但后来DeepMind的Hoffmann等人(Chinchilla论文)修正为N和D应按同比例扩展。这就是我们引用的20倍规则来源--他们发现260亿参数的Gopher不如按最优定律训练的70亿参数Chinchilla,因为后者数据用了够多1.4T,前者数据相对不够。• 换言之,在给定计算预算下,与其训练超大模型但数据不足,不如训练适中模型配足够数据,效果更好更经济。这也是Llama2等很多模型采用的策略:没有盲目上千亿参数,而是把数据质和量做好。• 模型参数N对模型能力种类有影响。一些复杂推理和理解能力被发现具有**"Emergent Abilities"(突现能力)**,即模型性能随规模提升非线性跃迁。例如Chain-of-Thought 自行涌现只有在一定大参数模型上才观测到,小模型几乎不会。虽然这里面有Prompt和评测的因素,但规模确实是前提。• 模型数据D对知识覆盖有直接影响,大数据扫盲嘛。但质量也很重要,现在达成共识宁要高质量,不要纯堆量。能用自动合成(GPT生成)或精筛来提升质量密度,小数据集也能培养出高性能模型。这在近年的Phi-1等小模型中得到验证,它们参数不大但数据精挑细选,最终性能甚至媲美比它大数倍的模型。如何理解"模型表现的上限涵盖对世界的理解、推理和任务执行能力"?用户给的表述非常准确:上限意味着如果模型训练充分,它在知识(对世界事实的记忆)、推理(逻辑思考链条)和任务执行(应用能力,如编程、翻译)的极限水平。从Scaling定律看,这上限由N和D共同决定:• N决定容量:N越大,模型潜在上限越高,因为它"脑容量"更大,可以刻画更复杂的函数关系。但N本身不是越大越好,必须有足够数据填充。N大到一定程度如果数据跟不上,Loss曲线不会再明显下降,甚至模型会开始重复记忆低质量内容反而伤害能力。• D决定知识面:D越大,模型看到的例子越丰富,知识盲点越少,上限涵盖的领域越广。但D过大而N小,模型记不牢全部东西,会以平均策略来学,结果就是学皮毛。所以两者要匹配。Loss(L)作为聪明度指标:在缩放视角下,更低的Loss基本意味着更聪明的模型。因此上限通常用Loss下界来衡量。但对于人类需要的实际能力来说,还要结合Downstream任务表现来看,这里Loss低通常也带来各项指标高,这也是大量基准测试验证的,如前面提到GPT-4的MMLU远高于小模型。1. 参数规模N与模型能力的关系在众多变量中,参数量N最受瞩目,因为它往往和模型名字绑在一起(GPT-3 175B,Llama2-70B等等)。参数量有时被直观类比为"大脑神经元数量"或"硬盘容量"。前面您的比喻"参数量多少就像百科全书多厚"非常贴切。这部分我们就展开谈谈参数规模对模型能力上限的影响,从知识和推理复杂度两个方面:** 参数量 vs. 知识存储**:参数越多,模型越像一本厚百科全书。参数充足时,模型能记录下非常冷门的知识细节;反之参数太少,很多知识点它只能模糊处理甚至直接没记住。• 小模型(如6B参数):知识面狭窄。你问它**"1890年阿根廷总统是谁"**,它很可能答非所问甚至编造,因为训练中类似细节不够用且参数有限无法死记那么多琐事。• 大模型(如100B参数):有更大概率答上来**"胡利奥·罗卡"**(假设正确答案)或者至少说不知道但不会乱编。这是因为在训练中,它存储了更多历史知识。175B的GPT-3就被发现具备相当百科能力。• 参数是存知识但也有优先级:模型倾向先记常见高频知识,对罕见条目只有足够容量才照顾。因此,小模型回答流行常识可能还行,但专业冷门问题漏洞百出;大模型就覆盖更多领域。需要注意,参数不是以线性效率存储知识:增加10倍参数不意味着能存10倍知识,也许只能多记几倍知识。这和α指数有关,收益递减。然而不增加参数又不行,小模型天花板很低--无论训练多长,7B参数模型不可能达到175B那种百科水平,因为**"硬盘"就那么大**。** 参数量 vs. 推理复杂度**:参数不仅存知识,还形成电路支撑推理。Transformer层数和维度增加,相当于增加了模型可以执行的思考步数和并行脑回路。• 小模型脑回路少:在完成简单任务(如翻译一句简单英文)时可能勉强够用,但一旦任务需要分成多个步骤,它常常顾此失彼。举例:让一个7B模型翻译句子、再提取其中人名,再格式化输出JSON,这涉及多子任务,7B模型往往混乱输出。而70B模型就更能兼顾多步要求。这是因为大模型有更多参数可以专门负责不同子任务处理,不会互相干扰。• 大模型大脑深邃:参数多意味着网络层深、宽度大,可以容纳更长的推理链条。论文观察到,一些数学推理或逻辑题,小模型基本全错,大模型才能逐步接近正确。这不是因为小模型没见过问题,而是它的大脑迂回路径不够,无法持续多步推导。• Emergent ability:有些能力确实需要一定规模突现。如让模型写代码并解释意图,这需要理解复杂意图、规划和生成结构化输出。50B以上模型才开始表现出可靠的多步Chain-of-Thought推理能力,小模型几乎全凭碰运气或者很容易中途混乱。这背后隐含原因是:参数多才能实现更长深度的因果关联。** 参数分配与空白页问题**:参数多也有潜在问题--不充分利用。DeepMind提出Chinchilla结论就是很多先前模型参数过多训练不够,导致"空白参数"浪费。可以这样想:• 1000页百科全书的纸买来了,但只印了100页内容,其余900页空白--浪费纸张,相当于浪费参数。• 反之,1000页内容硬塞进100页纸,就会超密缩写,损失大量细节,相当于数据多参数少,模型记不全,压缩会导致"遗忘"或混叠。因此,参数与数据需要平衡才能充分发挥上限作用。参数设定合理、数据量充足时,模型的能力上限才真正接近所选规模的理论上限。2. Loss降低与模型变聪明:深入解读在Scaling Laws的讨论中,交叉熵损失(Loss)经常用作性能指标。有些读者可能疑惑:"Loss低真的就代表模型聪明吗?" 这里我们详细解释为什么降低Loss等价于提高模型智能,从预测下一个词的角度揭示模型的语言理解。回顾:交叉熵Loss定义为:,就是模型在每个位置上预测正确词的对数概率的负值平均。它越小,表示模型为正确词赋予的概率越高。场景一:非常简单的句子输入:"今天天气真___。"选项:{好, 坏, 鸭子, asdf}几乎所有模型无论好坏都会猜"好",因为语境和常识太明显。一个哪怕Loss较高的模型也可能把"好"概率设0.8,"坏"0.1,"其他"0.1。这种句子不能区分模型好坏,因为任何模型都能凭高频模式猜对。"聪明"的模型Loss= -log ≈ 0.22,"笨"模型Loss= -log =0.69,也差不太多。这也说明,光看几个简单例子不能看出模型真本事。场景二:复杂推理句子输入:"因为A导致B,且C抑制B,所以A和C的关系是___。"正确答案:"对立"(C在抵消A的作用)。一个不懂逻辑的模型可能给选项概率:"因果"0.3,"并列"0.2,"对立"0.1,"没有关系"0.4。它压根没推理对。这种模型 。一个懂逻辑的模型会高概率选择"对立",比如给"对立"0.9,其 ,很低。由此看出,在困难、有挑战性的预测上,模型需要真正理解句子含义和隐含推理才能提高正确词概率,也就是降低Loss。简单场景愚者巧合也能对,复杂场景智者方显智慧。因此,大量不同模式、不同难度的数据共同训练下,总体Loss的下降意味着模型在越来越多样的情境下都能给出高概率的正确答案。Loss从2降到1再降到0.5,是质的飞跃--模型从常识判断进化到逻辑推理都得心应手。OpenAI在Scaling Laws论文中描述,Loss vs N和D呈平滑下降,暗示没有出现瓶颈:只要给更多资源,模型性能(Loss)还会继续改进。这在GPT-4等超大模型身上得到验证--它们Loss更低,果然在各任务上碾压小模型。因此以Loss为度量的**"上限"**概念非常重要:它告诉我们用多少参数和数据能达到多低的Loss,从而大致推断模型会有多强。而目前我们还没触碰到明显的下限(AGI的Loss?),可以预见更大模型(如未来的GPT-5、Gemini)Loss还会降,能力还会升。3. "模型上限由Scaling Laws决定"是否权威?用户问到了这一点。确实,在学术权威定义中,Scaling Laws是目前最可靠的关于上限的理论框架。几乎所有大模型研发团队都会参考Scaling Laws选型。这不只是OpenAI,Meta和谷歌也在他们报告中提及模型扩展遵循类似规律。不过,需注意两个现实因素:• 数据质量:经典Scaling Laws假设数据是i.i.d且质量均一。但实际中,随着数据扩大,我们往往要从次优来源拿数据,导致质量下降。模型最后的Loss可能高于理想曲线预期。这也是为什么一些推断Alpha Beta的工作需考虑"irreducible loss"(不可降低的误差)。• 架构改进:Scaling Laws通常fix架构,只扩大小。这意味着如果换了更好架构,上限曲线本身也会下移。例如引入MoE稀疏专家可以在参数更多情况下更低计算,提高效用;再如ALiBi之类改进长程建模的技术也可能改变Loss下降速度。最近有人讨论**"上限由记忆而非智力决定"**等观点--意思是参数主要存知识,真正推理靠数据训练,等等。这些都会对上限理解产生细微变化。• 多模态和RL:Scaling Laws主要针对语言完形填空任务的Loss。未来大模型需要在多模态、交互环境中表现,上限衡量不再只是交叉熵Loss,而可能是复杂的综合指标。当前的Scaling Law或许只是反映认知基础的上限。总的来说,现阶段参数量N和训练量D仍是决定上限的硬通货。在权威著作和报告里,上限通常画成Loss随N,D的曲面,或者给出Compute vs Performance的曲线。这些让研究者可以推算下一个数量级模型的大致效果。如果我有10倍算力,是增大模型呢还是多训练数据?Scaling Law可以给指导。因此可以回答用户的问题:理解模型表现上限确实是大模型研发的核心理论基础之一,而Scaling Laws就是描述上限的"公式化"体现。上面的表述已经很好概括了上限涵义,而补充是:这个上限在实践中由参数和数据按幂律规律决定,多大模型配多少数据达到何种Loss基本可预测。4. 参数N对模型不同方面表现的上限用户还问到:"$N$(参数量)这个上限对应模型哪方面表现?" 其实参数量提升带来的上限提升,体现在几乎所有NLP任务上:从对话、问答,到翻译、总结,再到编程、数学,都显著受益于大N。当然,不同任务提升幅度不同,比如算术可能更依赖模型推理深度(需要一定N才能掌握多步公式应用),而常识QA更多依赖知识(N大直存更多常识)。概括来说,参数主要扩充了模型的"知识容量"和"并行能力"。这对应:• 更高的知识上限:模型知道更复杂冷僻的知识点。过去小模型会瞎编的, 大模型能老老实实或给出正确回答。参数为模型提供了存储长尾知识的空间。上限足够高时,模型几乎像百科全书+应用手册合体。• 更高的推理上限:模型能解决更复杂的问题。逻辑推理题、编程题,大模型往往出现跨越式提升。这被一些研究称为"智能涌现"效应,参数是必要条件之一。• 更稳健的指令遵循:有意思的是,Even指令跟随和多任务并行执行能力也随N提升。大模型更擅长按照复杂要求输出。这可能是因为大模型有足够容量学习到了任务格式化、指令模式等多种能力的组合,不容易被一种任务牵着走而丢了指令。当然,要发挥这些,通常大模型需要再经过微调和RLHF来激发。7B模型微调后也能执行指令,但常受限于基础能力。70B模型微调后则游刃有余,因为基础能力上限高。一句话:参数量决定了模型可能具备的最强能力,但实际达到需要充分训练。这个上限覆盖知识、推理、理解、生成各个方面的综合表现。5. 知识密度与准确性的评价(再访)前面数据章节谈了知识密度和准确性,这里串联到模型上限。知识密度与准确性最终体现为模型在任务中的事实掌握程度。大模型上限高意味着它应该能高准确率回答海量知识问题。如何判断模型达到了自身上限的"知识储备"呢?• 如提到的MMLU基准:如果一个70B模型只能达到50%准确率,而理论上70B应能达到80%(假设GPT-4 175B达到86%,按参数缩放70B应该也有70-75%),那说明它的知识密度还有提升空间,没到上限。只有当你发现增大模型或延长训练,准确率不再明显升高,那就是接近上限了。• 开放域问答测试:给模型海量事实性问题(例如TriviaQA、WebQuestions),看它在无需外部资料的情况下能答对多少。相比于100%是完美知识库,当前模型可能60-70%。这个离上限还有距离。• 知识图谱覆盖:将模型记忆到的实体、关系挖掘出来,与维基知识库比对,看覆盖率。这样的研究能发现模型"知道"多少事实。越大模型这个覆盖率越高,但有天花板。基于Scaling Law推算,也许无穷大模型在无穷数据下能接近100%覆盖(相当AGI知识完备),现实中看可到某上限比如90%就很了不起。• 幻觉率:上限模型应该更少幻觉,因为它已掌握大部分知识或至少知道自己不知道。当模型参数不足或训练不足时,为掩盖无知会乱编。这也是知识准确性的反面指标。上限高的模型幻觉率会降低,但可能不会为0,因为语言本身歧义和模型输出随机性永远在。所以知识密度与准确性指标需要定量测试才能判断。主观上很难凭感觉判断模型记住了多少。必须在诸如MMLU等统一标尺下对比。你会发现参数从7B到70B到GPT-4显著提高各知识类任务得分。只有当模型继续扩展不再提升得分时,才可说知识存储达到上限或饱和。目前我们离那还有距离(GPT-4在一些领域仍有漏洞,所以OpenAI继续搞GPT-4.5/5等)。综上,参数规模和数据规模基本决定了模型的性能上限,而Loss降低具体体现了模型在语言预测上的"聪明度"提高--这反映到下游任务中,就是知识更丰富,推理更严谨,错误更少。Scaling Laws在大方向上指导我们设计模型和训练以逼近理想上限。了解这些理论后,我们回到实践中来看看模型推理和微调的一些现象,例如Chain of Thought的应用、上下文短期记忆和人类反馈微调对模型行为的影响。这将解答用户剩下的一些深层问题,如"模型能自发CoT的原理"、"上下文理解的机制"、"RLHF如何让回答变长"等。高级能力:思维链、上下文记忆与人类反馈对齐在模型具备了强大的基础能力后,我们关心的是它如何运用这些能力去完成复杂任务。几项近年来提升大模型表现的关键点包括:• 思维链(Chain-of-Thought, CoT):模型逐步推理的能力,有时需要通过特殊提示触发,有时大模型会自主在内部组织多步推理。我们解析其原理及为何需要CoT提示。• 上下文理解与"短期记忆":模型通过Attention实现对大段上下文的理解和利用,我们看看长上下文是如何保持,及上下文长度的限制对模型记忆的影响。• 输出长度与细节控制:过去模型回答简短,现在的ChatGPT/GPT-4回答详尽,这背后有人类偏好强化学习(RLHF)的驱动。我们解释RLHF如何影响模型啰嗦程度,以及如何在推理时控制输出长短和细节。• **检索增强生成 ** vs 模型内部知识:模型参数记忆(FFN知识库)和外部资料检索的优劣比较,帮助理解为什么需要RAG以及它与模型本身能力的关系。这些都是在基础模型训练完成后,通过提示工程或微调实现的增强。它们体现了模型"用脑"的方式和与人协作优化的思路。1. 思维链 :让模型逐步推理什么是CoT? 思维链提示是一种对模型的提问方法,即要求模型显式地分步给出推理过程,而不是直接给最终答案。例如,对于一个数学应用题,普通模型回答:"42。"而用CoT提示的模型会回答:"首先计算A,得到x;然后计算B…所以答案42。"--中间这些推理步骤构成了Chain-of-Thought。CoT原理:大型语言模型被训练成预测下一个词,它本身并没有硬编码一个"推理模块"。但当我们提示"请分步骤思考",模型会倾向于先吐露推理过程,再给结论。从训练角度看,也许模型读过很多人类解题的示范,每步写出来,所以它学会了这种格式。在没有显式CoT提示时,大模型可能在内部也进行了多步骤推理,只是直接输出最终结论;而加上CoT,它把那些隐藏步骤显式输出了。为什么CoT有效? 研究表明,CoT提示可以显著提高模型在复杂推理任务上的准确率。因为:• 分解难题:CoT让模型把一个难问题拆解成易于处理的多个子问题。这和人类思考类似,一步步来更不容易犯逻辑错。• 减少逻辑跳步:没有CoT时,模型可能基于相关性立即给答案,容易犯"跳到结论"的错误。而CoT要求它逐步来,降低出错概率。• 调试可行:如果模型每步都写出来,人可以看中间步骤是否正确,从而定位模型错误来源。对于训练过程,可以有针对性地微调纠错。无CoT时模型思考隐在内部,我们无法干预。例如,一个算术应用题,没有CoT时模型可能直觉给一个错误数字;CoT时模型会列出算式,哪怕结果错,人类或程序也能看出哪步算错,下次修正。这种透明度提升是CoT的重要好处。CoT自主涌现:有趣的是,超过一定规模后模型即使不特别提示,有时也会自发在回答中加入推理痕迹。比如GPT-4在一些情况下会先解释一下再答。这表明模型内部确实在多步推理,而且它觉得把理由一起说出来是合理的回答方式。这可能是因为训练数据里,大模型见过人类思考过程表述的文本。小模型就很少这样,它们更可能给简短甚至敷衍的答案,不具备复杂推理能力,所以不会有长链条输出。实现CoT:用户通常通过在提示末尾加:"请一步步展示你的推理过程" 或给一个示例展示逐步推理的格式,让模型进入CoT模式。OpenAI等也在指令微调时加入了大量CoT演示数据,让模型熟悉这种问答风格。结果,模型在数学、推理解谜、代码解释等任务上表现大幅提高。CoT从原理上看,并没有改变Transformer的内部结构--它只是改变了模型输出的内容,进而影响模型的思考路径。当模型需要输出逻辑步骤时,它就真的会顺着逻辑推演而非立刻取结论(因为一步步输出token比直接输出答案token序列得分更高,模型学会了这样顺着输出)。简化理解:CoT提示像是在模型输出空间塑造了一个更复杂的轨迹。模型本来可以直接从问题跳到答案,现在被引导走一条曲折的路,中间路过许多推理步骤的词。这条路虽然长,但每一步都能被上下文验证和引导,下一个词的预测更可靠。这就是CoT让模型走对的原因:它逐步约束了模型的思维路线。例子:问模型:"数字7, 10, 17, 26,...请给第10个数字。"- 不用CoT,小模型可能直接拍脑袋:"第10个数字是(随便乱算)100。"- 用CoT,大模型答: 1. 序列似乎差分别是3,7,9,...不规则。 2. 也许差本身成规律?3,7,9,... 看不出。 3. 可能另有模式,每项公式?尝试二次方: 7=2^2+3,10=3^2+1,17=4^2+1,26=5^2+1,...哦规律:从3^2+1开始? 4. 17=4^2+1,26=5^2+1,下一个应是6^2+1=37... 5. ...于是第10个数=...?最终答案=某数。这里模型用CoT展现了探索过程,即使一开始猜错,后面自己调整。最后得到正确答案。如果不要求过程,它可能猜第一印象错的就停了。CoT让它纠错并找到正确模式。当然,CoT也不是万能,有时模型会**"瞎编步骤"但结论还是错。这被称为错误思维链**。如何纠正模型的CoT过程是研究热点,有些方法用特判或两阶段思考。原理小结:思维链提升模型表现的原理在于外显中间状态,约束解题过程。大模型有能力做到正确推理,但需要一点引导将这种能力发挥出来。这种引导通过简单的Prompt就能实现,充分说明了大模型蕴含的通用推理能力远比表面强--我们只需调整输出格式,就能解锁更多潜能。2. 上下文理解与"短期记忆":Attention的威力与局限我们已经讲过,自注意力赋予模型在一个上下文窗口内整合信息的能力,让模型拥有一定的"短期记忆力"。这里的短期指模型在一次推理中所能"记住"的内容长度,由**上下文长度(Context Length)**决定。比如GPT-3上下文2048 tokens,GPT-4有8K和32K版本,Claude有100K以上。上文解密:当你与ChatGPT对话,模型每次回复其实都将你和它之前的对话作为输入上下文一起处理。所以它能"记得"聊天内容,是因为那些内容作为Token上下文一起进入Transformer,被注意力机制处理。模型没有像人一样的大脑存储,而是每轮对话都重新看一遍历史文本。Attention相当于模型的工作记忆黑板。上下文理解表现在:模型能引用对话前面提到的人名、事件细节,不会每轮都把事情忘了。这完全依赖Attention头在这些位置间建立关联。例如你提到"Tom喜欢Jerry的书",后问"他什么时候出版那本书?",模型能明白"He"指Jerry,因为在上下文Tom->Jerry->书的关联中,出版和写书对应Jerry而不是Tom。上下文的局限:• 长度限制:超过上下文窗口的内容,模型就完全看不到了,自然谈不上记忆。例如ChatGPT有时会提醒"对不起超出最大长度"。要处理长文,就需要切片或者特殊架构(如Transformer-XL, RMT等),但经典模型有固定窗口。• 长距离衰减:虽然理论上Attention可以全局,看论文远程依赖可以捕获,但实证发现非常长距离的信息模型未必有效利用。Attention有$\frac{1}{\sqrt{d}}$的点积scale,信息可能会淡化。另外,训练中模型很少碰到超长文本(绝大多数句子或文章有限长),所以在极长上下文下(几千词距离的两处关联),模型未必学会去连接。不过,像GPT-4等经过特殊训练的可以程度上利用32K甚至更长,但效率和可靠性下降。• 无长期累积:一旦对话结束,本次上下文清空。模型无法像人那样下次见面还记得你(除非把之前记录再作为上下文提供)。这就是为什么有记忆管理的需求。为了解决长期记忆,人们开发RAG等方案,把对话摘要或信息存储,下次调用。模型本身没有跨会话记忆。• 上下文漂移和遗忘:Attention关注的是相关性。如果上下文很长且主题多样,模型可能难以区分哪些该关注,哪些无关。它可能受一些不相关但表面相似的信息干扰。这类似人类记忆里的干扰效应。怎样做到上下文理解?关键仍在Attention得分的计算:Transformer通过训练学会给相关词较高的Q·K相似度,不相关的低。因此当上下文里很多内容时,模型通过注意力权重实现一种"记忆选择"。像人读书一样,会对中心主题保持注意,对次要背景一带而过。Transformer每一层注意力都会重新分配权重,高层Attention头甚至专门学会**"聚焦重要部分"**的机制。例如,对于长文问题回答任务,模型的做法可能是:• 底层Attention把所有句子embedding起来,各自吸收一些邻近词信息。• 中层Attention可能有头专门看段落的主题句,将那些主题句聚合。• 高层Attention进一步把文章主旨词汇集中到输出,用以回答问题。这种多层信息抽取过程,让模型能从冗长上下文里提炼关键点记住。当然这是理想情况,实际情况复杂,但确实观察到Attention模式有逐层抽象的效果。短期记忆 vs 参数长期记忆:参数里存的是长期知识,而Attention上下文则相当于工作内存。如果你问模型一个训练中没见过的知识但在给定上下文里提供了,它可以利用上下文回答正确。这就是开放书考试 vs 闭卷考试区别。• RAG/检索增强充分利用这个特点,把外部知识放入上下文,让模型即时"现查现用"。模型不用记住所有知识,只要记得怎么用搜索的结果就行,降低参数需要。• 当然,参数里存的背景知识仍重要,否则模型拿到资料也不懂。而且注意力有长度限制,参数知识没有这种限制(只要训过就一直在)。因此上下文理解力也是模型能力的重要层面。一些任务(对话、多文档综述)需要特别长的上下文。模型上限也体现在最大可处理信息量上。GPT-4 32K版和8K版在需要长引用的任务上,上限明显不同。未来模型若能扩展到百万Token上下文,将可以短期记忆整本书内容,处理更加宏大的推理任务。研究在朝这个方向发展,比如FlashAttention优化计算和稀疏注意力降低复杂度,以突破长度限制。总而言之,模型的上下文理解和短期记忆完全由Attention机制实现。它通过赋予输入序列元素互相看到彼此的能力,使模型每次生成时都相当于"读透了"所有上下文。这个能力受限于窗口大小,但在窗口内模型可以做到接近全局一致性理解。正是Transformer优于RNN的重大优势。3. 模型输出风格与RLHF:从惜字如金到滔滔不绝用户注意到一个现象:早期模型回答简短,现在模型回答很长。这是非常典型的指令微调+RLHF成果。让我们解释背后原因:Base模型 vs 指令微调模型:预训练完成的基础模型(如GPT-3 davinci)本质上只是一个"续写模型"。你给它一个问句,它不知道该简洁回答还是展开讲,于是倾向于继续胡乱生成一串话题相关的文本,往往不切题或漫无目的。而OpenAI的InstructGPT通过监督微调(SFT)教会模型:遇到人类指令,应该简明回答问题。于是ChatGPT之类会努力给出答案本身,而不是天马行空续写。这使回答变准确有用了。但长度呢?一开始的InstructGPT回答其实也不算太长,往往几句话。因为模型没有特殊动机写很长。它完成指令即可,多说还可能跑题甚至增加出错风险。所以若让SFT模型自己选择,它会偏向简洁--语言模型有正则化倾向,不会无端啰嗦(除非训练数据示范那样做)。RLHF介入:OpenAI引入人类偏好强化学习(RLHF)后,用户体验显著提升。其中一个现象是:人类往往更喜欢详细、有解释的回答(觉得模型有诚意、专业)。人类标注在比较模型输出时,会给详细且正确的回答高分,给简短但也正确的回答低一些分。模型在这个信号下学到了:"回答越长可能越好"。再加上安全原因,模型倾向把潜在敏感回答多绕点弯、多加澄清(以免直接说错话挨罚)。RLHF技术上通过一个奖励模型衡量输出好坏,然后Policy模型(即最终对话模型)学习去最大化人类评分。结果我们看到ChatGPT那种风格:先感谢提问,再阐述分析,再分点结论,最后总结。这无疑是很啰嗦的,但用户大多买账,因为显得专业周全。OpenAI论文提到RLHF模型字数相比SFT模型明显增加,用户评分也更高--所以这个趋势一直延续。模型FFN大,潜力足:大模型本身储备了丰富知识,完全可以长篇大论(参数足够存百科般内容)。早期简短,是因为没被要求输出。现在有了人类"希望详细"的反馈约束,模型自然把肚子里的料都倒出来。这相当于开发了模型的啰嗦潜能。FFN层存的知识点,不用白不用,所以它会自发调动各种冷知识、背景往答案里加,以显得全面。这也是幻觉率提升的隐患之一,因为说太多难免有不准确的点。但总体上,人类宁可它啰嗦带一点点错,也不要惜字结果不清楚(从RLHF结果看确实如此)。案例:问:"什么是黑洞?"- 早期GPT-3模型可能回答:"黑洞是引力场极强的一种天体,连光都无法逃脱。" 一句话完事。 - ChatGPT则会回答一长段,分几段介绍黑洞定义、形成、性质、观测、结论等,末尾可能还补一句"总之,黑洞是极端物理条件下的特殊天体..."。很显然更"用心"。输出长度控制:当然,现在模型也不会无节制地一直写下去,因为token成本和上下文长度限制。OpenAI在RLHF时也给定了输出长度的先验,他们不会标注一个500字回答比50字更好无止境,而是在"足够解释清楚"这个范围。所以模型学会的是根据提问深度要求给足够详细回答。如果你问一句简单facts,它不会写1000字论文,可能写100字即可。问写小说那它才连续输出上千字情节。这种长度调节能力来自训练数据中不同指令类型的示范。另外还有用户指令直接控长度的方法,如"请给不少于1000字的回答",模型会尽量遵守--因为微调 教它严格听从格式要求。这种指令就像我们之前类比的**"斥力场"**,使得模型推理时拒绝过早结束,不断拓展内容直到达到字数。反之"简明回答"指令就像黑洞吸引,让模型赶紧收尾。底层原理:Transformer本身并没有长度喜好,但训练Reward改变了终止分布。模型学会在没有明确要求时,输出句子达到某种完成度再停止。这完成度是经RLHF学习的人类满意度综合的函数。可以认为Reward Model部分内化了"多长合适"这个隐含判断,在Policy模型参数中体现为标点、结尾词概率的调整。比如ChatGPT经常最后一句收尾语气明显,因为它觉得回答"够长了,该结尾了"人类评分最高。总结:从技术上看,SFT塑造了模型内容的正确性和遵指令性,RLHF塑造了模型回答的风格和详尽程度。早期没有RLHF的模型往往给简短直接答案甚至列个项就完,因为它不清楚需要展开。而现在模型经过RLHF,会努力满足大多数用户偏好:提供上下文、解释原因、给出完整答案。简短回答则只在明确要求简洁时才给(或模型不确定答案时才敷衍一句)。这也回答了用户的问题:FFN参数增大提供潜在长回答内容,但要模型真发挥出来,需要人类反馈指挥。通过RLHF,人类等于对模型说:"别怕麻烦,多说点细节我们喜欢"。模型于是倾向给长答案。4. 模型内知识 vs 检索增强 :各有所长用户提到了RAG,并猜测RAG无法比拟模型FFN存储和理解能力。这是很关键的认知点。参数内知识:模型参数存储知识的优点是即时、模糊匹配和融合推理:• 模型可以将相关知识隐式结合。比如通过FFN同时调出多个相关事实进行综合,然后回答。这种多知识点的交叉,是当前检索工具难做到的(通常检索文档各自独立)。• 模型调取知识几乎零时延,因为就是矩阵计算。检索需要访问数据库或向量库,有I/O开销和索引不完备性。• 模型永远有答案,哪怕知识不全也会编(虽不好但有答复)。RAG如果检索不到就只能说不知道。但参数内知识的短板也明显:• 时效性:训练完固定,不能自动获得新知识。不可能为每周新事实都重新训练庞大模型。• 准确性:当模型不确定时,会幻觉编造以填充。这对追求精确答案场景不友好(比如法律咨询不能乱说)。• 容量瓶颈:即使参数再多,也不可能囊括所有冗长细节文档(如整篇维基)。模型知识存的是高度压缩的,适合判断和概要,不适合逐字输出内容。• 无法引用来源:模型说出的知识没法直接证明出处,追责困难。而RAG提供的文本可以附来源链接,增强可信度。RAG(Retrieval-Augmented Generation):就是在模型回答前,先用查询去知识库(通常向量数据库或者搜索引擎)拿一些相关资料,加入上下文,让模型阅读后回答。这样一来,模型输出质量取决于检索资料质量:• 如果检索命中正确详细资料,模型只需稍微措辞组织,就能给出真实且信息丰富的答案,比参数记忆可靠。• 如果检索不到(知识库没收录或索引失败),模型仍然可能乱答。这时RAG也没辙,除非返回"抱歉未找到答案"。RAG和FFN关系:• RAG是对模型的知识补充手段,不提升推理能力本身。模型依然要理解检索到的文本,这需要模型有相应语言理解水平。所以FFN存的基础常识、语言能力仍发挥作用:它读资料、判断资料和问题的关联、抽取关键点,都靠自身训练来的能力。• RAG有点像给模型发了一本小册子参考书。模型从闭卷变开卷考试。但开卷也要你懂得在哪找答案、怎么看懂书,FFN支持这些。• RAG劣势:模型没有见过的格式或内容,它也可能读不懂。例如代码片段或特殊表格,模型理解有限,RAG给它那些资料可能也不会用。• RAG成本:检索过程需要基础设施。对于要求实时联网查询的应用,RAG是必需的,比如问昨天天气,不可能让模型参数记住每天天气,需要RAG拿。• 参数知识对于对话上下文相关的事实尤其重要。RAG一般针对外部知识库,不一定处理聊天中的前文信息。所以RAG更像提升世界知识,而对话上下文的记忆还是靠Attention。所以,RAG和FFN并不是完全对立,而是互补**:• 对静态领域知识,能存则存:比如医学、法律条文,可以硬灌进模型参数,模型随答随有。但要非常准确时仍可RAG原文引用以确认。• 对动态或详尽内容,RAG更优:例如新闻动态、数据库查询、长篇文章Summarize,这些内容不可能全预存,也不需要泛化推理,就是要实打实引用。• 很多系统会模型+搜索引擎结合。先模型判断需求-> 用关键词检索-> 将结果和模型已有知识一起产出,得到既准确又通顺的回答。Memory vs RAG:最近一些"个人长期记忆"项目,把对话摘要embedding存库,每次新对话拿出来。这可看做RAG扩展,用于上下文补全。因为Transformer注意力不能跨长会话,这样做相当于把历史以文本形式伪造进入上下文。但模型对这种补全的可靠处理依赖embedding质量,而且容易错配。最终,随着模型参数增加,我们希望减少对RAG的依赖,因为RAG增加系统复杂度和响应延迟。但参数再大也不现实覆盖一切,所以Hybrid方法比较实际。OpenAI自己的GPT-4,也常配合工具使用,比如上网搜索、调用计算器,都是RAG思路。回答用户猜想:RAG确实没有训练过程,它只是检索。但它能提供精确原文,在事实准确性上有无可比拟的优势。FFN存知识的过程有压缩,会出错。但FFN比RAG强在灵活运用:模型可以将知识转化、结合、举例等,RAG只能给你材料不会自己组合。当今趋势其实是把两者结合:让模型既大又查。比如Bing ChatGPT就是后台有必应搜,搜完资料投喂给一个GPT-4。ChatGPT企业版也提供用户私有知识库检索的接口。这样做的理念是:让模型专注推理和语言生成(内功),知识细节用外挂填充。这样,我们基本回答了RAG和FFN能力的对比:RAG解决知识更新和精准问题,但不提供推理;模型参数提供泛化理解,但知识更新慢、偶有幻觉。两者结合,优势互补,打造一个既聪明又知道最新知识的AI系统。结语:在本文中,我们从工程实践和理论研究两个角度,对大模型开发的关键环节和概念进行了全面剖析。从数据(语料收集、清洗、去重)的艰辛工作到模型架构(嵌入、注意力、前馈)的精妙设计;从训练过程的梯度调参到Scaling Laws描绘的性能上限;再到模型拥有高级能力如思维链推理、上下文记忆,以及通过人类反馈调整风格和引入外部知识增强,我们力求呈现一个立体的图景。可以看到,大模型开发既是一门科学(有明确的理论规律指引,如Scaling定律、Transformer原理),也是一门工程艺术(需要大量实践经验,如分布式计算、内存优化、微调技巧)。同时,大模型的能力展现受数据、模型、训练、微调等多因素影响,需要统筹兼顾、迭代调优。最后,我们建议每一位有志自己研发大模型的读者:• 从小规模试验开始:哪怕是训练一个几千万参数的模型,用少量数据跑通全流程,你都会收获宝贵经验。正如前文提到的,先试着用一个开源小模型+少量数据感受Loss下降曲线。在实践中体会embedding、attention的作用,比文字描述更深刻。• 充分利用已有资源:善用开源的Tokenizer、现成模型做增量预训练,而非从0造轮子。开源社区有丰富的工具(Transformers库、DeepSpeed优化器等)和模型权重(如Llama系列)可用,这能让你站在巨人肩膀上前行。• 重视数据质量:数据上的努力常常比调模型结构更管用。花时间清洗、去重、过滤,乃至用GPT-4生成高质量数据,都可能比盲目扩大模型更有效提升性能。• 理论指导实践:用Scaling Laws估算所需资源,避免浪费算力在明显没法收敛的配置上。关注最新研究进展,如更高效的长上下文机制、新的微调方法,以升级自己的技术方案。• 平衡能力与准确:大模型不是孤芳自赏的学者,而是要服务人的。确保在追求模型上限时,也通过微调和工具让它尽量听话、靠谱。一味让模型自由生成可能冒出幻觉或不恰当内容,这就需要RLHF和RAG等手段加持。希望这份深入研究和学习结果能够帮助您更系统地理解大模型开发的路径和奥秘。从准备语料到模型训练再到部署应用,每一步都有学问,每一步也都有前人经验可循。在AI快速演进的今天,"大力出奇迹"有一定道理,但方向正确地用力才能真正创造奇迹。祝您在大模型探索之旅上取得成功!不断探索、不断创新,把握理论与实践结合的关键点,寻找下一个突破。 来源:工业软件产业发展探索

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈