然后有人在群里问了一句:你们厂里真的用起来了吗?
没人接话。
这个沉默,其实比视频本身更值得聊。
先说热闹的那一头。现在市面上关于"大模型自动跑 CFD"的内容,大致来自三个地方:
这三者有一个共同点:它们验证的都是"能不能跑通",没人验证"能不能一直跑对"。
再看安静的那一头。真正靠仿真出产品性能的制造企业,这些年对前后处理自动化、参数化建模、优化平台(optiSLang、modeFRONTIER 这一类的用法)一点都不排斥,该花的钱都花了。但一说到"让大模型来决定仿真过程",态度普遍是:再看看。
原因也不难理解。
如果只能挑一个词来概括大模型驱动 CFD 自动化的瓶颈,那就是可靠性。展开说是三层。
最要命的一层:CFD 的错误大多是静默失败。
写代码写错了,编译器会骂你;脚本参数填错了,程序会报异常。但 CFD 不一样:网格划歪了、边界给错了、湍流模型选错了、时间步放大了,求解器不会报错,它会笑嘻嘻地给你收敛出一条漂亮的曲线,然后交出一个物理上毫无意义的云图。你甚至可能因为这次"收敛得特别快"而心情不错。
静默失败是所有自动化系统的天敌。因为自动化的前提是"出错了能被发现",而静默失败恰好把错误藏了起来。人来做这些判断时,靠的是经验里那些说不清道不明的直觉;换成大模型,它连"我觉得这里不太对"都说不出一个可靠的依据。
第二层:不可复现。
大模型的输出带随机性。同样的问题、同样的上下文,今天问和明天问,答案可能不一样。对人来说这不是问题,因为人会解释自己的思路、会被追问、会认错。但自动化流程需要的是确定性——同一个 case 跑两遍,结果必须一样,否则没法做验证,没法做回归测试,也没法在客户面前解释。
第三层:误差级联。
一个完整的仿真流程,从几何清理到报告输出,二三十个步骤是有的。假设每个步骤大模型的判断准确率都是 95%——这个数字听起来已经很高了——那么全流程走对一次的概率是:
也就是说,一百次里能顺顺当当跑完的只有三十几次。企业要的恰恰是那九十几次。这就是为什么 demo 那么好做,产品那么难做。
顺带说一句,也有人寄希望于"让模型自己检查自己"。目前来看这条路不太通——模型给出的检查结论,本质上还是它自己生成的文本,它并不知道自己什么时候是错的。你问它"你确定吗",它只会更自信地重复一遍。
聊到这里,最近火起来的 Jev 模型就绕不开了。
按官方口径,Jev 是 TypeSafe AI 推出的"决策模型",跟传统大模型最本质的区别是:它不写文章、不写代码、不聊天,只接收非结构化输入,返回带校准概率的结构化判断。输出只有三类原语——布尔判断(是/否的概率)、选择(在预定义选项里给概率分布)、评分(按指定尺度打分),全部附带置信度。据官方数据,端到端延迟只有几十到几百毫秒,成本比前沿大模型低两三个数量级。
它为什么能又快又便宜,原理上其实好理解:传统大模型是自回归逐 Token 生成,输出越长越慢;Jev 用自研的并行采样器,一次前向就把全部判断吐出来,不逐字解码。同时它把输出空间限死在一个预先定义的 schema 里,所以输出天然可解析,不存在格式错误和类型幻觉这一说。
我更关心的是它训练上的取向。它用的是 RLCD(校准决策强化学习),优化目标不是"人类更喜欢哪个答案",而是置信度和真实正确率对齐:如果模型对一批判断都报 90% 的把握,那么这批判断里就应该有大约 90% 是对的。
这一点对 CFD 自动化的价值,比速度快几百倍还要大。
因为 CFD 流程里塞满了这种类型的微判断:
生成式大模型做这些判断有两个硬伤:输出不稳定(今天说 A 明天说 B),以及无法量化把握程度(它永远都是一副很有把握的样子)。而 Jev 这一类模型的输出,天然带着一个可以写进 if 语句的概率: 直接执行, 交给更强的模型复核, 转人工。
这才是自动化系统该有的形态。不是赌模型不出错,而是让系统知道模型什么时候可能出错。
当然,冷水还是要泼的。官方公布的性能数据自注为内部评测的收益上限,存在偏差;所谓"零幻觉"只保证输出类型和结构不出错,官方 FAQ 也承认它仍可能选错;目前该服务尚未向中国大陆开放。更关键的一点是:Jev 解决的是"判断稳不稳",解决不了"判断依据从哪来"。 什么叫"网格质量可以接受",这个阈值是谁定的、依据是什么,模型替你回答不了。
所以我认为,这件事真正的工程量不在模型那一侧,而在这儿:
1. 将老法师脑子里的隐性判断显性化。 网格质量的硬阈值、收敛判据、物理合理性检查(质量守恒、能量守恒、量纲是否对得上)、什么情况下必须换模型——这些平时靠经验的活儿,得一条条写成规则和检查清单。这是最枯燥、最费时、也最不可替代的一步。
2. 给流程加过程约束。 每一步之间加"拉闸":输入合法性校验、参数取值范围限制、中间结果与经验区间的比对、越界即停。这听起来像是在限制 AI,实际上是在给自动化上保险,同时让整条流程可审计、可回滚。
3. 做评测集,而不是做演示。 现在大家比的是 demo 好不好看,没人比同一个任务跑一百次成功率是多少。没有统一的评测基准,可靠性讨论就是玄学,厂商说自己 99% 也只是说说。
4. 分段自动化,而不是端到端。 前处理的参数化、网格模板、后处理报告生成,这些环节成熟、判断少,可以先自动掉;中间那些强依赖物理判断的环节,老老实实留人在环。等底层的判据库足够厚了,再一段一段往前推。
5. 留数据。 每一次算例的输入、输出、走过的岔路、为什么这么选,都留档。这些记录是将来的燃料——无论你最后用的是 Jev 这类决策模型,还是自己训一个小模型,喂给它的都得是这些。
这五件事有个共同点:不出论文、不出 demo、不涨 KPI,短期看不到任何收益。 所以现在做的人少。但恰恰是它们决定了这件事最终能不能落地。
我的判断还是那几条:
大模型驱动 CFD 自动化,方向上我认为是对的,甚至是迟早的事。但目前它更像是"趋势正确、时机未到"——民间炒得火热,企业真正落地还很少。
当前的瓶颈不在模型聪不聪明,而在可靠性和稳定性。而提高可靠性这件事,靠的不是换一个更强的模型,而是补上那些基础性的、没有收益的功课:底层决策、过程约束、判据沉淀。
最怕的是顺序搞反:先搭一个炫酷的端到端 Agent,跑通两个 case,然后逢人就讲"大模型不靠谱"。它不靠谱,是因为我们跳过了最不性感的那部分工作。
CFD 这个行当其实有个优势——我们天天在跟误差、收敛、验证、不确定性打交道,怀疑一切漂亮结果是刻在职业习惯里的。把这套习惯用在 AI 身上,大概就是这件事的正确姿势。
至于 Jev 这类决策模型,我会继续盯着。它至少指出了一个方向:在生成已经足够便宜之后,下一个值钱的,是判断。
胡言:随便聊聊,当真就输了!
”
(完)