GPT 6 Astra CAD建模能力达新高,国产工业软件差距又拉大
近日,OpenAI发布了其最新的GPT-6 Astra系列模型,突出强调了其从“问答工具”走向“完成工作”的能力,即调用各种软件工具完成专业任务。模型介绍里展示了一系列其面向专业任务的测试结果,包括办公、科研、编程、影视动画3D建模等。其中也包括了面向工业领域的PCB布线,以及机械零件的3D建模。PCB布线
GPT-6 Astra用一个15秒的视频,演示了在KiCad环境中进行印刷电路板布局的过程。AI操作KiCAD,自己规划位置,放置元器件,再把不同元器件之间的铜线连接起来,最后得到一块可以进入制造流程的电路板。机械零件3D建模
GPT-6 Astra公布了在BenchCAD测试集的得分。BenchCAD是一个用于测试AI识别零件图并创建对应CAD3D建模代码能力的测试集。 GPT-6 Astra在建模结果上的得分为95.9%,相比GPT-5.6 Sol的83.3%和之前最高的Claude Fable 5.1.5的84.3%又创造了新高。同时,其预估的API成本显著降低,比Sol低约43%,比Fable 5.1低86%。BenchCAD准备了共106类合计17900个工业零件的多视角视图,要求根据图片写出能生成这些零件的CAD代码。题目看起来简单,但涉及到视觉感知、图像与文本之间的转换、以及3D空间推理能力,需要模型识别零件,理解3D结构,并将图中尺寸标注与模型尺寸联系起来,能力要求不低。
题目包含的零件都是实际零件,106种零件中约一半(52个)符合ISO/DIN/EN/ASME/IEC标准,其余的来自典型的工程实践规范。很多零件还涉及了46种复杂Cad操作:如旋转、数组处理、扫描、定位、螺旋运动等,这些操作需要真正的3D推理能力才能完成。
模型写出代码后,将模型在CAD中运行,对比生成结果与标准结果的几何重叠率,乘上代码执行成功率,得到一个名为IoU的数值,作为评测的得分。对生成模型的检验包含完整的尺寸检验,而非看着差不多就行。如果代码执行失败,那对应的得分也就为 0重点是方向,而非当前能力
在CAD建模等方向,尽管GPT-6 Astra相比之前的模型又往前有了进步,但是进入真实的建模环境,其能力依然很有限,距离理想中的“一句话建模”仍有相当距离,此前的文章有更具体说明。但此次发布的重点,在于其长远意义:基座模型的发展方向已经走向了专业任务完成,尤其是在CAD这种专业方向。头部厂商OpenAI和Anthropic都会主动在每代新模型上开展BenchCAD的测试,Cluade Code官方也对接了Autodesk Fushion,尽管目前还只是开始,但后续充满了想象空间。GPT-6 Astra是世界上最智能、最协调的模型,为计算机操作、浏览器操作、软件工程、网络安全、科学和专业工作树立了新的标杆。
对很多CAD AI助手厂商而言,现在的很多CAD AI助手的功能,未来说不定会被新的基模能力所覆盖。国产工业软件差距又拉大
两大基模厂商在CAD方向上的持续调优,正持续拉大和国产模型的差距。国内头部模型目前在通用能力上与头部模型GPT和Fable差距不大,但在专业任务领域能力上与头部模型的差距正在日趋拉大。社交平台上一大堆用Codex或Claude进行3D建模和仿真的测试案例,国产模型基本很少有人用。Kimi3在BenchCAD的测试结果距离GPT、Fable还远(上图是BenchCAD的较新结果)。传统工业软件时代,工业软件的差异主要在各种具体功能,国产厂商正在加速追赶,很多软件功能已经接近国外软件,可以在大多数场景替代国外软件未来的AI时代,变成了更智能的AI操作工业软件。工业软件功能大家差不多,但AI在智能上的差距,则成为软件应用效率上的分水岭。在两大基模都不开源且国内没法直接使用,以及国产基模与国外差距日益加大的背景下,AI时代国产工业软件与国外工业软件的差距可能会更大。当然,当前阶段这还不是大问题:模型智力不够,可以靠Harness和经验来补。通过为CLI Agent增加各种Skills和建模经验,可以让其变成更专业的设计工程师,至少在当前阶段,这部分对于建模能力的提升的重要性,远高于基模本身。当前国内已经涌现了不少“设计仿真专业版Codex”,虽然还很早期,但是在完成复杂的设计和仿真流程自动化和生成式设计方面,已经处于领先的探索,详见之前的盘点文章。未来,随着基模能力的变化,设计仿真类智能体是否还是通过这套典型的CLI Agent+Skills+Harness的技术路线构架还不得而知,届时给国产工业软件更多是机遇,还是挑战,还不好说。