随着越来越多人开始使用AI CAD 助手或Codex、Cluade对接CAD,尤其是逐步探索使用自然语言建模相关功能,不同基础大模型的差异变得值得关注。那么目前的主流模型中哪个模型在建模方面的表现更好?
结合MecAgent和BenchCAD的一些评测结果看,目前的GPT 5.6 Sol在同比时取得了显著的领先。当然,这个领先只是当前的横向比较,在同一水平档次上的小差距,距离直接实现“一句话建模”依然相当遥远。
作为专业提供AI助手的公司,MecAgent对GPT5.6和Fable 5进行了具体的测试。这里列举2个测试结果。
总体建模能力评价
当前2个模型总体建模能力在同一档次上,能够较好的处理简单机械零件,简单装配体GPT表现比Fable 5略好。更复杂的曲面等当前的模型能力都还很有限。
Cluade Fable 5和Opus 4.8

GPT 5.6 Sol

复杂模型自然语言建模
公司使用GPT-5.6 Sol + MecAgent 组合从头到尾生成一个完整的斜齿轮,包括其预览界面。在大约 10 次迭代提示和1小时的指导的情况下,获得了可用的结果。


公司用 Fable 5 + MecAgent 的组合从头到尾生成一个实用的水杯装配体(杯体、杯盖和装配约束)。也是经过了大约10次迭代提示和1个小时的指导获得了可用的结果。此前使用 Opus 4.8 需要约20次提示和2个小时的指导。


BenchCAD是一个用于测试AI识别零件图并创建对应CAD代码能力的测试集,他们会测试一些头部模型给出得分(如下图圆圈),一些公司自己也会基于它对自己的模型进行测试,并公布结果(如下图菱形)。
从BenchCAD的测试结果看,GPT5.6、Opus等新一代模型相比之前都有了显著进步,GPT5.6 Sol模型是目前的最高分,显著领先Opus。Kimi新发布的K3模型也被纳入了测试,结果与Opus很接近。图中未包含Fable 5,据称其得分为0.384,与Mythos 5接近。

BenchCAD准备了共106类合计17900个工业零件的多视角视图,要求根据图片写出能生成这些零件的CAD代码。题目看起来简单,但涉及到视觉感知、图像与文本之间的转换、以及3D空间推理能力,需要模型识别零件,理解3D结构,并将图中尺寸标注与模型尺寸联系起来,能力要求不低。


题目包含的零件都是实际零件,106种零件中约一半(52个)符合ISO/DIN/EN/ASME/IEC标准,其余的来自典型的工程实践规范。很多零件还涉及了46种复杂Cad操作:如旋转、数组处理、扫描、定位、螺旋运动等,这些操作需要真正的3D推理能力才能完成。

模型写出代码后,将模型在CAD中运行,对比生成结果与标准结果的几何重叠率,乘上代码执行成功率,得到一个名为IoU的数值,作为评测的得分。对生成模型的检验包含完整的尺寸检验,而非看着差不多就行。如果代码执行失败,那对应的得分也就为 0
在以上的标准下,GPT5.6的测试结果显著高于了Opus。
当然,以上大模型的能力测试算不上绝对严谨,只能作为我们了解不同模型能力差异的大概参考。模型能力也只是面向生成式设计的一部分,自然语言建模路还很长。