首页/文章/ 详情

大模型CAD建模哪家强?GPT5.6优于Fable/Opus 5、Kimi K3

6天前浏览253

随着越来越多人开始使用AI CAD 助手或Codex、Cluade对接CAD,尤其是逐步探索使用自然语言建模相关功能,不同基础大模型的差异变得值得关注。那么目前的主流模型中哪个模型在建模方面的表现更好?

结合MecAgent和BenchCAD的一些评测结果看,目前的GPT 5.6 Sol在同比时取得了显著的领先。当然,这个领先只是当前的横向比较,在同一水平档次上的小差距,距离直接实现“一句话建模”依然相当遥远。


MecAgent测试结果


作为专业提供AI助手的公司,MecAgent对GPT5.6和Fable 5进行了具体的测试。这里列举2个测试结果。

总体建模能力评价

当前2个模型总体建模能力在同一档次上,能够较好的处理简单机械零件,简单装配体GPT表现比Fable 5略好。更复杂的曲面等当前的模型能力都还很有限。

Cluade Fable 5和Opus 4.8

GPT 5.6 Sol

复杂模型自然语言建模

公司使用GPT-5.6 Sol + MecAgent 组合从头到尾生成一个完整的斜齿轮,包括其预览界面。在大约 10 次迭代提示和1小时的指导的情况下,获得了可用的结果。

过程中公司对API集成、代码鲁棒性、CAD逻辑和文档规范性等方面进行了评分,总体得分较高。

公司用 Fable 5 + MecAgent 的组合从头到尾生成一个实用的水杯装配体(杯体、杯盖和装配约束)。也是经过了大约10次迭代提示和1个小时的指导获得了可用的结果。此前使用 Opus 4.8 需要约20次提示和2个小时的指导。

过程中公司对API集成、代码鲁棒性、CAD逻辑和文档规范性等方面进行了评分,总体得分限制不如GPT 5.6。



BenchCAD测试结果


BenchCAD是一个用于测试AI识别零件图并创建对应CAD代码能力的测试集,他们会测试一些头部模型给出得分(如下图圆圈),一些公司自己也会基于它对自己的模型进行测试,并公布结果(如下图菱形)。

BenchCAD的测试结果看,GPT5.6、Opus等新一代模型相比之前都有了显著进步,GPT5.6 Sol模型是目前的最高分,显著领先Opus。Kimi新发布的K3模型也被纳入了测试,结果与Opus很接近。图中未包含Fable 5,据称其得分为0.384,与Mythos 5接近。

BenchCAD准备了共106类合计17900个工业零件的多视角视图,要求根据图片写出能生成这些零件的CAD代码。题目看起来简单,但涉及到视觉感知、图像与文本之间的转换、以及3D空间推理能力,需要模型识别零件,理解3D结构,并将图中尺寸标注与模型尺寸联系起来,能力要求不低。

题目包含的零件都是实际零件,106种零件中约一半(52个)符合ISO/DIN/EN/ASME/IEC标准,其余的来自典型的工程实践规范。很多零件还涉及了46种复杂Cad操作:如旋转、数组处理、扫描、定位、螺旋运动等,这些操作需要真正的3D推理能力才能完成。

模型写出代码后,将模型在CAD中运行,对比生成结果与标准结果的几何重叠率,乘上代码执行成功率,得到一个名为IoU的数值,作为评测的得分。对生成模型的检验包含完整的尺寸检验,而非看着差不多就行。如果代码执行失败,那对应的得分也就为 0

在以上的标准下,GPT5.6的测试结果显著高于了Opus。

当然,以上大模型的能力测试算不上绝对严谨,只能作为我们了解不同模型能力差异的大概参考。模型能力也只是面向生成式设计的一部分,自然语言建模路还很长。

来源:AIE 加速工业进化
曲面装配
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-08-19
最近编辑:6天前
AIE加速工业进化
签名征集中
获赞 5粉丝 8文章 230课程 1
点赞
收藏
作者推荐
未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈