先看这个视频👇然后我们来说原理。今年以来,借着年初Deepseek的爆火,小狼进行了一些CATIA+AI的一些尝试,也在我们的pycatia学习群里分享了相关的案例源代码。但之前的研究,都是基于LLM,即Large Language Model,也就是大语言模型。简单说,它只能接收文字形式的消息,然后理解并回复,实现对话的效果。但现在,从GPT-4V到Claude3.5Sonnet,从国外巨头到国产厂商,多各类多模态大模型,即Multimodal Large Language Models(MLLMs)层出不穷。多模态大模型与单模态大模型的区别就是,它能够整合文本同年、图像、音频、视频等多种信息。这个“数字大脑”有了更多的感知能力,能够“眼观六路,耳听八方”,从而实现更加丰富和全面的智能交互。所以,本篇文章,我们就来通过一个小例子,探索一下:如果让大模型“看到”我们的CATIA图形界面显示的内容,它能如何刚好地为我们服务。首先,我们可以借助AI,帮我们写出代码,实现“把一张图片发给大模型,它解析图片的内容并返回给我们”。这部分的内容,小编前两天发的视频已经展示过了👇所以,我们只需要在这个基础上, 把Prompt提得具体一些。1、最开始,我们传给它一张下面的图:并给出如下提示词时: 大模型会解析并做出如下详细描述: 2、当我们选中一个零件,使其高亮然后将提示词这样修改后: 它给我们的答复是这样的: 3、在这个基础上,我们继续修改提示词如下:那么,同样传入上面的模型时,我们将会得到下面的回复内容: 有了上面的基础,我们只需要借助CATIA二次开发,做一个简单的遍历,然后分别让每个零件高亮,截图后传给大模型,再将大模型返回的答案赋给零件的PartNumber属性,就实现了文章开头视频展示的效果啦!最后,给出CATIA二次开发相关部分的代码及注释(调用大模型api的代码,ai可以给出): 来源:CATIA那点事儿