首页/文章/ 详情

HouseMind:让大模型学会“空间语言”,统一建筑平面户型理解、生成和编辑

5月前浏览1296

0

太长不看版

      建筑平面户型图设计需要同时推理几何、语义和空间层级,这对现有AI系统仍是一个巨大挑战。虽然扩散模型和大语言模型提升了视觉保真度,但在连贯的空间推理和可控生成方面仍存在困难。

      因此我们提出了HouseMind,一个多模态大语言模型,在统一框架内实现了建筑平面户型图的理解、生成和编辑三大任务。通过引入离散的房间实例token构建统一词汇表,桥接布局和符号推理。经过多模态对齐和指令微调,模型可以根据文本指令合成连贯、可控的布局。

      实验表明,该框架在几何有效性和可控性方面均优于现有方法,保持高效并且可本地部署。

 


1

研究背景

      你有没有想过,为什么AI可以写出流畅的代码、画出精美的画作,却难以设计一个“合理”的房子?这背后的原因是:建筑平面户型图不是简单的图像,它需要理解复杂的空间关系:厨房要靠近餐厅,卧室要远离客厅,卫生间要通风采光……这些都需要层次化的空间推理能力

      这让人不禁思考:能否让AI真正理解“空间语言”,像搭积木一样智能地设计和修改建筑平面布局?

 

(插图由Nano Banana 2生成)


      目前主流的方法存在几个关键问题,包括:将建筑平面布局生成视为纯视觉过程,没有在房间实例层面进行显式推理,导致生成的方案缺乏全局空间连贯性细粒度房间理解能力;理解、生成、编辑通常需要不同的架构,难以在统一框架内完成;同时,大多数AI系统计算需求大,难以本地部署,限制了在实际设计流程中的应用。


2

研究方法

       HouseMind的核心思想是将连续的几何布局离散化为空间token,然后利用大语言模型进行多模态推理。这个框架由两个核心组件组成:房间布局token化以及多模态对齐与多任务学习


2.1 房间实例token化

       在token化阶段,我们使用VQ-VAE模块学习建筑平面户型图轮廓房间实例的离散表示。CNN编码器从二进制轮廓掩码中提取潜在特征,通过轮廓码本进行向量量化,将几何轮廓转换为离散词汇表。每个房间掩码与对应的轮廓上下文共同编码,模型学习到上下文感知的房间表示,捕获几何和空间邻接关系。

 


2.2 多模态对齐与多任务学习

       在多模态对齐与多任务学习阶段,HouseMind通过三阶段流程逐步增强空间推理、跨模态理解和可控生成能力。第一阶段是嵌入初始化,将空间码本整合到语言模型的词汇表中,建立离散空间代码与文本token的一一对应关系。第二阶段是多模态预训练,在包含文本描述、轮廓token和房间token的大规模配对数据上训练模型,使语言和几何之间的双向对齐成为可能。第三阶段是指令微调,在策划的多模态指令数据上进行监督微调,覆盖理解、生成和编辑三个核心任务。

 


3

实验分析

       我们构建了一个统一基准测试,在一致的几何、文本和评估协议下联合评估建筑平面户型图的理解、生成和编辑。

      在理解任务上,HouseMind在所有指标上都达到优异性能。成功率和匹配率均达到100%,房间定位和邻接准确率提高超过40个百分点,平均房间面积误差从数平方米降低到0.6平方米以下。其关系推理准确率约为0.8,进一步展示了模型推断复杂空间依赖关系的能力。

 

       生成任务上,HouseMind在像素级和图级指标上持续优于现有方法。Micro/Macro IoU分数达到0.71/0.65,相比ChatHouseDiffusion (建筑平面您说咋改就咋改,剩下的都交给AI了|新论文:ChatHouseDiffusion:提示词引导的建筑平面图生成与编辑方法)提高了10%以上IoU,同时FID从11.3降低到1.9,显著提升了真实感和空间精度。图级指标进一步表明,HouseMind生成的布局在房间连通性和邻接一致性方面表现更优。

 

       在编辑任务上,HouseMind产生可控且空间一致的修改,编辑保真度显著更高。近乎完美的Node F1表明房间类型的准确修改,而明显更低的GED和更高的边重叠证明HouseMind在编辑后产生更连贯和语义一致的空间关系。

 

       值得一提的是,HouseMind在单张NVIDIA RTX 3090 GPU上即可运行,推理时间约为2-3秒,实现了高效且可本地部署的智能设计。


4

结语

       本研究针对建筑平面户型图设计的三大核心任务,提出了HouseMind统一框架。

      主要贡献包括:提出房间实例token化方法,将几何布局转换为离散token序列,桥接符号推理与连续几何表示;设计三阶段多模态对齐和指令微调流程,实现理解、生成、编辑的统一建模;构建统一基准测试,涵盖三大任务,推动领域标准化评估;实现轻量化架构,推理时间仅2-3秒,高效且可本地部署

      当然,受限于数据规模,目前研究在复杂空间结构上的泛化能力仍有一定局限,对复杂编辑任务的处理能力也仍有提升空间。也欢迎各位专家、老师和同学交流讨论。



来源:陆新征课题组
振动非线性化学建筑消防BIM理论Opensees材料科普数字孪生控制试验
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-03-25
最近编辑:5月前
地震那些事
博士 抗震防灾数值模拟仿真
获赞 84粉丝 73文章 672课程 0
点赞
收藏
作者推荐

RED-ACT |1月19日云南巧家5.1级地震破坏力分析

Real-time Earthquake Damage Assess ment using City-scale Time history an alysis (RED-ACT)致谢和声明: 感谢中国地震台网中心为本研究提供数据支持。本分析仅供科研使用,具体灾情和灾损分析应根据现场调查情况确定。一、地震情况简介据中国地震台网正式测定,1月19日19时32分在云南昭通市巧家县发生5.1级地震,震源深度10公里,震中位于北纬27.01度,东经103.41度。二、强震记录及分析 20260119云南巧家5.1级地震获得了30组地震动,由于地震动没有完全收集,可能还有更强的记录。典型地震记录分析如下:YN.C2120典型台站位置北纬27.06度,东经103.36度,记录到水平向地震动峰值加速度为240 cm/s/s。该地震动及反应谱如图1、图2所示。 (a) EW (b) NS (c) UD图1 典型台站地面运动记录 图2 典型台站典型记录反应谱三、地震动对典型城市区域破坏能力分析根据中国地震学会标准《基于强震动记录的地震破坏力评估T/SSC 1—2021》(参阅新标准发布 :基于强震动记录的地震破坏力评估),利用密布强震台网在震后获取的实时地震动信息,再结合城市抗震弹塑性分析,就可以得到地震发生后不同地点的建筑破坏情况,为抗震救灾决策提供科学支撑。图3为根据本次地震震中附近范围内台站记录分析得到的建筑震害分布示意图。图4为根据本次地震震中附近范围内台站记录分析得到的人员加速度感受分布示意图。 图3 不同台站地震记录破坏力分布图 (建筑抗震承载力取均值加一倍方差) 图4 不同台站地震记录人员加速度感受分布图(建筑抗震承载力取均值加一倍方差)四、台站附近地震滑坡分析根据当地地形数据、岩性数据和实测地面运动记录,可以计算得到不同滑坡体饱和比例下的滑坡分布,如图5所示。其中,底图为当地坡度分布图,每个圆圈代表每个台站的计算结果,圆圈中的数字代表发生滑坡的临界坡度,台站附近坡度大于该数值的地方滑坡发生概率高。 (a)滑坡体饱和比例为 0% (b)滑坡体饱和比例为50% (c)滑坡体饱和比例为 90%图5 不同台站附近地震滑坡分布五、地震动对典型单体结构破坏能力分析(1) 对典型多层框架结构破坏作用模型1:三层框架结构(感谢中国建筑设计研究院王奇教授级高工提供模型) 将典型台站记录输入立面布置如图6(a)所示的6度、7度和8度设防的典型三层钢筋混凝土框架结构,得到其层间位移角包络如图6(b)所示。 (a)立面布置示意图 (b)层间位移角图6 典型三层钢筋混凝土框架结构(2) 对典型砌体结构破坏作用模型1:单层未设防砌体结构 选取图7所示纪晓东等开展的单层未设防砌体结构振动台试验模型,输入典型台站记录,分析结果表明该结构将处于中度破坏状态。(纪晓东等,北京市既有农村住宅砖木结构加固前后振动台试验研究,建筑结构学报,2012,11,53-61.) 图7 单层三开间农村住宅砖木结构振动台试验模型2:五层简易砌体结构 选取图8所示朱伯龙等开展的五层简易砌体结构足尺试验模型,输入典型台站记录,分析结果表明该结构将处于轻微破坏状态。(朱伯龙等,上海五层砌块试验楼抗震能力分析,同济大学学报,1981,4,7-14.) (a)平面图 (b)剖面图图8 五层简易砌体结构布置(3) 对典型桥梁破坏作用模型1:某80年代公路桥梁(感谢福州大学谷音教授提供模型) 选取图9所示某80年代公路桥梁模型,输入典型台站记录,分析结果表明该结构将处于完好状态。 图9 某80年代公路桥梁模型模型2:某特大桥引桥(感谢福州大学谷音教授提供模型) 选取图10所示某特大桥引桥模型,输入典型台站记录,分析结果表明该结构将处于完好状态。 图10 某特大桥引桥模型 来源:陆新征课题组

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈