0
太长不看版
建筑平面户型图设计需要同时推理几何、语义和空间层级,这对现有AI系统仍是一个巨大挑战。虽然扩散模型和大语言模型提升了视觉保真度,但在连贯的空间推理和可控生成方面仍存在困难。
因此我们提出了HouseMind,一个多模态大语言模型,在统一框架内实现了建筑平面户型图的理解、生成和编辑三大任务。通过引入离散的房间实例token构建统一词汇表,桥接布局和符号推理。经过多模态对齐和指令微调,模型可以根据文本指令合成连贯、可控的布局。
实验表明,该框架在几何有效性和可控性方面均优于现有方法,保持高效并且可本地部署。
1
研究背景
你有没有想过,为什么AI可以写出流畅的代码、画出精美的画作,却难以设计一个“合理”的房子?这背后的原因是:建筑平面户型图不是简单的图像,它需要理解复杂的空间关系:厨房要靠近餐厅,卧室要远离客厅,卫生间要通风采光……这些都需要层次化的空间推理能力。
这让人不禁思考:能否让AI真正理解“空间语言”,像搭积木一样智能地设计和修改建筑平面布局?
(插图由Nano Banana 2生成)
目前主流的方法存在几个关键问题,包括:将建筑平面布局生成视为纯视觉过程,没有在房间实例层面进行显式推理,导致生成的方案缺乏全局空间连贯性和细粒度房间理解能力;理解、生成、编辑通常需要不同的架构,难以在统一框架内完成;同时,大多数AI系统计算需求大,难以本地部署,限制了在实际设计流程中的应用。
2
研究方法
HouseMind的核心思想是将连续的几何布局离散化为空间token,然后利用大语言模型进行多模态推理。这个框架由两个核心组件组成:房间布局token化以及多模态对齐与多任务学习。
2.1 房间实例token化
在token化阶段,我们使用VQ-VAE模块学习建筑平面户型图轮廓和房间实例的离散表示。CNN编码器从二进制轮廓掩码中提取潜在特征,通过轮廓码本进行向量量化,将几何轮廓转换为离散词汇表。每个房间掩码与对应的轮廓上下文共同编码,模型学习到上下文感知的房间表示,捕获几何和空间邻接关系。
2.2 多模态对齐与多任务学习
在多模态对齐与多任务学习阶段,HouseMind通过三阶段流程逐步增强空间推理、跨模态理解和可控生成能力。第一阶段是嵌入初始化,将空间码本整合到语言模型的词汇表中,建立离散空间代码与文本token的一一对应关系。第二阶段是多模态预训练,在包含文本描述、轮廓token和房间token的大规模配对数据上训练模型,使语言和几何之间的双向对齐成为可能。第三阶段是指令微调,在策划的多模态指令数据上进行监督微调,覆盖理解、生成和编辑三个核心任务。
3
实验分析
我们构建了一个统一基准测试,在一致的几何、文本和评估协议下联合评估建筑平面户型图的理解、生成和编辑。
在理解任务上,HouseMind在所有指标上都达到优异性能。成功率和匹配率均达到100%,房间定位和邻接准确率提高超过40个百分点,平均房间面积误差从数平方米降低到0.6平方米以下。其关系推理准确率约为0.8,进一步展示了模型推断复杂空间依赖关系的能力。
在生成任务上,HouseMind在像素级和图级指标上持续优于现有方法。Micro/Macro IoU分数达到0.71/0.65,相比ChatHouseDiffusion (建筑平面您说咋改就咋改,剩下的都交给AI了|新论文:ChatHouseDiffusion:提示词引导的建筑平面图生成与编辑方法)提高了10%以上IoU,同时FID从11.3降低到1.9,显著提升了真实感和空间精度。图级指标进一步表明,HouseMind生成的布局在房间连通性和邻接一致性方面表现更优。
在编辑任务上,HouseMind产生可控且空间一致的修改,编辑保真度显著更高。近乎完美的Node F1表明房间类型的准确修改,而明显更低的GED和更高的边重叠证明HouseMind在编辑后产生更连贯和语义一致的空间关系。
值得一提的是,HouseMind在单张NVIDIA RTX 3090 GPU上即可运行,推理时间约为2-3秒,实现了高效且可本地部署的智能设计。
4
结语
本研究针对建筑平面户型图设计的三大核心任务,提出了HouseMind统一框架。
主要贡献包括:提出房间实例token化方法,将几何布局转换为离散token序列,桥接符号推理与连续几何表示;设计三阶段多模态对齐和指令微调流程,实现理解、生成、编辑的统一建模;构建统一基准测试,涵盖三大任务,推动领域标准化评估;实现轻量化架构,推理时间仅2-3秒,高效且可本地部署。
当然,受限于数据规模,目前研究在复杂空间结构上的泛化能力仍有一定局限,对复杂编辑任务的处理能力也仍有提升空间。也欢迎各位专家、老师和同学交流讨论。