浙江大学研究人员提出UrbanGIRAFFE应对具有挑战性的城市场景的可控3D感知图像合成
浙江大学研究人员开发UrbanGIRAFFE:应对具有挑战性的城市场景的可控3D感知图像合成技术


UrbanGIRAFFE,这是浙江大学研究人员提出的一种逼真图像合成方法,用于可控的相机姿态和场景内容。该模型解决了自由相机视角控制和场景编辑中生成城市场景的挑战,采用了一种组合和可控的策略,利用了粗糙的三维全景先验知识。它还包括无法计数的物体和可计数的对象的布局分布。这种方法将场景分解为物体、对象和天空,实现了多样化的可控性,如大幅移动相机、物体编辑和对象操作。
在条件图像合成方面,现有的方法已经取得了很大的进展,特别是那些利用生成对抗网络(GANs)来生成逼真图像的方法。尽管现有方法将图像合成的条件设置为语义分割地图或布局,但主要集中在以物体为中心的场景上,忽视了复杂的、不对齐的城市场景。UrbanGIRAFFE是一种专为城市场景设计的三维感知生成模型,该提案解决了这些限制,并提供了对大幅移动相机、物体编辑和对象操作的多样控制能力。
生成对抗网络在条件图像合成中生成可控和逼真图像方面已经证明是有效的。然而,现有方法局限于以物体为中心的场景,并需要在生成城市场景方面加以改进,从而限制了自由相机视角控制和场景编辑。UrbanGIRAFFE将场景分解为物体、对象和天空,利用语义体素网格和对象布局来实现多样化的控制能力,包括大幅移动相机和场景操作。
UrbanGIRAFFE创新性地将城市场景分解为无法计数的物体、可计数的对象和天空,并利用先验分布来揭示复杂的城市环境。该模型具有经过条件设置的物体生成器,利用语义体素格作为物体先验,集成了粗糙的语义和几何信息。对象布局先验有助于从混乱的场景中学习对象生成器。经过对抗性和重建损失的端到端训练,该模型利用射线体素和射线盒相交策略优化采样位置,减少所需的采样点数量。
在综合评估中,提出的UrbanGIRAFFE方法在合成和真实数据集上超过了各种2D和3D基准,展示了更好的可控性和保真度。对KITTI-360数据集的定性评估显示,UrbanGIRAFFE在背景建模方面的表现优于GIRAFFE,从而实现了增强的物体编辑和相机视角控制。在KITTI-360上进行的剔除研究证实了UrbanGIRAFFE在体系结构组件方面的有效性,包括重建损失、对象鉴别器和创新的对象建模。在推理过程中采用移动平均模型进一步提高了生成图像的质量。
UrbanGIRAFFE创新地解决了控制可感知三维图像合成的复杂任务,实现了在相机视角操作、语义布局和对象交互方面的卓越多样性。该模型利用三维全景先验知识有效地将场景分解为物体、对象和天空,促进了组合生成建模。该方法凸显了UrbanGIRAFFE在复杂、无界集合方面三维感知生成模型的进展。未来的方向包括结合语义体素生成器进行新场景采样,并通过光-环境颜色解耦来探索光照控制。重建损失的重要性强调了保持保真度和产生多样结果的重要性,尤其是对于很少遇到的语义类别。
UrbanGIRAFFE的未来工作包括在模型中加入语义体素生成器,以实现多样化和创新的城市场景生成能力。还计划通过将光线与环境颜色解耦来探索光照控制,以提供对生成场景视觉特征的更细粒度控制。在推理过程中使用移动平均模型是提高生成图像质量的一种潜在方法。




