本文刊发于《现代电影技术》2026年第7期
专家点评
徐 涛
正高级工程师
中国电影科学技术研究所(中央宣传部电影技术质量检测所)副所长
当前,我国电影科技与产业发展正加速推进全面智能化,以可控生成为代表的生成式人工智能(GAI)技术正在成为驱动行业提质增效、培育发展新质生产力的重要力量。在电影前期视觉开发中,GAI正推动工艺流程从单点式图像生成转向面向分镜迭代、美术资产管理和创意决策的流程化应用,该领域的关键问题也正从“能否生成高质量画面”转向“能否按照创作意图精准稳定修改画面”。电影美术创作通常需要围绕角色造型、道具样式、场景氛围和镜头构图进行多轮调整优化,其核心要求是在保持画面风格、叙事逻辑和资产一致性的前提下,实现人物、道具、环境与光影等局部元素的可控修改。未来,相关技术需要进一步打通导演意图、美术资产、分镜画面与模型生成结果之间的对应关系,并将多模态理解、区域控制、提示词生成和标准作业程序(SOP)融入影视创作生产流程,使人工智能(AI)从辅助出图工具转向支撑分镜推演、美术方案生成和创意比选的流程化技术能力。这一发展方向不仅有助于降低复杂模型的使用门槛,也将推动AI技术与电影语言、电影工业流程的深度融合。《面向电影前期视觉开发的图像智能生成框架研究》一文正是围绕上述需求展开研究。文章提出面向电影分镜迭代的ReMAP图像智能生成框架,通过区域掩码与对应提示词的显式绑定,实现多区域资产的精准控制和非编辑区域稳定保持;引入多模态SOP提示生成机制,降低复杂场景下的提示词编写成本。实验表明,该方法在多区域语义隔离、资产结构一致性和非编辑区域稳定性方面具有良好表现。本文兼具技术方法探索实践与影视生产流程应用价值,对于推动人工智能生成内容(AIGC)技术服务电影前期视觉开发具有较高的参考价值。
项目信息
上海市人才发展资助项目(2021016);上海市教育科学研究项目“生成式人工智能赋能影视创制人才培养的实践研究”(GSC2026099);中国电影地缘文化研究基地2025年度项目“国产中小成本电影的地缘版图研究”(25Z0105)。
作者简介
黄东晋
博士,副教授,上海大学上海电影学院、上海电影特效工程技术研究中心博士生导师,主要研究方向:人工智能、影视技术、计算机图形学等。
张诗雨
上海大学上海电影学院2023级硕士研究生,主要研究方向:图像处理与图像生成。
曲建涛
上海大学上海电影学院2023级博士研究生,主要研究方向:计算机视觉、图像智能处理等。
王 倩
上海大学上海电影学院2024级硕士研究生,主要研究方向:图像智能分割。
摘要
在电影开发中,分镜、概念图与美术资产往往需要围绕角色造型、道具样式、场景氛围和镜头构图进行多轮迭代,现有全局语义编辑与掩码重绘方法在多区域协同编辑时,仍难以兼顾结构稳定性与语义独立性。为此,本文面向电影前期视觉开发,构建了一种图像智能生成框架ReMAP。该方法将复杂分镜解构为独立的语义资产区域,通过建立区域空间掩码与对应提示词的显式约束映射,实现电影美术资产的局部精准控制与非编辑区域的稳定保持,有效支持多区域协同重绘与多变体创意比选。同时,为缓解复杂场景下的提示词工程成本,本文构建了一种多模态标准作业程序提示自动生成机制,能够从参考资产与原始分镜中自适应提取视觉语义特征,自动生成涵盖全局风格与区域约束的复用型场景描述模板。实验结果表明,在统一Flux2⁃Klein底座下,相较于Prompt⁃to⁃Prompt全局语义编辑与DiffEdit局部掩码编辑等基线,ReMAP在多区域语义隔离、资产结构一致性与非编辑区域稳定性方面表现更优,为电影美术设定与分镜制作提供了低成本、高交互的智能化技术支撑。
关键词
扩散模型;人工智能生成内容(AIGC);图像编辑;可控图像生成
1
引言
人工智能生成内容(AIGC)技术在电影前期视觉开发中的应用正逐步从单幅概念图生成走向分镜级别的持续迭代。扩散模型(Diffusion Model)从去噪扩散模型(DDPM)[1]到潜在空间扩散(Latent Diffusion)的演进为Stable Diffusion[2]等模型奠定了基础。近期基于Transformer的扩散模型与Rectified Flow进一步推动了新一代模型架构的发展,例如以DiT[3]为代表的演进方向及其在FLUX[4]等模型中的延伸。2025年以来,OmniGen[5]与OminiControl[6]等研究进一步表明,统一图像生成与面向DiT的多条件控制正在成为可控生成系统的重要发展方向。在文本条件建模方面,CLIP[7]与T5[8]为跨模态表征与提示词对齐提供了关键支撑。
电影分镜图不仅承担叙事结构与镜头调度的表达,还对角色造型、场景光影、道具材质等美术要素提出一致性要求。现实制作中,美术团队常需针对同一镜头进行多轮局部调整,例如替换单个资产、修改局部表情或调整区域光感,同时维持整体风格和非编辑区域的稳定性。因此,面向电影前期视觉开发的生成系统不仅需要生成单张视觉效果图,还应支持分镜迭代中的角色、道具、场景和光影等元素的局部修改,并在多轮修改中保持镜头构图与美术风格稳定。
现有方法多依赖全局提示词进行一次性生成,容易引发语义串扰,导致局部元素互相污染。ControlNet[9]等结构条件控制方法提供了更强的几何与结构约束,但对多区域语义隔离与局部独立控制仍有限。IP⁃Adapter[10]等图像条件适配器提供更直接的视觉约束能力,但在多区域协同与局部独立控制上仍存在局限。LoRA[11]作为低秩适配方法能在较低成本下实现风格与角色的个性化注入,但其侧重模型能力迁移,难以直接解决多区域并行编辑与语义隔离问题。在图像编辑领域,Prompt⁃to⁃Prompt[12]通过跨注意力控制实现文本驱动的全局语义编辑,InstructPix2Pix[13]进一步将自然语言编辑指令用于图像修改任务,但二者在多区域资产并行编辑中仍缺乏显式区域隔离机制。DiffEdit[14]与RePaint[15]等掩码(Mask)编辑方法可支持局部重绘,但在复杂资产与多区域条件下仍易出现结构漂移、边界不连续或非编辑区域细节破坏。近期BrushNet[16]与PowerPaint[17]等工作进一步提升了扩散模型在掩码区域修复、文本引导重绘与多任务图像修复(Inpainting)中的表现,但其重点仍在通用图像修复质量与任务泛化,尚未面向电影分镜中的多资产语义隔离与工作流闭环。MultiDiffusion[18]通过多扩散路径融合增强了区域控制能力,但对电影分镜中资产级语义绑定与生产流程自动化支持仍有限。
针对上述问题,本文提出一种面向电影前期视觉开发的图像智能生成框架ReMAP。核心思路是将分镜画面拆分为多个语义区域,为每个区域绑定独立提示词与掩码约束,并结合全局风格提示词实现局部可控与全局一致。为降低提示词负担,本文构建多模态标准作业程序(SOP)提示生成机制,自动生成兼顾风格与细节的提示词模板。实验结果表明,在同一生成底座和参数设置下,该流程相较于Prompt⁃to⁃Prompt全局语义编辑与DiffEdit局部掩码编辑,在多区域语义解耦、资产结构保持和背景稳定性方面具有更好的综合表现。本文的主要贡献如下:
(1)针对电影前期视觉开发场景,构建了ReMAP区域多模态注意力提示框架,将区域语义约束深度嵌入生成流程,实现了分镜中多区域资产的协同精准控制。
(2)设计多模态SOP提示生成机制,形成面向电影前期视觉开发的标准化工作流程,覆盖资产输入、区域标注、语义绑定、扩散重绘与多方案比选等关键环节。
(3)构建面向电影前期视觉开发的图像智能生成的完整ReMAP管线,并在此基础上开发ReMAP Storyboard原型系统,集成提示生成、区域标注、模型调度与结果评估等核心模块,验证该流程在分镜局部修改与多资产协同编辑中的可行性。
2
研究方法
2.1 系统整体框架
如图1所示,ReMAP生成框架由六个功能模块组成。各模块以前一阶段输出作为后一阶段输入,逐步完成电影分镜的局部可控生成、资产一致性保持与多方案输出。
图1 面向电影前期视觉开发的图像智能生成框架(ReMAP)
(1)用户输入模块。用户提供原始分镜图像、参考资产与编辑意图,明确需要修改的角色、道具、背景等目标区域及预期视觉效果。
(2)多模态场景生成与提示词输出模块。系统将原始分镜、参考资产与SOP指令、编辑意图输入多模态视觉模型,生成全局风格提示词、区域提示词以及多场景候选描述,为后续区域控制提供语义条件。
(3)多区域Mask标注模块。用户或系统辅助分割工具在原始分镜上完成多个目标区域的Mask标注,将画面中的资产区域、场景区域与非编辑区域进行空间区分。
(4)区域语义约束生成模块。系统将区域Mask与对应区域提示词建立显式绑定,并结合全局风格提示词形成区域化生成条件,使不同区域主要接收与其匹配的语义约束。
(5)扩散模型绘制模块。系统将全局提示词、区域提示词与区域Mask输入Flux2⁃Klein生成底座,通过区域化重绘与融合策略保持非编辑区域稳定,并完成局部可控生成。
(6)可控电影分镜输出模块。系统输出单资产多场景、单场景资产替换与多区域同时编辑等多类结果,支持多变体方案并行生成、对比与筛选。
2.2 多模态视觉分析模块
图2展示了多模态视觉分析模块的基本流程,其输入包括参考道具图像、SOP指令框架与编辑意图。系统首先基于多模态视觉模型,结合编辑意图和SOP指令框架,对参考资产和分镜画面进行语义解析,随后输出全局风格提示词、区域提示词以及多场景候选描述。其中,全局风格提示词用于控制整体电影风格,区域提示词分别绑定道具区域与场景区域,多场景候选描述用于支持后续方案生成与比选。SOP指令由固定约束前缀、可变场景描写规则与画质还原后缀构成。
图2 多模态视觉模型用于语义解析流程
固定约束前缀用于定义整体画面风格与排斥条件,保障场景基调一致。可变场景描写规则引导多模态模型从主色调、情绪基调、角色气质、造型语言、材质观感与空间光感等维度生成衍生元素。画质还原后缀用于对齐生成场景的画面质感与参考资产。
其中Φ为多模态提示词生成映射。系统据此输出全局风格提示词约束整体画面风格,并为每个编辑区域生成独立区域提示词,以提升局部可控性。该机制减少了人工编写复杂场景描述的工作量,能够快速产生与参考资产匹配的多场景候选描述,直接用于后续局部重绘。
2.3 区域语义约束与图像生成
本文采用训练免调的区域提示思想,在不额外训练模型的前提下,通过区域注意力掩码将不同文本提示约束到对应图像区域。Prompt⁃to⁃Prompt 证明了跨注意力图能够作为文本驱动图像编辑的有效控制入口,MultiDiffusion则通过多扩散路径融合展示了区域级生成控制的可行性。近期,Chen等[19]面向FLUX.1等DiT架构表明基于注意力操控的区域提示词-掩码绑定能够改善复杂提示下的空间组合控制。RAGD[20]则从区域硬绑定与软细化角度提升了多区域文本到图像生成的一致性。因此,本文并不将区域提示机制本身作为全新算法提出,而是将其与电影分镜资产编辑、SOP提示生成和多方案比选流程结合,形成面向影视前期制作的区域化编辑管线。在FLUX的DiT架构中,图像被划分为Patch token,区域语义约束通过对token空间的显式定位与注意力隔离实现,从而削弱全局提示词带来的语义串扰并提升局部可控性。
2.3.1 空间位置映射与区域控制
图像token保留空间位置信息,系统采用旋转位置编码(Rotary Position Embedding, RoPE)[21]表示token间的相对位置关系,并将二维坐标映射到token表征中。给定第i个编辑区域的二值掩码Mi,其中Mi(x)∈{0,1}表示空间位置x是否属于该区域,将其映射到token索引集合Ωi,如式(2)所示。
其中,t表示序列化后的图像Patch token(或对应的索引),pos(t)表示该token在原图中的空间位置。该映射为后续注意力隔离提供显式位置索引,使模型在自注意力与交叉注意力中保持区域可分性。
2.3.2 注意力隔离与区域提示词注入
如图3所示,为避免不同区域提示词相互干扰,本文在交叉注意力中加入区域注意力掩码。设区域提示词Pi 经文本编码器得到的键和值特征分别为Ki与Vi,图像token的查询矩阵为Q。区域注意力掩码Ai 作为注意力得分矩阵上的偏置项使用,其元素定义如式(3)所示。
图3 区域语义约束作用于注意力图示
区域注意力计算如式(4)所示。
其中d为注意力通道维度。实际计算中,Ai 会扩展为与注意力得分矩阵同维度的掩码偏置,使提示词Pi 仅作用于Ωi 对应区域,非目标区域对该提示词的注意力被抑制,从而实现跨区域语义隔离。
2.3.3 语义注入与局部修正
在区域化生成过程中,系统将全局风格提示词Pg与区域提示词Pi 共同注入。区域条件特征如式(5)所示。
其中,g(⋅)为提示词编码函数,C(x)表示空间位置x的综合条件特征。g(Pg)用于约束整体风格与画面基调,Mi(x)⋅g(Pi ) 表示第i个区域提示词仅在对应掩码区域内生效。通过区域掩码约束,局部语义在目标区域内得到强化,非编辑区域保持原始结构与材质稳定。该机制与FLUX区域提示(Regional Prompt)一致,将区域控制从全局语义约束的粗粒度约束转化为区域级语义注入,提升多区域同时编辑的稳定性与可控性。
3
实验结果与分析
3.1 实验设置
3.1.1 实验配置
实验平台采用英伟达(NVIDIA) RTX A5000双卡作为主要计算设备,扩散生成模型统一使用Flux2⁃Klein。系统运行于Python深度学习环境,核心推理模块基于PyTorch框架并通过CUDA进行GPU加速。所有实验输出图像分辨率统一设定为1600×1200。为保证对比公平性,不同方法在相同原始分镜、参考资产、区域掩码、输入分辨率与采样设置下进行测试,仅替换提示词组织方式、区域约束机制及局部编辑策略。测试任务覆盖单资产多场景、单场景多资产替换与多区域同时编辑三类典型需求。评价以定性对比为主、定量指标为辅,定量部分用于辅助衡量资产一致性、区域语义匹配度与非编辑区域结构稳定性。
3.1.2 基线模型与对比方法
为验证本文方法在多区域语义隔离、局部独立编辑与非编辑区域保持方面的有效性,实验设置三组对比对象:Prompt⁃to⁃Prompt全局语义编辑、DiffEdit局部掩码编辑以及本文采用的ReMAP区域语义约束流程。三组方法均采用相同的Flux2⁃Klein生成底座、原始分镜、参考资产、区域掩码、采样参数与输入分辨率,仅在提示词组织方式、区域约束机制和局部编辑策略上保持差异。
(1)Prompt⁃to⁃Prompt全局语义编辑。该方法通过跨注意力控制实现文本驱动图像编辑。本文将其作为全局提示词编辑基线,即把全局风格、局部资产与场景变化统一写入同一提示词中,再输入扩散模型生成结果。
(2)DiffEdit局部掩码编辑。该方法依据语义差异或给定目标区域掩码进行局部修改。本文将其作为局部重绘基线,即在相同原始分镜与区域掩码条件下,仅对目标区域进行重绘。
(3)ReMAP区域语义约束方法。本文方法将区域提示词与对应区域掩码进行显式绑定,并通过区域语义约束控制不同编辑区域的生成过程。
3.1.3 评价指标
本文评价以人工定性观察为主,重点考察资产结构是否稳定、非编辑区域是否保持一致以及整体画面是否符合电影分镜视觉需求。定量评价作为辅助验证,在单资产多场景编辑实验中,采用CLIP语义相似度(CLIP Similarity)、DINOv2结构相似度(DINOv2 Similarity)与图文匹配得分(CLIPScore),分别衡量资产语义一致性、局部结构稳定性与整体图文匹配程度;在多资产多场景同时编辑实验中,采用局部文本匹配度(Local CLIP⁃T)、背景感知差异(Background LPIPS)与整体图像偏好评分(ImageReward),分别衡量区域文本匹配度、背景保持程度与整体图像质量。
3.2 单资产多场景编辑
本实验考察单一资产在多场景条件下的跨域一致性与环境适配能力,设置Prompt⁃to⁃Prompt全局语义编辑、DiffEdit局部掩码编辑与本文方法(ReMAP)三种策略进行对比。
3.2.1 定性结果
图4展示了同一资产在多场景条件下的生成结果对比。Prompt⁃to⁃Prompt全局语义编辑容易产生风格漂移或语义串扰,导致资产外观与材质在场景切换中不稳定;DiffEdit局部掩码编辑在局部替换时可维持部分结构,但在复杂背景与光影条件下易出现边界突兀或细节破坏。本文方法通过区域语义约束与独立提示词绑定,使资产主体结构在多场景切换中保持稳定,同时能够随场景光照与材质环境进行合理适配。
图4 单资产多场景下的定性实验对比
3.2.2 定量结果
为进一步客观验证各生成方法的资产保真能力并消除主观视觉偏差,本文在定性对比的基础上,引入多维度视觉特征相似度开展定量测评。通过对生成图像中提取的资产区域特征与原始参考资产进行深度距离计算,可严谨衡量模型在跨域迁移任务中的结构维持底线。
表1 单资产多场景定量结果
表1汇总了各类方法在单资产多场景编辑实验中的客观量化指标对比。全局约束方法的CLIP Similarity、DINOv2 Similarity与CLIPScore分别为0.8389、0.7503和0.2815,说明仅依赖统一提示词时,资产语义与局部结构在跨场景变化中容易发生漂移。局部重绘方法在 CLIP Similarity 和 DINOv2 Similarity 上提升至 0.8819 和 0.8260,表明掩码约束有助于保持资产主体,但其CLIPScore降至0.2335,说明局部替换后的整体语义协调性仍存在不足。相比之下,ReMAP在三项指标上分别达到0.8969、0.8472和0.3564,均为最高值,说明本文方法在资产语义一致性、结构稳定性与整体画面匹配度方面具有更好的综合表现。
3.3 多资产多场景同时编辑
本实验旨在验证本文系统在多目标并发编辑场景下的特征隔离能力与局部可控性。同样设置Prompt⁃to⁃Prompt全局语义编辑、DiffEdit局部掩码编辑与本文方法ReMAP三种策略进行对比。
3.3.1 定性实验
如图5所示,实验以原始电影分镜为输入,分别对人物、车辆与场景风格设置不同的语义约束,要求系统在同一画面中同时完成人物造型变化、车辆外观变化以及整体场景风格转换。在复杂的电影分镜创作中,美术团队常需在保持镜头构图和空间关系稳定的前提下,同步修改多个独立元素,如人物服饰、背景道具、车辆类型或场景氛围等。因此,该实验重点考察不同方法在多区域协同编辑时的语义隔离能力、局部融合效果与非目标区域稳定性。
图 5 多资产多场景同时编辑流程图
从图6的对比结果可以看出,Prompt⁃to⁃Prompt将人物、车辆和场景变化统一写入全局提示词,能够在一定程度上改变整体画面风格,但由于缺乏显式区域约束,不同语义之间容易发生竞争与稀释。例如,在人物变化约束下,画面中的人物外观并未被彻底改写,仍保留较多原始服饰和轮廓特征;同时,车辆和街景变化也会受全局提示词共同影响,导致局部资产的修改边界不够清晰。DiffEdit依赖掩码进行局部重绘,能够更直接地作用于指定区域,但其生成区域与原始背景间的融合较弱,容易在人物、车辆边缘处产生突兀的贴图感或光影不连续现象,使局部修改结果显得不够自然。相比之下,ReMAP通过区域掩码与局部提示词的显式绑定,将人物、车辆与场景语义分别约束到对应区域,使不同编辑目标能够在同一画面中相对独立地生效。从结果上看,人物造型、车辆外观和赛博朋克场景氛围均得到较稳定的响应,同时整体透视关系、街道结构和画面光照保持较好的连贯性。
图 6 多资产多场景同时编辑效果示例
3.3.2 定量结果
为从统计量化层面对多资产同步编辑的实际有效性进行验证,本节选取了Local CLIP⁃T(衡量独立区域内文本与图像语义的匹配度)、Background LPIPS(评估非目标编辑区域的像素级内容破坏程度,数值越低代表背景保护越好)以及ImageReward(反映生成整体画面的工业美学与人类偏好综合评分)作为定量考量基准。
表2详细列出了多场景混排实验中的客观对比面板。如表2所示,本文方法在Local CLIP⁃T指标上相较代表性基线取得了一定提升,表明其在多参数叠加的复杂场景下具备较好的局部语义还原能力。同时,相比其他基线,ReMAP取得了较低的Background LPIPS(0.0462),说明该算法在执行复杂前景并排编辑时,对原始场景的非编辑区域具有较好的保护效果。最后,较高的ImageReward综合评分也从整体视觉质量与人类偏好角度说明,即便施加多维交叉空间掩码,核心扩散系统的最终成图仍能维持较稳定的电影视觉美学表现。
表 2 多资产多场景下的定量结果
3.4 与通用图像编辑大模型对比
为进一步分析本文方法的实际使用价值,本文对比其与通用图像编辑大模型在局部精准编辑任务中的差异。如图7所示,本文选取“池塘中指定锦鲤替换为未来风格机械鱼”作为补充实验。该任务的难点在于,画面中存在多条外观相近、语义类别一致的鱼类目标,仅依靠自然语言描述较难准确指定需要修改的具体对象。实验中,各方法均输入了包含目标区域标记的参考图像,以尽可能向模型说明待编辑对象的位置。然而,Gemini 2.5 Flash Image、元宝与豆包等通用图像编辑模型虽然能够理解“机械鱼”这一编辑意图,并生成具有一定风格化特征的结果,但其对图像中掩码或标记区域的理解更接近软提示,难以稳定地将编辑操作严格限制在指定区域内,因此仍可能出现生成对象偏离原始目标位置、影响多条鱼的外观,或对池塘背景和水面结构产生额外改动等现象。相比之下,本文方法通过显式区域Mask将编辑意图绑定到指定锦鲤所在区域,并在生成过程中将区域提示词主要约束于目标对象,从而在保持其他鱼类、水面环境和整体构图稳定方面表现更为可控。需要说明的是,通用大模型在开放式语义理解和自然语言交互方面具有明显优势,而本文方法的优势主要体现在目标区域难以用语言精准描述且需要严格局部修改的场景中,可通过区域约束掩码降低定位歧义,提升局部编辑的可控性与结果稳定性。
图 7 与通用大模型在指定区域修改定性对比实验
4
系统功能设计与实现
为验证本文方法在电影分镜工业生产中的实际可行性,本文基于前述流程框架开发了一套原型系统ReMAP Storyboard。系统采用前后端分离架构,前端基于React与TypeScript构建交互界面,通过组件化方式实现资产上传、区域标注、参数配置与结果比选等功能;后端采用FastAPI搭建推理服务接口,负责请求调度、任务管理、文件存储与模型调用。核心生成模块基于PyTorch深度学习框架实现。其各个职能模块均对应本文第2、3章论述的方法流程,系统界面呈现四个核心板块。
4.1 多模态SOP提示模块
系统中的“多模态视觉分析模块”对应了本文图1中“多模态场景生成与提示词输出”阶段。 在该控制面内,用户可导入原始分镜模板(Layout)以及待嵌入的特写资产图片(如机械盾牌、特定场景载具)。系统提供结构化参数录入框,将前文设计的SOP提示框架具象化为“固定约束前缀(Prefix)”“可变场景描写规则(Variable Rules)”与“画质还原后缀(Suffix)”三大控制区。
结合后端的视觉-大语言理解模型,该系统能生成多组剧情级候选方案(Candidate Prompts),降低分镜画师人工编写冗长自然语言的负担,也为后续区域注入提供较充分的高层语义信息。
4.2 语义提取与区域标注中心
系统中的“语义区域描述模块”对应本文图1中的“多区域Mask标注”和“区域语义约束生成”阶段,是实现局部区域控制的关键交互环节。为减少烦琐的人工掩码绘制操作,系统集成了SAM(Segment Anything Model)零样本图像分割方法,用户可通过点选交互将分镜画面中的道具区域、场景区域等目标区域分离出来,形成相互独立的区域Mask。在完成区域Mask标注后,系统将不同区域Mask与对应区域提示词进行绑定,例如将道具Mask绑定至道具提示词,将场景Mask绑定至场景提示词,并形成区域语义约束条件。 通过这种空间区域与文本语义的显式对应关系,系统能够在后续扩散绘制阶段降低不同区域之间的语义交叉干扰,使局部编辑主要作用于指定区域,同时保持非编辑区域内容稳定。
4.3 扩散重绘核心调度台
系统中的“模型参数调整模块”作为生成渲染的运算执行控制台,集成了全部底层的节点调度链路。此处不仅赋予用户随时调度包含Flux⁃Klein在内的高参数量基础基座的能力,还配备了融合Canny(边缘抓取)与Depth(深度信息感知)控制单元的ControlNet条件开关,用以维系并锁定原电影分镜骨架。该控制界面的灵魂功能是为其设有的“启用ReMAP注意力注入(Regional Semantic Constraint Core)”核心算法调度拨钮;配置完成采样步数(Sampling Steps)与重绘抗噪强度(Denoising Strength)后,一旦用户下发生成指令,后端便会将含有精准空间坐标掩码的跨模态协同条件送入云计算资源层推流,以此发起无损害环境结构的高保真影像重绘。
4.4 产出方案分析评估矩阵
为达成验证所生资产图组跨模态语义保真并反馈定性一致性结论的工程闭环,系统中“产出分析模块”提供强有力的评估展示与结果下发支撑。该模块依据前文设定的评价指标,对不同候选方案进行并列展示,并在结果界面中呈现由系统自动计算的 等视觉指标。系统进一步根据多项指标加权形成综合评分,用于辅助用户比较不同生成结果的资产一致性、局部结构稳定性与整体视觉质量。用户可根据评估结果筛选较优方案,并通过导出功能将结果流转至后续特效制作与美术开发环节。
4.5 系统性能与用户使用
为进一步验证ReMAP Storyboard在实际分镜迭代流程中的可用性,本文对系统主要环节的运行时间进行统计。系统整体流程可划分为SOP提示生成、区域Mask标注、扩散图像生成与结果评估四个阶段。不同阶段的耗时来源有所差异:SOP阶段主要受多模态大模型文本生成速度影响;Mask阶段与用户标注区域数量及分割交互次数相关;扩散生成阶段主要由Flux⁃Klein底座推理耗时决定;结果评估阶段则基于CLIP Similarity、DINOv2 Similarity、Background LPIPS等指标进行特征提取与自动评分。
在测试环境中,SOP模块一次生成5组候选场景提示词的平均耗时约为8~15秒,能够满足前期创意发散阶段的交互需求。区域Mask标注阶段的耗时与目标数量相关,单个目标区域通常可在5~10秒内完成点选与修正;当编辑对象增加至2~3个时,整体标注时间约为15~30秒。扩散生成阶段是系统耗时最高的部分,单张图像生成时间通常稳定在30秒左右;若进行多方案候选生成,则总耗时随候选图数量近似线性增长。结果评估阶段由于仅需进行特征提取与相似度计算,整体耗时较短,单张图像通常可在2~5秒内完成。
5
结语
本文面向电影前期视觉开发,针对电影分镜迭代中多区域协同编辑所面临的结构稳定性与语义独立性难题,构建了一种图像智能生成框架ReMAP。通过将分镜画面解构为多个独立的语义区域,并建立区域空间掩码与对应提示词的显式约束映射,实现了生成过程中的局部控制与非编辑区域保护。相比Prompt⁃to⁃Prompt等全局语义编辑方法易导致跨区域特征污染,以及DiffEdit等局部掩码编辑方法在多区域交接处产生的边界割裂,本文方法通过在扩散模型交叉注意力层中引入空间掩码,使区域提示词主要作用于对应区域,从而增强多区域编辑中的特征解耦与语义隔离。同时,本文构建的多模态SOP提示自动生成机制,将参考资产、原始分镜与编辑意图转化为可复用的全局风格提示词和区域级细节描述,降低了复杂场景下的提示词编写成本。后续可进一步结合自动分割、区域跟踪与时序一致性约束,将该流程扩展至连续镜头中的角色、道具和场景协同控制,从而更好地服务于电影概念设计、分镜迭代与前期视觉开发。
参考文献
(向下滑动阅读)
[1] Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models[C]//Advances in Neural Information Processing Systems, 2020:6840⁃6851.
[2] Rombach R, Blattmann A, Lorenz D, et al. High⁃resolution image synthesis with latent diffusion models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022:10684⁃10695.
[3] Peebles W, Xie S. Scalable diffusion models with transformers[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision, 2023:4195⁃4205.
[4] Liu X, Gong C, Liu Q. Flow straight and fast: Learning to generate and transfer data with rectified flow[C]//International Conference on Learning Representations, 2023.
[5] Xiao S, Wang Y, Zhou J, et al. OmniGen: Unified image generation[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2025:13294⁃13305.
[6] Tan Z, Liu S, Yang X, et al. OminiControl: Minimal and universal control for diffusion transformer[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025:14940⁃14950.
[7] Radford A, Kim J W, Hallacy C, et al. Learning transferable visual models from natural language supervision[C]//International Conference on Machine Learning,2021:8748⁃8763.
[8] Raffel C, Shazeer N, Roberts A, et al. Exploring the limits of transfer learning with a unified text⁃to⁃text transformer[J]. Journal of Machine Learning Research, 2020, 21(140):1⁃67.
[9] Zhang L, Rao A, Agrawala M. Adding conditional control to text⁃to⁃image diffusion models[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision, 2023:3836⁃3847.
[10] Ye H, Zhang J, Liu S, et al. IP⁃Adapter: Text compatible image prompt adapter for text⁃to⁃image diffusion models[PP/OL]. arXiv(2023⁃08⁃13)[2026⁃05⁃11]. https://arxiv.org/abs/2308.06721.
[11] Hu E J, Shen Y, Wallis P, et al. LoRA: Low⁃rank adaptation of large language models[C]//International Conference on Learning Representations, 2022.
[12] Hertz A, Mokady R, Tenenbaum J, et al. Prompt⁃to⁃Prompt image editing with cross attention control[C]//International Conference on Learning Representations, 2023.
[13] Brooks T, Holynski A, Efros A A. InstructPix2Pix: Learning to follow image editing instructions[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2023:18392⁃18402.
[14] Couairon G, Verbeek J, Schwenk H, et al. DiffEdit: Diffusion⁃based semantic image editing with mask guidance[C]//International Conference on Learning Representations, 2023.
[15] Lugmayr A, Danelljan M, Romero A, et al. RePaint: Inpainting using denoising diffusion probabilistic models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022:11461⁃11471.
[16] Ju X, Liu X, Wang X, et al. BrushNet: A plug⁃and⁃play image inpainting model with decomposed dual⁃branch diffusion[C]//Computer Vision - ECCV 2024. Cham:Springer, 2025:150⁃168.
[17] Zhuang J, Zeng Y, Liu W, et al. A task is worth one word: Learning with task prompts for high⁃quality versatile image inpainting[C]//European Conference on Computer Vision, 2024.
[18] Bar⁃tal O, Yariv L, Lipman Y, et al. MultiDiffusion: Fusing diffusion paths for controlled image generation[C]//International Conference on Machine Learning, 2023:1737⁃1752.
[19] Chen A, Xu J, Zheng W, et al. Training⁃free regional prompting for diffusion transformers[PP/OL]. arXiv(2024⁃11⁃04)[2026⁃05⁃11]. https://arxiv.org/abs/2411.02395.
[20] Chen Z, Li Y, Wang H, et al. RAGD: Regional⁃aware diffusion model for text⁃to⁃image generation[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025:19331⁃19341.
[21] Su J, Lu Y, Pan S, et al. RoFormer: Enhanced transformer with rotary position embedding[J]. Neurocomputing, 2024, 568:127063.
期刊导读 |《现代电影技术》2026年第7期
程絮森等:人工智能驱动下元宇宙技术赋能电影科技创新提质研究
孙立军等:人工智能(AI)影像生成技术与传统影视制作的融合路径及流程标准化研究

