设为首页
收藏本站
用户名
Email
安全手机号
自动登录
找回密码
密码
登录
立即注册
快捷导航
编辑圈首页
BBS
期刊目录
期刊发表
专利知产
硕博论文
个人提升
相关网站
著作出版
期刊运营
在线咨询
北核期刊目录
科技核心期刊目录
SCI期刊目录
SCI/SSCI期刊检索
中文普刊目录
SCI/SSCI/EI期刊发表
闭源SCI/SSCI期刊发表
知网普刊发表
Scopus期刊发表
CSCD期刊发表
万方期刊发表
维普期刊发表
北核期刊发表
南核期刊发表
AMI期刊发表
知网期刊加急发表
中文普刊加急发表
万方期刊加急发表
发明专利
实用新型专利
软件著作权
外观设计专利
版权登记
香港专利
美国专利
日本专利
德国专利
尼日利亚专利
卢森堡专利
MBA/EMBA毕业论文辅导
MPA毕业论文辅导
数学专业毕业论文辅导
计算机专业毕业论文辅导
美术专业毕业论文辅导
人工智能方向毕业论文辅导
土木方向毕业论文辅导
医学专业毕业论文辅导
金融专业毕业论文辅导
教育专业毕业论文辅导
传播学方向毕业论文辅导
工业设计方向毕业论文辅导
CISA国际信息系统审计师
PMP项目管理师
海外优青
国际在职硕士
国际在职博士
申博论文发表
申博外语能力证明
马来西亚本硕博留学
云科服论坛
学术圈中文网
美国留学论坛
日本留学论坛
澳洲留学论坛
韩国留学论坛
英国留学论坛
华人留学网
考研重点网
集群智慧云科服
自有完整书稿,自费独自出版
自有完整书稿,希望与他人分担费用
自有部分书稿,寻求自费与他人合著出版
没有书稿,希望自费与他人合著出版
ISSN刊号申请
Google Scholar期刊收录
维普期刊收录
期刊GEO优化
期刊创刊
期刊代运营
期刊代理
期刊推广
期刊约稿
中文期刊发表
英文期刊发表
搜索
搜索
热搜:
期刊编辑
学术期刊
期刊约稿
期刊内推
期刊推广
期刊创刊
期刊代运营
期刊合作
SCI期刊
SSCI期刊
Scopus期刊
英文期刊
中文核心期刊
本版
帖子
编辑圈
»
编辑圈首页
›
专业技术交流区
›
同行评审
›
上交大提出ICRDrag:首个上下文区域拖拽模型,精准可控 ...
返回列表
发新帖
查看:
408
|
回复:
0
上交大提出ICRDrag:首个上下文区域拖拽模型,精准可控图像编辑 ...
[复制链接]
zhongguohaoa
zhongguohaoa
当前离线
积分
179
44
主题
14
回帖
179
积分
注册会员
注册会员, 积分 179, 距离下一级还需 21 积分
注册会员, 积分 179, 距离下一级还需 21 积分
积分
179
发消息
发表于 2026-7-6 19:03:30
|
显示全部楼层
|
阅读模式
还在用 DragGAN、DragDiffusion 拖拽修图?点选拖拽容易变形、边界割裂、细节丢失的时代落幕了!ECCV 2026 ICRDrag 首创上下文区域拖拽模型,用掩码精准定位局部区域,移动、缩放、变形全都丝滑自然,兼顾精准度与画面真实感。
Paper: https://arxiv.org/pdf/2606.25907
GitHub: https://github.com/bcmi/ICRDrag-Region-Drag-Editing
Demo: https://drag.ustcnewly.com/
效果展示
先看编辑效果,每一组图像左边蓝色掩码是源区域,右边红色掩码是目标区域。拖拽编辑旨在把源区域拖拽到目标区域,其他区域除了必要的跟随性改动 (比如嘴巴动了,下巴也要跟着动) 之外,细节尽量保持不变。可以看出 ICRDrag 对于各种类型图片的姿态和形状调整都能轻松拿捏。
下面视频是 demo 展示,用户可以用不同颜色画出多对源区域和目标区域 (目前最多支持 5 对),把多个源区域拖拽到对应的目标区域。如果其他区域出现了不想要的改动,可以在其他区域增加类似锚点的源区域和目标区域,锁定其他区域。
体验链接:
https://drag.ustcnewly.com/
直击痛点
传统拖拽修图,到底有多难用?玩过 AI 拖拽编辑的朋友一定踩过这些坑:
基于单点拖拽:
主流点拖拽模型比如 DragGAN, DragDiffusion 仅靠少量点对控制画面。点对信息模糊,AI 经常猜不透你的想法。点越少歧义越大,想要精准调整物体形态基本靠碰运气,很难严格对齐目标位置。
现有区域拖拽:
后来出现的 RegionDrag, DragFlow 等模型改用掩码控制区域,但缺陷依旧明显:物体拖拽后边缘断层,和背景融合生硬;复杂的形状姿态调整完全 hold 不住。
上下文区域拖拽
本次 ECCV2026 提出的 ICRDrag(In-Context Region-based Drag)全新解法:上下文区域拖拽,真正实现「选啥改啥」。
上下文学习框架:
基于 DiT 上下文学习框架,一次性输入原图、源区域掩码、目标区域掩码,直接输出编辑完成的图片,从底层解决拖拽编辑的控制难题。
图像 - 掩码注意力一致性约束:
目标图像在借鉴原图信息时,注意力分布必须和目标掩码匹配源掩码的分布保持一致。AI 不再割裂看图片和选区,生成画面严格贴合掩码划定的空间轮廓。
源 - 目标双向注意力对应约束:
目标物体看向原图对应区域,原图区域也反向关注目标物体,建立编辑前后物体的对应关系。
图片 / 掩码专属模态 LoRA:
图像富含纹理细节,掩码仅存储空间轮廓,二者的性质差别很大。ICRDrag 为图像、掩码分支使用独立 LoRA。
分阶段课程式训练:
现实使用中,用户勾勒的掩码往往比较粗糙。模型采用两阶段渐进式训练:第一阶段用完整语义掩码训练,让模型学会区域变换逻辑;第二阶段用稀疏不完整掩码训练,随机膨胀模拟手绘粗糙选区,大幅提升模型容错率。哪怕掩码画得潦草,AI 依旧能精准理解你的编辑意图。
区域拖拽大规模数据集
为了训练 ICRDrag 模型,该工作基于百万级视频数据集 OpenVid,打造了首个大规模区域拖拽数据集 PRD (Paired Region Dataset),补齐领域空白:
训练集
:28.7 万组「原图 + 源掩码 + 目标图 + 目标掩码」配对样本,如下图所示。下图中,左栏是原图、源掩码、从源掩码采样的部分区域,右栏是目标图、目标掩码、从目标掩码采样的部分区域。
评测基准 PRDBench
:1000 组人工校验高质量样本,同时标注掩码 + 关键点,可公平对比点拖拽、区域拖拽两类模型。
应用场景
图像拖拽编辑覆盖多个落地场景,是广大设计师和摄影爱好者的福音。
人像修图
:框选人脸、四肢,随意调整身材比例、姿态、五官位置,不变形不失真;
静物 / 产品设计
:拖拽商品调整摆放位置、缩放大小,无需重绘光影;
场景构图优化
:移动画面中人物、花草、建筑,自动填充背景,画面无缝融合;
创意设计
:自由扭曲物体轮廓,实现复杂创意形变,告别生硬拼接。
实验室简介
ICRDrag 出自上海交通大学牛力实验室。该实验室近几年主要工作集中在图像生成和编辑领域,代表性子领域是图像合成 / 物体插入 (image composition/object insertion) 和少样本图像生成 (few-shot image generation),也涉猎过图像填充、图像分层、风格迁移、拖拽编辑等其他子领域。近两年在关注生成模型的后训练和理解生成一体化模型。
回复
举报
返回列表
发新帖
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖后跳转到最后一页
快速回复
返回顶部
返回列表