当前位置: 首页 > news >正文

港科大快手提出统一上下文视频编辑 UNIC,各种视频编辑任务一网打尽,还可进行多项任务组合!

由香港科技大学、快手科技提出的UNIC(统一上下文视频编辑)是一个简单而有效的框架,它以上下文的方式统一单个模型中的各种视频编辑任务。从此,视频编辑用着一个工具就够了!

ID插入

ID交换

删除ID

相机控制

风格化

第一帧传播

紧急任务组合

UNIC 还表现出了新兴任务组合能力。

重新拍摄+风格化

ID+风格化

相关链接

论文名:UNIC:Unified In-Context Video Editing

  • 论文:https://arxiv.org/pdf/2506.04216

  • 主页:https://zixuan-ye.github.io/UNIC

论文介绍

UNIC:框架和设计

动机

  • 基于DDIM反转的方法(例如Video-P2P、FLATTEN):性能欠佳。 附加阶段,使推理步骤和总体成本加倍。

  • 基于适配器的方法:需要修改模型架构。通过添加适配器模块引入参数冗余。

它们通常是针对特定任务的,需要针对每个不同的条件信号训练单独的模块。这严重阻碍了任务的可扩展性和各种编辑功能的统一。

统一上下文框架

UNIC 通过将所有输入(含噪视频潜伏信号、参考视频标记以及各种多模态条件标记)处理为一个组合序列来统一视频编辑。这使得扩散变换器 (DiT) 的原生注意力机制能够“在上下文中”学习复杂的编辑任务,从而提供灵活性和简便性。

  • 针对不同任务的统一模型。

  • 将输入标记定义为三种类型。

  • 没有特定任务的适配器模块。

任务感知 RoPE

根据任务类型和视频长度动态分配唯一的旋转位置嵌入 (RoPE) 帧索引。这确保了在不同条件下对时间的理解和正确对齐。

条件偏差

为条件标记添加特定于任务的可学习嵌入。这有助于模型在模态重叠时区分目标任务,从而有效解决歧义。

结论

论文提出的统一的上下文内视频编辑UNIC是一个简单而有效的框架,它以上下文内的方式将不同的视频编辑任务统一到一个模型中。为此,我们将不同视频编辑任务的输入表示为三种类型的标记,并将它们集成为一个统一的标记序列,并与扩散变换器 (Diffusion Transformer) 的原始全注意力机制联合建模。凭借设计的任务感知 RoPE 和条件偏差,该方法可以灵活地执行不同的编辑任务并支持它们的组合。为了便于评估,论文还构建了一个统一的视频编辑基准。在六个代表性视频编辑任务上进行的大量实验表明,该模型在每项任务上都表现出卓越的性能,并展现出新兴的任务组合能力。

http://www.dtcms.com/a/237311.html

相关文章:

  • win11系统 Docker Desktop 突然提示Docker Engine stopped解决情况之一
  • 利用frp和腾讯云服务器将内网暴露至外网(内网穿透)
  • 《真假信号》速读笔记
  • 微服务架构的性能优化:链路追踪与可观测性建设
  • 头像上传功能的实现
  • btstack协议栈---Ubuntu驱动CSR8510 USB Dongle
  • 八、【ESP32开发全栈指南:UDP客户端】
  • 【强化学习】——04Model-Based RL
  • 运维_集运维linu自动化运维和部署
  • 会计 - 合并4 - 或有对价的会计处理
  • Python基于Django的文件销毁系统【附源码、文档说明】
  • ubuntu的虚拟显示器安装
  • Vue具名插槽
  • FirmAE安装-重新写
  • 【STM32F1标准库】理论——定时器中的输出比较
  • Day47
  • PostgreSQL数据类型使用
  • ros创建工作空间配置运行状态机
  • go语言学习 第8章:切片
  • spring中的@RabbitListener注解详解
  • 腾讯 ovCompose 跨平台框架发布,几年后还会有人用吗?
  • SSM spring Bean实例化
  • matlab 2024a ​工具箱Aerospsce Toolbox报错​
  • 【力扣链表篇】19.删除链表的倒数第N个节点
  • 2025年06月07日Github流行趋势
  • Vue3 项目的基本架构解读
  • 2012-2023年 上市公司-知识重组创造、知识重组再利用数据-社科经管实证数据
  • 《从零掌握MIPI CSI-2: 协议精解与FPGA摄像头开发实战》-- CSI-2 协议详细解析LLP (二)
  • 备份还原打印机驱动
  • 数据库管理与高可用-MySQL高可用