DragNUWA

7小时前发布 1 0 0

微软发布了DragNUWA 1.5版本,用户可以在图像上画出对应方向的箭头标记。在通过图像生成视频之前,这些标记可以用来指导镜头的运动方向。

语言:
zh
收录时间:
2026-08-31
DragNUWADragNUWA

微软发布了DragNUWA 1.5版本,用户可以在图像上画出对应方向的箭头标记。在通过图像生成视频之前,这些标记可以用来指导镜头的运动方向。如果用户标记的是具体的物体,那么这个物体就会按照标记的方向运动;如果用户标记的是非物体区域,镜头的运动则会按照标记的方向进行。通过这种方式,DragNUWA 1.5版本为用户提供了更灵活、更精确的视频生成控制方式。

数据统计

相关导航

OpenGPTs

OpenGPTs

一个开源版的GPTs,它支持定制聊天机器人,并提供了沙盒环境、自定义工具、数据分析等特性。其旨在创造与OpenAI的GPTs类似的体验。该项目建立在LangChain、LangServe和LangSmith的基础上,用户可以选择语言模型、自定义工具和控制提示等。此外,该项目还提供了简单的托管版本,用户可以直接在网站上体验使用。对于有能力的用户,也可以自行搭建体验。该项目有详细的使用教程。
LabelU 开源标注工具

LabelU 开源标注工具

1.产品介绍 一款轻量级开源标注工具,自由组合多样工具,无缝兼容多格式数据,同时支持载入预标注,加速数据标注效率 2.特色功能 LabelU 提供了多种标注工具和功能,支持图像、视频、音频标注。 · 图像类:多功能图像处理工具,涵盖 2D 框、语义分割、多段线、关键点等多种标注工具,协助完成图像的标识、注释和分析。 · 视频类:具备强大视频处理能力,可实现视频分割、视频分类、视频信息提取等功能,为模型训练提供优质标注数据。 · 音频类:高效精准的音频分析工具,可实现音频分割、音频分类、音频信息提取等功能,将复杂的声音信息直观可视化。 3.产品特性 · 简易,提供多种图像标注工具,通过简单可视化配置即可标注 · 灵活,多种工具可自由组合使用,满足大部分图像,视频,音频的标注需求 · 通用,支持导出多种数据格式,包括 JSON,COCO,MASK
Video-LLaVA

Video-LLaVA

一个基于深度学习的视频超分辨率(SR)和视频增强(VE)框架,由北京大学元培学院的研究团队开发。该框架旨在提高低分辨率视频的质量和视觉效果,使其更接近高分辨率视频。Video-LLaVA 采用了多尺度融合、残差学习、自适应注意力机制等技术,以提高视频超分辨率和视频增强的性能。 主要特点: 1. 多尺度融合:通过在不同尺度上进行特征融合,提高了模型对细节和全局信息的捕捉能力。 2. 残差学习:引入残差连接,使网络能够更好地学习输入和输出之间的映射关系。 3. 自适应注意力机制:根据输入视频的特点,自动调整注意力权重,使模型能够关注到更重要的区域。 4. 端到端训练:整个框架可以作为一个整体进行端到端训练,简化了模型的训练过程。 5. 支持多种视频格式:Video-LLaVA 支持多种常见的视频格式,如 YUV、RGB 等。
facefusion

facefusion

facefusion是一款下一代的人脸交换和增强应用程序。它具有以下功能特点: 人脸交换:facefusion具有强大的人脸交换功能,可以将两个不同的人脸进行交换,创造出有趣而奇特的效果。您可以将自己的面部特征与他人合并,或与名人进行面部交换,体验跨界面部的有趣效果。 人脸增强:除了人脸交换,facefusion还具有人脸增强功能。它可以通过应用滤镜、特效和美化工具来改善人脸外观。您可以尝试不同的滤镜样式、调整颜色和对比度,甚至添加贴纸和文字等元素,使您的照片或视频更加吸引人和有趣。 简单易用:facefusion提供用户友好的界面和简单的操作流程,使任何人都能够轻松使用。您只需选择需要交换或增强的人脸,然后选择相应的选项和效果即可完成操作。 高质量结果:facefusion的人脸交换和增强算法采用了先进的深度学习技术,以提供高质量、逼真和精确的结果。它能够准确捕捉面部特征,实现更加自然和真实的人脸交换和增强效果。