Wunjo 一个高级语音和Deepfake神经网络工具。功能: * 可以合成和克隆英语、俄语和中文的声音,同时支持实时语音识别。 * 能深度伪造面部和嘴唇动画,并使用一张照片进行人脸交换。 * 通过文本提示改变视频,进行分割和修饰。 * 具有语音合成、声音克隆、实时语音识别、多对话创建、视频到视频转换、深度伪造动画、AI修饰工具、自动分割掩码等功能。 * 支持英语、俄语、中文和西班牙语等多种语言。 * 适用于初学者和专业人士。 * 保护用户隐私。 * 应用于广告配音、游戏角色配音、有声书朗读和深度伪造项目等应用场景。 * 需要Python 3.10和ffmpeg作为运行环境。 * 由Wladislav Radchenko进行开发和维护。
Video-LLaVA 一个基于深度学习的视频超分辨率(SR)和视频增强(VE)框架,由北京大学元培学院的研究团队开发。该框架旨在提高低分辨率视频的质量和视觉效果,使其更接近高分辨率视频。Video-LLaVA 采用了多尺度融合、残差学习、自适应注意力机制等技术,以提高视频超分辨率和视频增强的性能。 主要特点: 1. 多尺度融合:通过在不同尺度上进行特征融合,提高了模型对细节和全局信息的捕捉能力。 2. 残差学习:引入残差连接,使网络能够更好地学习输入和输出之间的映射关系。 3. 自适应注意力机制:根据输入视频的特点,自动调整注意力权重,使模型能够关注到更重要的区域。 4. 端到端训练:整个框架可以作为一个整体进行端到端训练,简化了模型的训练过程。 5. 支持多种视频格式:Video-LLaVA 支持多种常见的视频格式,如 YUV、RGB 等。
GPT-vup GPT-vup是一个公共的代码存储库,主要用于BIliBili视频网站、抖音以及人工智能(AI)方面的虚拟主播项目。该存储库在GitHub上备受关注,已经获得了364颗星星和77个分支。它的主要目标是开发虚拟主播技术,为BIliBili和抖音等平台提供更加逼真和有趣的虚拟人物形象。该存储库是公开的,任何人都可以查看和使用其中的代码。