Wunjo

Wunjo

一个高级语音和Deepfake神经网络工具。功能: * 可以合成和克隆英语、俄语和中文的声音,同时支持实时语音识别。 * 能深度伪造面部和嘴唇动画,并使用一张照片进行人脸交换。 * 通过文本提示改变视频,进行分割和修饰。 * 具有语音合成、声音克隆、实时语音识别、多对话创建、视频到视频转换、深度伪造动画、AI修饰工具、自动分割掩码等功能。 * 支持英语、俄语、中文和西班牙语等多种语言。 * 适用于初学者和专业人士。 * 保护用户隐私。 * 应用于广告配音、游戏角色配音、有声书朗读和深度伪造项目等应用场景。 * 需要Python 3.10和ffmpeg作为运行环境。 * 由Wladislav Radchenko进行开发和维护。
10
CoDeF

CoDeF

CoDeF通过将静态内容与时间变形结合,为视频处理提供了新的视角和工具。这种方法能够提高视频编辑和分析的效率,并具有潜力影响电影制作到虚拟现实等领域。CoDeF将视频分为规范内容字段和时间变形字段,能够精确分析和处理每一帧的内容。它还可以跟踪和分析视频中的复杂运动,实现卓越的跨帧一致性。CoDeF具有灵活性和高效性,可以应用于多种视频处理任务。 该项目由蚂蚁集团、香港科技大学和浙江大学团队共同创建。
10
ComfyUI Portrait Master

ComfyUI Portrait Master

ComfyUI Portrait Master 肖像大师 简体中文版是一款专业的人物肖像提示词生成工具。它专注于优化肖像生成,让选择比填空更适合人类的操作方式。这款工具可以根据用户的具体需求,生成各种肖像的提示词,覆盖镜头类型、性别、国籍、面部表情、发型等多个参数。用户可以根据自己的需求进行个性化设置,例如调整发型、表情等。此外,此工具适用于多种工作流程,广泛应用于视频制作和设计等领域。目前最新版本为2.2,经过优化和汉化处理,ComfyUI Portrait Master项目为使用者提供了更加便捷的使用体验。如果你对此感兴趣,可以到项目官网学习使用方法,网上也有详细的教程可供参考。 使用参考:https://zhuanlan.zhihu.com/p/663008600
10
pyvideotrans

pyvideotrans

一个功能强大且易于使用的视频翻译和配音工具,适用于需要翻译视频或为视频添加不同语言配音的人们。它的开源性质和灵活性使得用户能够根据自己的需求进行自定义和改进。 功能点: 1. 视频翻译:pyvideotrans 允许用户将一种语言的视频翻译成另一种语言。通过使用该项目,你可以轻松地转换视频的语言,使得观众能够更好地理解视频内容。 2. 配音:除了视频翻译外,pyvideotrans 还可以添加配音。你可以选择一种语言作为原始音频,然后用另一种语言的音频来替换它。这对于将视频转换成多种语言版本或为特定目标受众添加配音非常有用。 3. MIT许可证:pyvideotrans 采用了MIT许可证,这意味着用户可以免费使用、修改和分发该项目。这种开放的授权方式使得pyvideotrans 在用户和开发者之间建立了更好的互动和合作环境。
10
InsightFace

InsightFace

InsightFace是一个开源的2D和3D深度人脸分析库。 功能特点: 面部识别:InsightFace实现了最先进的面部识别算法,可以高效准确地进行人脸识别。它在CVPR 2019上被接受为最先进的面部识别方法。 面部检测:该库提供了RetinaFace,这是一种最先进的多任务面部检测方法。它在CVPR 2020上被接受,并能在复杂场景下实现高准确率的面部检测。 面部对齐:InsightFace提供了SDUNet和CoordinateReg等面部对齐方法。这些算法能够对面部进行准确的对齐,保证了后续处理的准确性。 易于使用和部署:InsightFace是一个易于使用的Python库,提供了方便的API接口,使得研究机构和商业组织可以轻松地使用和部署该库中的算法。 开源:InsightFace是开源的,用户可以自由地查看和修改源代码,以满足自己的需求。 强大的性能:InsightFace在多个面部分析挑战中取得了优异的成绩,包括在ECCV 2022 WCPA Challenge中获得第一名,在NIST-FRVT 1:1 VISA中获得第一名,在NIST-FRVT 1:1中排名第四。
10
HierVST

HierVST

HierVST 是一种分层自适应零样本语音风格转换模型,它具备以下功能特点: 零样本语音风格转换:HierVST 可以在没有目标说话者语音数据的情况下,将一个新的说话者的语音风格转换为目标风格。这意味着即使没有目标说话者的语音样本,HierVST 也可以生成具有目标风格的语音。 分层自适应结构:HierVST 使用分层自适应生成器,逐步生成音高表示和波形音频,从而实现逐步转换语音的能力。这种结构让模型能够适应新的语音风格,并逐步进行转换。 自监督表示学习:HierVST 仅使用语音数据集进行训练,而无需使用文本转录。它采用了层次变分推断和自监督表示学习的方法,提高了模型在音频表示上的性能。 性能优于其他模型:在零样本语音风格转换场景中,HierVST 的实验结果表明其性能优于其他 VST 模型,如 AutoVC、VoiceMixer、DiffVC、Speech Resynthesis 和 YourTTS。
10
anytext

anytext

阿里达摩院发布的AnyText项目看起来非常出色,它能够生成与原始图片风格相融合的文字,或者对图片中的文字进行修改,同时支持中文! AnyText项目包括两个核心模块:一个潜在特征模块和一个文本嵌入模块。潜在特征模块使用文本字形、位置和蒙版图像等输入,生成用于文本生成或编辑的潜在特征。文本嵌入模块则利用OCR模型将笔画数据转化为嵌入,再与来自标记器的图像标题嵌入相结合,生成能够与背景无缝融合的文本。 为了提高书写的准确性,AnyText采用了两种损失函数进行训练:文本控制扩散损失和文本感知损失。
10