GPT-SoVITS

6小时前发布 1 0 0

零样本文本到语音(TTS): 输入5秒的声音样本,即刻体验文本到语音转换。 少样本TTS: 仅需1分钟的训练数据即可微调模型,提升声音相似度和真实感。 跨语言支持: 支持与训练数据集不同语言的推理,目前支持英语、日语和中文。 WebUI工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注,协助初学者创建训...

语言:
zh
收录时间:
2026-08-31
GPT-SoVITSGPT-SoVITS

零样本文本到语音(TTS): 输入5秒的声音样本,即刻体验文本到语音转换。 少样本TTS: 仅需1分钟的训练数据即可微调模型,提升声音相似度和真实感。 跨语言支持: 支持与训练数据集不同语言的推理,目前支持英语、日语和中文。 WebUI工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注,协助初学者创建训练数据集和GPT/SoVITS模型。 介绍视频 https://www.bilibili.com/video/BV12g4y1m7Uw/ 来自B站up主:花儿不哭

数据统计

相关导航

StreamDiffusion

StreamDiffusion

StreamDiffusion是一种专门为实时图像生成服务设计的扩散模型管道,显著地提升了实时图像生成的性能。 在模型和输出帧率方面,它支持SD-turbo模型,1步,t2i每秒帧率106,i2i每秒帧率93。同时,它也支持LCM-LoRA+KohakuV2模型,4步,t2i每秒帧率38,i2i每秒帧率37。 其主要特点包括: 1. 通过高效的批处理操作实现数据处理流程的优化。 2. 改进的指导机制可以最大程度地减少计算冗余。 3. 通过先进的过滤技术提高GPU利用效率。 4. 有效管理输入和输出操作,实现更顺畅的执行。 5. 优化缓存策略以加速处理。 6. 利用各种工具进行模型优化和性能提升。 这些特点使得StreamDiffusion成为一种高效、实时的图像生成服务扩散模型管道。
MDX23声音分离,一键安装包

MDX23声音分离,一键安装包

本整合包修改自MVSEP-MDX23-Colab_v2,原项目为colab部署,作者修改了部分代码使其可以本地运行 该方案在 https://mvsep.com/ 网站上的SDR Vocals得分10.2196,截止打包日为开源模型中得分最高方案,对应参数已按照榜单修改完成。 评价:人声剥离完整,不砍频,测试用的这首很多模型都会把人声剥没一部分,该方案在作者测试中目前表现最好,但是会漏器乐,可能需要额外处理。 对比2.2版本,主要的变化是换用了新模型,以及配套的新方案和参数。 MVSEP-MDX23,如果你需要运行这个算法进行音源分离,占用显存可达4-15G,低于4G显存,可能运行失败 项目地址: https://github.com/jarredou/MVSEP-MDX23-Colab_v2 下载链接: https://pan.baidu.com/s/14KkRhYMIbqeYooq6mH0Knw?pwd=h9er 解压密码 领航员未鸟 2.2版本视频介绍: https://www.bilibili.com/video/BV1u8411y7P4/ 2.3版本视频介绍: https:/