VoiceStreamAI

6小时前发布 2 0 0

一个可以自己托管的 Whisper 解决方案,服务端是 Python,客户端是 JS,基于 WebSocket 实时通信,可以做到语音的实时传输和文本转换。

语言:
zh
收录时间:
2026-08-31
VoiceStreamAIVoiceStreamAI

VoiceStreamAI是一个可以自己托管的 Whisper 解决方案,服务端是 Python,客户端是 JS,基于 WebSocket 实时通信,可以做到语音的实时传输和文本转换。 我们运用了Huggingface的语音活动检测(VAD)技术,以及OpenAI的Whisper模型,从而精确地识别和处理语音。 功能特性: * 支持WebSocket,实现实时音频流的传输。 * 采用Huggingface的VAD技术,精确检测语音活动。 * 利用OpenAI的Whisper模型,完成语音转写。 * 可针对音频块进行个性化处理。 * 具备多语言转写功能。

数据统计

相关导航

Segment-Anything

Segment-Anything

Segment-Anything是一个模型,它提供了运行推理的代码、训练模型的检查点下载链接以及示例笔记本。以下是Segment-Anything的功能特点总结: 推理功能:Segment-Anything模型通过使用已训练的模型检查点,可以对图像进行分割,并提取出图像中各个区域的感兴趣部分。 模型检查点下载:用户可以从该项目中获取已经训练好的模型检查点,以便在自己的应用中使用或进行二次开发。 示例笔记本:Segment-Anything提供了一些示例笔记本,展示了如何使用该模型进行图像分割的步骤和方法。 开放源代码:Segment-Anything的代码是开放源代码,并使用Apache-2.0许可证进行授权,这意味着用户可以自由地使用、修改和分发代码。
pyvideotrans

pyvideotrans

一个功能强大且易于使用的视频翻译和配音工具,适用于需要翻译视频或为视频添加不同语言配音的人们。它的开源性质和灵活性使得用户能够根据自己的需求进行自定义和改进。 功能点: 1. 视频翻译:pyvideotrans 允许用户将一种语言的视频翻译成另一种语言。通过使用该项目,你可以轻松地转换视频的语言,使得观众能够更好地理解视频内容。 2. 配音:除了视频翻译外,pyvideotrans 还可以添加配音。你可以选择一种语言作为原始音频,然后用另一种语言的音频来替换它。这对于将视频转换成多种语言版本或为特定目标受众添加配音非常有用。 3. MIT许可证:pyvideotrans 采用了MIT许可证,这意味着用户可以免费使用、修改和分发该项目。这种开放的授权方式使得pyvideotrans 在用户和开发者之间建立了更好的互动和合作环境。