通义听悟

通义听悟

通义听悟是阿里云通义家族新成员,是一款聚焦于音视频内容的工作学习AI助手。内置了通义千问大模型的理解与摘要能力,结合阿里云在音频AI领域深厚的积累,可帮助用户高效地完成对音频视频内容的记录、转写、摘要、整理和分析,实现通义大模型能力与场景化应用的结合,成为人人都可亲手体验和使用的效率工具。
10
CapsWriter-Offline 语音输入 字幕转录工具

CapsWriter-Offline 语音输入 字幕转录工具

这是 CapsWriter-Offline ,一个 PC 端的语音输入、字幕转录工具。 两个功能: 视频教程: CapsWriter-Offline 电脑端离线语音输入工具 对 Windows 端: 其它系统: 模型说明: 下载地址: (百度网盘容易掉链接,补链接太麻烦了,我不一定会补链接。GitHub Releases 界面下载是最可靠的。)
10
Buzz:离线开源免费语音转文字(字幕) 翻译站点

Buzz:离线开源免费语音转文字(字幕) 翻译站点

Whisper 是一种通用语音识别模型。它利用各种大型数据集上的音频进行训练,也是一个多任务模型,可以执行多语言语音识别以及语音翻译和语言识别。 在第一次使用 Buzz 的时候,会下载 Whisper 的模型,根据不同的质量要求,模型尺寸也非常可观: Whisper模型存储在~/.cache/wilsper中。 Whisper.cpp模型存储在~/Library/Caches/Buzz(Mac OS)、~/.cache/Buzz(Unix)或C:Users<username>AppDataLocalBuzzBuzzcache(Windows)中。 Hugging 模型存储在~/.cache/huggingface/hub中。 https://github.com/chidiwilliams/buzz
10