面灵AI 面灵AI是一款面向求职面试场景的AI辅助工具,支持实时语音识别、面试问题分析、智能提词和回答参考生成等功能。面灵AI适用于校招、社招、技术面试和在线面试等场景,可帮助用户在面试过程中获取实时辅助信息。本页提供面灵AI的功能介绍、应用场景、使用方式及官方访问入口。 10 AI语音识别-音转文# AI办公工具# 招聘面试
Insanely Fast Whisper 一个使用OpenAI的Whisper Large v2进行语音识别的脚本,能够在短短10分钟内转录300分钟的音频 。该项目的目标是提供一个简单的入口来运行推理和微调Whisper,用于自动语音识别(ASR) 。该项目还提供了一个CLI(命令行界面),可以在终端上进行100多种语言的数据翻译和转录 。 10 AI语音识别-音转文# AI开源项目# AI编程
OpenVoiceOS OpenVoiceOS 是一个社区支持的 Linux 发行版,专门用于展示开源语音 AI 在各种设备上的强大功能 。它基于 Raspberry Pi,旨在为智能家居和机器人控制提供语音控制能力 。OpenVoiceOS 提供了详细的安装、配置和使用说明,包括如何在 Raspberry Pi 上安装和配置系统、训练自己的语音助手以及添加语音控制功能等。此外,OpenVoiceOS 还提供了一个基于云的语音识别服务,用户可以使用该服务来处理和识别来自语音助手的请求。该系统支持多种语言,包括英语、法语、西班牙语、葡萄牙语、德语等。总之,OpenVoiceOS 是一个实用的工具,可帮助用户将语音控制添加到他们的项目中,无论是构建智能家居还是机器人,都可以实现更好的交互和控制 。 10 AI语音识别-音转文# AI开源项目# AI编程
MyShell MyShell 是一个去中心化的AI Agent生成平台,用于发现、创建和托管AI Agent智能体机器人。借助自主研发的自动语音识别(ASR)和文本转语音(TTS)能力模型,只需几秒钟即可将您的想法转化为 AI Agent智能体机器人。 10 AI语音识别-音转文# Agent工具# Agent智能体# AI 聊天问答
TTS-Voice-Wizard TTS语音向导是一种工具,允许用户通过微软Azure语音识别和TTS将语音转换为文本,然后再转换回语音 10 AI语音识别-音转文# 文本转语音# 语音生成# 语音转文本
字幕组机翻小助手软件版 解决2个问题: (备注:如果你对字幕质量要求很高,想要信达雅,最好还是雇人翻译。机器翻译的准确度区间 50%~85%) 软件分为两个版本: 重要说明:专业版的”无上限”指的是软件本身不做任何使用量的限制(免费版会做限制,参考上一段说明) “无上限”和服务商没有任何关系,”无上限”不等于免费, 服务商该怎么计费还是怎么计费,服务商怎么收费不会受到软件是”免费版”还是”专业版”的影响。 举个实际例子,阿里云的语音转文字服务,每天的免费额度是2小时(有效期3个月) 假设你连续5天,每天都把2小时的免费额度用完, 那么在第6天,虽然阿里云的免费额度还有,但是软件的免费版10小时已经到了,就会提示无法继续使用了。 除非等到下个月1号重置,或者随便买一个专业版(比如7天的专业版) 就可以继续使用了。 查看表格: 免费额度和价格 说明:所有语音转文字服务商都支持”任务历史”功能, 意思是只要文件成功传给服务商,服务商开始处理了,那么就可以关掉软件,不需要一直开着。 过一阵子再回来看任务做完没 基本概念: 推荐先申请 百度 ,因为免费额度无限,而且注册流程较快,无需等待人工审核,照着”使用教程”一步步 10 AI语音识别-音转文# AI加字幕/AI字幕翻译# AI视频工具
讯飞听见 讯飞听见依托科大讯飞的语音识别技术,打造智慧办公服务平台,提供语音转文字、录音转文字、视频会议、视频转文字、视频加字幕、同声翻译、语音翻译等服务,可满足多样化的语音转文字需求,致力于提高办公效率。 10 AI语音识别-音转文# AI会议工具# AI办公工具# AI语音转文字
33字幕 AI字幕工具,支持英语、日语、韩语、法语、西班牙语、意大利语、葡萄牙语、德语、中文等20多种不同国家语言,ChatGPT生成台词摘要,给视频自动加字幕,高精度AI语音转写模型,语音识别字幕,支持SRT和ASS格式字幕。 10 AI语音识别-音转文# AI加字幕/AI字幕翻译# AI视频工具
FunASR 基础语音识别工具包 FunASR是一个基础语音识别工具包,提供多种功能,包括语音识别(ASR)、语音端点检测(VAD)、标点恢复、语言模型、说话人验证、说话人分离和多人对话语音识别等。FunASR提供了便捷的脚本和教程,支持预训练好的模型的推理与微调 10 AI语音识别-音转文# AI开源项目# AI编程
Buzz:离线开源免费语音转文字(字幕) 翻译站点 Whisper 是一种通用语音识别模型。它利用各种大型数据集上的音频进行训练,也是一个多任务模型,可以执行多语言语音识别以及语音翻译和语言识别。 在第一次使用 Buzz 的时候,会下载 Whisper 的模型,根据不同的质量要求,模型尺寸也非常可观: Whisper模型存储在~/.cache/wilsper中。 Whisper.cpp模型存储在~/Library/Caches/Buzz(Mac OS)、~/.cache/Buzz(Unix)或C:Users<username>AppDataLocalBuzzBuzzcache(Windows)中。 Hugging 模型存储在~/.cache/huggingface/hub中。 https://github.com/chidiwilliams/buzz 10 AI语音识别-音转文# AI开源项目# AI编程# AI语音转文字
CapsWriter-Offline 语音输入 字幕转录工具 这是 CapsWriter-Offline ,一个 PC 端的语音输入、字幕转录工具。 两个功能: 视频教程: CapsWriter-Offline 电脑端离线语音输入工具 对 Windows 端: 其它系统: 模型说明: 下载地址: (百度网盘容易掉链接,补链接太麻烦了,我不一定会补链接。GitHub Releases 界面下载是最可靠的。) 10 AI语音识别-音转文# AI加字幕/AI字幕翻译# AI开源项目# AI视频工具
Notta Notta是语音转文本工具,能将音频和视频内容实时转录成文字,支持多达 58 种语言。工具自动生成会议摘要、提取关键信息和行动项,将重要内容剪辑成片段分享给团队成员。 10 AI语音识别-音转文# AI音频工具
飞书妙记 飞书妙记是飞书旗下的一款智能会议纪要工具,专注于音视频转文字功能,旨在提升会议、培训、访谈等场景中的效率与便捷性。飞书妙记提供实时语音转文字、智能摘要、多语言翻译、关键词提取以及互动功能等,能够将音视频内容快速转化为可编辑的文档,显著提升了会议记录的效率和质量。飞书妙记集成于飞书平台,包括网页版和App版,每天登录可赠送2小时的免费转录时长。 10 AI语音识别-音转文# AI 办公学习# 工作效率# 语音生成