Koko AI

Koko AI

Koko AI是由Seele公司推出的一款结合AI和3D技术的情感陪伴产品,可以为用户提供沉浸式的社交和娱乐体验。Koko AI核心功能包括AI生成的3D角色、AI动画表演、语音聊天以及用户可自定义的AI角色创建,用户可以自由设计 AI 角色的外观、声音和性格。Koko AI支持多种动漫角色选择,用户可以通过文字或语音与Koko AI动漫角色进行互动,并提供情感表达和动画表演,增强互动的真实感。
10
Noiz AI

Noiz AI

Noiz AI是一家专注于AI语音合成、声音克隆与多语言音频处理的技术公司,为用户提供自然流畅、富有表现力的智能语音合成服务。Noiz AI依托自主研发的大规模语音模型,在成本效益、生成效率和个性化服务方面具有行业优势,提供从即时生成到专业级音色定制的多样化解决方案。Noiz AI应用场景包括文本转语音(TTS)、音色定制、多媒体配音及跨语言音视频翻译。
10
千鹿Pr助手

千鹿Pr助手

「千鹿Pr助手」是一款基于Adobe Premiere Pro(简称Pr)开发的AI智能插件,它将强大易用的AI功能、丰富多样的剪辑素材,无缝融入Pr用户的创作流程,帮助Pr用户简化剪辑操作、节省创作时间,提升Pr用户剪辑创作体验。「千鹿Pr助手」支持一键语音识别字幕、AI配音、声音克隆等功能,内置丰富的贴纸、特效、转场、滤镜、字幕模板等素材,可以适用于多种Pr剪辑创作场景。
10
超级椰子 Super Coco

超级椰子 Super Coco

超级椰子(Super Coco)是一款专为Mac用户设计的AI语音输入法助手工具,由即刻旗下团队打造。超级椰子深度集成了AI大语言模型与系统级语音识别技术,主打 「语音输入+AI 处理+全局操作」一体化,用户只需通过语音指令,即可实现文本润色、即时翻译、自动化办公及本地化操作,无需在多个软件之间切换,解决传统键盘输入效率瓶颈。超级椰子目前仅支持MacOS版,基础功能可以免费使用,部分高级功能需云端联网运行。
10
AstronClaw

AstronClaw

AstronClaw是科大讯飞推出的一款基于OpenClaw(业内称为“龙虾”)架构的AI智能体,为企业和个人用户提供零门槛、安全运行的AI助手工具。AstronClaw结合了讯飞在语音、翻译、OCR 等领域的技术优势,将 OpenClaw的“养虾”能力进行本土化包装,提供“云端一键部署、沙箱隔离运行、主流IM全面接入、10000+Skills、多模型自由切换”等核心AI能力。AstronClaw主打零门槛部署和沙箱隔离运行,无需编写代码或配置复杂环境,点击“立即部署”即可在云端极速启动,网页端即开即用。
10
SenseAudio

SenseAudio

SenseAudio是商汤科技推出的专业AI语音生成和开放平台,提供高拟真语音合成、声音克隆、人声分离及多语种识别转写等能力。拥有70+专业音色,支持情感调节与高保真输出,可生成自然流畅、贴近真人的语音;仅需3-30秒音频即可完成声音克隆,精准复刻专属音色。支持20+语种语音识别转写,适配全球化需求。SenseAudio提供便捷API接口,支持毫秒级流式播报与万字长文本合成,可快速集成至各类应用。
10
呦呦有声

呦呦有声

「呦呦有声」是一款AI驱动的一站式有声书全流程制作工具,覆盖从文本画本到成品音频的完整链路,专为有声书制作团队打造。「呦呦有声」将有声书制作拆解为 6 大核心环节——画本编辑、在线配音、智能对轨、专业审听、后期处理和项目统筹,并在一个平台上实现全链路闭环协作。无论是个人创作者还是多人剧组团队,都能高效完成有声书从文本到成品的全部制作。
10
StyleTTS 2

StyleTTS 2

一个开源的文本转语音工具,其表现可以媲美Elevenlabs。它具有以下特点: 1. 能够自动生成多种不同的语音风格,无需依赖特定的参考语音。 2. 采用特殊的训练方法,使得生成的语音更加贴近真人的说话方式。 3. 利用扩散模型技术,高效地生成不同风格的语音。 4. 提供对语音的精确控制,包括语速、语调等方面。 5. 在测试中,生成的语音质量接近于真人录音。即使没有特定说话者的样本,也能生成高质量的语音。 StyleTTS 2的工作原理是通过风格扩散和与大型语音语言模型的对抗性训练来实现接近人类水平的TTS合成。这个模型与其前身不同之处在于,它通过扩散模型将风格建模为一个潜在的随机变量,以生成最适合文本的风格,而不需要参考语音。此外,StyleTTS 2采用非自回归架构,它在生成语音时不需要依次预测每个音频样本,而是可以并行生成整个语音序列。这种方法大大提高了语音合成的速度。 StyleTTS 2在多个评估结果方面表现出色: 1. 在多个测试中,StyleTTS 2生成的语音质量非常高,接近或达到了真人录音的水平。这表明了其在模仿人类语音方面的高效能力。 2. 在LJSpeech数据集
10
RealtimeTTS

RealtimeTTS

一个能够将文本实时转换为语音的解决方案。它具有即时反应能力,可以在文本输入的同时立即开始语音合成,无需等待整个文本输入完毕。此外,RealtimeTTS还采用了流式处理技术,可以处理持续不断的文本流,而不仅限于单个、静态的文本块。 该解决方案还采用了先进的算法来精准识别句子的结束点,从而加快了语音合成的开始速度。无论文本是长是短,RealtimeTTS都能保持快速响应,适用于各种长度的文本。此外,它还具有多引擎兼容性,能够与多个语音合成引擎协同工作,例如Azure、Elevenlabs、Coqui XTTS等。 RealtimeTTS还具有很高的可扩展性,它允许添加自定义的文本到语音引擎,提供了更大的灵活性和扩展性。总之,RealtimeTTS是一个非常适合需要实时语音反馈的应用场景的工具,如交互式教学、游戏、实时翻译或语音助手等。通过即时反应和流式处理技术,它能够提供一个流畅且自然的用户体验。
10