QAnything

QAnything

QAnything ( Q uestion and A nswer based on Anything ) 是致力于支持任意格式文件或数据库的本地知识库问答系统,可断网安装使用。 您的任何格式的本地文件都可以往里扔,即可获得准确、快速、靠谱的问答体验。 目前已支持格式: PDF , Word(doc/docx) , PPT , Markdown , Eml , TXT , 图片(jpg,png等) , 网页链接 ,更多格式,敬请期待… QAnything官网: https://qanything.ai/ 开源GitHub: https://github.com/netease-youdao/QAnything
20
AudioGPT

AudioGPT

这是一个借助大语言模型(LLM)处理音频的工具,可以: – 生成音乐 – 背景音效 – 音频生成字幕 – 文字生成音频 – 文字生成音频并模拟声音 – 根据图片生成音频 – 对音频进行inpaint(局部屏蔽) – 根据音频和人脸照片合成视频 – 检测音频中的事件,以及开始和结束时间 – 单声道变双声道 – 通过文本描述检测特定声音发生的时间 – 抽取某种声音 – 去除背景噪音 多人混合声分离出单人声音 语音翻译 http://github.com/AIGC-Audio/AudioGPT 演示:https://huggingface.co/spaces/AIGC-Audio/AudioGPT 论文:https://arxiv.org/abs/2304.12995
20
pdf2htmlEX

pdf2htmlEX

一个用于将PDF文件转换为HTML格式的开源工具。它是由coolwanglu在GitHub上开发和维护的。这个工具的主要功能是将PDF文件中的文本、图像、表格等内容提取出来,并将其转换为可以在网页浏览器中显示的HTML格式。 pdf2htmlEX支持多种操作系统,包括Windows、Linux和macOS。它具有简单易用的界面,用户只需通过简单的命令行操作即可完成PDF到HTML的转换。此外,pdf2htmlEX还提供了一些高级功能,如自定义输出样式、设置转换参数等,以满足不同用户的需求。
20
Massively Multilingual Speech

Massively Multilingual Speech

Facebook AI推出了一款多语言语音识别模型,它是目前最先进的系统之一,可以同时支持多种语言的语音识别,包括非标准化和口音较重的语音。该模型使用了先进的深度学习技术和自监督学习方法,以更好地利用大量未标记的数据进行训练,并在多项基准测试中取得了最优秀的结果。这一技术的应用可以极大地提高语音识别的准确性和可用性,为用户提供更好的语音交互体验。
20