OneThingAI OneThingAI是什么 OneThingAI是由网心科技推出的一站式AI算力云平台,旨在为开发者、企业和AI创作者提供高效、灵活且经济实惠的GPU算力资源和AI应用生态。该平台支持多种业务场景,包括AI训练与推理、科学计算、图形图像处理、视频编解码等,满足从个人创作到企业级应用的多样化需求。 10 AI图像处理# AI开发平台
Wan Wan是阿里万相推出的AI视频生成模型,支持文生视频、图生视频、视频编辑和动态内容生成。Wan适用于广告创意、电商视频、影视内容和短视频制作等场景,可用于根据文本或图片生成具有连续画面的AI视频内容。 810 AI图像生成# AI图像工具# AI视频工具# 插画生成
QAnything QAnything ( Q uestion and A nswer based on Anything ) 是致力于支持任意格式文件或数据库的本地知识库问答系统,可断网安装使用。 您的任何格式的本地文件都可以往里扔,即可获得准确、快速、靠谱的问答体验。 目前已支持格式: PDF , Word(doc/docx) , PPT , Markdown , Eml , TXT , 图片(jpg,png等) , 网页链接 ,更多格式,敬请期待… QAnything官网: https://qanything.ai/ 开源GitHub: https://github.com/netease-youdao/QAnything 20 AI图像工具# AI开源项目# AI知识库问答# AI编程
pdf2htmlEX 一个用于将PDF文件转换为HTML格式的开源工具。它是由coolwanglu在GitHub上开发和维护的。这个工具的主要功能是将PDF文件中的文本、图像、表格等内容提取出来,并将其转换为可以在网页浏览器中显示的HTML格式。 pdf2htmlEX支持多种操作系统,包括Windows、Linux和macOS。它具有简单易用的界面,用户只需通过简单的命令行操作即可完成PDF到HTML的转换。此外,pdf2htmlEX还提供了一些高级功能,如自定义输出样式、设置转换参数等,以满足不同用户的需求。 20 AI图像工具# AI开源项目# AI编程
AudioGPT 这是一个借助大语言模型(LLM)处理音频的工具,可以: – 生成音乐 – 背景音效 – 音频生成字幕 – 文字生成音频 – 文字生成音频并模拟声音 – 根据图片生成音频 – 对音频进行inpaint(局部屏蔽) – 根据音频和人脸照片合成视频 – 检测音频中的事件,以及开始和结束时间 – 单声道变双声道 – 通过文本描述检测特定声音发生的时间 – 抽取某种声音 – 去除背景噪音 多人混合声分离出单人声音 语音翻译 http://github.com/AIGC-Audio/AudioGPT 演示:https://huggingface.co/spaces/AIGC-Audio/AudioGPT 论文:https://arxiv.org/abs/2304.12995 20 AI图像生成# AI开源项目# AI编程
3D to Photo 3D to Photo聚焦面向人工智能创作与应用的在线工具,适合创作者、开发者和需要提升效率的用户使用。,官网域名为github.com。,涉及AI开源项目、AI编程适合需要相关工具与资源的个人用户、创作者或团队使用,可从官网了解最新功能、使用方式和服务条款。 210 AI图像工具# AI开源项目# AI编程
WeChat-AIChatbot WeChat-AIChatbot聚焦面向人工智能创作与应用的在线工具,适合创作者、开发者和需要提升效率的用户使用。,官网域名为github.com。,涉及AI开源项目、AI编程适合需要相关工具与资源的个人用户、创作者或团队使用,可从官网了解最新功能、使用方式和服务条款。 20 AI图像工具# AI开源项目# AI编程
LLaVA LLaVA是一个大型多模态模型,旨在实现通用视觉和语言理解。它端到端训练,可以理解文本和图像,并在聊天中灵活运用这些信息。LLaVA在多模态指令跟随数据集上与GPT-4表现相似,相对分数达到85.1%。在Science QA上,其准确率达到92.53%。LLaVA模型将预训练的视觉编码器(CLIP ViT-L/14)与大型语言模型(Vicuna)通过简单投影矩阵连接。训练分为两个阶段:阶段1只更新投影矩阵,基于CC3M子集进行特征对齐预训练;阶段2更新投影矩阵和大型语言模型进行端到端微调,适应日常用户导向应用和科学问答场景。 10 AI图像工具# AI开源项目# AI编程
sd-webui-faceswaplab sd-webui-faceswaplab是一个扩展功能强大的面部替换工具,其功能特点如下: 多功能面部替换:sd-webui-faceswaplab可以进行多个面部的替换操作,使用户能够对多个人脸进行替换,实现不同面部的互换。 修复涂鸦:该工具还具有修复功能,可以对图像中的涂鸦进行修复,使图像看起来更加干净和自然。 检查点功能:sd-webui-faceswaplab支持检查点功能,用户可以在进行面部替换操作时保存检查点,方便随时恢复和继续进行操作。 开源许可证:该工具使用AGPL-3.0许可证,这意味着它是开源的,用户可以自由地使用、修改和分发该工具的源代码。 10 AI图像工具# AI开源项目# AI编程
Shutter Encoder Shutter Encoder是一款视频、音频和图像转换软件,基于FFmpeg和其他优秀工具设计,旨在尽可能方便和高效。它被视频编辑人员设计,目标是尽可能方便和高效。Shutter Encoder支持几乎所有你听过的编解码器,以及许多你没听过的编解码器。 Shutter Encoder提供了一系列功能,包括: 你可以在Shutter Encoder的官方网站https://www.shutterencoder.com/en/上下载该软件。根据你的操作系统选择相应的版本进行下载,比如Windows系统的INSTALL VERSION和PORTABLE VERSION,它们的区别在于一个需要安装,一个解压后就可以使用。 在使用过程中,如果发现软件启动时进度条卡住不动,可以检查路径是否含有中文字符。此外,为了获得最佳性能,建议开启底部的GPU解码,如果使用的是Nvidia显卡,可以选择cuda进行解码。 10 AI图像工具# AI开源项目# AI编程
Video-LLaVA 一个基于深度学习的视频超分辨率(SR)和视频增强(VE)框架,由北京大学元培学院的研究团队开发。该框架旨在提高低分辨率视频的质量和视觉效果,使其更接近高分辨率视频。Video-LLaVA 采用了多尺度融合、残差学习、自适应注意力机制等技术,以提高视频超分辨率和视频增强的性能。 主要特点: 1. 多尺度融合:通过在不同尺度上进行特征融合,提高了模型对细节和全局信息的捕捉能力。 2. 残差学习:引入残差连接,使网络能够更好地学习输入和输出之间的映射关系。 3. 自适应注意力机制:根据输入视频的特点,自动调整注意力权重,使模型能够关注到更重要的区域。 4. 端到端训练:整个框架可以作为一个整体进行端到端训练,简化了模型的训练过程。 5. 支持多种视频格式:Video-LLaVA 支持多种常见的视频格式,如 YUV、RGB 等。 10 AI无损放大# AI开源项目# AI编程
pulse pulse 是一个基于隐式空间的图像超分辨率算法。该算法的作者来自杜克大学。图像超分辨率任务的目标是将低分辨率图像转换为对应的高分辨率图像。 PULSE 算法利用生成式对抗网络(GAN)和自动编码器(AE)进行图像重建,通过学习隐式空间中的图像表示,实现高分辨率图像的生成。它具有去除图片上马赛克的功能,并且可以用于图像超分辨率任务。 具体的使用方法可以参考该项目的说明文档。使用 PULSE 进行图像去马赛克或超分辨率处理的过程需要运行 run.py 文件,并提供相应的参数。在该文件中可以找到所需参数的具体描述和使用指南。 值得注意的是,PULSE 算法曾因其生成的高分辨率图像可能存在种族偏见的问题而受到一些争议。 10 AI无损放大# AI开源项目# AI编程
Astria 一个定制化的人工智能图片生成工具。 它可以让您用文本描述来生成您想要的图片,无论是视频制作、产品展示还是概念艺术。您可以使用它提供的数千个开源模型,或者用自己的图片数据集来训练一个专属的模型。您还可以使用增强按钮功能来调整和优化生成的图片。 10 AI图像生成# AI应用接口API# AI编程
GPT4Tools GPT4Tools是一个可以控制多个视觉基础模型的集中式系统。它基于Vicuna(LLaMA),并71K自建指令数据。通过分析语言内容,GPT4Tools能够自动决定、控制和利用不同的视觉基础模型,允许用户在对话过程中与图像进行交互。通过这种方法,GPT4Tools提供了一个无缝高效的解决方案,以满足对话中各种与图像相关的需求。与以前的工作不同,我们支持用户通过自学指令和LoRA教授自己的LLM使用具有简单细化的工具。 10 AI图像工具# AI开源项目# AI编程
Final2x Final2x 是由 Tohrusky 开发的一款图像超分辨率技术,它可以以更高的分辨率和质量重构图像。 功能特点: 1)可以快速实现显著的图像改善; 2)可以有效地消除毛刺和噪点; 3)可以提高图像的质量; 4)可以有效地提升对比度。 10 AI无损放大# AI开源项目# AI编程