LLaVA

LLaVA

LLaVA是一个大型多模态模型,旨在实现通用视觉和语言理解。它端到端训练,可以理解文本和图像,并在聊天中灵活运用这些信息。LLaVA在多模态指令跟随数据集上与GPT-4表现相似,相对分数达到85.1%。在Science QA上,其准确率达到92.53%。LLaVA模型将预训练的视觉编码器(CLIP ViT-L/14)与大型语言模型(Vicuna)通过简单投影矩阵连接。训练分为两个阶段:阶段1只更新投影矩阵,基于CC3M子集进行特征对齐预训练;阶段2更新投影矩阵和大型语言模型进行端到端微调,适应日常用户导向应用和科学问答场景。
10
sd-webui-faceswaplab

sd-webui-faceswaplab

sd-webui-faceswaplab是一个扩展功能强大的面部替换工具,其功能特点如下: 多功能面部替换:sd-webui-faceswaplab可以进行多个面部的替换操作,使用户能够对多个人脸进行替换,实现不同面部的互换。 修复涂鸦:该工具还具有修复功能,可以对图像中的涂鸦进行修复,使图像看起来更加干净和自然。 检查点功能:sd-webui-faceswaplab支持检查点功能,用户可以在进行面部替换操作时保存检查点,方便随时恢复和继续进行操作。 开源许可证:该工具使用AGPL-3.0许可证,这意味着它是开源的,用户可以自由地使用、修改和分发该工具的源代码。
10
Shutter Encoder

Shutter Encoder

Shutter Encoder是一款视频、音频和图像转换软件,基于FFmpeg和其他优秀工具设计,旨在尽可能方便和高效。它被视频编辑人员设计,目标是尽可能方便和高效。Shutter Encoder支持几乎所有你听过的编解码器,以及许多你没听过的编解码器。 Shutter Encoder提供了一系列功能,包括: 你可以在Shutter Encoder的官方网站https://www.shutterencoder.com/en/上下载该软件。根据你的操作系统选择相应的版本进行下载,比如Windows系统的INSTALL VERSION和PORTABLE VERSION,它们的区别在于一个需要安装,一个解压后就可以使用。 在使用过程中,如果发现软件启动时进度条卡住不动,可以检查路径是否含有中文字符。此外,为了获得最佳性能,建议开启底部的GPU解码,如果使用的是Nvidia显卡,可以选择cuda进行解码。
10
GPT4Tools

GPT4Tools

GPT4Tools是一个可以控制多个视觉基础模型的集中式系统。它基于Vicuna(LLaMA),并71K自建指令数据。通过分析语言内容,GPT4Tools能够自动决定、控制和利用不同的视觉基础模型,允许用户在对话过程中与图像进行交互。通过这种方法,GPT4Tools提供了一个无缝高效的解决方案,以满足对话中各种与图像相关的需求。与以前的工作不同,我们支持用户通过自学指令和LoRA教授自己的LLM使用具有简单细化的工具。
10
Real-ESRGAN

Real-ESRGAN

一个用于图像和视频修复的应用程序,它使用ESRGAN模型进行训练,该模型使用合成数据进行图像和视频的恢复。它支持各种模型、选项和推理方法,并且提供在线和离线演示、更新和使用指南。 Real-ESRGAN旨在开发实用的通用图像/视频恢复算法,可以恢复各种来源的图像,如动画视频、照片和视频。 Real-ESRGAN ncnn Vulkan是Real-ESRGAN的ncnn实现版本,从realsr-ncnn-vulkan项目中汲取了许多灵感。 在使用Real-ESRGAN进行图像修复时,可以直接下载项目的执行程序进行运行。如果无法下载,可以使用提供的链接进行下载。 此外,Real-ESRGAN项目还提供了详细的使用说明和演示,包括图片测试修复超分和视频测试修复超分的步骤。 总的来说,Real-ESRGAN是一个功能强大的图像/视频修复工具,具有实用性强、操作简便等特点。
10
screenshot-to-code

screenshot-to-code

将屏幕截图转换为清洁的HTML / Tailwind / JS代码。 这是一个使用MIT许可证进行许可的项目,因此,它是免费并且开源的。 功能点如下: 1. 屏幕截图转代码:用户通过输入截图,系统将自动将图像转换为HTML,Tailwind,或JS代码。 2. 开源活动:作为GitHub上的公开项目,任何对此项目感兴趣的开发者都可以查看源代码,对其进行修改,或进行贡献。 3. 自动化工作流程:项目包含一系列自动化的功能,可以帮助用户更有效地转换屏幕截图。 这是一个非常实用的工具,对开发者来说,尤其是前端开发者,它可以极大地提高他们的工作效率。
10
PhotoMaker 翻译站点

PhotoMaker 翻译站点

PhotoMaker,利用多张照片作为身份ID,获取人物特征,然后根据描述生成符合描述的人物照片创造出一个新的、个性化的人物图像。 PhotoMaker也能把几个不同人的照片特征混合在一起,创造出一个全新的人物形象。还能改变照片人物的性别、年龄和生成多种风格的其他照片。快速逼真,效果自然。 PhotoMaker主要功能: PhotoMaker主要特点: PhotoMaker如何工作? PhotoMaker首先分析照片,识别出每张照片中人物的特征,比如面部特征、发型、服装风格等。然后,它将这些特征结合起来,创建一个新的图像。这个图像基本上是你的脸,但可能有着电影明星的发型和表情,同时穿着那张历史服装照片中的服装。 最终的结果是一张全新的照片,这张照片展示了一个独特的人物形象:看起来像你,但具有其他照片中人物的特征和风格。这就是PhotoMaker的核心功能——结合多个不同照片的特征,创造出一个全新、个性化的图像。 源码:https://github.com/TencentARC/PhotoMaker
10