StyleDrop Google Research的一篇研究,介绍了StyleDrop:通过参考图片,使用文本生成图像,风格符合参考图像。效果好于DreamBooth、Imagen和Stable Diffusion的textual inversion方法。 项目地址: https://styledrop.github.io/ 论文: https://arxiv.org/abs/2306.00983 10 AI文案工具# AI开源项目# AI编程
商汤日日新 商汤科技推出的”商汤日日新”大模型体系涵盖自然语言生成、文字生成图片、感知模型标注和模型研发等功能。该公司以”大模型+大算力”作为通用人工智能领域的发展战略,推出了多种大模型和能力,包括自然语言处理、内容生成、自动化数据标注和自定义模型训练。 10 AI大模型# AI应用接口API# AI编程
CoDeF CoDeF通过将静态内容与时间变形结合,为视频处理提供了新的视角和工具。这种方法能够提高视频编辑和分析的效率,并具有潜力影响电影制作到虚拟现实等领域。CoDeF将视频分为规范内容字段和时间变形字段,能够精确分析和处理每一帧的内容。它还可以跟踪和分析视频中的复杂运动,实现卓越的跨帧一致性。CoDeF具有灵活性和高效性,可以应用于多种视频处理任务。 该项目由蚂蚁集团、香港科技大学和浙江大学团队共同创建。 10 AI视频工具# AI开源项目# AI编程
ComfyUI Portrait Master ComfyUI Portrait Master 肖像大师 简体中文版是一款专业的人物肖像提示词生成工具。它专注于优化肖像生成,让选择比填空更适合人类的操作方式。这款工具可以根据用户的具体需求,生成各种肖像的提示词,覆盖镜头类型、性别、国籍、面部表情、发型等多个参数。用户可以根据自己的需求进行个性化设置,例如调整发型、表情等。此外,此工具适用于多种工作流程,广泛应用于视频制作和设计等领域。目前最新版本为2.2,经过优化和汉化处理,ComfyUI Portrait Master项目为使用者提供了更加便捷的使用体验。如果你对此感兴趣,可以到项目官网学习使用方法,网上也有详细的教程可供参考。 使用参考:https://zhuanlan.zhihu.com/p/663008600 10 AI提示指令# AI开源项目# AI编程
pyvideotrans 一个功能强大且易于使用的视频翻译和配音工具,适用于需要翻译视频或为视频添加不同语言配音的人们。它的开源性质和灵活性使得用户能够根据自己的需求进行自定义和改进。 功能点: 1. 视频翻译:pyvideotrans 允许用户将一种语言的视频翻译成另一种语言。通过使用该项目,你可以轻松地转换视频的语言,使得观众能够更好地理解视频内容。 2. 配音:除了视频翻译外,pyvideotrans 还可以添加配音。你可以选择一种语言作为原始音频,然后用另一种语言的音频来替换它。这对于将视频转换成多种语言版本或为特定目标受众添加配音非常有用。 3. MIT许可证:pyvideotrans 采用了MIT许可证,这意味着用户可以免费使用、修改和分发该项目。这种开放的授权方式使得pyvideotrans 在用户和开发者之间建立了更好的互动和合作环境。 10 AI视频工具# AI开源项目# AI编程
Background Removal Background Removal 是一个强大的 npm 包,它提供了一个在线浏览器中使用的抠图脚本。该脚本基于 ONNX 模型,并通过使用 WebAssembly 在浏览器上运行。 10 AI图片背景移除# AI开源项目# AI编程
InsightFace InsightFace是一个开源的2D和3D深度人脸分析库。 功能特点: 面部识别:InsightFace实现了最先进的面部识别算法,可以高效准确地进行人脸识别。它在CVPR 2019上被接受为最先进的面部识别方法。 面部检测:该库提供了RetinaFace,这是一种最先进的多任务面部检测方法。它在CVPR 2020上被接受,并能在复杂场景下实现高准确率的面部检测。 面部对齐:InsightFace提供了SDUNet和CoordinateReg等面部对齐方法。这些算法能够对面部进行准确的对齐,保证了后续处理的准确性。 易于使用和部署:InsightFace是一个易于使用的Python库,提供了方便的API接口,使得研究机构和商业组织可以轻松地使用和部署该库中的算法。 开源:InsightFace是开源的,用户可以自由地查看和修改源代码,以满足自己的需求。 强大的性能:InsightFace在多个面部分析挑战中取得了优异的成绩,包括在ECCV 2022 WCPA Challenge中获得第一名,在NIST-FRVT 1:1 VISA中获得第一名,在NIST-FRVT 1:1中排名第四。 10 AI开放平台# AI开源项目# AI编程
Wunjo 一个高级语音和Deepfake神经网络工具。功能: * 可以合成和克隆英语、俄语和中文的声音,同时支持实时语音识别。 * 能深度伪造面部和嘴唇动画,并使用一张照片进行人脸交换。 * 通过文本提示改变视频,进行分割和修饰。 * 具有语音合成、声音克隆、实时语音识别、多对话创建、视频到视频转换、深度伪造动画、AI修饰工具、自动分割掩码等功能。 * 支持英语、俄语、中文和西班牙语等多种语言。 * 适用于初学者和专业人士。 * 保护用户隐私。 * 应用于广告配音、游戏角色配音、有声书朗读和深度伪造项目等应用场景。 * 需要Python 3.10和ffmpeg作为运行环境。 * 由Wladislav Radchenko进行开发和维护。 10 AI声音克隆# AI开源项目# AI编程
LobeChat 一个开源、可扩展的高性能聊天机器人框架,支持一键部署私有ChatGPT/LLM Web应用程序。它具有快速部署、精致的UI设计、流畅的对话体验、插件支持和自定义插件开发、隐私保护、可自定义的座席角色、自定义域以及角色市场等特征。 10 AI插件# AI开源项目# AI编程
MidJourney Proxy MidJourney Proxy 是一个开源项目,它可以实现 API 形式的调用 AI 绘图。它的功能特点包括:提供 Discord 频道的代理,支持 API 调用,实现 AI 绘图等。MidJourney Proxy 是免费的,无需任何费用即可使用。 10 AI开放平台# AI开源项目# AI编程
one-api 一个OpenAI接口管理和分发系统,它支持多个不同的人工智能模型,包括Azure、Anthropic Claude、Google PaLM 2、智谱ChatGLM、百度文心一言、讯飞星火认知、阿里通义千问以及360智脑 10 AI开放平台# AI开源项目# AI编程
ChatGPT+Midjourney 一键免费部署私人 ChatGPT+Midjourney 网页应用 支持原ChatGPT-Next-Web所有功能 还额外支持AI绘图、图片放大、识图、 混图、垫图等等功能 10 AI无损放大# AI开源项目# AI编程
HierVST HierVST 是一种分层自适应零样本语音风格转换模型,它具备以下功能特点: 零样本语音风格转换:HierVST 可以在没有目标说话者语音数据的情况下,将一个新的说话者的语音风格转换为目标风格。这意味着即使没有目标说话者的语音样本,HierVST 也可以生成具有目标风格的语音。 分层自适应结构:HierVST 使用分层自适应生成器,逐步生成音高表示和波形音频,从而实现逐步转换语音的能力。这种结构让模型能够适应新的语音风格,并逐步进行转换。 自监督表示学习:HierVST 仅使用语音数据集进行训练,而无需使用文本转录。它采用了层次变分推断和自监督表示学习的方法,提高了模型在音频表示上的性能。 性能优于其他模型:在零样本语音风格转换场景中,HierVST 的实验结果表明其性能优于其他 VST 模型,如 AutoVC、VoiceMixer、DiffVC、Speech Resynthesis 和 YourTTS。 10 AI学习网站# AI开源项目# AI编程