PhotoMaker 翻译站点

PhotoMaker 翻译站点

PhotoMaker,利用多张照片作为身份ID,获取人物特征,然后根据描述生成符合描述的人物照片创造出一个新的、个性化的人物图像。 PhotoMaker也能把几个不同人的照片特征混合在一起,创造出一个全新的人物形象。还能改变照片人物的性别、年龄和生成多种风格的其他照片。快速逼真,效果自然。 PhotoMaker主要功能: PhotoMaker主要特点: PhotoMaker如何工作? PhotoMaker首先分析照片,识别出每张照片中人物的特征,比如面部特征、发型、服装风格等。然后,它将这些特征结合起来,创建一个新的图像。这个图像基本上是你的脸,但可能有着电影明星的发型和表情,同时穿着那张历史服装照片中的服装。 最终的结果是一张全新的照片,这张照片展示了一个独特的人物形象:看起来像你,但具有其他照片中人物的特征和风格。这就是PhotoMaker的核心功能——结合多个不同照片的特征,创造出一个全新、个性化的图像。 源码:https://github.com/TencentARC/PhotoMaker
10
LibreChat 翻译站点

LibreChat 翻译站点

LibreChat,一个增强版的ChatGPT程序,一个免费开源的聊天机器人平台,集成了多种 ai 模型,例如 ChatGPT、OpenAI、BingAI、PaLM 2 等。 LibreChat 允许您与不同的 AI 进行自然且引人入胜的对话,并使用各种功能和插件定制您的体验。LibreChat还集成并增强了原始客户端功能,例如对话和消息搜索、提示模板和插件。 项目地址: https://github.com/danny-avila/LibreChat 官方GitHub:https://librechat.ai 文档: https://docs.librechat.ai
10
Buzz:离线开源免费语音转文字(字幕) 翻译站点

Buzz:离线开源免费语音转文字(字幕) 翻译站点

Whisper 是一种通用语音识别模型。它利用各种大型数据集上的音频进行训练,也是一个多任务模型,可以执行多语言语音识别以及语音翻译和语言识别。 在第一次使用 Buzz 的时候,会下载 Whisper 的模型,根据不同的质量要求,模型尺寸也非常可观: Whisper模型存储在~/.cache/wilsper中。 Whisper.cpp模型存储在~/Library/Caches/Buzz(Mac OS)、~/.cache/Buzz(Unix)或C:Users<username>AppDataLocalBuzzBuzzcache(Windows)中。 Hugging 模型存储在~/.cache/huggingface/hub中。 https://github.com/chidiwilliams/buzz
10
Suno 非官方的API接口 翻译站点

Suno 非官方的API接口 翻译站点

这是一个基于 Python 和 FastAPI 的非官方 Suno API。它目前支持生成歌曲、歌词等。 它带有内置的令牌维护和保持活动功能,因此您不必担心令牌过期。 https://github.com/SunoAI-API/Suno-API —————————————————————— 使用 API 调用 suno.ai 的音乐生成 AI,并轻松集成到 GPT 等代理中。 https://github.com/gcui-art/suno-api
10
LabelU 开源标注工具

LabelU 开源标注工具

1.产品介绍 一款轻量级开源标注工具,自由组合多样工具,无缝兼容多格式数据,同时支持载入预标注,加速数据标注效率 2.特色功能 LabelU 提供了多种标注工具和功能,支持图像、视频、音频标注。 · 图像类:多功能图像处理工具,涵盖 2D 框、语义分割、多段线、关键点等多种标注工具,协助完成图像的标识、注释和分析。 · 视频类:具备强大视频处理能力,可实现视频分割、视频分类、视频信息提取等功能,为模型训练提供优质标注数据。 · 音频类:高效精准的音频分析工具,可实现音频分割、音频分类、音频信息提取等功能,将复杂的声音信息直观可视化。 3.产品特性 · 简易,提供多种图像标注工具,通过简单可视化配置即可标注 · 灵活,多种工具可自由组合使用,满足大部分图像,视频,音频的标注需求 · 通用,支持导出多种数据格式,包括 JSON,COCO,MASK
10