HuggingFace镜像/pony-v7-base
模型介绍文件和版本分析

Pony V7

Pony V7

Pony V7 是一款基于 AuraFlow 架构的多用途角色生成模型。它支持多种风格和物种类型(人形、拟人、野性等),并能通过自然语言提示处理角色互动。

Fictional

首先,让我介绍 Fictional——我们的多模态平台,在这里 AI 角色通过文本、图像、语音(不久后还将支持视频)变得栩栩如生。Fictional 由 PonyV7、V6、Chroma、Seedream 4 以及其他先进模型提供支持,让你能够发现、创建并与那些拥有自己生活和故事的角色互动。

Fictional 也是我们能够开发出 V7 这类模型的基础,因此,如果你对多模态 AI 角色的未来感到兴奋,请在 iOS 或 Android 设备上下载 Fictional,帮助我们塑造未来!

  • iOS:https://apps.apple.com/us/app/fictional/id6739802573
  • Android:https://play.google.com/store/apps/details?id=ai.fictional.app

与我们取得联系

如果你对 Fictional 和 Pony 模型有任何疑问,请加入 我们的 Discord 服务器。

重要模型信息

请查看 本文,了解我们为何花了这么长时间才发布 V7 以及即将推出的模型版本相关信息。

重要 HuggingFace 链接

  • GGUF 模型 - 量化模型,降低显存占用(推荐 Q8_0 以获得最佳质量/大小平衡)
  • Safetensor 模型 - 单文件 safetensors 格式,便于加载
  • LoRA 训练 - 使用 SimpleTuner 训练 LoRA 的信息和工具
  • 工作流 - 用于标准和 GGUF 推理的 ComfyUI 工作流示例
  • ComfyUI 节点 - 用于 GPU/CPU 噪声选择的自定义 PonyNoise 节点

模型提示词

该模型支持多种风格和美学,但提供了一个预设的默认提示词模板:

special tags, factual description of image, stylistic description of image, additional content tags

特殊标签

score_X、style_cluster_x、source_X - 注意:V7 的提示词功能可能存在不一致性,详情请参阅相关文章,我们正在开发 V7.1 以解决此问题。

图像事实描述

对图像中所描绘内容的描述,不包含任何风格指示。两条建议:

  1. 在进入细节描述之前,先用一个短语概括图像中你想要的内容

  2. 提及角色时,请使用以下格式:<物种> <性别> <名称> from <来源>

例如“Anthro bunny female Lola Bunny from Space Jam”。

此模型能够识别许多热门及小众的角色和系列。

图像风格描述

关于图像媒介、拍摄类型、光线等的任何信息(更多信息将在字幕 Colab 中提供)。

标签

V7 是在自然语言提示词和标签相结合的基础上训练的,能够理解两者,因此在大多数情况下,使用正常语言描述预期结果即可,不过你也可以在主要提示词后添加一些标签以增强效果。

字幕 Colab

为了更好地理解 V7 的提示词使用方法,我们发布了一个字幕 Colab,其中包含了用于 V7 字幕生成的所有模型。

支持的推理设置

V7 支持 768px 至 1536px 范围内的分辨率。建议在推理过程中使用更高的分辨率,并至少进行 30 步。

与 V6 相比的亮点

  • 更强的提示词理解能力,尤其是在空间信息和多角色方面
  • 更强的背景支持 - 无论是背景生成还是角色与背景的结合使用
  • 开箱即支持更强的真实感表现
  • 能够生成极暗和极亮的图像
  • 分辨率最高可达 1536x1536 像素
  • 扩展了角色识别范围(部分 V6 角色的识别度可能降低,但总体而言,我们极大地扩展了知识库)

特别感谢

  • Iceman 帮助获取必要的训练资源
  • Simo Ryu 以及 FAL.ai 团队的其他成员,感谢他们创建了 AuraFlow 并提供了情感支持
  • Runpod 提供字幕计算支持
  • Piclumen 作为我们的合作伙伴
  • City96 帮助提供 GGUF 支持
  • diffusers 团队支持 AuraFlow 的集成工作
  • PSAI Server 订阅者支持项目成本
  • PSAI Server 版主保持警惕并管理社区
  • 许多选择匿名但对 V7 的完成起到关键帮助的支持者

技术细节

该模型在约1000万张经过美学排序的图像上进行了训练,这些图像选自超过3000万张图像的超集,其中动漫/卡通/兽人/小马数据集的比例约为1:1,安全/可疑/露骨内容评级的比例也约为1:1。所有图像均已进行标记,并配有高质量的详细描述。

所有图像均结合其描述和标签用于训练。艺术家姓名已被移除,源数据已根据我们的“选择加入/选择退出”计划进行筛选。任何不当的露骨内容均已过滤。

局限性

  • 此模型不支持文本生成,与基础AuraFlow模型相比,其文本生成能力有所下降。
  • 特殊标签(包括质量标签)的性能较V6版本有明显减弱,这意味着在某些提示词中,score_9不一定能产生更好的结果。我们正在开发V7.1版本以改进此问题。
  • 根据艺术风格的不同,小细节,尤其是面部,可能会显著失真,这是由于VAE版本过时以及训练数据不足造成的,我们正努力在V7.1中改进这一点。

LoRA训练

我们建议使用SimpleTuner进行LoRA训练,具体可遵循本指南。

有关如何将SimpleTuner LoRA转换为diffusers/ComfyUI兼容格式的信息,请参见LoRA文件夹。此外,还提供了一个LoRA工作流示例。

商业API

我们通过独家合作伙伴FAL.ai提供商业API。

许可证

本模型采用Pony License许可证。

简而言之,您可以将此模型及其输出用于商业用途,但以下情况除外:提供推理服务或应用程序、公司收入超过100万、或用于专业视频制作。如果您使用第一方商业API,则不受这些限制。

如果您想将此模型用于商业用途,请通过contact@purplesmart.ai与我们联系。

CivitAi和Hugging Face已获得商业推理的明确许可。