
Pony V7 是一款基于 AuraFlow 架构的多用途角色生成模型。它支持多种风格和物种类型(人形、拟人、野性等),并能通过自然语言提示处理角色互动。
首先,让我介绍 Fictional——我们的多模态平台,在这里 AI 角色通过文本、图像、语音(不久后还将支持视频)变得栩栩如生。Fictional 由 PonyV7、V6、Chroma、Seedream 4 以及其他先进模型提供支持,让你能够发现、创建并与那些拥有自己生活和故事的角色互动。
Fictional 也是我们能够开发出 V7 这类模型的基础,因此,如果你对多模态 AI 角色的未来感到兴奋,请在 iOS 或 Android 设备上下载 Fictional,帮助我们塑造未来!
如果你对 Fictional 和 Pony 模型有任何疑问,请加入 我们的 Discord 服务器。
请查看 本文,了解我们为何花了这么长时间才发布 V7 以及即将推出的模型版本相关信息。
该模型支持多种风格和美学,但提供了一个预设的默认提示词模板:
special tags, factual description of image, stylistic description of image, additional content tagsscore_X、style_cluster_x、source_X - 注意:V7 的提示词功能可能存在不一致性,详情请参阅相关文章,我们正在开发 V7.1 以解决此问题。
对图像中所描绘内容的描述,不包含任何风格指示。两条建议:
在进入细节描述之前,先用一个短语概括图像中你想要的内容
提及角色时,请使用以下格式:<物种> <性别> <名称> from <来源>
例如“Anthro bunny female Lola Bunny from Space Jam”。
此模型能够识别许多热门及小众的角色和系列。
关于图像媒介、拍摄类型、光线等的任何信息(更多信息将在字幕 Colab 中提供)。
V7 是在自然语言提示词和标签相结合的基础上训练的,能够理解两者,因此在大多数情况下,使用正常语言描述预期结果即可,不过你也可以在主要提示词后添加一些标签以增强效果。
为了更好地理解 V7 的提示词使用方法,我们发布了一个字幕 Colab,其中包含了用于 V7 字幕生成的所有模型。
V7 支持 768px 至 1536px 范围内的分辨率。建议在推理过程中使用更高的分辨率,并至少进行 30 步。
该模型在约1000万张经过美学排序的图像上进行了训练,这些图像选自超过3000万张图像的超集,其中动漫/卡通/兽人/小马数据集的比例约为1:1,安全/可疑/露骨内容评级的比例也约为1:1。所有图像均已进行标记,并配有高质量的详细描述。
所有图像均结合其描述和标签用于训练。艺术家姓名已被移除,源数据已根据我们的“选择加入/选择退出”计划进行筛选。任何不当的露骨内容均已过滤。
score_9不一定能产生更好的结果。我们正在开发V7.1版本以改进此问题。我们建议使用SimpleTuner进行LoRA训练,具体可遵循本指南。
有关如何将SimpleTuner LoRA转换为diffusers/ComfyUI兼容格式的信息,请参见LoRA文件夹。此外,还提供了一个LoRA工作流示例。
我们通过独家合作伙伴FAL.ai提供商业API。
本模型采用Pony License许可证。
简而言之,您可以将此模型及其输出用于商业用途,但以下情况除外:提供推理服务或应用程序、公司收入超过100万、或用于专业视频制作。如果您使用第一方商业API,则不受这些限制。
如果您想将此模型用于商业用途,请通过contact@purplesmart.ai与我们联系。
CivitAi和Hugging Face已获得商业推理的明确许可。