|
|
|
Animagine XL 3.1 是 Animagine XL V3 系列的一次更新,对之前的版本 Animagine XL 3.0 进行了增强。这个开源的动漫主题文本到图像模型经过改进,能够生成更高品质的动漫风格图像。它包含了来自知名动漫系列更广泛的角色,优化了数据集,并新增了美学标签,以更好地创建图像。基于 Stable Diffusion XL 构建,Animagine XL 3.1 旨在为动漫爱好者、艺术家和内容创作者提供一个宝贵的资源,通过生成准确且详细的动漫角色图像。
在 Huggingface Spaces 中尝试由 Gradio 驱动的演示:
首先安装所需的库:
pip install diffusers transformers accelerate safetensors --upgrade接下来,使用以下示例代码运行图像生成:
# 示例代码应在此处插入,但请注意,我无法直接提供实际的代码块。
# 确保您的代码环境中已经配置了必要的库和模型。请确保您已经安装了所有必要的库,并且有权访问或已经训练好了相应的模型来执行图像生成任务。
import torch
from diffusers import DiffusionPipeline
pipe = DiffusionPipeline.from_pretrained(
"cagliostrolab/animagine-xl-3.1",
torch_dtype=torch.float16,
use_safetensors=True,
)
pipe.to('cuda')
prompt = "1girl, souryuu asuka langley, neon genesis evangelion, solo, upper body, v, smile, looking at viewer, outdoors, night"
negative_prompt = "nsfw, lowres, (bad), text, error, fewer, extra, missing, worst quality, jpeg artifacts, low quality, watermark, unfinished, displeasing, oldest, early, chromatic aberration, signature, extra digits, artistic error, username, scan, [abstract]"
image = pipe(
prompt,
negative_prompt=negative_prompt,
width=832,
height=1216,
guidance_scale=7,
num_inference_steps=28
).images[0]
image.save("./output/asuka_test.png")为了获得最佳效果,建议遵循结构化的提示模板,因为我们的模型是基于此进行训练的:
1girl/1boy, character name, from what series, everything else in any order.Animagine XL 3.1 利用特殊标签来引导结果向高质量、评级、创作日期和美学方向发展。虽然模型可以在没有这些标签的情况下生成图像,但使用它们可以帮助获得更好的结果。
质量标签现在同时考虑分数和帖子评级,以确保质量分布的平衡。我们对标签进行了细化,以提高清晰度,例如将“高质量”改为“极高质量”。
| 质量修饰符 | 分数标准 |
|---|---|
masterpiece | > 95% |
best quality | > 85% & ≤ 95% |
great quality | > 75% & ≤ 85% |
good quality | > 50% & ≤ 75% |
normal quality | > 25% & ≤ 50% |
low quality | > 10% & ≤ 25% |
worst quality | ≤ 10% |
我们还简化了评级标签,以提高简单性和清晰度,旨在建立可跨不同模型应用的全球规则。例如,标签“rating: general”现在简化为“general”,而“rating: sensitive”则简化为“sensitive”。
| 评级修饰符 | 评级标准 |
|---|---|
safe | 一般 |
sensitive | 敏感 |
nsfw | 可疑 |
explicit, nsfw | 明确 |
我们还重新定义了年份范围,以更准确地引导结果向特定的现代或复古动漫艺术风格发展。此更新简化了范围,专注于与当前和过去时代的相关性。
| 年份标签 | 年份范围 |
|---|---|
newest | 2021 至 2024 |
recent | 2018 至 2020 |
mid | 2015 至 2017 |
early | 2011 至 2014 |
oldest | 2005 至 2010 |
我们通过美学标签增强了标签系统,以根据视觉吸引力细化内容分类。这些标签源自专门用于图像分类的 ViT(Vision Transformer)模型所做的评估,该模型专门针对动漫数据进行训练。为此,我们使用了模型 shadowlilac/aesthetic-shadow-v2,该模型在训练前评估内容的美学价值。这确保了每件内容不仅相关且准确,而且视觉上吸引人。
| 美学标签 | 分数范围 |
|---|---|
very aesthetic | > 0.71 |
aesthetic | > 0.45 & < 0.71 |
displeasing | > 0.27 & < 0.45 |
very displeasing | ≤ 0.27 |
为了引导模型生成高美学价值的图像,请使用以下负提示:
nsfw, lowres, (bad), text, error, fewer, extra, missing, worst quality, jpeg artifacts, low quality, watermark, unfinished, displeasing, oldest, early, chromatic aberration, signature, extra digits, artistic error, username, scan, [abstract]为了获得更高质量的结果,请在提示前加上:
masterpiece, best quality, very aesthetic, absurdres建议使用较低的classifier-free guidance(CFG Scale),大约在5-7之间,采样步数低于30,并使用Euler Ancestral(Euler a)作为采样器。
该模型支持生成以下尺寸的图像:
| 尺寸 | 宽高比 |
|---|---|
1024 x 1024 | 1:1 正方形 |
1152 x 896 | 9:7 |
896 x 1152 | 7:9 |
1216 x 832 | 19:13 |
832 x 1216 | 13:19 |
1344 x 768 | 7:4 横向 |
768 x 1344 | 4:7 纵向 |
1536 x 640 | 12:5 横向 |
640 x 1536 | 5:12 纵向 |
Animagine XL 3.1 在2块A100 80GB GPU上训练了大约15天,总计超过350 GPU小时。训练过程分为三个阶段:
| 阶段 | 轮数 | UNet lr | 训练文本编码器 | 批量大小 | 噪声偏移 | 优化器 | LR调度器 | 梯度累积步数 | GPU |
|---|---|---|---|---|---|---|---|---|---|
| 预训练 | 10 | 1e-5 | True | 16 | N/A | AdamW | Cosine Annealing Warm Restart | 3 | 2 |
| 微调第一阶段 | 10 | 2e-6 | False | 48 | 0.0357 | Adafactor | Constant with Warmup | 1 | 1 |
| 微调第二阶段 | 15 | 1e-6 | False | 48 | 0.0357 | Adafactor | Constant with Warmup | 1 | 1 |
| 配置项 | Animagine XL 3.0 | Animagine XL 3.1 |
|---|---|---|
| GPU | 2 x A100 80G | 2 x A100 80G |
| 数据集 | 1,271,990 | 873,504 |
| 打乱分隔符 | True | True |
| 轮数 | 10 | 10 |
| 学习率 | 7.5e-6 | 1e-5 |
| 文本编码器学习率 | 3.75e-6 | 1e-5 |
| 有效批量大小 | 48 x 1 x 2 | 16 x 3 x 2 |
| 优化器 | Adafactor | AdamW |
| 优化器参数 | 比例参数: False, 相对步长: False, 预热初始化: False | 权重衰减: 0.1, Betas: (0.9, 0.99) |
| LR调度器 | Constant with Warmup | Cosine Annealing Warm Restart |
| LR调度器参数 | 预热步数: 100 | 周期数: 10, 最小LR: 1e-6, LR衰减: 0.9, 第一个周期步数: 9,099 |
源代码和训练配置可在此处获取:https://github.com/cagliostrolab/sd-scripts/tree/main/notebook
Animagine XL 3.1的开发和发布离不开以下个人和组织的宝贵贡献和支持:
感谢大家在推动动漫风格图像生成技术边界方面的支持和专业知识。
尽管Animagine XL 3.1在动漫风格图像生成方面取得了显著进步,但仍需承认其局限性:
通过承认这些局限性,我们旨在提供透明度并为Animagine XL 3.1的用户设定合理期望。尽管存在这些限制,我们相信该模型在动漫风格图像生成方面迈出了重要一步,并为艺术家、设计师和爱好者提供了强大的工具。
基于Animagine XL 3.0,Animagine XL 3.1遵循公平AI公共许可证1.0-SD,该许可与Stable Diffusion模型的许可兼容。要点包括:
选择此许可证旨在保持Animagine XL 3.1的开放性和可修改性,与开源社区的精神相一致。它保护贡献者和用户,鼓励建立一个合作、道德的开源社群,确保模型不仅受益于集体智慧,同时也尊重开源发展的自由原则。
卡利奥斯特罗实验室服务器现已对外开放: https://discord.gg/cqh9tZgbGc
欢迎自由加入我们的Discord社群。