HuggingFace镜像/SenseNova-U1.5-8B-MoT-8bit
模型介绍
文件和版本
分析

SenseNova-U1.5-8B-MoT-8bit

这是 SenseNova-U1.5-8B-MoT 的 Apple Silicon(MLX)权重产物——SenseTime 的统一 T2I + editing + VQA 旗舰模型(NEO-unify Mixture-of-Transformers、pixel-space rectified flow,无 VAE)。

该权重产物是 bf16 checkpoint,两条 Transformer 流均量化为 8-bit(group 64);embeddings、lm_head、norms、vision patchify、FM embedders 和 pixel head 保留高精度(字节占比 <3%)。 量化:group size 64,8-bit(config.json 中按 MLX 约定的 quantization 块)。

运行时: sensenova-u1-swift(MLX-Swift)。权重按运行时的 key layout 存储(NHWC convs;量化 linears 以 weight/scales/biases 形式存储),加载时零转换临时开销——峰值加载内存 ≈ 常驻内存。

性能(M5 Max)

峰值 22.9 GB · 1024² ≈ 7.4 s(8 步,cfg 4)

适用场景: 省内存的质量档位——8-bit 在固定随机种子下可复现 bf16 图像(cos 0.998,33 dB):50 步 T2I、editing、VQA 与 think mode 均可在 23 GB 内完成。

快速开始

git clone https://github.com/xocialize/sensenova-u1-swift && cd sensenova-u1-swift && swift build -c release
hf download mlx-community/SenseNova-U1.5-8B-MoT-8bit --local-dir SenseNova-U1.5-8B-MoT-8bit
.build/release/sensenova-cli --weights SenseNova-U1.5-8B-MoT-8bit \
  --prompt "A cinematic mountain lake at sunrise, realistic photography." \
  --width 1024 --height 1024 --steps 50 --cfg 4.0 --out out.npy

运行时还支持指令编辑(--edit-image)、VQA(--vqa)以及 think 推理模式(--think)——完整功能范围和一致性报告见仓库 README(组件一致性 < 1e-4;相对参考 PyTorch 实现的端到端逐轮余弦相似度 ≥0.999)。

来源与许可

  • 上游: sensenova/SenseNova-U1.5-8B-MoT @ 07d76f6,Apache-2.0,来自 SenseTime / SenseNova — 论文 · 参考实现。
  • 本仓库是上游检查点的格式转换(bf16 转换 + 8-bit group-64 量化),在同一 Apache-2.0 许可证下再分发,相关修改已在此处说明。模型贡献均归属于 SenseNova 团队。
  • tokenizer.json 由上游 vocab.json/merges.txt 生成(分词结果逐字节一致,并已根据参考 ids 验证)。