让模型更易用,让创作更自由
模型托管
安全托管,轻松版本化,让模型像代码一样流动





模型/数据集加速
全球分发,瞬间加载,让下载等待成为过去式,专注创新



开发者个人工作台
一站式管理与展示,让 AI 创作更有序、更出彩


模型使用
多样化体验方式,随时随地解锁 AI 能力



社区活动
活力四射的开发者社区,挑战赛、协作项目与开放交流,让创意在共创中走向世界
让模型更易用,让创作更自由
模型托管
安全托管,轻松版本化,让模型像代码一样流动





模型/数据集加速
全球分发,瞬间加载,让下载等待成为过去式,专注创新



开发者个人工作台
一站式管理与展示,让 AI 创作更有序、更出彩


模型使用
多样化体验方式,随时随地解锁 AI 能力



社区活动
活力四射的开发者社区,挑战赛、协作项目与开放交流,让创意在共创中走向世界
发现、分享、部署最先进的AI模型、数据集和应用
GLM-5.2-FP8
可用于长文本处理、代码生成等长序列任务,具备100万token稳定上下文,支持多级别思考力平衡性能与延迟,采用IndexShare架构降低计算量,MIT许可完全开源无地域限制。
MOSS-VL-Realtime
可用于连续视频流的实时处理与交互,支持任意时刻提问并动态生成文本。核心功能包括实时流理解、可中断交互、主动静默及动态修正,采用跨注意力架构与时间戳感知编码,保持256K文本上下文窗口。
Ternary-Bonsai-27B-gguf
可在标准笔记本或单GPU上实现27B级推理,用于文本生成等场景。项目采用三元语言权重,部署 footprint 约7.2GB,保留95% FP16智能,支持CUDA、Metal、CPU,具备262K token上下文和4-bit KV缓存量化。
Bonsai-27B-gguf
可在普通设备上实现 27B 级别推理,用于文本生成、对话等场景。项目采用 1-bit 权重压缩技术,部署大小仅 3.9GB,保留约 90% FP16 性能,支持多平台加速和长上下文处理。
Hy-Embodied-VLM-1.0
可用于构建物理世界中的具身智能体,支持多模态感知、动作推理与长程规划。该模型采用高效混合专家架构,单 token 仅激活约 3B 参数,在 38 项具身基准中 19 项性能领先。














