JoyAI-Image Model Zoo 选型指南:4 种权重版本一键选对,新手不踩坑
【免费下载链接】JoyAI-ImageJoyAI-Image is the unified multimodal foundation model for image understanding, text-to-image generation, and instruction-guided image editing.项目地址: https://gitcode.com/gh_mirrors/jo/JoyAI-Image
JoyAI-Image 是一个统一多模态基础模型,同时覆盖图像理解、文生图生成和指令引导图像编辑三大能力,官方 Model Zoo 提供Und、Edit、Edit-Plus、Edit-Distilled四种权重版本。本文带你用一张对比表 + 分场景建议,快速完成JoyAI-Image 模型权重选型,不再纠结下载哪个。
一分钟快速选型:4 种权重对比总览
| 权重版本 | 定位 | 擅长任务 | 推荐场景 |
|---|---|---|---|
| JoyAI-Image-Und | 多模态理解骨干(8B MLLM) | 空间推理问答、图像描述、编辑前的"看懂" | 只读分析、问答、作为理解模块单独部署 |
| JoyAI-Image-Edit | 主力编辑模型(16B MMDiT) | 指令编辑、空间编辑、相机控制、多图视角生成 | 绝大多数图像编辑需求,默认首选 |
| JoyAI-Image-Edit-Plus | 多图编辑增强版 | 跨图组合、多图一致性、联合操作 | 需要"把 A 图的元素放进 B 图"这类复合任务 |
| JoyAI-Image-Edit-Distilled | Edit 的蒸馏加速版 | 与 Edit 相同,推理更快 | 在线服务、批量出图(待发布) |
🎯一句话建议:只做分析问答选Und;做单图编辑选Edit;要跨多图合成选Edit-Plus;追求低延迟等Distilled。
先懂架构,再选权重
JoyAI-Image 的核心是8B 多模态大语言模型(MLLM)+ 16B 多模态扩散 Transformer(MMDiT)的闭环协作:理解得越准,编辑越可控;而视角变换等生成操作又反过来给空间推理提供证据。
从官方能力雷达图可以看到,JoyAI-Image-Edit在空间理解(Spatial Understanding)和编辑(Editing)维度上对多个同类模型形成了明显优势:
JoyAI-Image-Und:只做"看懂"的理解骨干
Und是纯理解骨干,不生成图片,只输出文字。它的强项是高保真空间推理(估距、量高、判断前后遮挡关系)和"编辑感知"的细粒度图像描述。
使用入口是独立的 inference_und.py,核心流程:加载 MLLM 权重 → 支持多张图片一次输入(用逗号分隔路径)→ 按对话模板生成回答,支持--temperature、--top-p等采样参数。
python inference_und.py \ --ckpt-root /path/to/ckpts_infer \ --image "test_images/test_1.jpg,test_images/test_3.png" \ --prompt "Compare these two images."适合人群:想复用 JoyAI-Image 的理解能力做视觉问答、空间测量问答,或给下游编辑流程提供"场景解析"前置模块。
JoyAI-Image-Edit:默认首选的指令编辑主力
Edit是整个 Model Zoo 中能力最完整的一档:单图指令编辑、长文本渲染、多视角生成、以及三大空间编辑能力——物体移动、物体旋转、相机控制。
官方仓库自带示例输入图,例如这张"雪景企鹅蛋糕":
以相机控制为例,同一场景在"Yaw + Pitch 旋转"指令前后的对比,可见场景内容保持不变、只有视角被改变:
空间编辑还有一个关键卖点:用编辑反哺推理。下图中 JoyAI-Image-Edit 通过忠实执行相机位姿指令合成的新视角,让"钟楼 vs 房屋谁更高"这类空间关系判断一目了然:
使用入口为 inference.py,常用参数:--steps 30、--guidance-scale 4.0、--basesize 1024;空间编辑任务建议严格套用 README 中的三类提示词模板(Move / Rotate / Camera),行为最稳定。
JoyAI-Image-Edit-Plus:多图编辑进阶版
如果你要做的不是"改一张图",而是"跨图组合"——把 A 图的人物放进 B 图的场景、多图之间保持身份/风格一致性、对多张图做联合操控——那就该上Edit-Plus。它在 2026 年 6 月发布,是 Edit 之上的多图增强版,同时保留了 Diffusers 版本的一键部署方式。
💡 判断标准:提示词里出现"第二张图"、"参考图"、"把两张图合成"这类跨图关系时,选Edit-Plus;只有一张输入图时,用 Edit 就够了。
JoyAI-Image-Edit-Distilled:等待发布的加速版
Distilled是 Edit 的蒸馏版,目标是在保持编辑质量的前提下显著降低推理步数、加快出图速度,适合在线服务和批量生产场景。目前官方标注为To be released,现阶段生产环境请以Edit为主力,发布后可直接替换权重平滑升级。
权重目录结构与加载机制
无论选哪个版本,理解目录结构都能让你少踩坑。官方推理代码通过 src/infer_runtime/checkpoints.py 校验布局,要求权重根目录下包含:
ckpts/ ├── transformer/transformer.pth # MMDiT 扩散模型 ├── vae/ # VAE(自动查找唯一条目) ├── JoyAI-Image-Und/ # 8B 理解 MLLM(text encoder) └── infer_config.py # 推理超参(步数、精度、offload 等)推理超参通过 src/infer_runtime/infer_config.py 中的InferConfig定义,支持bf16精度、FSDP 多卡分片(hsdp_shard_dim)与 CPU offload,显存吃紧时可组合使用。
更偏工程化的部署还有两条路:
- Diffusers:
JoyImageEditPipeline已被 Diffusers 官方合并,from_pretrained一步加载即可 - ComfyUI:官方自定义节点包见 joyai_image_comfyui/README.md,三个组件单文件权重放入
diffusion_models/、text_encoders/、vae/标准目录,支持四阶段手动 CPU offload,最低显存友好
总结:一张图记住选型逻辑
| 你的需求 | 选它 |
|---|---|
| 只要理解/问答/空间分析,不出图 | Und |
| 单图指令编辑、空间编辑、相机控制 | Edit(默认) |
| 多图组合、跨图一致性 | Edit-Plus |
| 同样的编辑效果,要更快 | Distilled(发布后) |
JoyAI-Image 在理解、生成、编辑之间形成了闭环,四种权重各司其职:Und 管"看懂",Edit 管"改好",Edit-Plus 管"多图联动",Distilled 管"更快"。选对版本,把时间花在提示词和创意上,而不是等待权重发布或排查显存报错。更多能力展示与许可证信息可参考仓库 README.md(Apache 2.0)。
【免费下载链接】JoyAI-ImageJoyAI-Image is the unified multimodal foundation model for image understanding, text-to-image generation, and instruction-guided image editing.项目地址: https://gitcode.com/gh_mirrors/jo/JoyAI-Image
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考