模型

Mage-Flow

microsoft/Mage-Flow

查看上游原文 ↗
上游访问:公开 本站服务:可咨询 许可证:mit 上游版本:faca09c18c1c

中文简介

Mage-Flow 是微软发布的原生分辨率图像生成与编辑基础模型,采用面向图像生成和编辑的流式建模方案。上游提供论文、项目页面、代码和相关模型仓库;使用时应核对支持的输入形式、推理管线、分辨率限制、显存需求及许可证要求。

UPSTREAM README

上游模型卡 / 数据集卡

在 Hugging Face 查看原文 ↗

Mage-Flow 是微软发布的原生分辨率图像生成与编辑基础模型,采用面向图像生成和编辑的流式建模方案。上游提供论文、项目页面、代码和相关模型仓库;使用时应核对支持的输入形式、推理管线、分辨率限制、显存需求及许可证要求。

已有简体中文译文 · 本站中文整理 · 2026-07-23 14:50

Mage-Flow An Efficient Native-Resolution Foundation Model for Image Generation and Editing Mage-Flow** is a compact **4B-scale generative stack** for efficient **text-to-image generation** and **instruction-based image editing**. Instead of scaling to tens of billions of parameters, Mage-Flow reaches state-of-the-art-competitive quality through careful **tokenizer–backbone–system co-design**, so it stays fast, memory-light, and easy to fine-tune under realistic compute budgets. The stack is built from **two shared, co-designed components**: **Mage-VAE** — a lightweight, high-fidelity latent tokenizer (one-step diffusion encode/decode with anchor-latent KL regularization). **NR-MMDiT** — a shared 4B **Native-Resolution Multimodal Diffusion Transformer**, trained with rectified flow matching in the Mage-VAE latent space. Together with native-resolution packing and a fused-kernel training infrastructure, this shared stack powers **two model instantiations**: **Mage-Flow** for text-to-image generation and **Mage-Flow-Edit** for instruction-based image editing. Each ships in **Base**, **RL-aligned**, and **4-step Turbo** variants. ✨ Highlights **Compact & competitive.** A single 4B family for generation *and* editing that matches or beats much larger open systems (Qwen-Image 20B, Z-Image 6B, FLUX.2 32B, FireRed-Image-Edit 20B). **Efficient tokenizer.** Mage-VAE matches FLUX.2-VAE reconstruction fidelity while using **~12× / ~22× fewer encode / decode MACs per pixel**, removing the VAE as the high-resolution bottleneck. **Native resolution.** One checkpoint generates from **512 to 2048** on any aspect ratio, including extreme **4:1** (e.g. `512×2048`, `2048×512`). **System-level speed.** Native-resolution packing (FlashAttention var-len + per-sample 2D RoPE) + fused CUDA kernels cut per-step training time from **~1.93 s → ~0.78 s** (**~2.5× faster training**); CFG's conditional/unconditional branches run in **one** packed forward. **Full family.** **Base**, **RL-aligned**

公开页仅展示原文摘录;完整模型卡或数据集卡请前往上游仓库查看。

上游文件元数据

  • .gitattributes2.73 KB
  • assets/cuisine.jpg2.08 MB
  • assets/dog.jpg512.89 KB
  • assets/edit_gallery_appearance.jpg3.29 MB
  • assets/edit_gallery_content.jpg3.08 MB
  • assets/edit_gallery_human_creative.jpg3.15 MB
  • assets/edit_gallery_lowlevel.jpg2.61 MB
  • assets/edit_gallery_restoration.jpg3.28 MB
  • assets/edit_gallery_scene_subject.jpg3.30 MB
  • assets/edit_gallery_showcase_1.jpg3.31 MB
  • assets/edit_gallery_showcase_2.jpg3.80 MB
  • assets/general.jpg2.15 MB
第三方资源声明

本页面为橙子AI科技的中文整理与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。