<aside> 🛠

Unified Multimodal Image Generation & Editing


A lightweight 5B-parameter unified multimodal model supporting general image generation, general image editing, reasoning image generation, reasoning image editing, and text rendering, all in a single model

</aside>


What it does

DeepGen 1.0 is a unified multimodal image generation and editing model built on a hybrid VLM + DiT (Diffusion Transformer) architecture. With only 5B parameters (3B VLM + 2B DiT), it integrates five core capabilities in a single model while remaining competitive with or surpassing models 3× to 16× larger. The model is designed to demonstrate that massive scaling is not the only path to high-performance multimodal generation.

Problem it solves

Input/Output

<aside>

<aside>

<aside>

</aside>

Accuracy & Speed

General Image Generation:

Benchmark Score Rank
Geneval ↑ 0.87 🥈 among open-source models
DPGBench ↑ 87.90 🥈 among open-source models
UniGenBench ↑ 75.74 🥈 among open-source models

General Image Editing:

Benchmark Score Rank
GEdit-EN ↑ 7.17 🥉 among open-source models
ImgEdit ↑ 4.14 🥉 among open-source models