ML Revisit: Unified Multimodal Models


2026-08-31

Transfusion

论文:(Zhou et al., 2024)

大概就是用一个 Transfusion 去同时做生成和理解两件事情:

Transfusion model diagramA single Transformer predicts text tokens autoregressively and denoises a sequence of four image patches.TransformerAcutecutecatcat..<BOI><BOI><EOI>WhatWhatcolorcolorisisitsitsnosenose?

Attention mask 大概是这样,就是文字看到前面的,然后图片互相都能看到。

Transfusion causal and bidirectional attention mask
Acutecat<BOI><EOI>What
AAllowedMaskedMaskedMaskedMaskedMaskedMaskedMaskedMaskedMasked
cuteAllowedAllowedMaskedMaskedMaskedMaskedMaskedMaskedMaskedMasked
catAllowedAllowedAllowedMaskedMaskedMaskedMaskedMaskedMaskedMasked
<BOI>AllowedAllowedAllowedAllowedMaskedMaskedMaskedMaskedMaskedMasked
AllowedAllowedAllowedAllowedAllowedAllowedAllowedAllowedMaskedMasked
AllowedAllowedAllowedAllowedAllowedAllowedAllowedAllowedMaskedMasked
AllowedAllowedAllowedAllowedAllowedAllowedAllowedAllowedMaskedMasked
AllowedAllowedAllowedAllowedAllowedAllowedAllowedAllowedMaskedMasked
<EOI>AllowedAllowedAllowedAllowedAllowedAllowedAllowedAllowedAllowedMasked
WhatAllowedAllowedAllowedAllowedAllowedAllowedAllowedAllowedAllowedAllowed

References

Zhou, C., Yu, L., Babu, A., Tirumala, K., Yasunaga, M., Shamis, L., Kahn, J., Ma, X., Zettlemoyer, L., & Levy, O. (2024). Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model. arxiv.org

Cite this post

@misc{pu2026mlrevisitumm,
  author = {Pu, Fanyi},
  title  = {ML Revisit: Unified Multimodal Models},
  year   = {2026},
  month  = {8},
  url    = {https://pufanyi.com/blog/ml-revisit-umm}
}