STARFlow2:连接语言模型和归一化流以实现统一多模态生成

能够理解、推理和生成交错文本-图像序列的统一多模态模型在结构上仍然分散:现有方法要么通过离散标记化牺牲视觉保真度,要么通过组合不同的模态施加结构不对称性。

来源:Apple机器学习研究

统一的多模态模型,能够理解、推理并生成交错的文本-图像序列,在结构上仍然支离破碎:现有方法要么通过离散标记化牺牲视觉保真度,要么通过将因果文本生成与基于迭代扩散的去噪相结合而强加结构不对称性,要么在调整视觉-语言模型用于生成时损害预训练理解。我们观察到,自回归归一化流是自回归变换器——与LLM共享相同的因果掩码、KV缓存机制和从左到右结构——使其成为真正统一的多模态生成的最自然范例,该生成是连续的、单次传递且纯因果的。我们提出STARFlow2,基于Pretzel架构,通过残差跳跃连接将冻结的预训练VLM流与TARFlow流垂直交错,两者都在相同的因果掩码下运行。该设计同时保留了预训练的多模态理解,实现了高保真连续图像生成,并在单一因果机制下实现了结构统一。结合深浅流设计和统一的FAE潜在空间,STARFlow2支持缓存友好的交错生成,其中文本和视觉输出都直接进入KV缓存而无需重新编码。实验表明,在图像生成和多模态理解基准上均有强劲表现,验证了自回归流作为统一多模态建模可行基础的有效性。

  • † 伊利诺伊大学厄巴纳-香槟分校
  • ** 在苹果公司期间完成的工作