Princeton's fully open text-to-image model i1 beats prior open models by 29.5 points
Princeton University's team led by Zhuang Liu released i1, a fully open text-to-image model with 3B parameters, trained using over 300 controlled experiments and more than 700,000 TPU v6e hours. On five benchmarks including GenEval and DPG-Bench, i1 outperforms the best previous fully open model by an average of 29.5 percentage points, approaching some larger open-weight models like 20B Qwen-Image. The project releases code, model, and dataset to enable reproducible research.
Coverage timeline
机器之心机器之心
近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。 由于缺少充分的消融实验、可复现的训练配方和可以复用的数据配方,研究者往往很难判断优异的模型表现究竟是来源于哪里:是更优质的训练数据,还是某个特定的模型或训练设计? 如果存在一个性能出色,同时从训练代码到训练数据完全公开可复现的模型的话,研究者们就可以在统一起点上做更多拓展和控制消融实验,从而更准确地分析、理解不同设计带来的实际影响。 最近,普林斯顿大学刘壮团队发布的 i1 模型就回应了这一需求。 论文标题:i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models 论文链接:https://arxiv.org/abs/2606.11289 项目主页:https://zlab-princeton.github.io/i1/ 代码:https://github.com/zlab-princeton/i1 模型:https://huggingface.co/zlab-princeton/i1-3B 数据集:https://huggingface.co/datasets/zlab-princeton/i1-captions 团队开展了 300 多组控制实验,总计使用超过 70 万 TPU v6e 小时,系统研究了文生图扩散模型中的模型与数据设计。基于这些实验结论,他们最终训练出一个参数量为 3B 的文生图模型 i1。 在 GenEval、DPG-Bench、PRISM-Bench、CVTG-2K 和 LongText-Bench 五项基准上,i1 平均领先此前最好的全公开模型 29.5 个百分点。在这些主要关注提示词遵循和文字渲染能力的自动评测中,i1 的综合表现也接近部分参数量更大、仅开放权重的模型,如 20B 的 Qwen-Image。 五项文生图基准上的平均表现。i1 平均领先此前表现最好的全公开模型 29.5 个百分点,并接近多款仅开放权重的领先模型 i1 在通用图像生成任务上的精选示例 i1 在文字渲染任务上的精选示例 控制实验 团队的探索基于一个简单且具有代表性的文生图基线:在模型方面,用浅层融合的方式由冻结的文本编码器提取特征,并输入到一个从头用 flow matchin
