详细内容或原文请订阅后点击阅览
一个简单的请求 - 一张报纸、一张医学图表或整本漫画就准备好了。阿里巴巴推出Qwen-Image-3.0
其他人工智能会画出漂亮的猫,而这个人工智能会打印出整本教科书。
来源:安全实验室新闻频道一个简单的请求 - 一张报纸、一张医学图表或整本漫画就准备好了。阿里巴巴推出Qwen-Image-3.0
其他人工智能会画出漂亮的猫,而这个人工智能会打印出整本教科书。
阿里巴巴团队推出了第三代图像生成和编辑基础模型Qwen-Image-3.0。开发人员不太关注壮观的插图,而是关注可在工作中使用的材料:复杂的信息图表、教育图表、报纸页面、故事板、界面和带有大量小文本的文档。
主要变化之一是支持长度达 4500 个标记的指令。之前的版本接受大约1000个,因此现在用户可以在一张画布上详细描述每个片段的组成、对象排列、签名、公式和设计。
在阿里巴巴的演示中,模型一次性创建了一个由九个独立块组成的网格。其中包括有关隧道安全的漫画、几何和物理课程、医学图表、生物学和群论材料、银行信息图表以及 DNA 结构比较。为了描述整个组合,需要大约 3,700 个令牌的指令。
Qwen-Image-3.0不仅要容纳许多并行元素,还要保持嵌套的场景结构。又例如,系统依次描绘了Visual Studio Code界面,在其中打开了Qwen Chat,然后是微信窗口和放置在更深处的广告海报。每个区域都有自己的设计,并且不与相邻层混合。
第二组改进涉及小细节。据开发人员介绍,新产品能够再现约十个像素的清晰字符,包括 LaTeX 公式、索引、希腊字母、定理数字和多行计算。在已发布的示例中,系统生成了一页科学文章、一页报纸和一张带有大量签名的信息海报。
