腾讯正式发布其最新的混元图像2.0模型(Hunyuan Image2.0),标志着 AI 图像生成技术迈入 “毫秒级” 响应时代。

image.png

新模型在速度上有了显著提升,相比于前代产品,混元图像2.0的参数量提高了一个数量级,结合了高效的图像编解码器和全新的扩散架构,能够在同类商业产品通常需要5到10秒的推理速度下,实现毫秒级的快速响应。用户在生成图像时,可以一边输入文本或进行语音指令,一边获得实时图像输出,极大地改变了传统的 “抽卡 – 等待 – 抽卡” 模式,提升了用户的交互体验。

image.png

超写实的图像质量 

除了速度上的突破,混元图像2.0在图像生成的质量方面也有显著进步。该模型通过强化学习和引入大量人类美学知识,有效避免了 AI 生成图像常见的 “AI 味”,生成的图像不仅真实感强,细节丰富,且具有很高的可用性。在国际权威的 GenEval 基准测试中,混元图像2.0在复杂文本指令的理解与生成能力评估中准确率超过95%,远超其他同类模型。

创新的实时绘画板功能 

本次升级还推出了实时绘画板功能,利用新模型的实时生图能力,用户在绘制线稿或调整参数时,预览区能够同步生成上色效果。这一功能突破了传统的 “绘制 – 等待 – 修改” 流程,极大地便利了专业设计师的创作过程。此外,实时绘画板支持多图融合,用户可以上传多个草图,AI 将自动协调透视与光影,按照用户的提示词生成融合图像,进一步丰富了 AI 生图的互动体验。

image.png

腾讯还透露,原生多模态图像生成大模型正在研发中,新模型将在多轮图像生成和实时交互体验等方面表现出色,期待为用户带来更为丰富的创作体验。

产品入口:https://hunyuan.tencent.com/