过去两年,大模型重塑了内容生产行业。在视觉领域,AI已从最初的“画不对手指”演进到如今能够生成复杂海报与高密度中文排版。然而,当AI生图已不再是新闻,整个行业开始思考:当视觉大模型越来越强,它的下一步究竟是什么?为此,兔展智能(RabbitPre)正式发布了其最新AI设计生产工具——RabbitVis,旨在让AI真正走通设计的全流程。
行业分析指出,AI正在从通用能力竞争,快速进入场景能力竞争。大模型负责底层能力,但真正为用户创造价值的是产品落地。对于设计师和运营人员而言,真正的痛点并非缺少一个会生成图片的AI,而是缺少一个能完成完整设计流程的工具。此前,兔展智能联合北京大学、鹏城实验室研发的 UniWorld-View 曾登顶 WorldScore 世界模型榜单;如今,他们将这一技术积淀转化为面向设计场景的 UniWorld-Design 视觉模型,并基于此推出了“产模一体”的核心产品 #RabbitVis。
在真实的商业设计场景中,设计工作往往在图片生成后才刚刚开始。面对“LOGO往左移一点”、“字号放大点”或“适配不同尺寸”的修改需求,传统AI输出的单一扁平化图片无法进行二次调整,用户不得不重新依赖 Photoshop 等工具。RabbitVis 解决的正是生成之后的“后半程”。它不再输出“一气呵成”的死图,而是将AI能力深入到图层级一站式编辑中,大幅降低了专业设计的门槛。
支撑 RabbitVis 持续编辑能力的是底层模型对视觉内容结构化生成的深度探索。UniWorld-Design 以图层作为核心组织方式,支持透明素材生成(T2RGBA)与图像分层(I2L)。在学术评测中,其图像分层指标 RGB L1 达到 0.1264(越小越好),Alpha Soft IoU 达到 0.7325(越大越好),可编辑性指标为 1.32。而在 T2RGBA 评估中,其语义匹配能力进一步提升,CLIP Score 达到了 33.03。这标志着AI输出正从“单张图片”演进为可持续加工、调整和复用的“设计资产”。
从 AI Agent(智能体)生态的长远演进来看,RabbitVis 背后代表的“图层级结构化生成”是一次关键的技术跃迁。传统的视觉 AI 如 Midjourney 或 Stable Diffusion 虽生成效果惊艳,但对 Agent 而言是一个难以拆解的“黑盒”像素集合。未来具身智能和多模态 Agent 必须具备与物理或虚拟世界深度交互的能力,这要求它们能够精确识别、操纵和重构空间中的每一个独立元素。#UniWorld-Design 所实现的图层拆解与透明素材生成,本质上是为多模态 Agent 提供了更加精细的“视觉感知与操纵接口”。当 Agent 能够像人类设计师一样,在图层维度上自由调用、修改、排列组合视觉资产,我们才真正距离“全自动、闭环的 AI 营销与 UI 交互 Agent”更近了一步。这不仅重塑了设计工具,更为下一代空间感知智能体奠定了底层的数据架构基础。