2026年5月,AI多模态初创企业智象未来在首届开放日正式推出基于Unified Transformer(UiT)原生架构打造的HiDream-O1-Image-Pro图像大模型,参数规模突破2000亿,核心任务表现达到行业顶尖水平。与此同时,企业官宣两周内连续完成两轮亿级融资,投资方覆盖深创投、金浦投资等头部机构,资金将全部投入全模态技术研发与场景落地。
在开放日的实测演示环节,工作人员现场输入“生成一张印有完整艺术字‘智象未来2026’的复古街头涂鸦海报”指令,仅用3秒就输出了分辨率4K、文字边缘无锯齿、色彩过渡自然的完整作品,没有出现过往同类产品常见的文字笔画错乱、字符缺失问题,令在场不少行业从业者直呼超出预期。
当前国内多模态AI赛道正进入从“功能拼接”向“原生统一”迭代的关键拐点。市面上多数主流多模态产品仍采用“独立文生图模型+通用大语言模型”的拼接式架构,两套系统语义空间无法完全对齐,始终无法彻底解决图文逻辑不符、生成文字乱码等长期痛点。
此前也有不少团队尝试研发统一架构的多模态底座,但普遍在千亿参数以上的规模就遇到了效果陡降、算力成本失控的瓶颈,难以兼顾性能与落地可行性。
作为本次开放日的核心成果,HiDream-O1-Image-Pro最大的创新点,在于完全依托自研的Unified Transformer(UiT)架构实现了超2000亿参数的规模落地,首次在同个底层架构中完成了图像像素、文本标记与任务条件三类信息的深度统一对齐,完全省去了不同模态模块之间的转译损耗。
目前这款大模型已经在通用文生图、高保真文字渲染、精细化图像编辑三类核心任务上拿到了公开榜单的SOTA评级,对比同量级产品的文字生成准确率提升超过47%,图像编辑的细节留存率提升62%。更关键的是,这套原生架构从设计之初就预留了视频、音频、3D点云等模态的接入接口,后续拓展新模态不需要推倒重构底座,迭代效率将提升数倍。
技术层面的突破性进展,也让智象未来拿到了资本市场的罕见青睐:这家成立不足三年的初创企业,在短短两周内连续完成两轮亿级规模融资,投资方阵容涵盖了国内头部国资创投与产业资本。
据智象未来团队透露,本轮融资资金将主要用于核心算力集群扩容与B端场景落地,现阶段HiDream-O1-Image-Pro已经开启定向邀请制内测,优先开放给广告内容创作、工业产品设计、数字内容生产类的企业客户试用,后续团队将在现有底座基础上逐步接入视频、音频能力,最终朝着构建能够还原真实世界运行逻辑的原生全模态物理世界模型的目标推进。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。