问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年,清华大学与香港科技大学联合团队完成的AI图像生成技术研究成果MoKus正式上传至学术预印本平台arXiv,论文编号为arXiv:2603.12743v1。该技术突破了现有AI图像生成工具长序列内容叙事连贯性不足、记忆点易丢失的行业痛点,首次实现图像生成领域的记忆化叙事理解能力,为AI内容创作、影视工业化等场景提供了全新技术路径。
如果你用过Midjourney、DALL·E等主流AI图像生成工具创作系列内容,大概率遇到过这样的窘境:前一张生成的主角还是黑发红衣的少年侠客,下一张输入同样的关键词就变成了棕发风衣的都市白领,要维持长序列内容的人设统一、叙事逻辑连贯,一直是AI图像生成领域悬而未决的行业痛点。
过去几年,AI图像生成技术的迭代速度超出行业预期,单张图像的生成质量已经达到甚至超过普通画师的产出水平,但在漫画连载、动画分镜、影视概念设计等需要长序列叙事的场景,现有技术的短板十分明显。
为了保证内容一致性,创作团队往往需要投入大量人力手动修正AI生成的偏差内容,仅人设统一的工作量就占到系列内容创作总成本的30%以上,严重制约了AI工具在工业化内容生产领域的落地。
此次清华和港科大联合团队推出的MoKus技术,核心是将大语言模型的上下文记忆能力与扩散模型的图像生成能力深度融合,重构了AI图像生成的推理逻辑。相关研究成果已以论文形式上传至arXiv,编号为arXiv:2603.12743v1,感兴趣的从业者可自行查阅完整技术细节。
MoKus可实现超过1000个叙事节点的长时记忆保留,不仅能记住人物外貌、服饰、场景设定等基础信息,还能理解叙事逻辑中的情绪伏笔、剧情转折,对应调整画面的色调、构图风格。根据公开的测试数据,在100页连贯漫画的生成任务中,MoKus的人设统一率达到98.7%,叙事逻辑匹配度超过92%,远超现有主流产品的表现。
MoKus的技术突破,为AI图像生成的落地打开了更大的想象空间。目前已有多家头部漫画平台、影视制作公司向研发团队抛出合作橄榄枝,希望率先将该技术应用于条漫量产、动画前期分镜制作、影视概念图批量生成等场景。
研发团队透露,目前正在优化MoKus的推理效率,降低运行硬件门槛,预计2026年下半年将开放测试接口,供普通内容创作者试用。未来该技术还可延伸至互动游戏内容生成、数字人场景搭建等更多领域。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。