问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
网站截图
内容说明:本文由 AI 基于目标网站公开信息及联网搜索结果整理生成,旨在帮助读者快速了解工具概况。文中涉及的功能、价格、性能等描述可能随官方更新而变化,请以官方最新说明为准。参考资料列表见文末,来源按权威性分组标注。
可图大模型(Kolors)是快手自研的大规模文本到图像生成模型,由快手Kolors团队基于潜在扩散模型框架开发,官方定位为“最懂中文的文生图大模型”。据北京市科学技术委员会等官方渠道发布的信息,可图于2024年6月正式对外开放,支持文生图与图生图两类核心功能,并已上线20余种AI图像玩法,用户可通过官方网站和微信小程序免费使用[1]。
从技术层面看,可图大模型经过数十亿个文本图像对的训练,参数规模达十亿级,训练数据来自开源社区、快手内部构建与自研AI技术合成,覆盖千万级中文实体概念,在视觉质量、复杂语义准确性以及中英文字符的文本渲染方面具备明显优势[1]。2024年7月,快手在世界人工智能大会(WAIC)上宣布可图(Kolors)全面开源,模型权重与完整代码已在Hugging Face和GitHub上线,支持个人开发者免费使用[2]。
目前,可图已与可灵AI深度整合,作为快手可灵AI平台的图像生成能力底座,同时保持独立的官网入口与小程序体验,覆盖从大众娱乐到专业创作的多层次需求。
可图大模型的实际生成成果主要体现在中文内容理解和图像质感两方面。据第三方开发者实测,可图在处理中文提示词时表现出色,能够直接在画面中生成汉字,例如输入“一位美女手里举着木牌,上面写着‘我爱老徐’的文字”等提示词,模型可以较为准确地渲染出牌面上的中文文字,这一能力在当时明显优于SD3.0等开源模型[3]。
在风格化创作方面,可图支持写实、卡通、水墨等多种风格。据官方介绍,可图2.0版本上线后,可支持60多种风格化的效果转绘,并新增局部重绘与扩图功能。例如用户上传一张猫的照片,涂抹选定眼睛位置并输入“戴上很酷的墨镜”,即可生成猫戴墨镜的图片,实现精准的局部编辑[4]。
在商业与社交场景中,可图也提供了落地应用。据官方发布的信息,可图小程序曾推出QQ秀风格的“红钻贵族”和“我的小时候”等玩法,支持用户上传图片生成复古像素风格化图片和童年写真,打造个人二次元IP形象[1]。此外,据界面新闻报道,可灵AI平台累计已生成3.44亿张图片素材,可图作为其图像生成底座,在电商商品图、营销海报、社交头像等场景中已有规模化应用[4]。
可图大模型的核心竞争力在于中文语义理解与汉字渲染能力。据官方介绍,可图综合指标超过SDXL/SD3等开源模型和Midjourney等闭源模型,支持长达256字符的文本输入,具备英文和中文写字能力[2]。这一能力使其在处理中文长文本和复杂语义输入时表现突出,解决了此前文生图大模型在中文场景下的痛点。
其次,可图采用“开源+应用”双轨策略:一方面全面开源模型权重与代码,构建插件生态,吸引开发者社区;另一方面通过可灵AI平台和小程序面向大众提供服务,降低使用门槛。据界面新闻报道,可图2.0对Midjourney V7的胜负比达307%,在文生图领域的文字相关性、画面质量等维度上表现突出[4]。
此外,可图与可灵AI深度整合,用户可在同一平台内完成图像生成与视频生成,形成从静态到动态的创作闭环,这是多数纯图像生成工具不具备的生态优势。
可图大模型采用“免费体验+灵感值计费”的混合模式。据官方信息,用户可通过官网和小程序免费使用基础图像功能,免费用户每日登录可领取66灵感值,可生成约60至70张基础图片,但生成内容默认带品牌水印[5]。
对于需要高清无水印、更多生成次数的用户,可通过可灵AI会员体系订阅。会员分为黄金、铂金等多档,以灵感值为统一计量单位,图像生成单次扣减1点灵感值(开启高清增强、多图参考等会额外加扣)[5]。企业用户还可通过API按量计费调用图像生成能力,具体价格需联系官方获取报价。
作为AI创作导航,我建议你把可图大模型当作中文AI绘画的首选入口之一。如果你是新手,先从官网或小程序的免费额度入手,用中文提示词直接描述画面,重点体验它的汉字渲染和中文语义理解能力,这两点是它相对海外模型的明显优势。日常做封面、头像、配图,免费额度基本够用,记得注意水印问题。如果你有商业出图需求,再考虑会员或灵感值,生成前关闭不必要的增强项,避免灵感值被额外扣减。对于技术型用户,我更推荐直接去Hugging Face或GitHub拉取开源模型,配合ComfyUI搭建自己的工作流,可定制空间更大。总之,可图兼顾了“开箱即用”和“开源可玩”两条路线,把它与可灵AI的视频生成配合使用,能形成从图到视频的完整创作闭环,性价比很高。