问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
成立仅三年的AI视频搜索初创公司Clipto近日宣布完成1500万美元最新融资,投后估值达2.5亿美元。本次融资前,Clipto已实现年度经常性收入(ARR)1500万美元,并达成全面盈利。其核心AI技术可实现对TB级音视频内容的精准语义搜索,目前已在媒体、企业服务等多场景落地,是AI多模态搜索赛道的头部玩家。
过去五年,全球音视频内容存量年增速超过40%,仅媒体行业每年新增的专业素材就超过10EB,传统依赖人工打标签的检索方式效率仅能覆盖不足10%的内容需求。面对动辄TB级的内部素材库,不少媒体、企业的内容团队平均要花费20%的工作时间寻找对应素材,效率短板十分明显,这也让AI多模态搜索成为近两年创投圈最受关注的落地赛道之一。
和不少靠烧钱拓展客户的AI初创公司不同,Clipto成立三年来始终聚焦商业化落地,其核心多模态检索模型突破了传统视频搜索的技术瓶颈:不同于普通产品仅能匹配标题、字幕的检索逻辑,Clipto的模型可以同时识别语音内容、画面元素、人物动作甚至场景情绪,哪怕是没有字幕的外语视频,也能精准定位到对应片段,处理TB级视频库的检索响应速度不到0.3秒,准确率达到92%以上。
凭借技术优势,Clipto目前已经拿下北美多家头部流媒体平台、广告公司及科技企业的订单,2025年全年就实现了1500万美元的年度经常性收入(ARR),并且达成全面盈利,本次1500万美元融资也是其成立以来的首次外部大额融资,投后估值达到2.5亿美元。据了解,本轮融资资金将主要用于大模型迭代、团队扩张以及亚太市场拓展。
随着大模型多模态能力的不断提升,视频搜索已经不是该技术的唯一落地场景。目前Clipto已经在测试检索+生成的一体化服务,用户搜索到对应视频片段后,平台可以直接生成剪辑、字幕、宣传文案甚至二次创作的短视频内容,预计能将内容团队的生产效率提升70%以上。
不过该赛道仍然存在不少待突破的瓶颈:跨语种、带口音的语音识别准确率仍有提升空间,工业级场景的定制化适配成本较高,都是接下来行业玩家需要解决的核心问题。长期来看,谁能率先实现更低成本的场景复用,谁就能在千亿级的AI内容服务市场抢占更多份额。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。