生成式AI厂商Cohere于2026年3月26日正式推出专为语音转录场景打造的开源语音模型,该模型参数量仅20亿,可在普通消费级GPU上流畅运行,目前支持14种主流语言的转写任务,大幅降低了中小开发者、垂直行业企业自建语音转录服务的技术与硬件门槛,为本地部署语音AI能力提供了新选项。
对于很多需要高频处理语音转录需求的中小团队而言,过去要么要承担每年数万到数十万元不等的闭源API调用成本,要么得采购数万元的高端计算卡才能跑通开源大模型,这个两难局面近期有了新的解决方案。
随着远程办公普及、客服智能化、内容生产工业化,全球语音转写服务的市场规模年增速超过32%,但现有方案始终存在明显的痛点:闭源API服务不仅调用成本高,还要求用户上传语音数据到服务商云端,金融、医疗、法律等有严格数据合规要求的行业根本无法使用;而现有开源语音模型大多参数量在100亿以上,需要A100级别的专业计算卡才能流畅运行,中小团队根本负担不起对应的硬件成本。
Cohere本次推出的转录专用模型,核心优势就是在保持转写准确率的前提下大幅压缩了参数量。据官方测试数据,该模型在通用场景下的转写准确率比同参数级别的竞品高出12%-18%,对带口音的语音、背景噪音较多的场景适应性更强。仅20亿的参数量意味着用户只需一张显存16G以上的消费级RTX 3060显卡,就可以实现本地实时转录,完全不需要依赖云端资源。
目前该模型已支持中、英、法、德、日、韩等14种主流语言,后续还将逐步增加小语种和方言的支持。更重要的是,该模型完全开源开放,允许商业用途,开发者无需申请授权即可直接二次开发,适配不同垂直场景的需求。
作为全球头部的生成式AI厂商,Cohere此前一直主打多语言大模型的ToB服务,本次推出轻量级开源语音模型,也反映了当前AI行业的两大发展方向:一是边缘部署需求快速上涨,越来越多的企业希望把AI能力部署在本地,避免数据泄露风险,轻量级、低硬件要求的模型会成为未来的竞争热点;二是垂直场景专用模型的价值凸显,相比通用大模型“大而全”的定位,专门针对某一类任务优化的小模型,往往能在更低的成本下实现更好的效果,更适合中小客户的需求。
据Cohere相关技术负责人透露,团队接下来会在现有模型的基础上迭代功能,预计2026年下半年推出集成说话人分离、实时字幕生成、专业术语定制功能的新版本,参数量依然会控制在30亿以内,保持消费级硬件可运行的特性。同时Cohere也在和多家办公硬件厂商洽谈合作,未来有望把该转录模型预装到智能会议平板、笔记本电脑等设备中,用户不需要连网就能实现本地语音转写。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。