问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
语音AI服务商Superwhisper近期正式开源轻量文本归一化模型S1-mini,该模型参数规模0.6B、体积仅462MB,可在端侧本地运行,直接将语音识别(ASR)输出的原始转写文本整理为通顺规范的书面文本。同时Superwhisper还推出两款云端版S1大模型,覆盖从个人开发者到大型企业的不同层级语音转写后处理需求,为端侧语音AI落地降低了技术门槛。
经常使用语音转文字功能的用户大概率有过类似体验:原始转写结果里堆满了“嗯”“啊”之类的语气助词、语序混乱的口语表达,甚至大量同音字错误,手动修正的时间往往比听录还长。这一长期制约语音识别落地体验的痛点,如今有了更轻量化的解决方案。
随着语音识别(ASR)技术的普及,当前通用场景下的ASR识别准确率已经突破98%,但原始转写结果的文本归一化始终是体验短板:规则驱动的修正方案适配性差,遇到口音、专有名词、口语化表达时错误率极高;基于大模型的修正方案参数规模普遍在10B以上,只能部署在云端,不仅延迟高,还存在数据上传的隐私风险,端侧硬件根本无法承载,不少消费级语音产品厂商长期在体验和成本之间两难。
本次Superwhisper推出的S1系列产品中,最受开发者关注的就是完全开放权重的S1-mini。462MB的体积、0.6B的参数规模,仅需1GB左右的运行内存即可在手机、录音笔等消费级终端流畅运行,全程不需要上传语音或文本数据到云端,从源头上避免了隐私泄露风险。在公开测试集中,S1-mini对日常对话、会议纪要、访谈录音三类ASR原始转写的修正准确率,比同参数级别的同类模型高出23%,处理速度达到每秒1200字,完全可以满足实时转写的需求。
除了开源的端侧版本,Superwhisper还同步推出了两款参数更高的云端S1模型,支持批量处理、专有名词库定制等企业级功能,适用于媒体内容转写、政务会议记录、客服对话质检等高精度需求场景。
本次S1-mini的开源,大幅降低了语音转写后处理的技术门槛:对于独立开发者和小型团队而言,不需要投入大量算力和数据训练文本归一化模型,直接基于S1-mini微调即可快速推出自有语音转写产品,开发成本能降低70%以上;对于C端硬件厂商而言,端侧运行的特性可以让智能录音笔、办公耳机、智能座舱等产品的语音转写功能完全离线运行,既降低了云端带宽成本,也解决了用户对隐私安全的顾虑。
据了解,Superwhisper后续还将推出参数更小的S1-nano版本,适配智能手表、智能家居等低算力IoT设备,同时会开放医疗、法律、教育等垂直领域的微调数据集,帮助开发者快速搭建场景化的语音转写方案。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。