工具介绍
WAAS(Whisper as a Service)是由挪威媒体集团Schibsted开发的开源语音转录服务项目,基于OpenAI Whisper模型构建。该项目旨在将先进的语音识别技术以更易用的方式提供给用户,提供图形界面(GUI)和应用程序接口(API)两种使用模式。项目最初由VG(Verdens Gang,Schibsted旗下挪威最大的新闻媒体)发起,用于解决媒体内容生产中的字幕生成需求。WAAS通过异步队列机制处理转录任务,支持批量文件处理,适合不同规模的用户使用。无论是需要简单上传文件获取字幕的非技术用户,还是需要将转录能力集成到自身系统的开发者,都能通过WAAS找到合适的解决方案。项目在GitHub上开源,用户可以自行部署使用。
效果展示/案例参考
以视频转录场景为例,用户通过Jojo界面上传一个视频文件(如jojo.mov),系统开始自动转录音频内容。转录完成后,用户会收到一封包含下载链接的邮件,可直接下载Jojo格式文件、SRT字幕文件或纯文本文件。若需修正转录错误,用户可将Jojo文件上传至浏览器编辑器,该编辑器完全在本地运行,无需联网。在编辑器中,用户可以按段落收听原始音频(按住Control键即可播放当前选中的段落),并手动修正识别错误。修正完成后保存文件即可得到最终准确的字幕或文本。整个流程从上传到修正完成,实现了半自动化加人工校对的高效工作模式。
核心功能
- Jojo图形界面:提供直观的文件上传与转录入口,用户无需技术背景即可使用,上传后自动处理并通过邮件发送结果。
- 浏览器本地编辑器:完全在浏览器中运行,支持分段播放音频、修正转录文本,保护用户数据隐私不离开本地。
- 异步队列API:通过POST /v1/transcribe接口提交转录任务,系统异步处理,返回job_id供后续查询状态。
- 多格式输出支持:提供JSON、SRT、TXT、VTT等多种输出格式,满足字幕制作、文本整理等不同后期需求。
- 语言自动检测与指定:支持自动检测音频语言,也可通过language参数手动指定目标语言。
- 多模型选择:可通过model参数选择不同的Whisper模型(默认tiny),平衡速度与准确性。
- 转录与翻译双任务:task参数支持transcribe(仅转录)和translate(转录并翻译为英文)两种模式。
- Webhook回调机制:支持webhook_id参数,可将处理结果回调至指定URL,便于自动化工作流集成。
- 语言检测独立接口:提供POST /v1/detect端点,可单独检测音频文件的语言类型。
使用流程
- 步骤1:访问WAAS服务,通过Jojo界面上传音频或视频文件;或调用API发送POST /v1/transcribe请求,在请求体中包含二进制音频数据,并设置email_callback或webhook_id参数。
- 步骤2:系统将任务加入异步队列处理,API调用会返回job_id用于查询进度;GUI方式则自动处理,无需手动查询。
- 步骤3:处理完成后,GUI用户收到包含下载链接的邮件,可下载SRT、TXT或Jojo格式文件;API用户通过GET /v1/download/端点获取结果,指定output参数选择格式。
- 步骤4:如需修正,将Jojo文件加载至浏览器编辑器,分段收听并修正错误,保存最终文件。
使用场景
- 视频内容创作者与字幕组:为YouTube、B站等平台视频快速生成多语言字幕,提升内容可访问性。
- 媒体新闻机构:将采访录音、新闻视频转化为文字稿件,加速新闻生产流程。
- 会议记录与办公场景:将会议录音自动转为文字记录,便于整理纪要和检索关键信息。
- 播客与音频内容生产者:生成播客文字稿,用于内容摘要、SEO优化和多平台分发。
- 开发者集成:通过API将语音转录能力嵌入自有应用或工作流,实现批量音频处理自动化。
独特优势
- 基于OpenAI Whisper的高准确性:采用业界领先的语音识别模型,在多语言场景下表现优异。
- 双模式覆盖全用户群:GUI适合非技术用户快速上手,API适合开发者深度集成,降低使用门槛。
- 异步队列处理机制:适合批量文件转录场景,避免长时间阻塞,提升处理效率。
- 浏览器本地编辑器:修正过程无需上传音频至服务器,最大程度保护数据隐私与内容安全。
- 灵活的输出与回调:支持多种字幕格式和Webhook回调,便于与现有后期制作流程或自动化系统对接。
- 开源可自部署:用户可根据需求自行部署,完全掌控数据流向和系统配置。
常见问题(FAQ)
-
Q1: 支持哪些音频或视频格式?
- A1: 支持常见的音频和视频文件格式,通过GUI可直接上传,API方式则通过二进制数据传输,系统会自动处理并提取音频内容。
-
Q2: 转录结果如何获取?
- A2: GUI用户会收到包含下载链接的邮件,可直接下载;API用户通过GET /v1/download/端点,指定output参数(如srt、txt、json、vtt)获取对应格式文件。
-
Q3: 如何修正转录中的错误?
- A3: 下载Jojo格式文件后,在浏览器编辑器中加载,按住Control键播放当前段落音频,手动修正文字,完成后保存文件即可。
-
Q4: 是否支持将非英语音频翻译为英文?
- A4: 支持。在API调用中将task参数设置为translate,系统会先转录再自动翻译为英文输出;也可结合language参数指定源语言。
-
Q5: 可以批量处理多个文件吗?
- A5: 可以。通过API循环提交多个转录任务,系统会通过异步队列依次处理,每个任务独立返回结果,适合批量场景。
实测体验(由AI创作导航实测)
我们这次实测用WAAS完成了一个视频文件的转录与字幕修正流程。通过Jojo界面上传视频后,系统自动进入队列处理,大约数分钟后收到了包含下载链接的邮件。下载SRT字幕文件后,我们发现大部分内容准确,但专业术语和口音部分存在少量错误。随后使用浏览器编辑器加载Jojo文件,按住Control键逐段听音修正,整个修正过程流畅,本地运行无延迟。优点是双模式设计友好,API文档清晰,适合开发者快速集成;缺点是默认tiny模型在复杂场景下准确性有限,建议根据需求选择更大模型。整体推荐视频创作者和媒体从业者使用,能显著提升字幕制作效率。
内容说明:本文由 AI 基于目标网站公开信息整理生成,旨在帮助读者快速了解工具概况。文中涉及的功能、性能等描述可能随官方更新而变化,请以官方最新说明为准。
还没有评论,来说两句吧~