问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年3月16日,IBM正式发布专为边缘计算与企业级部署打造的紧凑型多模态语音大模型Granite 4.0 1B Speech。该模型参数量仅为前代产品的50%,性能实现显著跃升,新增日语自动语音识别、关键词偏置功能,英文转录准确率大幅提升,目前已支持6种主流语言的语音识别与双向互译。
对于大量布局线下语音交互场景的企业而言,语音大模型的落地长期面临两难选择:云端部署存在传输延迟高、敏感数据泄露风险等问题,端侧部署则受限于终端算力,往往要在模型准确率和运行效率之间做取舍。IBM此次推出的新语音模型,恰好击中了这一长期存在的市场痛点。
近年来,零售门店智能客服、工业设备语音操控、线下网点实时翻译等场景的需求持续增长,这类场景普遍要求语音交互能力在本地运行,既不能有过高的延迟,也不能将用户语音数据上传至云端处理。过往行业内的同级别语音模型要么参数过大无法在普通边缘终端运行,要么为了压缩体积牺牲了识别准确率,无法满足企业级场景的可靠性要求。
此次发布的Granite 4.0 1B Speech最核心的优势在于参数量仅为上一代同系列产品的50%,但核心性能反而实现了显著提升。该模型采用创新的两阶段设计架构:第一阶段先将音频信号转换为文本,第二阶段再调用专属的Granite语言模型完成后续推理任务,这种模块化设计允许开发者根据场景需求灵活裁剪功能,比如仅需要语音转录能力时可以关闭翻译模块,进一步降低资源占用。
功能层面,新模型在原有英语、法语、德语、西班牙语、葡萄牙语的支持基础上,新增了日语自动语音识别能力,同时新增的关键词偏置功能允许企业自定义行业专有名词的识别优先级,比如医疗场景下的疾病名称、金融场景下的产品术语等,都可以通过设置提升识别准确率。此外,模型的英文转录准确率也较前代有大幅提升,整体内存占用、推理延迟和计算成本均远低于同性能级别的行业平均水平。
作为IBM面向企业级场景打造的Granite大模型产品线的新成员,Granite 4.0 1B Speech填补了IBM在边缘端语音交互能力的空白。该模型可以直接部署在普通智能终端、工业设备、线下服务终端等硬件上,不需要依赖云端算力就能完成高精度语音识别和翻译工作,尤其适合对数据隐私要求较高的金融、医疗、制造等行业使用。
据行业人士分析,随着边缘计算终端的普及,轻量化、低功耗的端侧大模型将成为未来两年AI落地的重要方向,此次IBM推出的语音大模型也印证了这一发展趋势,后续头部科技厂商大概率会跟进推出更多适配边缘场景的细分领域大模型。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。