问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年9月16日,科大讯飞正式上线讯飞星火Spark-Audio-1.0-Preview语音基座大模型。该模型采用0.65B Dense结构音频编码器搭配30B MoE架构,完全基于纯国产算力训练,可突破传统音频处理级联方案的固有短板,实现对语音信号的端到端直接理解。

过往大模型处理音频普遍采用级联方案,核心流程为“语音转文字-文字输入大模型理解”,这种处理路径存在两个难以规避的缺陷。一是信息丢失,文字载体仅能记录说话的具体内容,语音自带的语气、情绪属性,以及背景环境音等关键信息都会被过滤,直接影响模型对场景判断的完整性。二是链路割裂,语音转写、声纹识别、语音翻译等能力被拆分为独立模块串联运行,模块衔接处存在断点,不仅容易累积错误,还会导致使用过程中出现延迟、卡顿等体验问题。
此次上线的Spark-Audio-1.0-Preview语音基座大模型,彻底摒弃了“先转写再理解”的传统路径,不需要经过文字转写环节,可直接对语音信号进行解析。该模型可一次性完成对人声、环境音、音乐等多种声音信号的识别,同时能精准捕捉并理解声音中承载的语义、情绪及对应场景信息。硬件层面,该模型完全基于纯国产算力完成训练,采用0.65B Dense结构的音频编码器,搭配30B MoE架构,硬件与技术路径的适配性更强。
可以推断,该语音基座大模型的落地,有望提升对语音交互精度、响应速度要求较高的场景的使用体验,降低多模块衔接带来的体验损耗。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。