问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日,阿里巴巴Qwen(通义千问)团队正式发布多模态大模型Qwen3.8-Flash-Next,该模型总参数达125B,采用MoE稀疏混合专家架构,单token激活参数仅6B,开放权重开源,其核心架构设计将作为下一代Qwen4大模型的技术预演,兼顾大参数能力与低推理成本优势,引发大模型产业界广泛关注。

在大模型商业化落地的关键节点,如何平衡模型能力与推理成本,已经成为所有开源大模型团队要解决的核心命题。此次Qwen团队推出的新模型,正是针对这一行业痛点给出的最新解法。
过去两年,大模型参数规模一路从百亿级冲到万亿级,参数越大带来的能力上限越高,但相应的推理成本也呈指数级上涨。对绝大多数中小开发者而言,调用百亿级大模型的成本难以负担,自研小参数模型又无法满足复杂场景的需求,MoE稀疏混合专家架构由此成为行业破局的主要方向——通过仅激活部分参数处理请求,兼顾大参数的能力优势和低运行成本。
此次发布的Qwen3.8-Flash-Next,核心亮点就是125B总参数规模下,单token仅激活6B参数。这意味着开发者只需要付出6B级小模型的推理成本,就能获得接近百亿级大模型的能力表现,同时该模型为多模态设计,支持文本、图像等多类型输入,覆盖内容生成、多模态理解、智能客服等多数落地场景。
值得注意的是,该模型采用开放权重开源的形式发布,开发者可以直接下载权重进行本地化部署、二次微调,无需支付额外的授权费用,大幅降低了高性能大模型的使用门槛。
据Qwen团队披露,Qwen3.8-Flash-Next本质是下一代Qwen4大模型的“技术预览版”,其采用的稀疏激活策略、多模态统一建模框架等核心设计,都将沿用到后续正式发布的Qwen4系列大模型中。
这种提前释放核心架构的做法,一方面可以提前收集开发者的反馈优化正式版设计,另一方面也给行业合作伙伴留出了适配的时间窗口,有助于后续Qwen4发布后快速落地到各类场景中。
此前开源大模型的竞争主要集中在参数规模、基准测试得分等维度,而此次Qwen的发布或将把行业竞争的核心引向“单位成本下的能力表现”。
随着更多高效架构的开源大模型推出,未来AI应用的落地成本将进一步下探,中小开发者也能用上高性能的大模型能力,整个AI产业的落地速度有望大幅提升。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。