开源大模型的性价比,又被阿里"砍"了一刀

2026年8月26日晚,阿里千问发布并同步开源 Qwen3.8-Flash,把开源大模型的性价比"斩杀线"又拉低了一截。结论先行:这是一个总参数125B、每token仅激活6B的多模态混合专家(MoE)模型,性能超越 Claude Opus 4.6、逼近 Opus 4.8,而训练成本较上一代 Qwen3.7-Plus 骤降近90%(仅用约1/9资源),API定价低至 DeepSeek-V4-Flash 的1/3、约 Claude Opus 4.6 的3%。对需要长上下文、智能体编程、批量数据处理的企业而言,这意味着此前"算不起"的场景正在变得经济可行。

奇摩在为企业选型大模型时,最常被问到的就是"性能和成本能不能兼得"。Qwen3.8-Flash 的出现给出了一个较有说服力的参照——它并非单纯堆参数,而是用架构换效率,这正是国产开源模型这一轮竞争的主线。

一、Next架构:用稀疏注意力换长上下文速度

Qwen3.8-Flash 采用与过往千问模型完全不同的全新 Next 架构,官方明确这是下一代 Qwen4 的雏形,提前开源交由社区验证。三项关键设计:

  • QSA 稀疏注意力:先用轻量索引在微块粒度筛出重要上下文再做注意力,与 GDN 融合后,在1M Tokens 长上下文、缓存命中率高的场景中最高提速8倍以上。
  • Gated Residual 门控残差:把传统 Transformer 的1条信息主通道拆成4条,动态决定读写,信息传递更高效、训练更稳定。
  • 51B N-gram Embedding:相当于给模型"外挂"一份大规模记忆手册,每次 token 计算无需参与,可卸载到主机内存异步预取,用极少资源扩展参数。

原生上下文262K,经 YaRN 可扩展至1M。训练侧引入 Muon 优化器并重新拟合 scaling law,收敛效率与吞吐同步提升。

二、性能与成本:用1/9的资源追平上一代

性能上,Qwen3.8-Flash 在多项智能体与多模态评测中领先同档对手(厂商自测数据,仍待独立验证):

  • 智能体编程 SWE-bench Pro 62.5,领先 Opus 4.6 达9.1分(53.4);
  • 长程办公任务 CoWorkBench 73.9、工具调用 Toolathlon Verified 73.5,均超过 DeepSeek-V4-Flash;
  • 专业工作 JobBench 高出 Opus 4.6 近20分;移动端 AndroidWorld 领先22.5分、视觉数学 MathVision 领先25.1分。

成本是更直接的信号:训练成本约为 Qwen3.7-Plus 的1/9,API 定价每百万 Tokens 输入1元、输出3元,约为 DeepSeek-V4-Flash 的1/3,约 Claude Opus 4.6 的3%。模型当晚首发上线"千问办公",开发者与企业也可通过千问AI平台获取 API。截至目前,Qwen 已开源发布2.4T参数量的三大尺寸模型,全球下载量突破30亿次、衍生模型超30万个。

需要提示的是,权重虽已在 Hugging Face、魔搭社区开源,但采用 Qwen Community License 1.0 而非 Apache 2.0,对超大规模产品、模型即服务、AI工作助手等场景附有商用条件,企业自部署前应先审阅条款。

三、对企业选型的两点判断

第一,性价比窗口正在打开。当输出价格降到海外前沿模型的约1/30,长文档处理、智能体工作流、批量数据处理等"过去算不起"的用量变得可持续,企业有机会把更多场景真正跑起来。

第二,选型仍要看真实负载。厂商自测分数仅供参考,是否复现需独立测试。建议先在自身高频工作流上做小规模跑通,再决定是否规模化。深圳市奇摩计算机有限公司在帮客户落地 AI 智能体时,正是遵循"先跑通、再放量"的路径——模型参数再漂亮,最终要看能不能稳定承担实际任务。

开源大模型这轮"性价比斩杀"还会继续,对企业而言,与其追榜单,不如先把自身的真实工作流和算力账本摸清。

想了解如何为大模型选型与落地搭建可执行路径,可参阅奇摩的 AI 解决方案 或前往 咨询页 交流。