SOURCE // NEWS

阿里重磅发布Qwen3.8:2.4万亿参数,自主编程迎来新突破

阿里重磅发布Qwen3.8:2.4万亿参数,自主编程迎来新突破

8月3日,阿里巴巴正式发布了新一代基座大模型 Qwen3.8,其总参数量达到了惊人的 2.4万亿。新模型在编程(Coding)和专业办公(Cowork)领域实现了能力跃进。在权威 Arena 排行榜中,其整体性能直逼 Anthropic 的 Claude 系列,稳居全球第一梯队。目前,旗舰模型 Qwen3.8-Max 的 API 已同步上线千问 AI 平台,并接入全新 Agent 产品“千问办公”;而 Qwen3.8-27B 及 Max 版本预计将在下周正式开源。

在极具吸引力的定价方面,Qwen3.8 的国内 API 价格为:输入每百万 Tokens 仅需 12 元,输出为 36 元,而隐式缓存命中更低至 1.5 元。在国际市场上,其输入和输出价格仅为 Claude 3.5 Opus 的 40% 和 24%,以超高性价比为全球开发者赋能。

新模型 Qwen3.8-Max 拥有强大的视觉理解力,并支持 1M Tokens 的超长上下文。它采用 稀疏#MoE架构与混合注意力机制 的联合优化,激活参数为 95B,实现了更高的推理效率。在各项硬核评测中,Qwen3.8 展现出统治级实力:PaperBench 编程智能体评测斩获 93.0分 创下新高;WideSearch 与 Agent's Last Exam 评测中分别达到 81.9 分和 52.4 分;在评估智能体电脑操作能力的 OSWorld-Verified 测试中,更以 86.1分 荣登主流模型榜首。

自主编程是 Qwen3.8 的一大王牌。在 CodeArena 榜单中,Qwen3.8 位列全球第四。与过去只能写函数或补全代码的模型不同,Qwen3.8 能够从零开始、在无人工干预的情况下独立交付一个真实项目。例如,它能自主构建循环工程(Loop Engineering)框架并编排 Agent 执行任务,在运行 16 天后成功打造出 Hermes Agent 级别的自进化智能体框架 “oh-my-cli”(目前该项目已完全开源在 GitHub)。

在专业协同场景中,Qwen3.8 通过真实环境和算力的联合强化学习(RL)扩展,能稳定可靠地完成高频专业任务。比如,它能在一个小时内完成法务团队原本需要一周才能做完的数百份法律合同条款标注;可在数十分钟内拆解 160 小时长视频中的 8400 多个攻防回合,输出球员画像;甚至可以自主调度并行 Agent,完成跨越数年的 ETF 量化轮动策略回测与动态修正。此外,在数字芯片设计和商业模拟运营等长周期任务中,它也表现出优秀的“执行-反馈-迭代”自适应闭环能力。

除了推理性能,Qwen3.8 还刷新了 AI 视觉理解的上限。在 Vision Arena 榜单中斩获全球第二,可深度阅读 200 页财报或理解百小时视频,并能在无网络和源码的 RecreationBench 测试中仅靠视觉交互零基础复刻应用。此外,阿里 真武 M890 超节点已成功适配 Qwen3.8,通过软硬件全链路优化,使其在 Agentic 推理场景中带来高达 1.5倍 的性能提升。

AgentUpdate 深度解析

阿里巴巴 Qwen3.8 的发布,标志着大模型竞争的核心战场已从单纯的“常识问答”和“单步推理”全面转向“长程自主 Agent 工作流”。通过 2.4T 参数与稀疏 MoE 架构的深度融合,Qwen3.8-Max 不仅在推理成本上实现了对 Claude 3.5 Opus 等顶奢模型的降维打击,更在 OSWorld 和 CodeArena 等强 Agent 场景中展现了罕见的系统级闭环能力。这种能独立开发并在真实复杂物理与数字环境(如芯片设计、量化回测)中自适应迭代的特质,正是真正走向“L4 级自治 AI Agent”的技术分水岭。Qwen3.8 下周的开源举措,不仅能极大降低开发者构建高价值、高黏性智能体的门槛,也将彻底重塑目前由少数闭源厂商主导的 AI Agent 生态格局,加速应用端的大爆发。