SOURCE // NEWS

阿里Qwen3.8-Max突袭发布:直逼Claude,端到端Agent太强了

阿里Qwen3.8-Max突袭发布:直逼Claude,端到端Agent太强了

阿里巴巴今日突袭发布了全新一代基座大模型Qwen3.8-Max。该模型总参数量高达2.4万亿,在最新放榜的权威第三方LMSYS Chatbot Arena文本能力榜单中一路冲进全球大模型第一梯队,表现直逼Claude系列,甚至在编程和工具调用等智能体(Agent)场景中超越了Claude Opus 5Fable 5

性能强劲的同时,Qwen3.8-Max也展现了极致的性价比。国内API价格为每百万输入12元、输出36元,隐式缓存命中仅需1.5元。其国际定价仅为Opus 540%(输入)24%(输出)。这种超高性价比让众多开发者在社交平台上直呼“真香”,有用户仅用一周便以极低成本复刻了经典游戏《愤怒的小鸟》。

在核心技术指标上,Qwen3.8-Max在科研复现、多模态理解、长视频处理及电脑操作(Computer Use)等多项任务中超越了GPT-5.6。具体而言,它具备四大亮点能力:一是端到端自主编程,能从空文件夹出发、在无人干预下自主推进数十天交付完整项目;二是系统级自主规划,在数千轮超长交互中不迷失目标;三是高效的专业工作流处理;四是能够消化数万页材料和上百小时视频的多模态Agent能力。

为了验证其端到端编程能力,测试人员给Qwen3.8-Max输入了一份详尽的PRD(产品需求文档),要求其从零开发一个可运行的AI资讯网页。该模型在短短五分钟内完成了从需求拆解、技术选型到代码实现的全套流程。更令人惊叹的是,模型甚至自动生成了一份问题与解决记录(Debug Log),并在交付前进行了一轮包含依赖安装、本地启动及功能覆盖的自动化验收测试,全程无需人类干预。

AgentUpdate 深度解析

阿里巴巴 Qwen3.8-Max 的发布,标志着大模型从“单步指令响应”向“端到端自主执行”的智能体(Agent)时代迈出了决定性的一步。与传统的代码生成助手不同,Qwen3.8-Max 在实测中展现出的自我 Debug、生成错误日志、以及主动进行自动化 QA 验收的能力,深刻契合了下一代 AI Agent 闭环控制流的核心特征。横向对比 Anthropic 的 Claude 5 系列,Qwen3.8-Max 不仅在长程规划和复杂工具调用(Tool Use)上不落下风,更通过极致的性价比打破了闭源高壁垒模型的算力成本魔咒。这种“高智能+低成本”的双重优势,将极大加速企业级 Agent 生态的爆发。未来,AI 智能体将不再仅仅是程序员的辅助工具,而是能够自主消化 PRD 并独立交付软件工程的虚拟协作者,这必将重塑软件工程和自动化生产力的范式。