阿里Qwen3.8正式发布:性能全球第一梯队,价格远低于Claude

出品 | 电商派Pro 作者 | 老电团队

Qwen3.8-Max来了,编程、办公样样行
日前,阿里巴巴正式发布新一代基座大模型Qwen3.8,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。
不少行业人士测试后直呼:“我心目中的Qwen回来了”“这才是Qwen模型应该有的样子”……
这次发布的Qwen3.8-Max到底有多强?
据了解,其首次将千问大模型的总参数量拓展至2.4T,激活95B,获得了更高的推理效率、更快的推理速度,整体性能也迎来新突破,上下文长度达1M Tokens,并支持视觉理解——是阿里迄今为止最大、最强的模型。
在权威榜单Arena中,Qwen3.8-Max全球排名第二,得分1496,仅次于Anthropic的Claude系列。在编程能力榜Code Arena、视觉理解榜Vision Arena上,Qwen3.8-Max同样稳居全球第一梯队。

不仅是性能足够强,Qwen3.8-Max还把价格也打了下来:国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,而输入与输出的国际价格仅为Claude Opus5的40%与24%。目前全球开发者都可通过千问AI平台直接调用API。
值得一提的是,同一天,“千问办公”也开启公测,直接内置了Qwen3.8-Max,普通人也可以通过网页版和PC客户端直接上手体验。不需要懂代码,也不需要配置开发环境——打开浏览器就能用。

当然,AI大模型发展到今天,光看参数和跑分已经不够了。这些数字在新一轮的行业竞争中,更像是一张入场券。
真正决定价值的,是模型能不能真正帮企业把活干了、把钱省了、把效率提上去。

真正落地行业的模型长什么样?
我们注意到,Qwen3.8-Max的核心提升并不在某个单点能力,而在于把复杂任务往端到端完成的方向推进。
目前的一些测试结果显示,编程方面,它不是补全代码,而是能从一个空文件夹出发,自主运行约16天,交付一个完整开源项目——覆盖理解需求、搭建工程、运行验证、持续优化的全闭环;
长程任务方面,它在365天模拟的电商经营中,能够根据反馈持续调整策略,最终以最高4倍回报胜出;
专业工作方面,法务团队标注数百份法律文档、千余个条款需要一周,它只用一小时就能完成;面对160小时的比赛录像,它只用数十分钟就能拆解出8400多个攻防回合的战术报告——不只是看懂视频,而是把理解转化为可直接使用的结果;
多模态智能体方面,新模型可以理解约200页的财报和复杂PDF,精准处理超过100小时的长视频,并进一步完成信息分析、内容整理或Vlog剪辑等。
当然,这些测试结果可能来自专业人士,普通用户使用Qwen3.8-Max的具体效果如何,还得放进真实场景里进一步验证。
为了测试Qwen3.8-Max在办公与知识处理方面的能力,《电商派Pro》尝试把亚马逊最新发布的2026年Q2财报丢给了它。
这份财报大概有十几页,而且是纯英文的。如果换作以往,我们可能需要花上大半天时间逐页翻译、整理重点,再手动提取关键数据。
如今将这份财报发给Qwen3.8-Max,任务要求也很简单:提取核心财务数据,识别业务亮点和风险信号,判断对电商行业的影响,输出带数据依据的分析报告——而非简单摘要。
结果是,Qwen3.8-Max给出了一份5000字的完整汇报提纲。不仅有“30秒摘要”和核心结论,而且每条结论都标注了财报原文出处和页码。
比如它在报告中指出:Q2净利润626亿美元、同比+245%,但其中534亿美元来自对Anthropic投资的重估收益,剔除后净利润约210亿美元——“利润高增有水分,但主业改善为实”。这种判断已经超越了数据复述,进入了分析层面。

报告还列出了8条风险变化,包括自由现金流首次转负(TTM -76亿美元)、长期债务半年内从656亿增至1289亿美元等容易被忽略的信号。
在对电商行业的影响部分,它拆解了亚马逊“代理式购物”的转化数据——使用Alexa for Shopping的用户客单价平均高出40%以上,并给出了对国内即时零售、AI导购、零售媒体等细分赛道的影响判断。

通俗点说,这已经是一份可以直接拿去汇报的分析报告。不是摘要,是工作成果。
第二个测试更贴近众多商家的电商日常。
我们给了Qwen3.8-Max一个店铺的基本信息——品类、客单价、目标人群、促销节点等,要求生成一份新品上市营销方案。
最终Qwen3.8-Max输出了三件东西:完整营销方案、逐日排期甘特图、分模块执行清单。
其中,营销方案把上市周期拆成四个阶段。准备期8.10-8.16,预热期8.17-9.06,爆发期9.07-9.27,返场期9.28-10.08,以8月24日为上市T日。每个阶段有明确任务、渠道和预算分配。
甘特图中,按天排了30多个任务节点。从卖点提炼、素材制作、KOC建联,到搜推、店播排期、评价冲刺——全链路覆盖。关键节点用金色标记:8.16物料验收、8.24正式上市、8.30首周评价≥150条、9.07爆发启动加价、10.08收官复盘。

执行清单中,共分成6个模块、42条任务,每条标注负责人和截止日期。其中,“上架准备”11条,从卖点提炼到监控看板搭建;搜推场景拆出品牌词、成分词、功效长尾、竞品截流、智能拉新五个计划,每个带具体预算;“内容种草”里KOC铺量30-50篇约7500元、垂直达人背书视频约3000元、笔记加热预算2000元——金额精确到百位。

更关键的是它还设置了一些规则。比如渠道ROI连续两天低于2.0,砍50%预算。每日09:30盯盘,盯转化率、评价增速、花费进度、ROI等等。
换句话说,一个中小商家没有专业策划团队,也能用Qwen3.8-Max在十几分钟内拿到一份结构完整、可直接交付运营的方案。质量可能仍需人工判断,但从零到一的成本被大幅压缩了。
目前,在更多的真实场景中,来自不同行业的用户已经把Qwen3.8-Max用进了真实业务。
比如作为电商核心环节的物流场景中,稳定的履约能力离不开软件层面的精准调度。
菜鸟研发总监郭凤钊直言:“软件交付真正的难点,从来不是写某一段代码,而是几十个环节串起来后的系统性一致。”Qwen3.8-Max在菜鸟的交付流水线里连续自主完成了设计、编码、审查到部署的全链路,各环节衔接稳定、上下文不丢。“以前需要多名工程师协同盯守的一次完整交付,现在一次启动即可闭环。”
在法律研究等高门槛的专业服务领域,Qwen3.8-Max同样展现出惊人的理解力。
金杜律师事务所知识产权部合伙人瞿淼提到:“进行法律研究和检索时,信息反馈精准,对于法律行业非常重要和必要。我们能够依赖的信息和成果必须是有出处和精确的。”而Qwen3.8-Max成功守住了这条底线——信息反馈精准、有出处,在不确定处主动提示,而非硬编答案。
在适用范围更广的企业开发场景中,网易智企CodeWave技术负责人姜天意从企业级AI编程的角度给出了判断:Qwen3.8-Max加持下的企业级AI Coding平台,实现了Spec驱动下AI生成代码可维护、可迭代,开发效率翻倍,Token成本大幅下降,“让企业敢把AI编程用在生产项目中”。
这些都不是简单的参数堆砌,而是实打实的业务结果。

大模型竞争下半场,从跑分到交付
全球最大的模型API聚合平台OpenRouter数据显示,美国企业调用中国模型的token份额,从2025年初的4.5%一路攀升,到今年7月已达到63%,创下历史新高。眼下在OpenRouter的调用榜单上,前十名几乎都是国产模型。

这场大规模迁移的背后,我们看到有三个条件凑齐了:
一是性能够用了。以Qwen为代表的国产顶级模型,在编程、Agent等主流场景中已具备足够竞争力;
二是价格打下来了。据OpenRouter数据团队透露,中国开源模型的使用成本比Anthropic和OpenAI便宜60%至90%,已有美国公司公开表示切换后数月省下数百万美元;
三是开放权重带来信任。企业可以自行部署、审计和改造,用起来“心里有底”。就比如Qwen系列自2023年开源至今,累计开源超400款模型,衍生模型数超20万,下载量突破10亿次,是全球第一开源模型家族。Qwen3.8-Max预计也将在下周开源,同时还将开源Qwen3.8-27B。
更值得注意的是这些调用的质量。OpenRouter高管透露,中国开放权重模型在美国公司运行的Agent工作流中占比“不成比例地高”。涨上去的不是闲聊,而是替企业干活的任务,也是企业级市场里Token消耗最大、粘性最强、最难被替换的那部分。
由此可见,63%的token份额,不是靠参数赢来的,是靠企业真正在用。
透过实测和用户评价可以看到,Qwen3.8在各个场景下做到的事,都已经是实打实的业务结果。在这场从“跑分”到“交付”的转向中,Qwen3.8已经交出了答卷——大模型的竞争,终究不是谁参数更大,而是谁先帮企业把活干了。
(来源:电商报)