QWEN 3.8 MAX · LONG-RUN AGENT 国产模型 集体飞升了 2.4T 参数,把长任务一路跑到底 RESEARCH / SKILL / BUILD / VERIFY 2.4T PARAMETERS 1M CONTEXT QWEN 3.8 MAX 12 份年报 RESEARCH → SKILL 桌宠工程 CODE → VOICE GOAL · COMPLETE

PART 01

年报训练

12 份研究沉淀 Skill

PART 02

视觉揭晓

Qwen 对阵 GPT

PART 03

桌宠工程

接手代码再加语音

大家好啊,我是刚逛完 CJ 展的甲木。

上回刚聊完 Kimi K3,转头Qwen3.8-Max 正式版也到了……好家伙,国产模型开始集体飞升了是吧。

WAIC 逛展的间隙我就测了 Qwen3.8 的 Preview 版本,这次正式版终于发布了,苦等好久……

之前写模型,我基本都在横评,同一道题,几个模型各跑一遍,比个高下。说实话,你们看腻了,我也写腻了,横评我是真测不动了,想 Case 想得头秃,灵感也枯竭了。

所以这次换个玩法:不横评。我给它一个从 0 到 1 的长任务,然后直接让它自己执行,能不能一路跑到底。

它是谁,先两句交代完。8 月 3 日,阿里发布 Qwen3.8-Max 正式版:2.4T 总参数、1M 上下文,编程和办公能力都大幅提升,整体站在全球第一梯队。还放了个话:一周后开源。

呜呼,熟悉的「源神」又要回来了!

Ps. 去年做企业落地的时候,Qwen 32B 简直是 yyds……

打开网易新闻 查看更多图片

由于是多模态模型,图、视频、PDF,它都能读。想上手玩的话,可以订阅 Token Plan,千问办公、Qoder、千问APP 里也直接能用。

先说感受:整体水平站在全球第一梯队里不虚,部分场景中效果比肩 GPT-5.6 Luna还是能打一打的。比如,下面这个从 0 到 1 的长任务,就是 Qwen3.8-Max 自己跑的。

先看成品,顺便大家可以来猜一猜。

下面这六张,是六份 AI 生成的年报,我打乱了——三份 Qwen,三份 GPT。你先猜一下,最后我再揭晓答案。

打开网易新闻 查看更多图片

PART

01

AUTONOMOUS RESEARCH

撒手,让它自己学会做年报

我之前不是跟小李一起在折腾公众号排版助手嘛,其实最大的问题就是AI 排版还是差点意思。所以我也一直在琢磨一件事:怎么给 AI 补上审美和排版这门课。

找着找着就盯上了年报——这玩意儿天生就是排版的天花板,讲究、克制、信息密度高,拿来喂给 AI 当教材正合适。

打开网易新闻 查看更多图片
打开网易新闻 查看更多图片

于是这次我让 Qwen3.8-Max 接一个从 0 到 1 的任务:我先自己画好范围,让 Qwen3.8-Max自己搜、自己下、自己读,最后自己沉淀出一套做年报的 Skill。

PROMPT · MARKDOWN LONG-RUN GOAL

先用 /goal 设立目标:研究世界级年报的视觉语言,沉淀为可复用 skill,并据此制作三个完全虚构的 HTML 年报案例。  不要问我,自己完成第一阶段:只做调研与 skill,不做案例页面。  研究范围要广,至少覆盖 10 份公开年报/股东信,且必须横跨: - 美国科技与消费品牌 - 欧洲能源/工业/可持续企业 - 日本或北欧设计导向企业 - 中国互联网、制造、消费企业 - 强监管披露型报告与强品牌叙事型报告  每份研究必须: 1. 使用官方来源; 2. 实际打开 PDF,并渲染/查看至少封面、财务摘要、经营讨论、一个图表页、一个表格页;不能只看网页摘要或元数据; 3. 在 references/research-cards/ 下写研究卡:来源链接、实际观察到的页面、字体层级、网格、色彩、图表、图片使用、表格规则、适用场景、不适用场景、no-copy 规则; 4. 不复制真实文本、数字、图形、Logo、插画或图片。  随后创建 nianbao-skill/: - SKILL.md:端到端工作流与硬约束; - references/:视觉研究卡、版式语法、图表规范、设计 token、图片与插画决策规范; - 明确规定:图片必须服务叙事;优先 CSS、内联 SVG、自制数据图;只使用可验证授权的开放素材;找不到合法且合适的素材时,零图片是正确答案; - 明确禁止:儿童手绘感、emoji、廉价 stock 图、无来源素材、把真实公司视觉资产搬进虚构案例。  最后自检 skill:它必须能指导另一个 agent 独立完成高质量年报,而不是一份审美口号。

发布任务后,因为 Prompt 里面的约束很详细和完善,我倒头干别的活去了。

接下来就该 Qwen3.8-Max 发挥,它干的第一件事,是并行。它自己作为主 Agent 负责调度,一次放出6 个研究代理,分头去啃 6 家公司的年报。而它自己呢,就等完成通知,逐个审阅结果,颇有一番领导的派头。

不过从工程化的角度上来讲,让子 Agent 去执行,就不会过多占用主 Agent 自己的上下文。使得主 Agent 能聚焦于调度,更加长程地完成任务。

打开网易新闻 查看更多图片

两波下来,Qwen3.8-Max 一共下载、研究了12 家公司的年报:腾讯、小米、无印良品、可口可乐、耐克、阿里巴巴、宜家、壳牌、李宁、联合利华、Alphabet,还有一家丹麦的新能源公司 Ørsted。

横跨中美欧日,监管披露型和品牌叙事型,两种都覆盖到。

打开网易新闻 查看更多图片

12 份年报读完,它照着 Prompt 的要求,把方法沉淀成了一个 Skill:一份 SKILL.md 八阶段工作流,外加六份参考文档、十二张研究卡。

打开网易新闻 查看更多图片

有一个细节我觉得挺值得一讲的。我给的那份 Prompt,主要在于指导 Qwen3.8-Max 如何设计 nianbao Skill,至于“做出来的年报算不算过关”,我没怎么立规矩。

可它交回来的 Skill,严格规定了输出年报的规范。顺手把做到什么程度才算验收通过也补上了,而且补得比我想的还细,它替我回答了“什么样的年报才算拿得出手”。

打开网易新闻 查看更多图片

SKILL.md 里专门有一节叫「质量门控」:要求所有使用这个 Skill 生成年报的 AI,要在提交前逐条过清单,如果任意一项不过,就不提交。

PART

02

VISUAL REVEAL

揭晓,挑一份给你看

还记得开头那六张打乱的年报吗?现在揭晓答案。

打开网易新闻 查看更多图片

同一份 Skill、同一类任务,两边各做三份,一起摆到你面前。说句我自己的偏好:这六份里Qwen 的视觉我更买账。GPT 赢在克制、稳当,挑不出毛病;

Qwen 赢在愿意给每个品牌名字长出一套专属的视觉,整体来看 Qwen 的视觉效果更胜一筹。怎么样,没猜到吧?Qwen 的效果还是很强的。

六份里我挑一份给你看:Qwen 做的远净循环。

打开网易新闻 查看更多图片
打开网易新闻 查看更多图片
打开网易新闻 查看更多图片

补一句为什么这事对模型挺难。审美没有标准答案,也就没有分数能对着优化,它得自己把「高级感」拆成一条条能执行的决定

PART

03

EXISTING CODEBASE

桌宠加试,工程先跑通了

Qwen3.8-Max 可以完成从 0 到 1 的任务。但平时大多数 Vibe Coding 不是从 0 到 1,更多时候是接手一份写好的代码,在上面修修改改。

之前不是流行 Codex 桌宠嘛,我就找了个开源项目 Petdex,让 Qwen3.8-Max 先读项目,再接新皮肤和中文语音。打算是给自己做两个美美的陪伴桌宠,顺便时刻提醒我 Vibe Coding 干到哪一步了(严肃)。

我先自己生成了两张图片,后面全让 Qwen3.8-Max 自己折腾。

打开网易新闻 查看更多图片
打开网易新闻 查看更多图片
打开网易新闻 查看更多图片

Qwen3.8-Max 加的是配音这一层,它读完代码发现各家工具都往同一份state.json 写状态,就让语音去读它,于是谁在跑配音就跟着谁响,跑完还会出声提醒你一下,人不在屏幕前也能收到。

打开网易新闻 查看更多图片

来看看做好的结果:

打开网易新闻 查看更多图片

VIDEO 01

最后做完后,Qwen3.8-Max 把两只桌宠都添加进 Petdex 中,还可以直接切换:

BASH · PETDEX

petdex select xiaoxi petdex select xinglan

语音也做了区分,小汐是少女声,星澜是御姐声,跟着角色一起切。

VIDEO 02

这下再也不用担心中断了,要是 AI 提问或者 AI 完工了,立刻就可以听到甜甜的声音提醒你该 Vibe Coding 了。

LAST

FINAL VERDICT

结语

不过不知道是不是参数上来了,Qwen3.8-Max 速度方面其实我觉得可以做得更好,以年报任务为例。

打开网易新闻 查看更多图片

如上图所示,这个从 0 到 1 的长任务,它跑了相当久。不过如果不用实时盯着的活,本来就不急在这一两分钟,可以放着慢慢跑。

抛开慢,整体体验还是很出乎我意外。我全程做的就两件事:下需求,验收。

而且官方还有个贼离谱的例子,他们让Qwen3.8-Max 从零创建一个叫 oh-my-cli 的开源项目,开发过程中自动从社区收集需求、把需求规范化为 GitHub Issue、由 Agent 自动领取任务并执行。在这个过程里面它还会把用户反馈和社区先进实践转化为新需求,持续给项目演进新功能。

整个过程完全无人工介入,自主运行约 16 天后,仓库累计留下265 次 commits、127 个 PR、151 个 issues(累计增加中),全部 trace 公开在 GitHub。

打开网易新闻 查看更多图片

qwen-code-dev-bot / oh-my-cli,可查验

想自己试试的:8 月 3 日正式版上线,Token Plan 就能用。而且 千问办公、Qoder 和 千问APP 里也都能用。一周后正式开源。

顺带一提,如果你用 Claude Code + CCSwitch 的话,这里不光要填 API,一定记得要填模型昵称,不然用的不一定是最新的 3.8-Max。

打开网易新闻 查看更多图片
打开网易新闻 查看更多图片

上线之后替换为正式版的 qwen3.8-max 即可

如果你不想自己折腾,千问办公 和 Qoder 里也都能用。

说到这我其实挺感慨。搁一两年前,国模能接住这种从 0 到 1 的长任务,我不太敢想。结果现在Qwen3.8-Max已经能在 TextArena 中杀入全球前五,距离公认当下性能最强 Fable 5 仅差十几分。

打开网易新闻 查看更多图片

差距当然还有,但各家都着实不错了。

期待国产模型全面超越的一天,干掉 A÷。

以上。

我是甲木,热衷于分享一些 AI 干货内容,同时也会分享 AI 在各行业的落地应用。

打开网易新闻 查看更多图片

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下期再见