QWEN 3.8 MAX · LONG-RUN AGENT 国产模型 集体飞升了 2.4T 参数,把长任务一路跑到底 RESEARCH / SKILL / BUILD / VERIFY 2.4T PARAMETERS 1M CONTEXT QWEN 3.8 MAX 12 份年报 RESEARCH → SKILL 桌宠工程 CODE → VOICE GOAL · COMPLETE
PART 01
年报训练
12 份研究沉淀 Skill
PART 02
视觉揭晓
Qwen 对阵 GPT
PART 03
桌宠工程
接手代码再加语音
大家好啊,我是刚逛完 CJ 展的甲木。
上回刚聊完 Kimi K3,转头Qwen3.8-Max 正式版也到了……好家伙,国产模型开始集体飞升了是吧。
WAIC 逛展的间隙我就测了 Qwen3.8 的 Preview 版本,这次正式版终于发布了,苦等好久……
之前写模型,我基本都在横评,同一道题,几个模型各跑一遍,比个高下。说实话,你们看腻了,我也写腻了,横评我是真测不动了,想 Case 想得头秃,灵感也枯竭了。
所以这次换个玩法:不横评。我给它一个从 0 到 1 的长任务,然后直接让它自己执行,能不能一路跑到底。
它是谁,先两句交代完。8 月 3 日,阿里发布 Qwen3.8-Max 正式版:2.4T 总参数、1M 上下文,编程和办公能力都大幅提升,整体站在全球第一梯队。还放了个话:一周后开源。
呜呼,熟悉的「源神」又要回来了!
Ps. 去年做企业落地的时候,Qwen 32B 简直是 yyds……
由于是多模态模型,图、视频、PDF,它都能读。想上手玩的话,可以订阅 Token Plan,千问办公、Qoder、千问APP 里也直接能用。
先说感受:整体水平站在全球第一梯队里不虚,部分场景中效果比肩 GPT-5.6 Luna还是能打一打的。比如,下面这个从 0 到 1 的长任务,就是 Qwen3.8-Max 自己跑的。
先看成品,顺便大家可以来猜一猜。
下面这六张,是六份 AI 生成的年报,我打乱了——三份 Qwen,三份 GPT。你先猜一下,最后我再揭晓答案。
PART
01
AUTONOMOUS RESEARCH
撒手,让它自己学会做年报
我之前不是跟小李一起在折腾公众号排版助手嘛,其实最大的问题就是AI 排版还是差点意思。所以我也一直在琢磨一件事:怎么给 AI 补上审美和排版这门课。
找着找着就盯上了年报——这玩意儿天生就是排版的天花板,讲究、克制、信息密度高,拿来喂给 AI 当教材正合适。
于是这次我让 Qwen3.8-Max 接一个从 0 到 1 的任务:我先自己画好范围,让 Qwen3.8-Max自己搜、自己下、自己读,最后自己沉淀出一套做年报的 Skill。
PROMPT · MARKDOWN LONG-RUN GOAL
先用 /goal 设立目标:研究世界级年报的视觉语言,沉淀为可复用 skill,并据此制作三个完全虚构的 HTML 年报案例。 不要问我,自己完成第一阶段:只做调研与 skill,不做案例页面。 研究范围要广,至少覆盖 10 份公开年报/股东信,且必须横跨: - 美国科技与消费品牌 - 欧洲能源/工业/可持续企业 - 日本或北欧设计导向企业 - 中国互联网、制造、消费企业 - 强监管披露型报告与强品牌叙事型报告 每份研究必须: 1. 使用官方来源; 2. 实际打开 PDF,并渲染/查看至少封面、财务摘要、经营讨论、一个图表页、一个表格页;不能只看网页摘要或元数据; 3. 在 references/research-cards/ 下写研究卡:来源链接、实际观察到的页面、字体层级、网格、色彩、图表、图片使用、表格规则、适用场景、不适用场景、no-copy 规则; 4. 不复制真实文本、数字、图形、Logo、插画或图片。 随后创建 nianbao-skill/: - SKILL.md:端到端工作流与硬约束; - references/:视觉研究卡、版式语法、图表规范、设计 token、图片与插画决策规范; - 明确规定:图片必须服务叙事;优先 CSS、内联 SVG、自制数据图;只使用可验证授权的开放素材;找不到合法且合适的素材时,零图片是正确答案; - 明确禁止:儿童手绘感、emoji、廉价 stock 图、无来源素材、把真实公司视觉资产搬进虚构案例。 最后自检 skill:它必须能指导另一个 agent 独立完成高质量年报,而不是一份审美口号。发布任务后,因为 Prompt 里面的约束很详细和完善,我倒头干别的活去了。
接下来就该 Qwen3.8-Max 发挥,它干的第一件事,是并行。它自己作为主 Agent 负责调度,一次放出6 个研究代理,分头去啃 6 家公司的年报。而它自己呢,就等完成通知,逐个审阅结果,颇有一番领导的派头。
不过从工程化的角度上来讲,让子 Agent 去执行,就不会过多占用主 Agent 自己的上下文。使得主 Agent 能聚焦于调度,更加长程地完成任务。
两波下来,Qwen3.8-Max 一共下载、研究了12 家公司的年报:腾讯、小米、无印良品、可口可乐、耐克、阿里巴巴、宜家、壳牌、李宁、联合利华、Alphabet,还有一家丹麦的新能源公司 Ørsted。
横跨中美欧日,监管披露型和品牌叙事型,两种都覆盖到。
12 份年报读完,它照着 Prompt 的要求,把方法沉淀成了一个 Skill:一份 SKILL.md 八阶段工作流,外加六份参考文档、十二张研究卡。
有一个细节我觉得挺值得一讲的。我给的那份 Prompt,主要在于指导 Qwen3.8-Max 如何设计 nianbao Skill,至于“做出来的年报算不算过关”,我没怎么立规矩。
可它交回来的 Skill,严格规定了输出年报的规范。顺手把做到什么程度才算验收通过也补上了,而且补得比我想的还细,它替我回答了“什么样的年报才算拿得出手”。
SKILL.md 里专门有一节叫「质量门控」:要求所有使用这个 Skill 生成年报的 AI,要在提交前逐条过清单,如果任意一项不过,就不提交。
PART
02
VISUAL REVEAL
揭晓,挑一份给你看
还记得开头那六张打乱的年报吗?现在揭晓答案。
同一份 Skill、同一类任务,两边各做三份,一起摆到你面前。说句我自己的偏好:这六份里Qwen 的视觉我更买账。GPT 赢在克制、稳当,挑不出毛病;
Qwen 赢在愿意给每个品牌名字长出一套专属的视觉,整体来看 Qwen 的视觉效果更胜一筹。怎么样,没猜到吧?Qwen 的效果还是很强的。
六份里我挑一份给你看:Qwen 做的远净循环。
补一句为什么这事对模型挺难。审美没有标准答案,也就没有分数能对着优化,它得自己把「高级感」拆成一条条能执行的决定。
PART
03
EXISTING CODEBASE
桌宠加试,工程先跑通了
Qwen3.8-Max 可以完成从 0 到 1 的任务。但平时大多数 Vibe Coding 不是从 0 到 1,更多时候是接手一份写好的代码,在上面修修改改。
之前不是流行 Codex 桌宠嘛,我就找了个开源项目 Petdex,让 Qwen3.8-Max 先读项目,再接新皮肤和中文语音。打算是给自己做两个美美的陪伴桌宠,顺便时刻提醒我 Vibe Coding 干到哪一步了(严肃)。
我先自己生成了两张图片,后面全让 Qwen3.8-Max 自己折腾。
Qwen3.8-Max 加的是配音这一层,它读完代码发现各家工具都往同一份state.json 写状态,就让语音去读它,于是谁在跑配音就跟着谁响,跑完还会出声提醒你一下,人不在屏幕前也能收到。
来看看做好的结果:
VIDEO 01
最后做完后,Qwen3.8-Max 把两只桌宠都添加进 Petdex 中,还可以直接切换:
BASH · PETDEX
petdex select xiaoxi petdex select xinglan语音也做了区分,小汐是少女声,星澜是御姐声,跟着角色一起切。
VIDEO 02
这下再也不用担心中断了,要是 AI 提问或者 AI 完工了,立刻就可以听到甜甜的声音提醒你该 Vibe Coding 了。
LAST
FINAL VERDICT
结语
不过不知道是不是参数上来了,Qwen3.8-Max 速度方面其实我觉得可以做得更好,以年报任务为例。
如上图所示,这个从 0 到 1 的长任务,它跑了相当久。不过如果不用实时盯着的活,本来就不急在这一两分钟,可以放着慢慢跑。
抛开慢,整体体验还是很出乎我意外。我全程做的就两件事:下需求,验收。
而且官方还有个贼离谱的例子,他们让Qwen3.8-Max 从零创建一个叫 oh-my-cli 的开源项目,开发过程中自动从社区收集需求、把需求规范化为 GitHub Issue、由 Agent 自动领取任务并执行。在这个过程里面它还会把用户反馈和社区先进实践转化为新需求,持续给项目演进新功能。
整个过程完全无人工介入,自主运行约 16 天后,仓库累计留下265 次 commits、127 个 PR、151 个 issues(累计增加中),全部 trace 公开在 GitHub。
qwen-code-dev-bot / oh-my-cli,可查验
想自己试试的:8 月 3 日正式版上线,Token Plan 就能用。而且 千问办公、Qoder 和 千问APP 里也都能用。一周后正式开源。
顺带一提,如果你用 Claude Code + CCSwitch 的话,这里不光要填 API,一定记得要填模型昵称,不然用的不一定是最新的 3.8-Max。
上线之后替换为正式版的 qwen3.8-max 即可
如果你不想自己折腾,千问办公 和 Qoder 里也都能用。
说到这我其实挺感慨。搁一两年前,国模能接住这种从 0 到 1 的长任务,我不太敢想。结果现在Qwen3.8-Max已经能在 TextArena 中杀入全球前五,距离公认当下性能最强 Fable 5 仅差十几分。
差距当然还有,但各家都着实不错了。
期待国产模型全面超越的一天,干掉 A÷。
以上。
我是甲木,热衷于分享一些 AI 干货内容,同时也会分享 AI 在各行业的落地应用。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下期再见

