
调研时间:2026年8月17日 覆盖平台:HuggingFace / Reddit / Hacker News / X(Twitter) / YouTube / B站 / 知乎 / 中文媒体 调研人:AI调研助手
一、模型概述
Qwen3.8-27B 是阿里千问团队于 2026年8月14日 正式开源的模型,是 Qwen3.8 系列的稠密(Dense)版本。
核心参数
架构独特性
Qwen3.8-27B 采用了混合线性注意力架构:
每16层中,12层使用 Gated DeltaNet(线性注意力,速度快、内存省) 4层使用 Gated Attention(传统注意力,精度高) 这种设计在保持性能的同时大幅降低了长上下文的计算开销
与 Qwen3.6-27B 的关系
完全相同的架构——社区用户 Course_Latter 在 Reddit 上发布了 HuggingFace 模型对比,显示架构 diff 为 0 处变更。所有能力提升 100% 来自后训练(训练数据、RL、蒸馏策略改进)。这与 GLM 5.2→5.3、Grok 4.5→4.6、DeepSeek V4 Flash→0731 的迭代模式完全一致——"小版本号=训练迭代,大版本号=架构变更"。
二、基准性能全面数据
文本性能基准
| Terminal Bench 2.1 | 73.0 | 78.2 | |||
| SWE-bench Pro | 61.7 | ||||
| NL2Repo-Bench | 47.6 | ||||
| DeepSWE 1.1 | 42.2 | ||||
| QwenSWEBench | 79.0 | ||||
| CoWorkBench | 70.7 | ||||
| JobBench | 33.4 | ||||
| Agents' Last Exam (Pass@1) | 20.4 | ||||
| IFBench | 79.5 | ||||
| GPQA Diamond | 90.3 | 91.3 | |||
| HLE | 40.0 | ||||
| LiveCodeBench v6 | 90.3 |
多模态性能基准
| OSWorld-Verified | 84.3 | ||||
| WebArena-Verified | 64.8 | ||||
| AndroidWorld | 81.9 | ||||
| RecreationBench | 47.1 | ||||
| SWE-MM | 38.6 | ||||
| Vision2Web | 62.9 | ||||
| MathVision (w/ CI) | 94.6 | ||||
| BabyVision (w/ CI) | 85.6 | ||||
| CharXiv (RQ, w/ CI) | 90.2 | ||||
| OmniDocBench 1.5 | 91.1 | ||||
| RealWorldQA | 85.9 |
关键提升幅度
DeepSWE 1.1: 13.3 → 42.2,**+218%**(最惊人的跳跃) QwenSWEBench: 49.3 → 79.0,**+60%** OSWorld: 63.9 → 84.3,**+32%** BabyVision (w/ CI): 28.9 → 85.6,**+196%** SWE-bench Pro: 53.5 → 61.7,**+15%**(超过 Opus 4.6 Max 的 53.4)
仍落后 Opus 4.6 Max 的领域
Terminal Bench: 73.0 vs 78.2 GPQA Diamond: 89.2 vs 91.3 HLE: 30.8 vs 40.0 NL2Repo-Bench: 42.3 vs 47.6
三、HuggingFace 社区反馈
基础数据
| 10,400 | |
| 118 |
社区讨论热门帖(按赞数排序)
? 最高赞:#75 "Please provide the model Qwen 3.8 35B-A3B" — 78赞/5评论
社区强烈要求35B MoE版本。用户 highpolygonal 发帖请求,获得大量支持。
#90 "MOE MODEL 35B!" — 31赞/1评论
pinkpink96 直接用大标题呼吁:"35B MOE please!"
#77 "35B-A3B" — 32赞/2评论
gbuzhf 简洁有力地请求35B-A3B版本。
#76 "Why Qwen3.8-27B Overthinks? Here the reason and partial fix confirmed by benchmarks" — 24赞/25评论
LuffyTheFox 发布了详细的过度思考分析与修复方案,是讨论最热烈的技术帖。
#97 "A crazy thinking model" — 9赞/15评论
xuguowong 抱告模型不停思考的问题:"关于模型不停思考的问题"。
#92 "After waiting 49 minutes and 16 seconds while the model was still thinking, I'm simply giving up..." — 3赞/10评论
MrDevolver 报告等待49分钟后放弃,引发大量共鸣讨论。
#112 "I benchmarked 45 llama.cpp settings on Qwen3.8-27B. The MTP draft head is worth 1.81x, free (RTX 5090, Q4_K_M)" — 6赞
laxmimerit 系统性测试了45种llama.cpp配置,发现MTP draft head可带来1.81倍加速。
#103 "Benchmarked Qwen3.8-27B vs Nemotron 3.5 Lightning and Muse Glimmer on 16 hard problems" — 10赞/6评论
laxmimerit 在16个难题上对比测试,提供独立评测数据。
#107 "代码能力可能变强了,但是写作能力明显变弱了" — 5赞/3评论
sumirecccp 指出代码能力提升的代价是写作能力下降。
#105 "Hallucinates MUCH more than Qwen3.6-27B?" — 3条评论
nebi 报告3.8比3.6幻觉明显增多,引发讨论。
#84 "Bench maxed -- don't be fooled by the table presented in the model card" — 1赞/4评论
pathosethoslogos 质疑基准数据可能被优化过(benchmaxxing),引发争议。
#69 "It is inferior to the qwen3.6 35 model in image and video recognition" — 4条评论
wzgrx 报告在图像和视频识别方面不如Qwen3.6-35B。
#80 "MTP speculation is net-negative under Ollama's GGUF path, strongly positive under MLX (measured on M4 Pro)" — 5赞
OtsoaD 发现MTP在不同推理后端表现相反——Ollama GGUF下负面,MLX下正面。
#100 "It's really good" — 4赞/3评论
jbourny 简短但积极的评价。
#102 "Thank You Qwen Team!!!!" — 4赞
cob05 纯粹的感谢帖。
#73 "恭迎小模型的神!" — 1赞/1评论
Kalida6 用中文表达了对小模型的赞美。
#101 "qwen3.8-27b on one pro 6000: 140 tok/s, day after release" — 2赞
Avifenesh 报告在RTX Pro 6000上达到140 tok/s。
社区讨论关键主题分布
35B MoE请求(#75/#77/#84/#85/#88/#89/#90/#94等)—— 超过15个帖子,累计超过200赞,是社区最强烈的集体呼声 过度思考问题(#76/#79/#82/#83/#92/#96/#97/#107等)—— 超过10个帖子讨论 MTP性能优化(#80/#112)—— 技术深度讨论 基准质疑(#84/#85)—— benchmaxxing担忧 能力退步报告(#105/#107/#69)—— 幻觉增多、写作变弱、多模态退步 感谢与赞美(#73/#98/#100/#102等)
四、Reddit 社区反馈
r/LocalLLaMA 帖子汇总(按热度排序)
1. "Qwen 3.8-27b coming this week" — 2,500赞 / 311评论(6天前,预热帖)
发布前的期待讨论。社区用户开始讨论硬件准备、预期性能等。
2. "Qwen3.8-27B is identical to Qwen3.6-27B!" — 1,100赞 / 184评论(3天前,争议帖)
本帖是最具技术深度的讨论。用户 Course_Latter 发布了HuggingFace模型对比,确认架构完全相同。
关键评论摘录:
onil_gova: "RL environments + On-policy Distillation would be my guess for the jump in performance" onil_gova (解释OPSD): "On-Policy Self-Distillation (OPSD): Imagine you have a twin. You're both asked to solve the same problem, but your twin has the answer sheet, and their goal is to get you to solve the problem yourself without giving you the answer." onil_gova (解释MOPD): "Multi-Teacher On-Policy Distillation (MOPD): Imagine you have 8 twins. Each twin is an expert in something different." Stepfunction: "That's why it's 3.8 and not 4.0. The major version generally indicates architecture changes, while the minor version generally indicates training increments." aguspiza: "Same pattern as GLM-5.2 vs GLM-5.3, grok-4.5 vs grok-4.6, DeepSeekV4-Flash-preview vs DeepSeekV4-Flash-0731" DigitalguyCH: "The knowledge cutoff however is still 2024..." Old_Restaurant_2216: "Better training data != newer knowledge. In terms of coding performance, all you need is high quality traces of agentic sessions with coding." odomobo: "Minor releases sharing architecture is the standard paradigm. Most of the gains these days come from advancements in post-training. However, pretraining dwarfs post-training in pure compute costs." BringTea_666: 介绍了 NInfer 自定义推理引擎——RTX 5090上200 t/s,C=8并发时1300 t/s stephen_holograf: 详细分享了LoRA热交换实践——用Tinker为Qwen3.6-35B-A3B创建LoRA,$5/10分钟,但llama.cpp中每加一个LoRA会降低t/s ConfidenceSuper4462: "Same pattern as DeepSeek's V3 point releases, arch held while post-training changed. Presumably 4.0 is where the arch moves."
3. "Qwen/Qwen3.8-27B · released" — 990赞 / 298评论(3天前,发布公告帖)
最热闹的发布讨论帖,用户 de4dee 发布。
关键评论摘录:
kevin_cn_ai: "RTX 3090 fans: ENGAGE" jijig: "Dual RTX 3090 owners: ENGAGE ENGAGE" / "2x3090 with nvlink loves this size of model" / "Running 3.6 at Q8 with full context and getting ~60-70tps. No NVLink" / "I can push my context to ~160k at F16" munkiemagik: 详细讨论了KV cache量化策略——"sitting at just under 200k and I use KV at Q8_0" / "I've been thinking maybe I am looking at it the wrong way and instead of looking for a big model to fill up 96GB I should be looking at it from a more orchestrated perspective of how many multiple models can I run concurrently" Blues520: "I have 3 [3090s] now and looking for an excuse to get a 4th ?" Terrible-Detail-1364: "q4xl 256k with 3090+4060ti (40gb vram) and q8_0 at 128k ctx so far, with f16 kv/cache quant" WonderfulEagle7096: "Beating Opus 4.6 Max in multiple benchmarks sounds too good to be true. (already downloading)" michaelsoft__binbows: "first we had a 744B model in GLM 5.2 reach opus 4.6. Then DSV4Flash-0731 reached it with 284B. Now... 27B? nooooo way if it can really pull some weight as a coder and have some amount of general common sense this is about to basically 10x the capability of those of us with 'cheap' local rigs." Haiku-575: "That... that can't be real, can it? At 27B? This much improvement in a couple months?" n0head_r: "Qwen38-27B-Q6_K from unsloth on 2*RTX 5080 and latest llama.cpp build from source. The model fit in 32GB VRAM with 172k ctx kv q8_0. MTP and -sm tensor it runs stable at 100 tps until 60-70k context is filled, at 100k it dropped slightly - around 95tps." dingo_xd: "History in the making." social_zip: "now there is gguf + uncensored (made by me)" Alternative_Ad4267: "at 27B parameters, Qwen3.8 27B is pretty close to DeepSeekV4 Flash 0731 which is 284B A13B!" miniocz: "Frankly I think we are at point where harness is going to be more important than model itself." AXYZE8: "FINALLY! I waited since GPT-OSS for other local model that natively has low and medium reasoning!" CoreParad0x: "I actually made a full game editor for an old MMO from scratch using Opus 4.5. I think it was around 70k lines of code, proper RHI, used OpenGL behind that... Opus has gone to shit since then."
4. "Local uncensored Opus 4.6 at home - Qwen3.8 27B heretic" — 901赞 / 214评论(2天前)
越狱版(uncensored)讨论帖。社区发布了去除安全对齐的版本,引发关于审查制度与开源自由的讨论。
5. "Exact Qwen 3.8 27b release date and time" — 897赞 / 219评论(5天前)
倒计时讨论帖,社区用户猜测和等待发布时间。
6. "Qwen3.8-27B vs Qwen3.6-27B writing ray-tracers in BASIC" — 831赞 / 97评论(1天前)
直接对比评测——用两个模型分别写BASIC光线追踪器,展示3.8相比3.6的进步。
7. "Qwen 3.8-27B is a game changer" — 665赞 / 299评论(2天前)
兴奋讨论帖,大量用户分享第一印象和实测结果。
r/unsloth: "Qwen3.8-27B is out now!" — 1,100赞 / 227评论
Unsloth 团队快速发布了GGUF量化版本,社区高度活跃。
r/LocalLLM: "This is why uncensored open-weight models matter" — 1,100赞 / 309评论(15小时前)
越狱版引发的深层次讨论——为什么无审查开源权重模型重要。
r/singularity 讨论
"We getting today grok 4.6, DeepSeek v4 pro, open source Qwen 3.8 models!!" — 201赞/15评论 "3.7 flash looks fine I guess" — 296赞/62评论(讨论3.8对3.7的替代)
Reddit 其他搜索结果
"30B is quietly becoming the default size for open models" — r/LocalLLM "Put Qwen3.8-27B on opencode-go" — r/Qwen_AI "How many tokens/second output are you getting?" — 性能讨论 "Qwen3.8-27b on RTX 3090 - 82 tps single request, up to 672 tps peak" — 性能分享 "WildClawBench ranks Qwen3.8-27B 15th on agent tasks" — 独立基准排名 "What's the purpose of Qwen3.8 27B?" — 讨论定位 "Can we upcycle Qwen3.8-27b to be MoE?" — 架构讨论
Reddit 社区情绪分布(基于评论分析)
五、Hacker News 反馈
HN 搜索结果(Algolia)
| 1,124 | |||
| 711 | |||
| 546 | |||
| 298 | |||
| 66 | |||
| 64 | |||
HN 关键发现
27B单独帖热度相对温和(298分/3评论)——HN社区更关注Qwen3.8 Max整体(1124分/615评论)和2.4T MoE(711分/170评论) Qwen3.8 Max被agentic index评为最佳综合模型——546分/354评论,这是独立第三方评测机构的认可 2.4T MoE权重已发布——5天前上线HuggingFace,A95B活跃参数 Cerebras即将支持——意味着超高速推理即将到来 Show HN新帖:16小时前有人发布了27B API服务,单GPU 140 tok/s
六、X/Twitter 社区反馈
高赞推文汇总
Qwen官方 @Alibaba_Qwen — 780转发 / 3,013赞 / 523万浏览(8月14日)
"我们承诺为 Qwen3.8 提供开放权重。现在,是兑现承诺的时候了!Qwen3.8-27B:一个原生多模态稠密模型。仅 27B 参数,却在整体性能上超越 Qwen3.7-Plus,并在真实世界的编码与办公工作流程中大放异彩。262K 原生上下文长度,可通过 YaRN 轻松扩展至 1M 令牌。"
huangserva @servasyy_ai — 239赞 / 6.7万浏览(16小时前)
"DSH + Qwen3.8 Q8 27B 4090单卡48G的9950x上跑,100 tokens/s 左右的速度。这下基本上tokens自由了!这次我记住了阿里,明天出完整的测试报告。" (引用前推)"感谢DSH+Qwen3.8 27B Q8!为了全面测试Fable5/Sol/Qwen3.8/Kimi-K3等模型,耗光了我的tokens!在我Claude Code/Codex 都快枯竭的时候出现了"
MaxForAI @MaxForAI — 121赞 / 2.4万浏览(2小时前)
"卧槽???你敢相信这是Qwen3.8-27B在本地跑的前端吗??"
bourneliu66(刘小排)— 159赞 / 78转发 / 16万浏览(8月14日)
"一件非常恐怖的事,悄然发生了:Qwen3.8-27B 在大部分能力上都超过或逼近了Claude Opus 4.6 Max!也就是说,从今天开始,你在自己的电脑上、单机单卡能够部署的小模型,已经拥有了不逊于Claude Opus 4.6(半年前的世界之巅)的智能!无论是写代码、还是驱动OpenClaw!"
实践哥MinLi @MinLiBuilds — 135赞 / 10万浏览(8月15日)
"卧槽,可以去开 token 无限量供应咖啡店了,你买咖啡,我提供 Opus4.6 级别的 token。可以支持十几个人共同使用。Qwen3.8-27B 这个 Dense 模型,我刚跑完一轮。跑的完全体,非量化版本,显存占用 84G 左右。配置是4090 48G*2:单流稳定在 31~32 tok/s,1024 token 输入,TTFT 只有 562ms"
Lonely__MH — 177赞 / 3.2万浏览(20小时前)
"Qwen3.8-27B 玩家福利 追求极致推理速度的看过来!SGLang 的 MTP 优化太强了,10个并发流下能稳跑 200+ tok/s,而且完美支持 1M 上下文的全量 KV Cache"
MiaAI_lab @MiaAI_lab — 177赞(8月15日)
"在你的 NVIDIA DGX Spark 上运行 Qwen3.8-27B,使用 SGLang:最高 1M 上下文 / MTP ~33-35 tok/s 单流(结构化)/ ~195-210 tok/s 带 10 个并发流 / 运行 256k 或 1M 上下文时速度无差异"
Aron厚玉 @aronhouyu — 81赞 / 6.7万浏览(8月15日)
"嗯 本地部署成功 qwen3.8 下一步干什么呢?卖 token?"
Paidax @xin_pai88825 — 44赞 / 1.8万浏览(8月14日)
"Qwen3.8 绝对是近半个月我体验最舒服的模型,甚至连 GPT5.6 Sol 我都懒得打开,我用它来做了超多复杂项目,每个产出都很符合我心意"
daotagoto @daotagoto — 73赞(3小时前)
"刚发现一个趋势:开源大模型正在'消费级化'。Qwen3.8-27B量化后4090单卡就能跑,100 tokens/s。3090 24G闲鱼7k出头,4090 48G 2w出头。这意味着什么?个人开发者的试错成本归零了。以前调API烧钱,现在本地跑免费。AI应用开发的门槛,从来没有这么低过。"
FiniYang @FiniYang — 29赞 / 4,154浏览(17小时前)
"本地实测 Qwen3.8-27B-VL 结论:16GB 显卡可流畅交互,但默认思考偏长。视觉任务建议 max_tokens≥512。配置:RTX 5080 16GB|llama.cpp|Q3_K_S|8K 上下文|单并发|视觉开启。热启动 9.0s,文本生成平均 54 tok/s。1960-token 预填 1575 tok/s,缓存后耗时 1.81→0.70s"
关木 @ZeroZ_JQ — 37赞 / 2.6万浏览(8月15日)
"Qwen3.8 为什么感觉都没有什么声音?感觉很不错的啊?"
雪瑜 @xueyu1125 — 30赞 / 7,581浏览(8月15日)
"为什么千问数据一直叫好不叫座,每次开源都掀不起来什么水花?Qwen3.8-27B、Qwen3.8-2.4T-A95B(Max-level)千问的小模型本地跑起来都很强,3.8-2.4T的模型也属于顶尖大模型啊?"
huangserva @servasyy_ai — 24赞 / 8.9万浏览(8月15日)
"推特上铺天盖地的qwen3.8的广告。每次阿里都吹的很厉害,最后出来点什么让大家记住的东西了吗?让我也来试试弄一下本地模型,试完出个分析报告"
小娜学AI @geesehowardt7 — 232赞(2小时前)
"Qwen3.8 27B 无限制模型来了!最近实测Qwen3.8 27B 非常强,很多方便已经比Deepseek V4 flash 效果好,关键可以本地部署在12GB显存的机器上"
SuSu_酥酥 @NFT_Chen — 33赞 / 4,027浏览(8月15日)
"重磅!阿里Qwen开源模型6个月下载破30亿,直接碾压Meta+谷歌,登顶全球No.1!与此同时Qwen3.8-27B杀疯了——27B小身材,性能却对标甚至超越一堆前沿大模型,agentic coding、长时工作流直接起飞!中国开源AI已经不是'参与者',而是全球开发者的默认选择。"
领哥LingGe @shangdu2005 — 9赞 / 3,367浏览(8月16日)
"Qwen3.8 27B模型刚出来。Qwen3.8 35B A3B又要来了。"
X/Twitter 情绪分布
七、YouTube 视频反馈
英文 YouTube 视频
| WorldofAI | 63,000 | ||
| Bijan Bowen | 59,000 | ||
| Execute Automation | 12,000 | ||
| Fahd Mirza | 8,176 | ||
| STARTUP HAKK | 5,836 | ||
| Codedigipt | 4,951 | ||
| Prompt Engineer | 1,903 | ||
| Venelin Valkov | 2,193 | ||
| Venelin Valkov | 1,213 | ||
| Julian Goldie SEO | 1,824 | ||
| Execute Automation | 2,390 | ||
| AI幫手 | 648 |
中文 B站 视频
B站搜索结果达 42页,以下为精选:
| AI观模者 | 5,793 | ||
| jeffzhengye | 1,791 | ||
| 63号炼金工坊 | 848 | ||
| 莉雅水嘟嘟 | 3,041 | ||
| 何健乐Jay | 901 | ||
| 量子菠萝_ | 487 | ||
| AI日日新 | 256 | ||
| -与AI同行- | 437 | ||
| 零度解说 | 36,000 | ||
| 抡锤者 | 7,972 | ||
| 电磁波Studio | 2,114 | ||
| 硅基包工头 | 53 | ||
| 编程分享录 | 87 | ||
| 名校课程-顶级中配 | 1,848 | ||
| 莉雅水嘟嘟 | 534 | ||
| 爱吃鲅鱼酱 | 94 | ||
| 已泰说 | 35 | ||
| AIToBox | 13 | ||
| 重走旧路哥 | 519 |
YouTube/B站 视频内容主题分布
本地部署教程(40%)—— Ollama/llama.cpp/SGLang/vLLM 部署指南 性能实测(25%)—— 不同硬件上的tok/s、显存占用、上下文长度 编程能力测试(15%)—— 生成游戏、网站、3D模型、光线追踪器 对比评测(10%)—— vs Opus 4.6 / vs Qwen 3.6 / vs DeepSeek / vs Muse Glimmer 越狱版教程(5%)—— 无审查版本部署 多模态测试(5%)—— 图像理解、视频通话
八、知乎社区反馈
基础数据
主帖:"Qwen-3.8 27B开源权重发布,有什么值得关注的地方?" — 58回答 / 32.8万浏览 第二帖:"如何评价刚刚开源的Qwen3.8-27B?" — 多个高赞回答 热度标签:657,290人正在热议
知乎 AI 搜索智能总结
"2026年8月14日,阿里千问团队正式开源Qwen3.8-27B模型权重,采用Apache 2.0协议允许免费商用,这款270亿参数的原生多模态大模型量化后可在消费级显卡本地运行,多项性能指标接近甚至超越顶级闭源模型,引发全球AI社区热议。"
知乎高赞回答精选
忻致知 — 180赞 / 47评论
"基于QwQ之后Qwen小模型一路狂歌猛进,可以认为Qwen-3.8 27b的推出,也许是Qwen下一波开源小模型反推高地的冲锋号"
cxuan — 155赞 / 44评论
"咱们先把 27B 搞明白。Qwen3.8 27B 这次真不是陪跑。Qwen3.8-27B 的参数量没有变得特别夸张"
平凡 — 143赞 / 24条评论
"这个时代你很少能看到 dense 模型了,因为绝大多数的模型大小都在几百个 B 以上。大一点的像 DeepSeek V4 Pro 这些模型,都到了 1.6T 级别的模型,如果全量跑的话是不可能的"
恋猫 — 128赞 / 12条评论
"我擦,这我就没看懂了,这反差怎么回事??Qwen 3.8 max 官方 API 支持多模态,然后开源的 Qwen3.8-2.4T-A95B 是 text-only???然后 27B 反而把完整多模态能力放在了开源版本里?"
量子位(专栏)— 16赞 / 10条评论
"源神启动!一张消费级显卡跑'Opus级'Agent,Qwen3.8-27B多项榜单反超Claude" "下面这老哥用3.8-27B和3.6-27B分别做了个像素风宝塔效果,3.8-27B在色彩细节和主体结构明显更next"
黑虾 — 50赞 / 35条评论
"《Qwen3.8-27B需要什么配置?下载安装教程》——终于等来了,千呼万唤的Qwen3.8-27B!单卡最强模型,前代Qwen3.6-27B就是单显卡能部署的最强模型"
刘聪NLP — 40赞 / 8条评论
"社区的评价真的超级高,Qwen3.8-27B是基于Qwen3.5的架构基础上训练的,跟Qwen3.6-27B的结构是一模一样的"
eechen — 32赞 / 6条评论
"那些说林俊旸离职后Qwen将走向闭源的谣言也不攻自破。千问3.8-27B编程、智能体、通识相比3.6都有大幅提升"
OwnDing — 3赞 / 2条评论
"Qwen3.8-27B 的 BF16、FP8、MTP、单卡表现,以及与 Qwen3.6 MoE 的差距"——技术深度评测
布布 — 5赞 / 8条评论
"单卡3090部署Qwen3.8 27B,上下文230k,可用于Coding Agent调用"
易旭昕 — 2赞
"在 M5 Pro 24G 上使用 Qwen 3.8 27B Q4/Q3 Coding 的实验"(7小时前新发布)
邵奈一 — 2赞
"Ollama 上 Qwen3.8-27B 的 MTP 提速实测——一句话:Ollama 里现在能直接拉 Qwen3.8-27B 的 MTP 版了"
import 潘多拉 — 1赞 / 2条评论
"Qwen3.8-27B 社区吹疯了,我先问你显存够不够"——理性降温帖
陈文茂 — 5赞
"Qwen3.8-27B 发布:性能调研及本地部署建议"
wei佳 — 1赞 / 2条评论
"M2 Max 64GB 能不能本地运行 Qwen3.8-27B?我实测了——能跑。用的是 Ollama 里的 qwen3.8:27b-mlx,模型文件大约 18GB"
Hunter — 3赞 / 1条评论
"Qwen3.8‑27B 刚开源!社区魔改未审查版出炉,17G 显存本地就能跑无滤镜 27B 大模型"
知乎社区讨论主题
模型定位与意义(35%)—— Dense模型的独特价值、小模型反攻 本地部署教程(30%)—— 各硬件配置下的部署方案 性能对比(20%)—— vs 3.6 / vs Opus / vs DeepSeek 多模态矛盾(5%)—— 27B有完整多模态但2.4T没有的矛盾 越狱版讨论(5%)—— 无审查版本 理性质疑(5%)—— "社区吹疯了,显存够不够"
九、Release Day Demos — 32个发布日Demo
社区开发者 loktar00 在发布当天用 Qwen3.8-27B 生成了 32个完整的交互式Demo,全部一次性生成(single sitting),展示了模型的编程能力多样性:
Demo 清单
Voxel Pagoda Garden — 体素宝塔花园 Dithered Bento Grid — 1位抖动便当布局 Stationery Retail Catalogue — 文具零售目录 Virtual Boy Microsite — Virtual Boy复古网站 The Moss Notebook — 手绘笔记本风格网站 Breathing Terrain — 呼吸地形(分数布朗运动) Molten Metaballs — 熔融金属球(片段着色器) Iridescent Blob — 彩虹色有机球体 Zombie Car Apocalypse — 僵尸驾驶(俯视街机) Wasteland Driver — 废土驾驶 Forest Fire Simulation — 森林火灾模拟(元胞自动机) Brutalist — 粗野主义网站 Risograph — 丝网印刷风格网站 Swiss — 瑞士国际主义风格 Pricing Terminal — SaaS定价终端(打字机风格) /dev/null ZINE — ASCII风格ZINE Meridian Metro — 城市交通网站 Bayer and Sons Print Works — 1位抖动印刷作品 AI Battle Royale — 60个AI战士大逃杀 The Outbreak — 僵尸爆发模拟 Living Reef — 珊瑚礁生态 Chalkboard Wildfire — 黑板野火 Ink Bloom — 墨水绽放 24-32. NVFP4和Q8量化版本对比Demo(8个)
"Every page here is a first attempt. This gallery and all thirty-two demos linked from it were generated by Qwen3.8-27B on release day."
十、硬件实测数据汇总
各硬件配置性能数据
关键硬件洞察
消费级显卡全面可用——从4GB到48GB都有可用配置 双3090是性价比之王——闲鱼7k出头,96GB VRAM可跑多模型并发 MTP加速显著——1.81x加速(HF #112),但Ollama GGUF下可能为负面(HF #80) 1M上下文无速度损失——SGLang在256K和1M上下文下速度相同 非量化版需要84GB显存——双4090 48G可跑
十一、工具链生态支持
十二、核心争议与社区讨论
争议1:过度思考(Overthinking)— 最广泛讨论的问题
问题:Qwen3.8-27B默认使用xhigh推理模式,生成思考链可达15,000词(前代3.6约3,000词),部分用户报告等待49分钟后放弃。
社区分析(HF #76 LuffyTheFox):
原因:模型默认reasoning_effort设为xhigh,思考链过长 部分修复:调低reasoning_effort到high或medium 基准确认:不同reasoning_effort级别对输出质量影响有限
社区反应:
"A crazy thinking model"(9赞/15评论) "等49分钟还在思考,放弃了"(3赞/10评论) "代码能力变强了但写作能力变弱了"——过度优化代码思考的代价
争议2:"与3.6完全相同"— 架构讨论
事实:架构diff为0,所有提升来自后训练。
社区共识:
"小版本号=训练迭代,大版本号=架构变更"——这是行业标准做法 DeepSeek V3→V4 Flash→0731同样模式 GLM 5.2→5.3同样模式 "预训练成本远超后训练,复用基座是经济理性选择"
争议点:
"知识截止仍为2024"——但编程能力提升不需要新知识 部分用户认为"花大力气下载后发现架构没变"有被欺骗感
争议3:35B MoE 的强烈请求
现象:HuggingFace社区超过15个帖子、累计超过200赞请求35B-A3B MoE版本。
原因分析:
27B Dense模型对16GB显卡用户仍需较激进的量化 35B-A3B MoE仅需约12GB显存即可运行(A3B=3B活跃参数) 前代Qwen3.6-35B-A3B深受社区喜爱 领哥LingGe透露"35B A3B又要来了"
争议4:Benchmaxxing 质疑
社区用户 pathosethoslogos(HF #84):
"Bench maxed -- don't be fooled by the table presented in the model card"
支持者观点:
DeepSWE从13.3跳到42.2(+218%)幅度过大,可疑 SWE-bench Pro超过Opus 4.6 Max"太好了难以置信" 模型可能在基准数据上过拟合
反驳者观点:
架构相同但后训练完全不同,基准提升合理 独立评测(laxmimerit的16题测试)部分证实了能力提升 WildClawBench排名15(独立基准)说明并非所有基准都顶尖
争议5:能力退步报告
争议6:MTP在不同后端的表现差异
HF #80 OtsoaD 发现:
Ollama GGUF路径下MTP为负面(降低性能) MLX路径下MTP为强正面(显著加速) 说明MTP效果高度依赖推理后端实现
十三、"叫好不叫座"讨论
现象
多位中文X/Twitter用户提到Qwen"每次开源都叫好不叫座":
关木(37赞/2.6万浏览):"Qwen3.8 为什么感觉都没有什么声音?" 雪瑜(30赞):"为什么千问数据一直叫好不叫座,每次开源都掀不起来什么水花?" huangserva(24赞/8.9万浏览):"每次阿里都吹的很厉害,最后出来点什么让大家记住的东西了吗?"
分析
中文社区热度实际很高——知乎32.8万浏览、B站42页视频、X/Twitter多推文破万浏览 英文社区热度同样高——Reddit 7个主帖累计7,914赞、HuggingFace 10.4k likes "叫好不叫座"可能指:相比GLM-5.3的"后训练之神"标签、DeepSeek V4 Pro的价格震撼,Qwen3.8-27B缺少一个出圈的"记忆点" 但"消费级化"叙事正在形成——"试错成本归零""token咖啡店"等概念可能成为Qwen的记忆点
十四、同期竞争格局
8月中旬"疯狂一周"
| DeepSeek V4 Pro 0813 | ||||
| Grok 4.6 | ||||
| GLM-5.3 | ||||
| Qwen3.8-27B | ||||
| Qwen3.8-2.4T | ||||
| Muse Glimmer-30B |
Qwen3.8-27B 的独特定位
唯一消费级可跑的旗舰级模型——27B Dense,Q4量化仅需17GB VRAM 唯一完整多模态的开源小模型——图像+视频+262K上下文 SWE-bench Pro开源第一——61.7超过Opus 4.6 Max的53.4 "中美AI对决"叙事中的一极——与GLM-5.3、DeepSeek V4 Pro形成中国开源三剑客
十五、社区情绪总览
情绪分布(综合所有平台)
关键金句集
"一件非常恐怖的事,悄然发生了" — bourneliu66 "先是744B,然后284B,现在27B??" — michaelsoft__binbows "可以开token无限量供应咖啡店了" — 实践哥MinLi "个人开发者的试错成本归零了" — daotagoto "History in the making" — dingo_xd "Local uncensored Opus 4.6 at home" — Reddit帖子标题 "30B is quietly becoming the default size for open models" — Reddit帖子标题 "我们在GTA VI之前就得到了本地Opus" — 社区共识 "恭迎小模型的神!" — HF社区 "Those numbers are amazing... at 27B? This much improvement in a couple months?" — Haiku-575
十六、关键功能特性详解
1. 灵活思考控制(Flexible Thinking Control)
默认开启思考模式,可按请求关闭 reasoning_effort 五级可调:xhigh / high / medium / low / none preserve_thinking:保留历史消息中的推理上下文 社区建议:编程用high,探索用low,日常用medium
2. 多模态理解(Vision-Language)
原生支持图像和视频理解 从STEM图表到小时级视频 MathVision(w/ CI)94.6分,远超Opus 4.6 Max的65.5 BabyVision(w/ CI)85.6分,Opus仅12.6
3. MTP(Multi-Token Prediction)
训练时使用多步预测 推理时可启用MTP draft head获得1.81x加速 在SGLang下效果最佳(200+ tok/s) 在Ollama GGUF下可能为负面
4. 长上下文(262K → 1M)
原生262,144 token上下文 YaRN扩展至1,000,000 token SGLang下1M与256K速度无差异 双3090可跑200K上下文(Q8 KV cache)
5. Agent执行能力
更强的自主规划和环境反馈处理 OSWorld 84.3(电脑操作) WebArena 64.8(浏览器操作) AndroidWorld 81.9(手机操作) 端到端任务完成更可靠
十七、社区对后续版本的期待
1. Qwen3.8 35B-A3B MoE(最高期待)
HuggingFace超过15个帖子请求,最高赞78 领哥LingGe透露"又要来了" 社区需要比27B更轻量的MoE版本(A3B=3B活跃参数) 前代Qwen3.6-35B-A3B深受喜爱
2. Qwen 4.0(架构更新)
社区共识:"3.8不是4.0,大版本=架构变更" 预计4.0将带来全新架构 "Presumably 4.0 is where the arch moves"
3. Qwen3.8 9B(小模型版本)
HF #71:"Qwen3.8-9B please" — 11赞/6评论 AMAImedia请求9B模型
4. Cerebras支持
HN帖确认"Coming to Cerebras" 意味着超高速推理即将可用
5. MLX优化
HF #87请求MLX支持 M系列芯片用户的期待
十八、总结与洞察
Qwen3.8-27B 的历史意义
"消费级旗舰"新范式——27B参数在消费级显卡上达到Opus 4.6级别的编程能力,这是史无前例的。参数量从744B→284B→27B持续缩小但性能不降,标志着"智能密度"成为新的竞争维度。 后训练 Scaling 的又一力证——与GLM-5.3一样,Qwen3.8-27B证明了在固定架构下,后训练(RL、蒸馏、数据质量)可以带来巨大提升。DeepSWE +218%的跳跃完全来自训练改进。 Dense模型的回归——在MoE大行其道的时代,27B Dense模型证明了"小而精"仍有巨大价值。简单架构+极致训练=惊人效果。 开源生态的成熟——从发布到Unsloth GGUF、越狱版、NInfer自定义引擎、32个Release Day Demos,整个生态在24小时内完成闭环。开源不再是"发布权重",而是"激活社区"。 "叫好不叫座"的悖论——尽管数据全面优秀、社区热度极高,但Qwen仍被认为缺少"出圈记忆点"。这反映了AI模型竞争已进入"品牌叙事"阶段——技术指标只是入场券,能否占领用户心智才是关键。 ---
报告完
数据来源:HuggingFace / Reddit / Hacker News / X(Twitter) / YouTube / B站 / 知乎 / Release Day Demos / Artificial Analysis调研时间:2026年8月17日


