苏北网
当前位置:首页>快讯 >

讯息:“最好”的Qwen3.6-27B版本,神级杰作,本地部署

时间 2026-08-05 18:37:21 来源:Ai学习的老章  

抱抱脸上有个神奇的大模型,GLM5.2、Kimi-K3、DeepSeek-V4-Flash 轮番上阵,它都能稳稳坐在前三

字长的离谱:Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF


(资料图片)

讨论区也是赞美之声一片:绝对猛兽、神级杰作、无与伦比。。。

这是个啥

简单说:这个模型是把 Qwen3.6-27B 做了多阶段微调 + 多阶段合并,然后放出了全套 GGUF 量化,Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF 这个离谱的名字其实每一段都有含义:

  • 711 :ARC-C 基准冲上 0.711,突破了 700 分档位

  • Fable-Fusion :多阶段微调 + 模型融合,混入了 Fable 叙事、Claude Opus 推理、GPT5 Polaris 等训练痕迹

  • Uncensored-Heretic :用 Heretic 方法做了去审查处理

  • NM-DAU :Nightmedia 和 DavidAU 两位主创的署名

  • NEO-MAX :NEO IMATRIX 量化,输出张量拉到 16 位全精度

  • MTP :多 token 预测版量化,推理速度更快

特性:

  • 只提升通用智力和指令遵循

  • 不碰核心模型的其他能力

  • 零 benchmaxing (刷榜式训练会损伤模型)

  • 所有核心基准保持或上涨

成绩单

先看 Nightmedia 跑的社区基准,七项对比(arc-c / arc-e / boolq / hellaswag / openbookqa / piqa / winogrande)

Fable-Fusion-711 与 Qwen 原版模型七项基准对比

几个关键点:

  • 8bit 和 4bit 双双 突破 700 ARC-C,作者称这是第一个做到这点的微调模型

  • 七项基准里六项超过 原版,剩下一项(boolq)持平

  • 对 Qwen3.6-35B-A3B 是七项全胜

  • 按作者的说法,700 这个档位此前只有 OpenAI、Claude、Gemini 的闭源模型待得住

不过啊:这是社区自测跑分,ARC-C 这类基准也偏老,微调后单项分数暴涨的模型历来要辩证看,作者自己也强调最终验收靠的是人工对照测试(新旧模型并排对比输出)

但有一点值得注意,这套方法先在 Qwen3.5 9B 上反复试验打磨,做出来的 9B 试验品就已经把 Qwen3.5 27B 的七项基准全部干掉了,方法论有连续性,路数看起来可信

9B 试验品 The-Defiant-Fable 的基准表现 底子本来就硬:Qwen3.6-27B

社区微调能玩出花,前提是基座够猛

我多次说过,Qwen3.6-27B是我最喜爱的本地部署模型

Qwen3.6-27B 是通义 2 月 Qwen3.5 系列之后放出的首个 Qwen3.6 开源权重,主打 Agentic Coding 和思维链保留,官方成绩单里几个数字相当扎眼:

  • SWE-bench Verified 77.2,超过自家 397B 的 Qwen3.5 旗舰

  • Terminal-Bench 2.0 拿到 59.3,和 Claude 4.5 Opus 打平

  • SkillsBench 48.2,比 Claude 4.5 Opus 还高

规格上也很能打:原生 256K 上下文,可扩展到 101 万 token,自带视觉编码器,架构是 Gated DeltaNet 和 Gated Attention 的混合层设计

也就是说,Fable-Fusion-711 相当于在一台原厂性能车上又刷了一阶程序

量化怎么选 这个仓库的量化选项多到眼花

我做了一张选型图:

Fable-Fusion-711 量化版本选择指南

Regular 和 MTP 两条线

全部量化都是 NEO IMATRIX 处理,作者称比普通 GGUF 精度再高 2-4%,长上下文表现也更好,输出张量统一拉到 16 位全精度

MTP 版(文件名带 MTP 后缀)是速度型选手,作者在 5090 + Windows 11 + LMStudio 实测:Q4_K_S 普通版约 75 t/s,MTP 版能跑过 90 t/s

但 MTP 有使用条件:

  • temp 保持 1 以下,调高会掉速

  • rep pen 保持 1(关闭),拉高性能受损

  • 观察 token acceptance,低于 50% 就老实换回普通版

特殊版本

  • 带 LOW 的(IQ4_XS、Q6_K):省显存版

  • 带 AMD 的:给 AMD/Vulkan 用户解决输出张量 CPU 卸载拖速问题

  • 想要视觉能力,记得另下一个 mmproj 文件放同目录

怎么下手

regular 和 MTP 各下一个,拿自己的真实用例跑对比,哪个快用哪个,创作类任务或者 temp 超过 1 的场景直接选 regular

参数照抄就行

本地部署最省事的还是

模型卡给的建议采样参数,跟 Qwen 官方一致:

# 思考模式(通用任务)temperature=1.0, top_p=0.95, top_k=20, min_p=0.0 # 思考模式(精确编码)temperature=0.6, top_p=0.95, top_k=20, min_p=0.0 # 指令模式(非思考)temperature=0.7, top_p=0.80, top_k=20, presence_penalty=1.5

聊天、角色扮演场景作者还给了个小技巧:在 KoboldCpp / text-generation-webui / Silly Tavern 里把 Smoothing Factor 设成 1.5,运行更顺滑

总结

适合谁

  • 手里有 24G/32G 显存、想在本地榨出最强 27B 智力的玩家

  • 写作、角色扮演、Agent 实验等需要模型少废话多执行的场景

  • 想研究社区微调方法论的炼丹爱好者

冷静看待

  • 社区自测跑分,等第三方复测前保持观望

  • ARC-C 高分代表推理和常识提升,代码和中文场景没有对应数据

  • 微调痕迹里混了多家模型的风格,输出口味变化需要自己适应

民间五人小队用消费级硬件把 27B 干进 700 俱乐部这件事本身,比分数更有意思,开源社区的炼丹力量已经能对着旗舰基座做二次开发了,这在两年前想都不敢想

我打算找台机器把 Q4 档拉下来,重点测中文和代码这两个模型卡里没给数据的场景,实测结果出来第一时间发出来

标签: 基准 推理 top arc 上下文 大模型 qwen

相关阅读RELEVANT

  • 版权及免责声明:

内容搜集整理于网络,不代表本站同意文章中的说法或者描述。文中陈述文字和内容未经本站证实,其全部或者部分内容、文字的真实性、完整性、及时性本站不做任何保证或者承诺,并且本站对内容资料不承担任何法律责任,请读者自行甄别。如因文章内容、版权和其他问题侵犯了您的合法权益请联系邮箱:5 146 761 13 @qq.com 进行删除处理,谢谢合作!