抱抱脸上有个神奇的大模型,GLM5.2、Kimi-K3、DeepSeek-V4-Flash 轮番上阵,它都能稳稳坐在前三
字长的离谱:Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
(资料图片)
讨论区也是赞美之声一片:绝对猛兽、神级杰作、无与伦比。。。
这是个啥
简单说:这个模型是把 Qwen3.6-27B 做了多阶段微调 + 多阶段合并,然后放出了全套 GGUF 量化,Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF 这个离谱的名字其实每一段都有含义:
711 :ARC-C 基准冲上 0.711,突破了 700 分档位
Fable-Fusion :多阶段微调 + 模型融合,混入了 Fable 叙事、Claude Opus 推理、GPT5 Polaris 等训练痕迹
Uncensored-Heretic :用 Heretic 方法做了去审查处理
NM-DAU :Nightmedia 和 DavidAU 两位主创的署名
NEO-MAX :NEO IMATRIX 量化,输出张量拉到 16 位全精度
MTP :多 token 预测版量化,推理速度更快
特性:
只提升通用智力和指令遵循
不碰核心模型的其他能力
零 benchmaxing (刷榜式训练会损伤模型)
所有核心基准保持或上涨
先看 Nightmedia 跑的社区基准,七项对比(arc-c / arc-e / boolq / hellaswag / openbookqa / piqa / winogrande)
Fable-Fusion-711 与 Qwen 原版模型七项基准对比
几个关键点:
8bit 和 4bit 双双 突破 700 ARC-C,作者称这是第一个做到这点的微调模型
七项基准里六项超过 原版,剩下一项(boolq)持平
对 Qwen3.6-35B-A3B 是七项全胜
按作者的说法,700 这个档位此前只有 OpenAI、Claude、Gemini 的闭源模型待得住
不过啊:这是社区自测跑分,ARC-C 这类基准也偏老,微调后单项分数暴涨的模型历来要辩证看,作者自己也强调最终验收靠的是人工对照测试(新旧模型并排对比输出)
但有一点值得注意,这套方法先在 Qwen3.5 9B 上反复试验打磨,做出来的 9B 试验品就已经把 Qwen3.5 27B 的七项基准全部干掉了,方法论有连续性,路数看起来可信
9B 试验品 The-Defiant-Fable 的基准表现 底子本来就硬:Qwen3.6-27B
社区微调能玩出花,前提是基座够猛
我多次说过,Qwen3.6-27B是我最喜爱的本地部署模型
Qwen3.6-27B 是通义 2 月 Qwen3.5 系列之后放出的首个 Qwen3.6 开源权重,主打 Agentic Coding 和思维链保留,官方成绩单里几个数字相当扎眼:
SWE-bench Verified 77.2,超过自家 397B 的 Qwen3.5 旗舰
Terminal-Bench 2.0 拿到 59.3,和 Claude 4.5 Opus 打平
SkillsBench 48.2,比 Claude 4.5 Opus 还高
规格上也很能打:原生 256K 上下文,可扩展到 101 万 token,自带视觉编码器,架构是 Gated DeltaNet 和 Gated Attention 的混合层设计
也就是说,Fable-Fusion-711 相当于在一台原厂性能车上又刷了一阶程序
量化怎么选 这个仓库的量化选项多到眼花
我做了一张选型图:
Fable-Fusion-711 量化版本选择指南
Regular 和 MTP 两条线
全部量化都是 NEO IMATRIX 处理,作者称比普通 GGUF 精度再高 2-4%,长上下文表现也更好,输出张量统一拉到 16 位全精度
MTP 版(文件名带 MTP 后缀)是速度型选手,作者在 5090 + Windows 11 + LMStudio 实测:Q4_K_S 普通版约 75 t/s,MTP 版能跑过 90 t/s
但 MTP 有使用条件:
temp 保持 1 以下,调高会掉速
rep pen 保持 1(关闭),拉高性能受损
观察 token acceptance,低于 50% 就老实换回普通版
特殊版本
带 LOW 的(IQ4_XS、Q6_K):省显存版
带 AMD 的:给 AMD/Vulkan 用户解决输出张量 CPU 卸载拖速问题
想要视觉能力,记得另下一个 mmproj 文件放同目录
怎么下手
regular 和 MTP 各下一个,拿自己的真实用例跑对比,哪个快用哪个,创作类任务或者 temp 超过 1 的场景直接选 regular
参数照抄就行
本地部署最省事的还是
模型卡给的建议采样参数,跟 Qwen 官方一致:
# 思考模式(通用任务)temperature=1.0, top_p=0.95, top_k=20, min_p=0.0 # 思考模式(精确编码)temperature=0.6, top_p=0.95, top_k=20, min_p=0.0 # 指令模式(非思考)temperature=0.7, top_p=0.80, top_k=20, presence_penalty=1.5
聊天、角色扮演场景作者还给了个小技巧:在 KoboldCpp / text-generation-webui / Silly Tavern 里把 Smoothing Factor 设成 1.5,运行更顺滑
总结
适合谁
手里有 24G/32G 显存、想在本地榨出最强 27B 智力的玩家
写作、角色扮演、Agent 实验等需要模型少废话多执行的场景
想研究社区微调方法论的炼丹爱好者
冷静看待
社区自测跑分,等第三方复测前保持观望
ARC-C 高分代表推理和常识提升,代码和中文场景没有对应数据
微调痕迹里混了多家模型的风格,输出口味变化需要自己适应
民间五人小队用消费级硬件把 27B 干进 700 俱乐部这件事本身,比分数更有意思,开源社区的炼丹力量已经能对着旗舰基座做二次开发了,这在两年前想都不敢想
我打算找台机器把 Q4 档拉下来,重点测中文和代码这两个模型卡里没给数据的场景,实测结果出来第一时间发出来
内容搜集整理于网络,不代表本站同意文章中的说法或者描述。文中陈述文字和内容未经本站证实,其全部或者部分内容、文字的真实性、完整性、及时性本站不做任何保证或者承诺,并且本站对内容资料不承担任何法律责任,请读者自行甄别。如因文章内容、版权和其他问题侵犯了您的合法权益请联系邮箱:5 146 761 13 @qq.com 进行删除处理,谢谢合作!