Qwen 3.8 27B 默认想太多 先把 reasoning 打低
按 Simon Willison 实测:默认 xhigh 会把简单题想爆上下文;建议先用 low/关推理,再谈本地 agent。

Qwen 3.8 27B 本身很强:Apache 2、约 17GB Q4 可上高配笔记本、有视觉与工具调用。Simon Willison 在 Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things 里的痛点是默认 reasoning_effort=xhigh:连「画个圆」都会写成几何论文,把时间和上下文烧光。型号介绍见 Qwen 3.8 27B 是什么;本文只谈怎么压默认胡思乱想。
默认有多夸张
官方档位:xhigh(默认)、medium、low。LM Studio 的 GGUF 保留了默认 xhigh。作者在默认 8k 上下文里,模型会把额度全耗在思考上;拉到最大上下文后,一个自行车鹈鹕 SVG 想了约 2.2 万 reasoning token、跑约 21 分钟才出图。关掉推理后同类题大约两分钟级。圈 SVG 在 xhigh 下甚至被做成带动画的「几何习作」,远超请求。
建议起手式
- 消费级硬件先设
low,或直接关 reasoning,确认模型能力。 - 只有复杂证明 / 多文件重构再升
medium/xhigh。 - 上下文窗口给足(作者提到需远大于 8k),否则思考先把自己挤死。
- 本地 agent(如 Pi)系统提示宜短,给小模型留输出预算。
速度侧补丁
稠密 27B 吃带宽,M 系列 Mac / DGX Spark 上常感 15–30 tok/s。社区在试 Multi-Token Prediction / llama.cpp draft-MTP;作者写 MTP 服务相对默认 GGUF 约快 72%。先把 effort 打低,比先堆 MTP 更能挽回「能用」体感。视觉框选、短系统提示下的 coding agent 循环,他都给出了正向例子,前提是别让 xhigh 当默认。